Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsPreiseBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
BefristetZeitlich begrenztHervorgehobener EintragPrüfung in 24 Std. · Kein Backlink · 30 Tage hervorgehoben$29.90danach $59.90Nach dem 31. Okt. steigt der Preis auf $59.90Endet in--:--:--Jetzt einreichen
  1. Startseite
  2. Alle Tools
  3. Entwicklertools
  4. Cerebras
Oberflächenvorschau von Cerebras
Logo von Cerebras

Cerebras

Cerebras betreibt Modelle mit offenen Gewichten wie GPT OSS 120B und Qwen 3.8 27B auf eigenen Wafer-Scale-Prozessoren über eine OpenAI-kompatible API, mit Pay-as-you-go-Token, reservierter Dedicated-Kapazität und CS-4-Systemen vor Ort.

EntwicklertoolsKI-EntwicklungKI-Trainingsplattform#Enterprise#LLM#OpenAI kompatible API
Preise ansehen
Gespeichert
Besuche
Aufrufe
Preis
Kostenpflichtig
Veröffentlicht
4. Okt. 2026
Domain
cerebras.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Cerebras Produktinformationen

Preise ansehen
Tool-Informationen
Gespeichert
Besuche
Aufrufe
Preis
Kostenpflichtig
Veröffentlicht
4. Okt. 2026
Domain
cerebras.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Empfohlene Tools

Verwandte Tools

Preise ansehen

Was ist Cerebras?

Cerebras ist eine KI-Inferenzplattform, die Sprachmodelle mit offenen Gewichten auf den eigenen Wafer-Scale-Prozessoren des Unternehmens ausführt. Entwickler nutzen sie über Cerebras Inference, eine Cloud-API mit Playground im Browser; größere Organisationen können Dedicated-Kapazität reservieren oder Cerebras-Systeme in eigenen Rechenzentren installieren, und dieselbe Hardware trägt auch Trainings- und Fine-Tuning-Dienste.

Die öffentliche Cloud-Stufe bietet eine regelmäßig aktualisierte Modellauswahl auf einem gemeinsamen Endpunkt, den Sie mit einem API-Schlüssel aufrufen.

Geschwindigkeit ist das zentrale Verkaufsargument. Cerebras stellt sein neuestes Rack-Scale-System, das CS-4, als bis zu 30-mal schneller bei der Inferenz als GPUs dar – eine Herstellerangabe, keine unabhängige Messung.

Das Unternehmen hinter dem Produkt, Cerebras Systems, nahm im Mai 2026 bei einem Börsengang 5,5 Milliarden US-Dollar ein, und unabhängige Wirtschaftsberichte nennen OpenAI, G42, die Mohamed bin Zayed University of Artificial Intelligence und Amazon Web Services unter seinen Kunden.

Kernfunktionen

Shared Inference API

  • OpenAI-kompatible API: Die Cerebras-API funktioniert für viele gängige Workflows mit den Client-Bibliotheken von OpenAI, sodass eine bestehende Anwendung durch Ändern von API-Schlüssel, Basis-URL und Zielmodell umsteigen kann.
  • Kleiner Self-Service-Katalog: Shared Inference listet derzeit gpt-oss-120b (120 Milliarden Parameter, Kontext von 65k im kostenlosen Test und 131k in bezahlten Stufen, etwa 3.000 Token pro Sekunde) und qwen-3.8-27b (27 Milliarden Parameter, Kontext 64k/128k, etwa 1.850 Token pro Sekunde).
  • Breiterer Katalog per Vertrag: Weitere Modellfamilien sind nur über Dedicated Inference verfügbar.
  • Bildeingabe: Bildeingaben sind auf Shared Inference für qwen-3.8-27b verfügbar, während gemma-4-31b und andere bildfähige Modelle Dedicated Inference erfordern.
  • Reasoning-Steuerung: Bei qwen-3.8-27b lässt sich der Reasoning-Aufwand auf none, low, medium oder high setzen, Standard ist high, und das Reasoning wird getrennt von der Antwort zurückgegeben.

Die Modelltreue ist ungewöhnlich detailliert dokumentiert. Cerebras erklärt, dass jedes Modell auf Shared Inference die originale, nicht beschnittene Version ist. Die Gewichte werden mit selektiver reiner Gewichtsquantisierung in teilweise 16-, 8- oder 4-Bit-Formaten gespeichert, während sensible Schichten in voller Präzision bleiben und Aktivierungen, Attention und KV-Cache unquantisiert sind. Wer Anbieter für schnelle KI-Inferenz vergleicht, erfährt so, was hinter den Geschwindigkeitswerten tatsächlich ausgeliefert wird.

Prompt-Caching

Prompt-Caching greift automatisch bei allen unterstützten API-Anfragen, ohne Cache-Breakpoints oder Codeänderungen. Cerebras garantiert eine Cache-Lebensdauer (TTL) von 5 Minuten, und Einträge können je nach Systemlast bis zu 1 Stunde bestehen bleiben. Der Vorteil liegt in der Kapazität, nicht im Preis: Gecachte Token zählen nicht zum Limit für nicht gecachte Token, werden aber nicht rabattiert.

Dedicated Inference

Dedicated Inference reserviert Kapazität für eine einzelne Organisation und ist die Option, auf die Cerebras für Produktionsarbeit mit Bedarf an vorhersehbarer Leistung verweist. Teams können damit auch feinabgestimmte Gewichte neben den Standardmodellversionen bereitstellen. Jedes Deployment lässt sich nach Kapazität, Draft-Modellen, Modellkonfiguration und Quantisierung abstimmen und ergänzt alle Shared-Inference-Funktionen um Fine-Tuning, Gewichtsverwaltung und Steuerung der Service-Tiers. Auf der dedizierten Seite werden unter anderem Qwen 3.8, Qwen3 und Qwen3-Coder, Llama 3 und Llama 4, GLM 4.X und 5.X, Kimi K2.X sowie DeepSeek V3.X unterstützt.

Batch API

Die Batch API verarbeitet Gruppen von Anfragen asynchron, und Batch-Anfragen werden garantiert innerhalb von 24 Stunden abgeschlossen.

Cerebras Code

Cerebras Code ist ein Coding-Abo für die Nutzung im eigenen Editor. Laut Produktseite läuft dafür GLM 4.7 zur Codegenerierung mit mehr als 1.000 Token pro Sekunde, das Deprecation-Log der API erzählt allerdings eine andere Geschichte.

Training und Fine-Tuning

Cerebras Training Cloud wird als Möglichkeit beschrieben, Modelle von 1 Milliarde bis zu mehreren zehn Billionen Parametern mit demselben einfachen Code zu trainieren und feinabzustimmen.

CS-4 und WSE-3 Turbo als Hardware

Das CS-4-System läuft auf dem WSE-3-Turbo-Prozessor, den Cerebras mit vier Billionen Transistoren und 900.000 KI-Kernen beschreibt, die 250 PFLOPS Rechenleistung und 43,2 Petabyte pro Sekunde Speicherbandbreite liefern. Laut CS-4-Seite beginnen die ersten Auslieferungen in diesem Quartal, ein Datum wird nicht genannt.

Anleitung

Einstieg in die API

  1. Öffnen Sie die Cloud Console, registrieren Sie sich oder melden Sie sich an, und erstellen Sie unter API Keys in der linken Navigation einen Schlüssel.
  2. Hinterlegen Sie eine Zahlungsmethode, denn ohne sie bleiben Playground und API-Zugang inaktiv.
  3. Installieren Sie das offizielle SDK, das als cerebras_cloud_sdk für Python über pip und als @cerebras/cerebras_cloud_sdk für Node.js über npm veröffentlicht ist, oder richten Sie einen vorhandenen OpenAI-Client auf die Basis-URL von Cerebras.
  4. Nutzen Sie den Playground, um Modelle zu bewerten, Prompts zu verfeinern, Tool-Calling zu testen, Parameter abzustimmen und eine funktionierende Anfrage als Code zu exportieren. Nach jeder Antwort zeigt er Token-Verbrauch, Inferenzzeit, Token pro Sekunde und Round-Trip-Zeit an – ein schneller Weg, die reale Geschwindigkeit mit eigenen Prompts zu prüfen.
  5. Setzen Sie max_completion_tokens auf einen realistischen Wert. Cerebras schätzt jede Anfrage aus dem Prompt plus diesem Parameter oder der eigenen Ausgabeschätzung, und eine Anfrage, deren Schätzung das verbleibende Kontingent übersteigt, wird vor Beginn der Verarbeitung gedrosselt.

Anwendungsfälle und Beispiele für Cerebras

Cerebras ordnet seine Anwendungsfälle um Workloads, bei denen das Warten auf Token dem Produkt schadet:

  • Coding-Assistenten: Cerebras wirbt mit sofortigen Zyklen aus Coden, Debuggen und Refactoring, mit Cognition als veröffentlichter Fallstudie.
  • Mehrstufige Agenten: Agenten-Workflows sollen ohne Verzögerungen oder Timeouts laufen, illustriert durch NinjaTech.
  • Suche, Copilots und Analyse: Hier lautet das Versprechen komplexes Reasoning in unter einer Sekunde, illustriert durch AlphaSense.
  • Sprachschnittstellen: Sofortige, präzise Sprachantworten sind das Argument, illustriert durch Tavus.
  • In-App-Unternehmenssuche: Notion sagt, dass Cerebras Echtzeitfunktionen wie die Unternehmenssuche antreibt.
  • Forschungsagenten in den Life Sciences: GSK sagt, es nutze die Inferenzgeschwindigkeit von Cerebras, um Anwendungen wie intelligente Forschungsagenten für seine Forschenden und die Wirkstoffforschung zu entwickeln.
  • Offline-Massenaufträge: Die Dokumentation der Batch API nennt Evaluierungspipelines, Datenannotation, Massengenerierung von Inhalten und Forschungsanalysen.

Das sichtbarste Deployment ist extern. Im Februar 2026 berichtete unabhängige Technikpresse, dass OpenAIs GPT-5.3-Codex-Spark, ein kleineres Codex-Modell für schnellere Inferenz und Zusammenarbeit in Echtzeit, auf der Wafer Scale Engine 3 von Cerebras läuft.

Für wen ist es

Cerebras passt zu Teams, für die die Antwortgeschwindigkeit das Produkt verändert, doch der richtige Einstieg hängt von der Phase ab:

  • Entwickler, die Geschwindigkeit bewerten: Die Self-Service-Stufe Developer ist für Entwicklung, Evaluierung und Experimente gedacht, nicht für den Produktionseinsatz.
  • Produktionsteams: Enterprise ergänzt produktionsreife Kapazität, beste Priorität, höhere Rate Limits und erweiterte Latenzoptionen, die die Developer-Stufe nicht enthält.
  • Betreiber von Rechenzentren und Frontier-KI: Das CS-4 ist dafür ausgelegt, im Hyperscale-Maßstab als Infrastruktur für Frontier-KI eingesetzt zu werden.

Auch der Support unterscheidet sich je nach Stufe: Developer-Konten sind auf einen Community-Discord angewiesen, Enterprise-Kunden erhalten ein eigenes Account-Team.

Weniger geeignet ist es für alle, die eine dauerhaft kostenlose Stufe, sehr lange Kontextfenster am Self-Service-Endpunkt oder eine breite Self-Service-Modellauswahl erwarten; die Details stehen in den Abschnitten zu Preisen, Einschränkungen und Funktionen.

Plattformen

  • SDKs: Cerebras bietet eigene SDKs für Python und TypeScript neben dem OpenAI-kompatiblen Zugang.
  • Partnerkanäle: Cerebras Inference wird auch über AWS Marketplace verkauft und ist über die einheitliche OpenRouter-API erreichbar.
  • Hugging Face und Vercel: Modelle mit Cerebras-Antrieb lassen sich aus dem Hugging Face Hub aufrufen, und Cerebras-Inferenzendpunkte können auf Vercel bereitgestellt werden.
  • Coding-Tools: Cerebras Code funktioniert mit jedem Editor oder Agenten, der einen API-Schlüssel akzeptiert, darunter Cline, OpenCode und Crush.
  • Bereitstellungsorte: Modelle werden in der Cloud und on-premises angeboten, und Cerebras sagt, dass die Inferenz in der Region läuft, um bei Latenz, Datenresidenz und Compliance-Pflichten zu helfen.
  • Teamzugriff: Organisationen vergeben die Rollen Organization Admin, Project Admin oder Project Member, und Projektadministratoren verwalten API-Schlüssel innerhalb der ihnen zugewiesenen Projekte.

Preise

Die Cerebras-API-Preise in der Self-Service-Stufe Developer folgen dem Pay-as-you-go-Prinzip und beginnen mit einem kostenlosen Guthaben von $5, während Enterprise-Preise auf Anfrage genannt werden.

Modell (Developer-Stufe)EingabeAusgabe
GPT OSS 120B$0.35 pro Mio. Token$0.75 pro Mio. Token
Qwen 3.8 27B$0.99 pro Mio. Token$1.49 pro Mio. Token
  • Das Guthaben von $5 ist ein einmaliges Aktionsguthaben, das eine gültige Zahlungsmethode voraussetzt und 30 Tage nach der Aktivierung verfällt; das Hinterlegen der Karte meldet Sie nicht für die kostenpflichtige Nutzung an, und API- und Playground-Zugang werden pausiert, wenn das Guthaben verfällt oder aufgebraucht ist, sofern Sie kein Pay-as-you-go-Guthaben kaufen.
  • Eine dauerhaft kostenlose Stufe gibt es nicht, da der kostenlose Test sowohl zeitlich als auch durch das Guthaben begrenzt ist.
  • Prompt-Caching kostet nichts extra, gecachte Eingabe-Token werden aber zum normalen Eingabe-Token-Tarif abgerechnet.
  • Die automatische Aufladung ist standardmäßig deaktiviert und lässt sich im Tab Pay as you go einschalten.
  • Der Tab Subscriptions der Cloud Console verwaltet modellbezogene Inferenzpläne, die jeweils in Stufen zu unterschiedlichen Monatspreisen angeboten werden.
  • Eigene Modellgewichte sowie Fine-Tuning- oder Trainingsdienste sind Enterprise-Funktionen und nur per Vereinbarung erhältlich.

Cerebras-Code-Pläne

Cerebras Code Pro ist mit $50 für bis zu 24 Millionen Token pro Tag gelistet und richtet sich an Indie-Entwickler und Wochenendprojekte. Cerebras Code Max ist mit $200 für bis zu 120 Millionen Token pro Tag gelistet und richtet sich an Vollzeitentwicklung und Multi-Agenten-Systeme. Beide kostenpflichtigen Pläne waren beim Abruf am 4. Oktober 2026 als ausverkauft markiert, und die für diese Seite geprüften Plankarten nennen keinen Abrechnungszeitraum.

Training Cloud

Training Cloud wird entweder pro Stunde verkauft, wobei Cerebras die Zeit bemisst, die ein eingereichter Workload braucht, oder pro Modell, wobei Cerebras-Experten ein Modell auf Ihrem Datensatz entwerfen und feinabstimmen; die Training-Cloud-Seite listet diese Optionen ohne Preise.

Alternativen zu Cerebras

Auch andere Anbieter bauen eigene Chips für schnelle Inferenz, statt Standard-GPUs zu mieten:

  • Groq: Groq beschreibt sich als Neocloud für schnelle Inferenz auf Basis seiner LPU, die inzwischen über LPX mit NVIDIA-GPUs zusammenarbeitet.
  • SambaNova SambaCloud: SambaNova sagt, sein RDU-Chip ermögliche SambaCloud schnelle Inferenz auf den größten Modellen. SambaCloud unterstützt Open-Source-Familien wie DeepSeek, Llama und Qwen.

Im Vergleich dazu hebt sich Cerebras durch seinen Wafer-Scale-Prozessor, eine OpenAI-kompatible API mit einem Self-Service-Test über $5 und die Möglichkeit ab, CS-4-Systeme on-premises zu installieren, während sein Self-Service-Katalog auf zwei Modelle beschränkt ist.

Einschränkungen

Rate Limits und Kontextfenster

  • Im kostenlosen Test ist jedes Shared-Inference-Modell auf 5 Anfragen pro Minute, 30.000 nicht gecachte Token pro Minute, 90.000 Token insgesamt pro Minute sowie 1 Mio. Token pro Stunde und pro Tag begrenzt, und qwen-3.8-27b akzeptiert 2 Bilder pro Anfrage innerhalb einer Payload von 10 MiB.
  • In der Developer-Stufe erlaubt gpt-oss-120b 1 Mio. nicht gecachte Token pro Minute und 1.000 Anfragen pro Minute, während qwen-3.8-27b 150.000 nicht gecachte Token pro Minute und 300 Anfragen pro Minute erlaubt, wobei sein Gesamtlimit vorübergehend von 450.000 auf 750.000 angehoben wurde.
  • Die Limits gelten pro Organisation statt pro Nutzer und variieren je nach Modell.
  • Die Kapazität füllt sich nach einem Token-Bucket-Algorithmus kontinuierlich auf, statt in festen Intervallen zurückgesetzt zu werden, und ein 429-Fehler gibt an, ob das Limit für nicht gecachte oder das Gesamt-Token-Limit überschritten wurde.
  • Gecachte Token zählen nicht zum Limit für nicht gecachte Token, und das Gesamtlimit beträgt standardmäßig das Dreifache davon, sodass die Cache-Trefferquote den Durchsatz direkt bestimmt.

Nutzerberichte weisen in dieselbe Richtung. In einer öffentlichen Entwicklerdiskussion über den Start von Qwen 3.8 27B bei Cerebras sagten mehrere Entwickler, der von Cerebras erlaubte 128k-Kontext sei für lange agentische oder Coding-Aufgaben zu klein. Andere im selben Thread sagten, das 150.000-TPM-Limit am öffentlichen Endpunkt mache das Modell für viele Coding-Aufgaben schwer nutzbar. Eine Meinungskolumne eines IT-Mediums vom September 2025, geschrieben, als Cerebras Code Qwen3 Coder nutzte, berichtete, dass die Generierung 10 bis 20 Sekunden lang dahinflog, bevor das Token-Limit pro Minute 429-Fehler auslöste, bis die Minute zurückgesetzt wurde.

Katalogwechsel und Vorschaufunktionen

  • Seit dem 3. September 2026 ist gemma-4-31b nicht mehr auf Shared Inference verfügbar, bleibt aber auf Dedicated Inference erhalten.
  • Das Deprecation-Log führt zai-glm-4.7 als am 2026-08-17 abgekündigt, während die Seite von Cerebras Code weiterhin mit GLM 4.7 wirbt; die beiden offiziellen Seiten stimmen also nicht überein.
  • Batch befindet sich in der Private Preview ohne SDK-Unterstützung, daher werden Batch-Jobs per cURL oder direkten HTTP-Anfragen eingereicht.
  • Service-Tiers zur Priorisierung von Anfragen sind mit Shared Inference nicht verfügbar.

API-Kompatibilitätslücken

  • Nur n: 1 wird unterstützt, und Bilder müssen als base64-kodierte PNG- oder JPEG-Data-URIs gesendet werden, weil externe HTTPS-Bild-URLs nicht unterstützt werden.
  • gpt-oss-120b lehnt Anfragen ab, die tools mit response_format kombinieren.
  • In ein Bild eingebetteter Text gelangt in den Prompt-Kontext, sodass ein Bild mit adversarialen Anweisungen das Modell dazu bringen kann, ihnen zu folgen, wenn der Prompt eine Antwort anhand des Bildes verlangt.

Leistungsangaben

Cerebras sagt, seine Leistungsvergleiche beruhten auf Benchmarks Dritter oder internen Tests und die beobachteten Geschwindigkeitsgewinne gegenüber GPU-Systemen könnten je nach Workload, Konfiguration, Datum und Modell variieren.

Datenschutz, Datennutzung und Bedingungen

  • Laut Datenschutzerklärung speichert Cerebras Ein- und Ausgaben seiner Trainings-, Inferenz- und Chatbot-Dienste nicht und löscht zugehörige Logs, sobald sie für die Erbringung des Dienstes nicht mehr nötig sind.
  • Cerebras erklärt, dass Playground- und API-Anfragen niemals zum Trainieren von Modellen verwendet werden.
  • Davon getrennt heißt es in der Batch-Dokumentation, dass Batch-Ergebnisse nach Abschluss 7 Tage aufbewahrt und dann automatisch gelöscht werden.
  • Das Trust Center führt SOC 2 Type 2, DSGVO (GDPR) und CCPA unter Compliance auf, Sicherheitsdokumentation gibt es auf Anfrage.
  • Bei API-Nutzung richtet sich das Eigentum an Modellausgaben nach den Bedingungen der Drittanbietermodelle, und Cerebras beansprucht kein Eigentum daran.
  • Konten setzen voraus, dass Nutzer mindestens 13 Jahre alt sind oder das Mindestalter für digitale Einwilligung in ihrem Land erreicht haben.
  • Die Cloud Console bietet keine Self-Service-Kontolöschung, Löschanfragen gehen daher an den Support.

FAQ

Q1. Was passiert, wenn das Testguthaben von $5 aufgebraucht ist?

API- und Playground-Zugang enden, aber API-Schlüssel, Projekte und Einstellungen bleiben erhalten, und ein Pay-as-you-go-Kauf reaktiviert den Zugang in der Developer-Stufe, die keine stündlichen oder täglichen Token-Obergrenzen hat.

Q2. Kann Cerebras das Modell hinter einer bestehenden Modell-ID austauschen?

Cerebras sagt, es liefere für bestehende Modell-IDs die Originalgewichte ohne Änderung aus und würde künftige beschnittene Varianten unter eigenen Modell-IDs veröffentlichen.

Q3. Funktioniert das OpenAI-SDK mit Dedicated Inference?

Ja. Das OpenAI-kompatible Feld model nimmt auf Shared Inference eine exakte Modell-ID und auf Dedicated Inference Ihre stabile Endpunkt-ID entgegen, die jede Anfrage an ihr aktives Deployment weiterleitet.

Kennen Sie ein ähnliches Tool?
Wenn Sie andere großartige KI-Tools kennen, können Sie sie uns gerne einreichen