Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Cerebras ist eine KI-Inferenzplattform, die Sprachmodelle mit offenen Gewichten auf den eigenen Wafer-Scale-Prozessoren des Unternehmens ausführt. Entwickler nutzen sie über Cerebras Inference, eine Cloud-API mit Playground im Browser; größere Organisationen können Dedicated-Kapazität reservieren oder Cerebras-Systeme in eigenen Rechenzentren installieren, und dieselbe Hardware trägt auch Trainings- und Fine-Tuning-Dienste.
Die öffentliche Cloud-Stufe bietet eine regelmäßig aktualisierte Modellauswahl auf einem gemeinsamen Endpunkt, den Sie mit einem API-Schlüssel aufrufen.
Geschwindigkeit ist das zentrale Verkaufsargument. Cerebras stellt sein neuestes Rack-Scale-System, das CS-4, als bis zu 30-mal schneller bei der Inferenz als GPUs dar – eine Herstellerangabe, keine unabhängige Messung.
Das Unternehmen hinter dem Produkt, Cerebras Systems, nahm im Mai 2026 bei einem Börsengang 5,5 Milliarden US-Dollar ein, und unabhängige Wirtschaftsberichte nennen OpenAI, G42, die Mohamed bin Zayed University of Artificial Intelligence und Amazon Web Services unter seinen Kunden.
Die Modelltreue ist ungewöhnlich detailliert dokumentiert. Cerebras erklärt, dass jedes Modell auf Shared Inference die originale, nicht beschnittene Version ist. Die Gewichte werden mit selektiver reiner Gewichtsquantisierung in teilweise 16-, 8- oder 4-Bit-Formaten gespeichert, während sensible Schichten in voller Präzision bleiben und Aktivierungen, Attention und KV-Cache unquantisiert sind. Wer Anbieter für schnelle KI-Inferenz vergleicht, erfährt so, was hinter den Geschwindigkeitswerten tatsächlich ausgeliefert wird.
Prompt-Caching greift automatisch bei allen unterstützten API-Anfragen, ohne Cache-Breakpoints oder Codeänderungen. Cerebras garantiert eine Cache-Lebensdauer (TTL) von 5 Minuten, und Einträge können je nach Systemlast bis zu 1 Stunde bestehen bleiben. Der Vorteil liegt in der Kapazität, nicht im Preis: Gecachte Token zählen nicht zum Limit für nicht gecachte Token, werden aber nicht rabattiert.
Dedicated Inference reserviert Kapazität für eine einzelne Organisation und ist die Option, auf die Cerebras für Produktionsarbeit mit Bedarf an vorhersehbarer Leistung verweist. Teams können damit auch feinabgestimmte Gewichte neben den Standardmodellversionen bereitstellen. Jedes Deployment lässt sich nach Kapazität, Draft-Modellen, Modellkonfiguration und Quantisierung abstimmen und ergänzt alle Shared-Inference-Funktionen um Fine-Tuning, Gewichtsverwaltung und Steuerung der Service-Tiers. Auf der dedizierten Seite werden unter anderem Qwen 3.8, Qwen3 und Qwen3-Coder, Llama 3 und Llama 4, GLM 4.X und 5.X, Kimi K2.X sowie DeepSeek V3.X unterstützt.
Die Batch API verarbeitet Gruppen von Anfragen asynchron, und Batch-Anfragen werden garantiert innerhalb von 24 Stunden abgeschlossen.
Cerebras Code ist ein Coding-Abo für die Nutzung im eigenen Editor. Laut Produktseite läuft dafür GLM 4.7 zur Codegenerierung mit mehr als 1.000 Token pro Sekunde, das Deprecation-Log der API erzählt allerdings eine andere Geschichte.
Cerebras Training Cloud wird als Möglichkeit beschrieben, Modelle von 1 Milliarde bis zu mehreren zehn Billionen Parametern mit demselben einfachen Code zu trainieren und feinabzustimmen.
Das CS-4-System läuft auf dem WSE-3-Turbo-Prozessor, den Cerebras mit vier Billionen Transistoren und 900.000 KI-Kernen beschreibt, die 250 PFLOPS Rechenleistung und 43,2 Petabyte pro Sekunde Speicherbandbreite liefern. Laut CS-4-Seite beginnen die ersten Auslieferungen in diesem Quartal, ein Datum wird nicht genannt.
Cerebras ordnet seine Anwendungsfälle um Workloads, bei denen das Warten auf Token dem Produkt schadet:
Das sichtbarste Deployment ist extern. Im Februar 2026 berichtete unabhängige Technikpresse, dass OpenAIs GPT-5.3-Codex-Spark, ein kleineres Codex-Modell für schnellere Inferenz und Zusammenarbeit in Echtzeit, auf der Wafer Scale Engine 3 von Cerebras läuft.
Cerebras passt zu Teams, für die die Antwortgeschwindigkeit das Produkt verändert, doch der richtige Einstieg hängt von der Phase ab:
Auch der Support unterscheidet sich je nach Stufe: Developer-Konten sind auf einen Community-Discord angewiesen, Enterprise-Kunden erhalten ein eigenes Account-Team.
Weniger geeignet ist es für alle, die eine dauerhaft kostenlose Stufe, sehr lange Kontextfenster am Self-Service-Endpunkt oder eine breite Self-Service-Modellauswahl erwarten; die Details stehen in den Abschnitten zu Preisen, Einschränkungen und Funktionen.
Die Cerebras-API-Preise in der Self-Service-Stufe Developer folgen dem Pay-as-you-go-Prinzip und beginnen mit einem kostenlosen Guthaben von $5, während Enterprise-Preise auf Anfrage genannt werden.
| Modell (Developer-Stufe) | Eingabe | Ausgabe |
|---|---|---|
| GPT OSS 120B | $0.35 pro Mio. Token | $0.75 pro Mio. Token |
| Qwen 3.8 27B | $0.99 pro Mio. Token | $1.49 pro Mio. Token |
Cerebras Code Pro ist mit $50 für bis zu 24 Millionen Token pro Tag gelistet und richtet sich an Indie-Entwickler und Wochenendprojekte. Cerebras Code Max ist mit $200 für bis zu 120 Millionen Token pro Tag gelistet und richtet sich an Vollzeitentwicklung und Multi-Agenten-Systeme. Beide kostenpflichtigen Pläne waren beim Abruf am 4. Oktober 2026 als ausverkauft markiert, und die für diese Seite geprüften Plankarten nennen keinen Abrechnungszeitraum.
Training Cloud wird entweder pro Stunde verkauft, wobei Cerebras die Zeit bemisst, die ein eingereichter Workload braucht, oder pro Modell, wobei Cerebras-Experten ein Modell auf Ihrem Datensatz entwerfen und feinabstimmen; die Training-Cloud-Seite listet diese Optionen ohne Preise.
Auch andere Anbieter bauen eigene Chips für schnelle Inferenz, statt Standard-GPUs zu mieten:
Im Vergleich dazu hebt sich Cerebras durch seinen Wafer-Scale-Prozessor, eine OpenAI-kompatible API mit einem Self-Service-Test über $5 und die Möglichkeit ab, CS-4-Systeme on-premises zu installieren, während sein Self-Service-Katalog auf zwei Modelle beschränkt ist.
Nutzerberichte weisen in dieselbe Richtung. In einer öffentlichen Entwicklerdiskussion über den Start von Qwen 3.8 27B bei Cerebras sagten mehrere Entwickler, der von Cerebras erlaubte 128k-Kontext sei für lange agentische oder Coding-Aufgaben zu klein. Andere im selben Thread sagten, das 150.000-TPM-Limit am öffentlichen Endpunkt mache das Modell für viele Coding-Aufgaben schwer nutzbar. Eine Meinungskolumne eines IT-Mediums vom September 2025, geschrieben, als Cerebras Code Qwen3 Coder nutzte, berichtete, dass die Generierung 10 bis 20 Sekunden lang dahinflog, bevor das Token-Limit pro Minute 429-Fehler auslöste, bis die Minute zurückgesetzt wurde.
Cerebras sagt, seine Leistungsvergleiche beruhten auf Benchmarks Dritter oder internen Tests und die beobachteten Geschwindigkeitsgewinne gegenüber GPU-Systemen könnten je nach Workload, Konfiguration, Datum und Modell variieren.
API- und Playground-Zugang enden, aber API-Schlüssel, Projekte und Einstellungen bleiben erhalten, und ein Pay-as-you-go-Kauf reaktiviert den Zugang in der Developer-Stufe, die keine stündlichen oder täglichen Token-Obergrenzen hat.
Cerebras sagt, es liefere für bestehende Modell-IDs die Originalgewichte ohne Änderung aus und würde künftige beschnittene Varianten unter eigenen Modell-IDs veröffentlichen.
Ja. Das OpenAI-kompatible Feld model nimmt auf Shared Inference eine exakte Modell-ID und auf Dedicated Inference Ihre stabile Endpunkt-ID entgegen, die jede Anfrage an ihr aktives Deployment weiterleitet.