Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Groq ist eine Inferenz-Cloud fĂŒr KI: eine Infrastruktur, an die man Anfragen schickt, und keine Anwendung, in die man sich einloggt, um zu chatten. Das Unternehmen beschreibt sich selbst als fĂŒhrende Neocloud fĂŒr schnelle Inferenz und vereint Infrastruktur, Inferenz und Steuerung in einer Plattform. Die gesamte ProdukterzĂ€hlung ruht auf einer Unterscheidung: Training bringt ein Modell hervor, Inferenz ist das, was jedes Mal geschieht, wenn dieses Modell tatsĂ€chlich genutzt wird. Die offizielle Seite formuliert es unmissverstĂ€ndlich: Training schafft die Möglichkeit, Inferenz schafft den Wert. Jeder bediente Kunde, jede abgeschlossene Agentenaufgabe, jeder von einem Modell geprĂŒfte Commit ist ein Inferenzaufruf â und je stĂ€rker Produkte auf KI setzen, desto mehr wird dieser Aufruf zum Engpass.
Was Groq unter den Cloud-Anbietern ungewöhnlich macht, ist der Start auf der Siliziumebene. Das Unternehmen hat die LPU entwickelt, einen Prozessor, der speziell fĂŒr das AusfĂŒhren trainierter Modelle statt fĂŒr deren Training gebaut wurde, und betreibt diese Hardware heute neben NVIDIA-beschleunigtem Computing als globale Produktions-Cloud. FĂŒr Entwicklerinnen und Entwickler verschwindet all das hinter einem einzigen HTTPS-Endpunkt. Man richtet das OpenAI-SDK auf https://api.groq.com/openai/v1, tauscht den API-SchlĂŒssel aus, und bestehender Code lĂ€uft ohne weitere Ănderungen auf Groq. Abgerechnet wird pro verbrauchtem Token, nicht pro Arbeitsplatz und nicht pro Monat.
Der Katalog, auf den man Zugriff erhĂ€lt, ist bewusst offen gehalten. Statt proprietĂ€re Spitzenmodelle zu hosten, liefert Groq Modelle mit offenen Gewichten â GPT-OSS, Qwen, Whisper und historisch die Llama-Familie â in Geschwindigkeiten, die geschlossene Modell-APIs in der Regel nicht erreichen. Dieser Tausch ist das Zentrale am Produkt: Man verzichtet auf Zugang zu den allergröĂten proprietĂ€ren Modellen und gewinnt Latenz, Durchsatz und Preisberechenbarkeit. Groq passt hervorragend, wenn Antwortgeschwindigkeit selbst ein Produktmerkmal ist. Es passt nicht, wenn man das leistungsfĂ€higste Modell am Markt braucht, ganz gleich, wie lange die Antwort dauert.
Inferenz-Hardware auf LPU-Basis: Die Language Processing Unit ist Groqs eigenes Silizium, fĂŒr Inferenz konstruiert statt aus Trainingshardware abgeleitet. Groq veröffentlicht Kennzahlen auf Rack-Ebene: 256 LPUs pro Rack, 40 PB/s SRAM-Bandbreite, 128 GB On-Chip-SRAM pro Rack, 315 PFLOPS FP8-Inferenzleistung und als Schlagzahl 1.000 Token pro Sekunde und Nutzer. Die architektonische Wette lautet, dass das Halten der Modellgewichte in schnellem On-Chip-Speicher â statt sie aus externem Speicher zu streamen â jene Latenzuntergrenze beseitigt, an die das Serving auf GPUs stöĂt.
Eine OpenAI-kompatible API: Die Migration wurde bewusst trivial gehalten. Basis-URL Ă€ndern, SchlĂŒssel Ă€ndern, bestehende OpenAI-Clientbibliothek behalten â und die Anwendung lĂ€uft auf anderer Hardware. Groq liefert zusĂ€tzlich eigene Python- und TypeScript-SDKs fĂŒr Teams, die einen nativen Client bevorzugen. Genau diese Designentscheidung erklĂ€rt, warum Groq so hĂ€ufig als unmittelbares Geschwindigkeits-Upgrade in Projekten auftaucht, die ursprĂŒnglich gegen OpenAI geschrieben wurden.
Ein Katalog offener Gewichte: Der Produktionskatalog dreht sich um Modelle mit offenen Gewichten: openai/gpt-oss-120b und openai/gpt-oss-20b fĂŒr Text sowie whisper-large-v3 und whisper-large-v3-turbo fĂŒr Spracherkennung. Die Preview-PlĂ€tze tragen neuere oder spezialisiertere Modelle â Qwen3.6 27B, GPT-OSS Safeguard fĂŒr Moderation, Llama Prompt Guard zur Erkennung von Prompt-Injection und Orpheus-Stimmen fĂŒr Sprachsynthese. Jedes Modell ist in der Dokumentation mit Geschwindigkeit, Preis, Ratenlimit, Kontextfenster und maximaler AntwortlĂ€nge ausgewiesen, sodass sich eine Arbeitslast kalkulieren lĂ€sst, bevor Code entsteht.
Compound: Modelle plus eingebaute Werkzeuge: Ăber reine Modellendpunkte hinaus bietet Groq sogenannte Systeme an. Groq Compound ist ein KI-System auf Basis offen verfĂŒgbarer Modelle, das eingebaute Werkzeuge â darunter Websuche und CodeausfĂŒhrung â selektiv einsetzt, um eine Anfrage zu beantworten. Compound und Compound Mini laufen mit rund 450 Token pro Sekunde bei einem Kontextfenster von 131.072 Token und liefern agentisches Verhalten, ohne dass man die Werkzeugaufruf-Schleife selbst bauen mĂŒsste.
Spracherkennung als eigenstĂ€ndige Produktlinie: Whisper ist hier keine Nebenfunktion. Es hat eine eigene Abrechnungseinheit (Audiostunde statt Token), eigene Ratenlimit-Dimensionen â Audiosekunden pro Stunde und pro Tag â, eine eigene Dateiobergrenze von 100 MB sowie dedizierte Endpunkte fĂŒr Transkription und Ăbersetzung. Teams, die Besprechungsprotokolle, GesprĂ€chsanalysen oder Untertitel-Pipelines bauen, können Groq fĂŒr die Audiostufe nutzen, ohne es fĂŒr Textgenerierung zu ĂŒbernehmen.
Servicestufen fĂŒr unterschiedliche ZuverlĂ€ssigkeitsansprĂŒche: Ein einzelner service_tier-Parameter bestimmt, wie die Anfrage eingeplant wird. on_demand ist die Voreinstellung und liefert Groqs ĂŒbliche Geschwindigkeit mit gelegentlicher Wartezeit zu Spitzenzeiten. flex tauscht ZuverlĂ€ssigkeit gegen Spielraum: zehnfache Ratenlimits zum gleichen Preis, nach dem Best-Effort-Prinzip. performance ist die Unternehmensstufe fĂŒr latenzkritische Produktion, auto wĂ€hlt die jeweils beste verfĂŒgbare Stufe.
Unternehmenssteuerung und dedizierte KapazitĂ€t: Die Plattform wird als drei aufeinander aufbauende Schichten verkauft. GroqMetal stellt dedizierte Bare-Metal-Infrastruktur bereit, GroqCore legt den erprobten Inferenz-Stack darĂŒber, und GroqAssured ergĂ€nzt Governance auf Unternehmensniveau, Auditierbarkeit und Kontrolle â jede Schicht schlieĂt die darunterliegenden ein. Diese Struktur erlaubt es, auf der geteilten API zu starten und spĂ€ter ohne Ănderung der Integration auf dedizierte KapazitĂ€t zu wechseln.
Globale PrĂ€senz: Groq betreibt dreizehn Rechenzentren auf vier Kontinenten, von Liberty Lake und Dallas ĂŒber Vantaa und Sydney bis London und Riad, mit Standorten in Kanada und Saudi-Arabien neben den US-amerikanischen und europĂ€ischen. FĂŒr latenzempfindliche Anwendungen zĂ€hlt die physische NĂ€he zu den Nutzenden ebenso viel wie die Chipgeschwindigkeit.
KonversationsoberflĂ€chen in Echtzeit: Wenn Nutzende zusehen, wie Text erscheint, ist der Unterschied zwischen 50 und 500 Token pro Sekunde der Unterschied zwischen Warten und Lesen. Support-Assistenten, produktinterne Copiloten und Sprachagenten passen am deutlichsten, weil die wahrgenommene ReaktionsfĂ€higkeit selbst das Merkmal ist. Ein verbreitetes Muster kombiniert ein schnelles kleines Modell auf Groq mit einem langsameren, stĂ€rkeren Modell fĂŒr Eskalationen: neunzig Prozent der einfachen Anfragen in GesprĂ€chsgeschwindigkeit bedienen und den Rest anderswohin leiten.
Agentenschleifen und Werkzeugaufruf-Ketten: Ein Agent, der plant, ein Werkzeug aufruft, das Ergebnis liest und erneut plant, multipliziert die Latenz mit der Zahl der Schritte. Eine fĂŒnfstufige Kette mit zwei Sekunden pro Schritt bedeutet zehn Sekunden Wartezeit; dieselbe Kette mit 300 Millisekunden pro Schritt wirkt unmittelbar. Hier verzinst sich schnelle Inferenz am dramatischsten, und deshalb wird Groq hĂ€ufiger unter Coding-Agenten und Workflow-Automatisierungen eingesetzt als fĂŒr einmalige Generierung.
Massentextverarbeitung und Klassifikation: RĂŒckstĂ€nde zusammenfassen, Support-Tickets verschlagworten, strukturierte Felder aus Zehntausenden DatensĂ€tzen extrahieren â solche Lasten interessieren sich fĂŒr Durchsatz und StĂŒckkosten, nicht fĂŒr die Latenz einer Einzelanfrage. Die flex-Stufe existiert genau fĂŒr diese Arbeitsform und bietet die zehnfachen Standardlimits bei identischem Preis pro Token, wĂ€hrend die Batch-Verarbeitung AuftrĂ€ge ĂŒbernimmt, die ein verzögertes Zeitfenster vertragen.
Transkription und Audio-Pipelines: Whisper auf Groq verarbeitet Besprechungsaufzeichnungen, Podcast-Archive, Callcenter-Audio und Untertitelerstellung, abgerechnet pro Audiostunde statt pro Token. Da Transkription und Textgenerierung hinter derselben API und demselben SchlĂŒssel liegen, benötigt eine Pipeline, die ein GesprĂ€ch transkribiert und anschlieĂend zusammenfasst, nur eine Anbieterbeziehung.
Prototyping und kostenkontrollierte Erprobung: Die kostenlose Stufe verlangt keine Kreditkarte und gewĂ€hrt Zugriff auf den Modellkatalog mit reduzierten Ratenlimits, weshalb Groq oft die erste Station fĂŒr Hackathon-Projekte, Nebenprojekte und interne Demos ist. Das Hinterlegen einer Zahlungsmethode hebt die Limits, ohne ein Abonnement einzugehen, sodass die Kosten einer Evaluierung durch die tatsĂ€chliche Nutzung begrenzt bleiben.
Migration einer bestehenden OpenAI-Anwendung: Weil die API auf Ebene der Clientbibliothek kompatibel ist, nutzen Teams Groq hĂ€ufig als VergleichsmaĂstab statt als Festlegung â dieselben Prompts gegen beide Anbieter laufen lassen und Latenz, Kosten und AusgabequalitĂ€t mit einer zweizeiligen KonfigurationsĂ€nderung vergleichen. Manche Lasten wandern dauerhaft, andere bleiben nach Aufgabentyp aufgeteilt.
Lege ein Konto in der Groq-Konsole an. Registriere dich, bestĂ€tige deine E-Mail-Adresse, und du landest in einer Organisation â das ist wichtig, weil Kontingente auf Organisationsebene und nicht pro Nutzer gefĂŒhrt werden.
Erzeuge einen API-SchlĂŒssel. Lege in der Konsole einen SchlĂŒssel an und speichere ihn in einer Umgebungsvariablen wie GROQ_API_KEY. Committe ihn niemals in die Versionsverwaltung; der SchlĂŒssel autorisiert Ausgaben zulasten deiner Organisation.
Richte deinen Client auf Groq. Wenn du bereits das OpenAI-SDK nutzt, setze base_url auf https://api.groq.com/openai/v1 und ĂŒbergib deinen Groq-SchlĂŒssel als api_key. Beginnst du neu, installiere das offizielle Paket groq fĂŒr Python oder groq-sdk fĂŒr TypeScript. Die erste Anfrage ist ein gewöhnlicher Chat-Completion-Aufruf mit einer Modell-ID wie openai/gpt-oss-20b.
WĂ€hle das passende Modell fĂŒr die Aufgabe. Lies die Seite der unterstĂŒtzten Modelle, bevor du dich festlegst: Sie fĂŒhrt fĂŒr jedes Modell Geschwindigkeit in Token pro Sekunde, Preis pro Million Token, Ratenlimits, Kontextfenster und maximale Antwort-Token auf. Nimm fĂŒr alles, was in den Betrieb geht, Produktionsmodelle â Preview-Modelle dienen der Evaluierung und können kurzfristig entfallen.
Lege eine Servicestufe fest und behandle Ratenlimits. Lass service_tier fĂŒr das voreingestellte On-Demand-Verhalten leer oder setze es auf flex fĂŒr durchsatzstarke, batchartige Arbeit, sobald du zahlender Kunde bist. Lies die Antwort-Header x-ratelimit-remaining-tokens und x-ratelimit-remaining-requests und implementiere Wiederholungen mit zufĂ€lliger Verzögerung bei HTTP 429 und, bei flex, HTTP 498.
Richte Abrechnungskontrollen ein, bevor du skalierst. Hinterlege eine Zahlungsmethode, um die Obergrenzen der kostenlosen Stufe aufzuheben, und setze anschlieĂend in der Konsole ein Ausgabenlimit sowie Nutzungswarnungen. Beobachte den Verbrauch unter Dashboard â Usage in der ersten Produktionswoche, in der SchĂ€tzungen am wenigsten belastbar sind.
WĂ€hle das Modell nach Aufgabe statt standardmĂ€Ăig das gröĂte. Auf Groq sind die kleineren Modelle deutlich schneller und gĂŒnstiger, und bei Klassifikation, Extraktion, Routing und kurzer Generierung ist der QualitĂ€tsunterschied fĂŒr Nutzende oft unsichtbar. Vergleiche gpt-oss-20b und gpt-oss-120b mit deinen eigenen Prompts, bevor du annimmst, das gröĂere zu brauchen â der Geschwindigkeitsunterschied liegt bei etwa Faktor zwei.
Plane die AbkĂŒndigung von Modellen vom ersten Tag an ein. Groqs Katalog erneuert sich schnell. Lies die Modell-ID aus der Konfiguration, statt sie fest zu verdrahten, behalte die Deprecations-Seite im Blick und stelle sicher, dass die Kontoadresse jemanden erreicht, der auf Migrationshinweise reagiert. Eine verschwundene Modell-ID ist ein Ausfall, wenn dein Code nicht schnell neu ausgerollt werden kann.
Versuche nicht, Spielraum ĂŒber zusĂ€tzliche API-SchlĂŒssel zu kaufen. Ratenlimits gelten auf Organisationsebene statt pro Nutzer oder pro SchlĂŒssel; zusĂ€tzliche SchlĂŒssel heben deine Obergrenze nicht an. Brauchst du mehr Durchsatz, hinterlege eine Zahlungsmethode, wechsle auf die flex-Stufe oder sprich mit dem Vertrieb ĂŒber dedizierte KapazitĂ€t.
Miss die Latenz bis zum ersten Token getrennt von der Gesamtlatenz. Groqs Vorteil zeigt sich in beidem, doch beide reagieren auf unterschiedliche MaĂnahmen. Ein langsames erstes Token deutet meist auf Warteschlangen oder eine entfernte Region hin, eine langsame VervollstĂ€ndigung meist darauf, dass mehr generiert wird als nötig. Begrenze max_tokens konsequent â eine kĂŒrzere Antwort ist auf jeder Hardware schneller.
Nutze Prompt-Caching und halte System-Prompts stabil. Zwischengespeicherte Token zĂ€hlen nicht auf deine Ratenlimits an; ein ĂŒber Anfragen hinweg stabiler System-Prompt senkt also die Kosten und verschafft zugleich effektiven Durchsatz. Den System-Prompt bei jedem Aufruf umzuschreiben verschenkt diesen Vorteil.
Implementiere Wiederholungen sauber, besonders bei flex. Die flex-Stufe ist ausdrĂŒcklich Best Effort: KapazitĂ€tsfehler sind erwartbar, kommen schnell zurĂŒck und lassen sich gefahrlos wiederholen. Exponentielles Backoff mit Jitter ist dort keine Option, sondern Pflicht. Behandle HTTP 498 als âgleich noch einmal versuchen", nicht als Fehler, den Nutzende zu sehen bekommen.
Aktiviere Zero Data Retention, bevor du Sensibles sendest. ZDR steht allen Kunden offen, ist aber nicht die Voreinstellung, und seine Aktivierung deaktiviert zugleich Funktionen, die Persistenz benötigen. Entscheide diesen Zielkonflikt vor der ersten Produktionsanfrage, nicht danach.
Halte einen Ausweichpfad zu einem anderen Anbieter offen. Da die API in beide Richtungen OpenAI-kompatibel ist, kostet ein zweiter, hinter derselben Schnittstelle konfigurierter Anbieter wenig und schĂŒtzt vor KapazitĂ€tsereignissen, AbkĂŒndigungen und PreisĂ€nderungen.
Anwendungsentwickler mit latenzkritischen KI-Funktionen: Wer Nutzende hat, die dem Text beim Erscheinen zusehen â Chat-OberflĂ€chen, Copiloten, Sprachprodukte â, profitiert am unmittelbarsten, weil Geschwindigkeit direkt in wahrgenommene QualitĂ€t umschlĂ€gt.
Teams, die Agenten und mehrstufige Workflows bauen: Wenn sich Latenz ĂŒber Schritte hinweg multipliziert, ist schnelle Inferenz mehr wert, als ein Benchmark auf Einzelanfragen vermuten lĂ€sst. Agenten-Frameworks, Coding-Assistenten und Automatisierungspipelines sind naheliegende Kandidaten.
Ingenieure, die bereits auf das OpenAI-SDK gesetzt haben: Ist die Codebasis gegen OpenAIs Clientbibliotheken geschrieben, kostet eine Evaluierung von Groq eine KonfigurationsĂ€nderung statt eine Neuentwicklung. Diese niedrige WechselhĂŒrde ist der wirksamste Akquisitionskanal der Plattform.
Kostenbewusste Teams mit hohen Volumina einfacher Aufgaben: Klassifikation, Verschlagwortung, Extraktion und Zusammenfassung im groĂen MaĂstab sind auf kleinen Modellen mit offenen Gewichten deutlich gĂŒnstiger als auf proprietĂ€ren Spitzenmodellen, und die Abrechnung pro Token macht die Rechnung ĂŒberschaubar.
Start-ups und Prototypenbauer: Eine kostenlose Stufe ohne Kreditkarte und nutzungsbasierte Abrechnung ohne Abonnement-Untergrenze machen die Plattform leicht ausprobierbar und leicht wieder aufgebbar â genau das, was ein Team in der FrĂŒhphase braucht.
Unternehmen mit Anforderungen an Latenz, Governance oder Datenstandort: GroqAssured, die performance-Servicestufe, Zero Data Retention und dedizierte Bare-Metal-KapazitĂ€t existieren fĂŒr Organisationen, die nicht auf einem geteilten Best-Effort-Endpunkt betrieben werden können.
Teams, die Audio- und Transkriptionsprodukte bauen: Whisper-Preise pro Audiostunde, eigene Audio-Ratenlimits und Ăbersetzungsendpunkte machen Groq unabhĂ€ngig davon als Transkriptionsanbieter tragfĂ€hig, ob man es fĂŒr Text nutzt.
https://api.groq.com/openai/v1, mit Chat-Completions, Responses-API, Audio-Transkription, -Ăbersetzung und -Synthese sowie Batch-, Datei- und Fine-Tuning-Endpunkten.console.groq.com bietet Kontoverwaltung, API-SchlĂŒssel, Projekte, Modellberechtigungen, Nutzungs-Dashboards, Ausgabenlimits und Datenkontrollen samt vollstĂ€ndiger Dokumentation und API-Referenz.Kostenlose Stufe. Groq bietet eine kostenlose Entwicklerstufe ohne Kreditkarte, die Zugriff auf den Modellkatalog mit reduzierten Ratenlimits gewĂ€hrt. Sie ist fĂŒr Prototyping, Nebenprojekte, interne Demos und Funktionen mit geringem Volumen wirklich brauchbar, und die Grenze, an die man zuerst stöĂt, ist meist die Zahl der Anfragen pro Tag und nicht die Token. Strukturell entscheidend: Da Limits pro Organisation gefĂŒhrt werden, lĂ€sst sich ein kostenloses Konto nicht durch zusĂ€tzliche SchlĂŒssel erweitern.
Nutzungsbasierte Abrechnung. FĂŒr den API-Zugang fĂ€llt keine AbonnementgebĂŒhr an. Textmodelle werden pro Million Token mit getrennten SĂ€tzen fĂŒr Ein- und Ausgabe abgerechnet â etwa gpt-oss-120b mit 0,15 $ Eingabe und 0,60 $ Ausgabe pro Million Token und gpt-oss-20b mit 0,075 $ und 0,30 $ â, wĂ€hrend Spracherkennung pro Audiostunde abgerechnet wird, mit whisper-large-v3 zu 0,111 $ pro Stunde und der Turbo-Variante zu 0,04 $. Eine hinterlegte Zahlungsmethode hebt die Ratenlimits erheblich und schaltet die flex- und Batch-Stufen frei, die höheren Durchsatz zum gleichen Token-Preis bieten. UnabhĂ€ngige Messungen von Artificial Analysis verorten die gemischte Spanne ĂŒber den Katalog hinweg je nach Modell zwischen etwa 0,05 $ und 0,84 $ pro Million Token, also rund das Sechzehnfache Unterschied.
Abrechnungsmechanik. Belastungen sind zunĂ€chst progressiv statt rein monatlich: Das erstmalige Ăberschreiten der kumulierten Schwellen von 1 $, 10 $, 100 $, 500 $ und 1.000 $ löst sofortige Abbuchungen aus, bevor das Konto in die monatliche Rechnungsstellung ĂŒbergeht; fĂŒr Kundinnen und Kunden in Indien gilt ein abweichender Rhythmus. Rechnungen unter 0,50 $ werden nicht ausgestellt. Ausgabenlimits und Budgetwarnungen lassen sich in der Konsole konfigurieren, die Nutzung ist nahezu in Echtzeit einsehbar.
Unternehmen. VertrĂ€ge mit Ausgabenzusage, die performance-Servicestufe, dedizierte GroqMetal-KapazitĂ€t und die GroqAssured-Governance-Schicht werden ĂŒber den Vertrieb und nicht per Selbstbedienung verkauft. UnternehmensvertrĂ€ge bringen auch jenseits der KapazitĂ€t einen praktischen Vorteil: Kunden mit Ausgabenzusage sind von den ModellabkĂŒndigungen ausgenommen, die fĂŒr die kostenlose und die Entwicklerstufe gelten. Exakte Konditionen und aktuelle SĂ€tze sollten in der offiziellen Dokumentation und der Konsole geprĂŒft werden, da sich Katalog und Preise hĂ€ufig Ă€ndern.
Der Modellkatalog wird aggressiv erneuert. Das ist das praktisch relevanteste Risiko. Groqs eigene Deprecations-Seite dokumentiert einen stetigen Strom an AbkĂŒndigungen: llama-3.1-8b-instant und llama-3.3-70b-versatile wurden beide am 16. August 2026 abgeschaltet, qwen3-32b und llama-4-scout einen Monat zuvor, davor Kimi K2 und Llama 4 Maverick. AbkĂŒndigungen betreffen die kostenlose und die Entwicklerstufe, wĂ€hrend Unternehmenskunden mit Ausgabenzusage ausgenommen sind â die am wenigsten geschĂŒtzten Nutzenden tragen also die meiste Erneuerungslast. Preview-Modelle tragen den ausdrĂŒcklichen Hinweis, dass sie kurzfristig eingestellt werden können.
Die OpenAI-KompatibilitÀt ist nah, aber nicht vollstÀndig. Mehrere Parameter, die in OpenAI-Code vorkommen, schlagen schlicht fehl: logprobs, logit_bias, top_logprobs und messages[].name liefern allesamt einen 400er-Fehler, und n muss gleich 1 sein. Audio-Transkription gibt weder vtt noch srt aus, und eine Temperatur von 0 wird stillschweigend auf 1e-8 umgeschrieben. Im Regelfall ist die Migration leicht und kann dennoch an den RÀndern brechen: testen statt annehmen.
Die LeistungsfĂ€higkeit ist durch den Katalog offener Gewichte gedeckelt. Die Geschwindigkeit ist real, aber es ist Geschwindigkeit auf mittelgroĂen offenen Modellen. In den unabhĂ€ngigen Messungen von Artificial Analysis gehört der höchste Wert im Intelligence Index unter den elf erfassten Groq-Modellen Qwen3.6 27B mit 38 â deutlich unter proprietĂ€ren Spitzenmodellen. FĂŒr das schwierigste Reasoning, langwieriges Coding oder nuanciertes Schreiben kann ein langsameres Spitzenmodell weiterhin bessere Ergebnisse liefern.
Ratenlimits gelten organisationsweit und mehrdimensional. Anfragen pro Minute, Anfragen pro Tag, Token pro Minute, Token pro Tag und Audiosekunden gelten gleichzeitig, und gedrosselt wird an der Grenze, die zuerst greift: Ein Muster aus vielen winzigen Anfragen kann das Minutenkontingent erschöpfen, wĂ€hrend das Token-Budget kaum angetastet wird. FĂŒr manche Organisationen kommen getrennte Limits fĂŒr Eingabe- und Ausgabetoken hinzu.
Die flex-Stufe ist ausdrĂŒcklich Best Effort. Sie bietet die zehnfachen Ratenlimits zum gleichen Preis, doch Anfragen scheitern mit HTTP 498 und dem Fehler capacity_exceeded, wenn keine KapazitĂ€t verfĂŒgbar ist. Das ist bewusstes Design und kein Mangel â und es macht flex ohne RĂŒckfalloption fĂŒr nutzerseitige Pfade ungeeignet.
Der Datenstandort ist auf die USA festgelegt. Zwar werden Inferenzanfragen standardmĂ€Ăig nicht gespeichert und Zero Data Retention steht allen Kunden offen, doch alle tatsĂ€chlich gespeicherten Daten liegen in Google-Cloud-Platform-Buckets in den Vereinigten Staaten, wobei Standardvertragsklauseln die grenzĂŒberschreitende Ăbermittlung abdecken. Organisationen mit strengen EU- oder APAC-Anforderungen an den Datenstandort sollten dies gegen ihre Compliance-Pflichten prĂŒfen und beachten, dass die Aktivierung von ZDR persistenzabhĂ€ngige Funktionen wie Batch-Jobs und Fine-Tuning deaktiviert.
Die Unternehmenslage war zuletzt bewegt. Im Dezember 2025 berichtete DataCenterDynamics, dass GrĂŒnder Jonathan Ross und PrĂ€sident Sunny Madra im Rahmen einer nicht-exklusiven Technologielizenzvereinbarung zu NVIDIA wechselten, wĂ€hrend Groq als eigenstĂ€ndiges Unternehmen unter Simon Edwards weiterlief und GroqCloud ohne Unterbrechung in Betrieb blieb. Die Berichterstattung zum Wert des GeschĂ€fts war uneinheitlich: Die vielfach zitierte Zahl von 20 Milliarden Dollar wurde nicht unabhĂ€ngig verifiziert, und die Bedingungen der nicht-exklusiven Lizenz wurden nie offengelegt. Die Series A vom August 2026 bewertete das Unternehmen mit 3,5 Milliarden Dollar, etwa der HĂ€lfte der 6,9 Milliarden aus der Finanzierungsrunde im September 2025. Die DienstkontinuitĂ€t blieb durchgehend gewahrt, doch Teams, die mehrjĂ€hrige Infrastrukturzusagen erwĂ€gen, sollten EigentĂŒmer- und FĂŒhrungswechsel neben der Technik gewichten.
UnabhĂ€ngige Nutzerbewertungen sind dĂŒnn. Groq erhĂ€lt viel Presseberichterstattung, aber sehr wenig strukturiertes Feedback auf Bewertungsplattformen â der G2-Eintrag weist eine vernachlĂ€ssigbare Zahl an Rezensionen auf, und Drittanbieter-Verzeichnisse ordnen Groq als KI-API, groĂes Sprachmodell und Open-Source-KI-Modell ein statt als Consumer-Chatbot, ebenfalls ohne nennenswertes Rezensionsvolumen. Die stĂ€rkste verfĂŒgbare unabhĂ€ngige Evidenz sind Benchmark-Daten und keine Nutzeraussagen; Aussagen ĂŒber SupportqualitĂ€t oder langfristige ZuverlĂ€ssigkeit sind daher als unbestĂ€tigt zu behandeln.
Nicht mit Grok zu verwechseln. Groq (groq.com) ist Inferenzinfrastruktur von Groq LLC. Grok (grok.com) ist ein Consumer-Chat-Assistent von Elon Musks xAI. Die Namen unterscheiden sich nur in der Position eines Buchstabens, die Produkte haben nichts gemeinsam: andere Unternehmen, andere Zielgruppen, andere GeschÀftsmodelle.
Ja, es gibt eine kostenlose Entwicklerstufe ohne Kreditkarte, die Zugriff auf den Modellkatalog mit reduzierten Ratenlimits gewĂ€hrt und fĂŒr Prototyping und Projekte mit geringem Volumen ausreicht. Eine hinterlegte Zahlungsmethode hebt diese Limits erheblich und schaltet die flex- und Batch-Stufen frei; es gibt keine AbonnementgebĂŒhr, nur nutzungsbasierte Kosten pro Token.
Es sind zusammenhanglose Produkte, die wegen der beinahe identischen Schreibweise hÀufig verwechselt werden. Groq unter groq.com ist eine KI-Inferenz-Cloud auf LPU-Hardware, die Entwicklern als API verkauft wird. Grok unter grok.com ist ein Consumer-Chat-Assistent von xAI. Andere Unternehmen, andere Produkte, andere Preismodelle.
In den meisten FĂ€llen ja, mit zwei Ănderungen: Basis-URL auf https://api.groq.com/openai/v1 setzen und einen Groq-API-SchlĂŒssel ĂŒbergeben. Einige Parameter werden nicht unterstĂŒtzt und geben einen 400er-Fehler zurĂŒck â logprobs, logit_bias, top_logprobs und messages[].name â, und n muss 1 sein. Teste daher deine konkreten Aufrufmuster, statt einen glatten Austausch vorauszusetzen.
Groq liefert Modelle mit offenen Gewichten statt proprietĂ€rer Spitzenmodelle. Der Produktionskatalog dreht sich um openai/gpt-oss-120b und openai/gpt-oss-20b fĂŒr Text sowie whisper-large-v3 und dessen Turbo-Variante fĂŒr Sprache, mit Preview-PlĂ€tzen fĂŒr Modelle wie Qwen3.6 27B, Sicherheitsklassifikatoren und Orpheus-Stimmen fĂŒr Sprachsynthese. Die aktuelle Liste ist jederzeit ĂŒber die Modelldokumentation und den Endpunkt /openai/v1/models abrufbar.
UnabhÀngige Messungen von Artificial Analysis setzen das schnellste Modell auf Groq, gpt-oss-20b bei hohem Reasoning-Aufwand, auf median 949 Token pro Sekunde, mit einer minimalen Zeit bis zum ersten Token von rund 0,77 Sekunden. Groqs eigene Hardwareangaben nennen bis zu 1.000 Token pro Sekunde und Nutzer. Der tatsÀchliche Durchsatz variiert mit Modell, PromptlÀnge, Servicestufe und Last.
Groq gibt an, Kundendaten bei Inferenzanfragen standardmĂ€Ăig nicht zu speichern. Gespeichert wird nur fĂŒr Funktionen, die Persistenz erfordern, etwa Batch-Jobs und Fine-Tuning, oder vorĂŒbergehend zur Fehlersuche bei ZuverlĂ€ssigkeitsproblemen und zur Missbrauchsuntersuchung â dann fĂŒr bis zu 30 Tage. Alle Kunden können Zero Data Retention aktivieren, wodurch allerdings die persistenzabhĂ€ngigen Funktionen deaktiviert werden.
Die Inferenz lĂ€uft in dreizehn Rechenzentren auf vier Kontinenten, doch alle gespeicherten Kundendaten liegen in Google-Cloud-Platform-Buckets in den Vereinigten Staaten, wobei Ăbermittlungen gegebenenfalls durch Standardvertragsklauseln abgedeckt sind. Organisationen mit strengen regionalen Anforderungen sollten dies an den eigenen Vorgaben prĂŒfen.
Nein. Ratenlimits gelten auf Organisationsebene, zusĂ€tzliche SchlĂŒssel teilen sich also dasselbe Kontingent. FĂŒr mehr Spielraum hinterlegst du eine Zahlungsmethode, um auf die Limits der Entwicklerstufe zu wechseln, nutzt die flex-Stufe fĂŒr durchsatzstarke Arbeit oder vereinbarst dedizierte KapazitĂ€t ĂŒber den Vertrieb.
Abgerechnet wird pro Token bei Textmodellen und pro Audiostunde bei der Transkription, ohne Abonnementanteil. Anfangs erfolgt die Belastung progressiv: Das Konto wird belastet, wenn die kumulierte Nutzung 1 $, 10 $, 100 $, 500 $ und 1.000 $ ĂŒberschreitet, danach wird rein monatlich abgerechnet. Rechnungen unter 0,50 $ werden nicht ausgestellt, und Ausgabenlimits mit Budgetwarnungen sind in der Konsole konfigurierbar.
GroqCloud lief durch erhebliche UnternehmensverĂ€nderungen hindurch ohne Unterbrechung â darunter die NVIDIA-Lizenzvereinbarung, den Weggang des GrĂŒnders und einen FĂŒhrungswechsel â, und das Unternehmen sammelte im August 2026 eine Series A ĂŒber 350 Millionen Dollar bei einer Bewertung von 3,5 Milliarden ein. Das praktische Risiko liegt weniger im Verschwinden des Unternehmens als im Modellwechsel: Baue mit konfigurierbaren Modell-IDs, verfolge AbkĂŒndigungshinweise und halte hinter derselben Schnittstelle einen zweiten Anbieter bereit.