Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Groq est un cloud d'inférence pour l'IA : une infrastructure à laquelle vous envoyez des requêtes, et non une application dans laquelle vous vous connectez pour discuter. L'entreprise se présente comme le premier neocloud dédié à l'inférence rapide, réunissant infrastructure, inférence et contrôle au sein d'une même plateforme. Tout son discours produit repose sur une distinction : l'entraînement produit un modèle, tandis que l'inférence est ce qui se produit chaque fois que ce modèle est réellement utilisé. Le site officiel le formule sans détour : l'entraînement crée la possibilité, l'inférence crée la valeur. Chaque client servi, chaque tâche d'agent menée à terme, chaque revue de code effectuée par un modèle constitue un appel d'inférence — et à mesure que les produits s'appuient davantage sur l'IA, cet appel devient le goulot d'étranglement.
Ce qui distingue Groq des autres fournisseurs cloud, c'est qu'il est parti de la couche silicium. L'entreprise a créé le LPU, un processeur conçu spécifiquement pour exécuter des modèles déjà entraînés plutôt que pour les entraîner, et exploite aujourd'hui ce matériel aux côtés du calcul accéléré NVIDIA sous forme d'un cloud de production mondial. Pour un développeur, tout cela reste dissimulé derrière un unique point de terminaison HTTPS. Vous pointez le SDK OpenAI vers https://api.groq.com/openai/v1, vous remplacez la clé d'API, et le code existant s'exécute sur Groq sans autre modification. La facturation se fait au token consommé, ni par siège ni par mois.
Le catalogue auquel vous accédez est délibérément ouvert. Plutôt que d'héberger des modèles propriétaires de pointe, Groq sert des modèles à poids ouverts — GPT-OSS, Qwen, Whisper et, historiquement, la famille Llama — à des vitesses que les API fermées n'égalent généralement pas. Cet arbitrage est l'élément central à comprendre : vous renoncez à l'accès aux plus grands modèles propriétaires et vous gagnez en latence, en débit et en prévisibilité tarifaire. Groq convient parfaitement lorsque la rapidité de réponse est en soi une caractéristique du produit. Il ne convient pas lorsque vous avez besoin du modèle le plus performant du marché, quel que soit le temps d'attente.
Matériel d'inférence fondé sur le LPU : le Language Processing Unit est le silicium propriétaire de Groq, conçu pour l'inférence plutôt qu'adapté d'un matériel d'entraînement. Groq publie des chiffres au niveau de la baie : 256 LPU par baie, 40 Po/s de bande passante SRAM, 128 Go de SRAM embarquée par baie, 315 PFLOPS de calcul d'inférence en FP8 et un chiffre phare de 1 000 tokens par seconde et par utilisateur. Le pari architectural consiste à maintenir les poids du modèle dans une mémoire embarquée rapide plutôt que de les acheminer depuis une mémoire externe, ce qui supprime le plancher de latence auquel se heurte le service sur GPU.
Une API compatible OpenAI : la migration a été rendue délibérément triviale. Changez l'URL de base, changez la clé, conservez votre bibliothèque cliente OpenAI existante, et votre application tourne sur un autre matériel. Groq fournit également ses propres SDK Python et TypeScript pour les équipes qui préfèrent un client natif. C'est précisément cette décision de conception qui explique la fréquence avec laquelle Groq apparaît comme une simple accélération dans des projets initialement écrits pour OpenAI.
Un catalogue de modèles à poids ouverts : le catalogue de production s'articule autour de modèles à poids ouverts — openai/gpt-oss-120b et openai/gpt-oss-20b pour le texte, whisper-large-v3 et whisper-large-v3-turbo pour la reconnaissance vocale. Les emplacements en préversion accueillent des modèles plus récents ou plus spécialisés : Qwen3.6 27B, GPT-OSS Safeguard pour la modération, Llama Prompt Guard pour la détection d'injections, et les voix Orpheus pour la synthèse vocale. Chaque modèle est documenté avec sa vitesse, son prix, ses limites de débit, sa fenêtre de contexte et sa longueur maximale de complétion, ce qui permet de chiffrer une charge de travail avant d'écrire la moindre ligne de code.
Compound : des modèles associés à des outils intégrés : au-delà des points de terminaison de modèles bruts, Groq propose ce qu'il appelle des systèmes. Groq Compound est un système d'IA alimenté par des modèles ouverts qui recourt sélectivement à des outils intégrés — recherche web et exécution de code — pour répondre à une requête. Compound et Compound Mini fonctionnent à environ 450 tokens par seconde avec une fenêtre de contexte de 131 072 tokens, offrant un comportement agentique sans avoir à construire soi-même la boucle d'appel d'outils.
La transcription comme ligne de produit à part entière : Whisper n'est pas ici une fonctionnalité secondaire. Elle dispose de sa propre unité de facturation — l'heure d'audio plutôt que le token —, de ses propres dimensions de limitation de débit (secondes d'audio par heure et par jour), de son plafond de 100 Mo par fichier et de points de terminaison dédiés à la transcription et à la traduction. Les équipes qui construisent des comptes rendus de réunion, de l'analyse d'appels ou des chaînes de sous-titrage peuvent utiliser Groq pour l'étape audio sans l'adopter pour la génération de texte.
Des paliers de service adaptés aux besoins de fiabilité : un simple paramètre service_tier détermine la façon dont votre requête est planifiée. on_demand est la valeur par défaut et offre la vitesse habituelle de Groq avec une mise en file d'attente occasionnelle aux heures de pointe. flex échange de la fiabilité contre de la marge : dix fois les limites de débit au même prix, en meilleur effort. performance est le palier entreprise destiné aux productions sensibles à la latence. auto sélectionne le meilleur palier disponible à cet instant.
Contrôles d'entreprise et capacité dédiée : la plateforme se vend en trois couches empilées. GroqMetal fournit une infrastructure bare-metal dédiée, GroqCore y ajoute la pile d'inférence éprouvée, et GroqAssured ajoute par-dessus une gouvernance de niveau entreprise, l'auditabilité et le contrôle — chaque couche englobant celles du dessous. Cette structure permet à une entreprise de démarrer sur l'API partagée puis de basculer vers une capacité dédiée sans modifier son intégration.
Une empreinte mondiale : Groq exploite treize centres de données répartis sur quatre continents, de Liberty Lake et Dallas à Vantaa, Sydney, Londres et Riyad, avec des sites au Canada et en Arabie saoudite en plus des implantations américaines et européennes. Pour les applications sensibles à la latence, la proximité physique avec les utilisateurs compte autant que la vitesse des puces.
Interfaces conversationnelles en temps réel : lorsqu'un utilisateur regarde le texte apparaître, la différence entre 50 et 500 tokens par seconde est celle qui sépare l'attente de la lecture. Les assistants de support, les copilotes intégrés au produit et les agents vocaux constituent le cas d'usage le plus évident, car la réactivité perçue est la fonctionnalité elle-même. Associer un petit modèle rapide sur Groq à un modèle plus performant mais plus lent pour les escalades est un schéma courant : traiter à la vitesse de la conversation les quatre-vingt-dix pour cent de requêtes simples, et router le reste ailleurs.
Boucles d'agents et chaînes d'appels d'outils : un agent qui planifie, appelle un outil, lit le résultat puis replanifie multiplie la latence par le nombre d'étapes. Une chaîne de cinq étapes à deux secondes chacune représente dix secondes d'attente ; la même chaîne à 300 millisecondes par étape paraît immédiate. C'est là que l'inférence rapide compose le plus spectaculairement, et c'est pourquoi Groq est fréquemment utilisé sous des agents de codage et des automatisations de flux de travail plutôt que pour de la génération ponctuelle.
Traitement de texte en masse et classification : résumer un arriéré documentaire, étiqueter des tickets de support, extraire des champs structurés de milliers d'enregistrements — ces charges de travail privilégient le débit et le coût unitaire à la latence d'une requête isolée. Le palier flex existe précisément pour cette forme de travail, offrant dix fois les limites standard à un prix au token identique, tandis que le traitement par lots prend en charge les tâches qui tolèrent une fenêtre différée.
Transcription et chaînes audio : Whisper sur Groq traite les enregistrements de réunions, les archives de podcasts, l'audio des centres d'appels et la génération de sous-titres, facturés à l'heure d'audio plutôt qu'au token. Comme la transcription et la génération de texte partagent la même API et la même clé, une chaîne qui transcrit un appel puis le résume ne nécessite qu'une seule relation fournisseur.
Prototypage et expérimentation à coût maîtrisé : le palier gratuit ne demande pas de carte bancaire et donne accès au catalogue de modèles avec des limites de débit réduites, ce qui fait de Groq une première étape fréquente pour les projets de hackathon, les projets personnels et les démonstrations internes. L'ajout d'un moyen de paiement relève les limites sans engagement d'abonnement, si bien que le coût d'évaluation de la plateforme reste borné par l'usage réel.
Migration d'une application existante bâtie sur OpenAI : parce que l'API est compatible au niveau de la bibliothèque cliente, les équipes utilisent souvent Groq comme référence comparative plutôt que comme engagement — en exécutant les mêmes invites chez les deux fournisseurs pour comparer latence, coût et qualité de sortie au prix d'un changement de configuration de deux lignes. Certaines charges migrent définitivement, d'autres restent réparties par type de tâche.
Adaptez le modèle à la tâche plutôt que de choisir le plus grand par défaut. Sur Groq, les modèles plus petits sont nettement plus rapides et moins chers, et pour la classification, l'extraction, le routage et la génération de textes courts, l'écart de qualité est souvent invisible pour les utilisateurs. Comparez gpt-oss-20b à gpt-oss-120b sur vos propres invites avant de supposer que le plus gros est nécessaire : l'écart de vitesse est d'environ un facteur deux.
Concevez dès le premier jour en anticipant l'obsolescence des modèles. Le catalogue de Groq se renouvelle rapidement. Lisez l'identifiant du modèle depuis la configuration plutôt que de le coder en dur, surveillez la page des dépréciations, et assurez-vous que l'adresse e-mail du compte parvient à quelqu'un qui agira sur les avis de migration. Un identifiant de modèle qui disparaît devient une panne si votre code ne peut pas être redéployé rapidement.
N'essayez pas d'acheter de la marge avec des clés d'API supplémentaires. Les limites de débit s'appliquent au niveau de l'organisation et non par utilisateur ou par clé : émettre des clés supplémentaires ne relève pas votre plafond. S'il vous faut plus de débit, ajoutez un moyen de paiement, passez au palier flex ou discutez d'une capacité dédiée avec le service commercial.
Instrumentez séparément la latence du premier token et la latence totale. L'avantage de Groq se manifeste sur les deux, mais elles répondent à des remèdes différents. Un premier token lent signale généralement une file d'attente ou une région éloignée ; une complétion lente signifie généralement que le modèle génère plus que nécessaire. Plafonnez max_tokens sans hésiter — une réponse plus courte est plus rapide sur n'importe quel matériel.
Exploitez la mise en cache des invites et gardez les invites système stables. Les tokens mis en cache ne comptent pas dans vos limites de débit : une invite système stable d'une requête à l'autre réduit donc le coût tout en vous achetant du débit effectif. Réécrire l'invite système à chaque appel revient à jeter ce bénéfice.
Implémentez correctement les reprises, en particulier sur flex. Le palier flex est explicitement en meilleur effort : les échecs de capacité sont attendus, arrivent rapidement et peuvent être réessayés sans risque. Une temporisation exponentielle avec gigue n'y est pas facultative. Traitez le code HTTP 498 comme un « réessayez sous peu » et non comme une erreur à exposer aux utilisateurs.
Activez la rétention zéro avant d'envoyer des données sensibles. Le ZDR est accessible à tous les clients mais n'est pas activé par défaut, et son activation désactive également les fonctionnalités nécessitant une persistance. Tranchez cet arbitrage avant votre première requête en production, pas après.
Conservez une voie d'échappement vers un autre fournisseur. Comme l'API est compatible OpenAI dans les deux sens, garder un second fournisseur configuré derrière la même interface coûte peu et vous protège des incidents de capacité, des dépréciations et des changements tarifaires.
Les développeurs d'applications construisant des fonctionnalités sensibles à la latence : quiconque a des utilisateurs qui regardent le texte apparaître — interfaces de discussion, copilotes, produits vocaux — en tire le bénéfice le plus direct, car la vitesse se convertit immédiatement en qualité perçue.
Les équipes qui construisent des agents et des flux de travail à plusieurs étapes : lorsque la latence se multiplie d'une étape à l'autre, l'inférence rapide vaut bien plus que ne le laisse paraître un test sur requête unique. Les frameworks d'agents, les assistants de codage et les chaînes d'automatisation sont des candidats naturels.
Les ingénieurs déjà investis dans le SDK OpenAI : si votre base de code est écrite avec les bibliothèques clientes d'OpenAI, évaluer Groq coûte un changement de configuration et non une réécriture. Ce faible coût de bascule constitue le canal d'acquisition le plus efficace de la plateforme.
Les équipes soucieuses des coûts exécutant de gros volumes de tâches simples : classification, étiquetage, extraction et résumé à grande échelle reviennent bien moins cher sur de petits modèles à poids ouverts que sur des modèles propriétaires de pointe, et la facturation au token rend le calcul limpide.
Les jeunes pousses et les prototypeurs : un palier gratuit sans carte bancaire et un paiement à l'usage sans plancher d'abonnement rendent la plateforme facile à essayer et facile à abandonner — exactement ce que recherche une équipe en phase initiale.
Les entreprises avec des exigences de latence, de gouvernance ou de localisation : GroqAssured, le palier de service performance, la rétention zéro et la capacité bare-metal dédiée existent pour les organisations qui ne peuvent pas fonctionner sur un point de terminaison partagé en meilleur effort.
Les équipes construisant des produits audio et de transcription : la tarification de Whisper à l'heure d'audio, des limites de débit audio dédiées et des points de terminaison de traduction rendent Groq viable comme fournisseur de transcription indépendamment de son usage pour le texte.
https://api.groq.com/openai/v1, couvrant les complétions de discussion, l'API Responses, la transcription, la traduction et la synthèse audio, les lots, les fichiers et les points de terminaison de fine-tuning.console.groq.com propose la gestion de compte, les clés d'API, les projets, les autorisations de modèles, les tableaux de bord d'usage, les limites de dépense et les contrôles de données, aux côtés de la documentation complète et de la référence de l'API.Palier gratuit. Groq propose un palier développeur gratuit qui ne requiert pas de carte bancaire et donne accès au catalogue de modèles avec des limites de débit réduites. Il est réellement utilisable pour le prototypage, les projets personnels, les démonstrations internes et les fonctionnalités à faible volume, et la contrainte que l'on atteint en premier est généralement le nombre de requêtes par jour plutôt que les tokens. Détail structurel important : les limites étant suivies par organisation, un compte gratuit ne peut pas être élargi en créant davantage de clés.
Paiement à l'usage. Il n'existe pas de frais d'abonnement pour l'accès à l'API. Les modèles de texte sont facturés au million de tokens avec des tarifs distincts en entrée et en sortie — par exemple gpt-oss-120b à 0,15 $ en entrée et 0,60 $ en sortie par million de tokens, et gpt-oss-20b à 0,075 $ et 0,30 $ — tandis que la reconnaissance vocale est facturée à l'heure d'audio, avec whisper-large-v3 à 0,111 $ de l'heure et la variante turbo à 0,04 $. L'ajout d'un moyen de paiement relève substantiellement les limites de débit et débloque les paliers flex et de traitement par lots, qui offrent un débit supérieur au même prix au token. Les mesures indépendantes d'Artificial Analysis situent la fourchette mixte du catalogue entre environ 0,05 $ et 0,84 $ par million de tokens selon le modèle, soit un écart d'environ seize fois.
Mécanique de facturation. Les prélèvements sont progressifs avant de devenir mensuels : les premiers franchissements des seuils cumulés de 1 $, 10 $, 100 $, 500 $ et 1 000 $ déclenchent des prélèvements immédiats avant que le compte ne bascule sur une facturation mensuelle, avec un calendrier différent pour les clients en Inde. Les factures inférieures à 0,50 $ ne sont pas émises. Des limites de dépense et des alertes budgétaires sont configurables dans la console, et l'usage y est visible en quasi-temps réel.
Entreprise. Les contrats à engagement de dépense, le palier de service performance, la capacité GroqMetal dédiée et la couche de gouvernance GroqAssured se vendent via le service commercial plutôt qu'en libre-service. Les contrats d'entreprise apportent aussi un avantage pratique au-delà de la capacité : les clients à engagement de dépense sont exemptés des dépréciations de modèles qui s'appliquent aux paliers gratuit et développeur. Les conditions exactes et les tarifs en vigueur doivent être vérifiés dans la documentation officielle et la console, le catalogue et ses prix évoluant fréquemment.
Le catalogue de modèles se renouvelle de façon agressive. C'est le risque le plus concret. La page des dépréciations de Groq documente un flux constant de retraits : llama-3.1-8b-instant et llama-3.3-70b-versatile ont tous deux été retirés le 16 août 2026, qwen3-32b et llama-4-scout un mois plus tôt, et Kimi K2 ainsi que Llama 4 Maverick avant eux. La dépréciation s'applique aux paliers gratuit et développeur tandis que les clients entreprise à engagement de dépense en sont exemptés, ce qui signifie que les utilisateurs les moins protégés absorbent le plus de renouvellement. Les modèles en préversion portent un avertissement explicite : ils peuvent être arrêtés à bref délai.
La compatibilité OpenAI est proche mais incomplète. Plusieurs paramètres présents dans du code écrit pour OpenAI échouent purement et simplement : logprobs, logit_bias, top_logprobs et messages[].name renvoient tous une erreur 400, et n doit valoir 1. La transcription audio ne produit ni vtt ni srt, et une température de 0 est silencieusement réécrite en 1e-8. La migration est aisée dans le cas courant et peut néanmoins casser sur les bords : testez plutôt que de supposer.
La capacité est plafonnée par le catalogue à poids ouverts. La vitesse est réelle, mais c'est de la vitesse sur des modèles ouverts de taille intermédiaire. Dans les mesures indépendantes d'Artificial Analysis, le meilleur score de l'indice d'intelligence parmi les onze modèles Groq suivis revient à Qwen3.6 27B avec 38 — bien en deçà des modèles propriétaires de pointe. Pour les raisonnements les plus ardus, le codage de longue haleine ou l'écriture nuancée, un modèle de pointe plus lent peut encore produire de meilleurs résultats.
Les limites de débit sont organisationnelles et multidimensionnelles. Requêtes par minute, requêtes par jour, tokens par minute, tokens par jour et secondes d'audio s'appliquent simultanément, et c'est la première atteinte qui vous bride : un motif fait de nombreuses requêtes minuscules peut épuiser le quota de requêtes par minute en n'entamant presque pas votre allocation de tokens. Certaines organisations se voient en outre appliquer des limites distinctes en entrée et en sortie.
Le palier flex est explicitement en meilleur effort. Il offre dix fois les limites de débit au même prix, mais les requêtes échouent avec un code HTTP 498 et une erreur capacity_exceeded lorsque la capacité manque. C'est une conception délibérée et non un défaut, et cela rend flex inadapté aux chemins exposés aux utilisateurs sans solution de repli.
La localisation des données est fixée aux États-Unis. Bien que les requêtes d'inférence ne soient pas conservées par défaut et que la rétention zéro soit accessible à tous les clients, les données effectivement conservées résident dans des compartiments Google Cloud Platform situés aux États-Unis, les transferts transfrontaliers étant couverts par des clauses contractuelles types. Les organisations soumises à des exigences strictes de localisation en Europe ou en Asie-Pacifique doivent vérifier ce point au regard de leurs obligations de conformité, en notant que l'activation du ZDR désactive les fonctionnalités reposant sur la persistance, comme les traitements par lots et le fine-tuning.
La situation de l'entreprise a récemment été mouvementée. En décembre 2025, DataCenterDynamics rapportait que le fondateur Jonathan Ross et le président Sunny Madra rejoignaient NVIDIA dans le cadre d'un accord de licence technologique non exclusif, tandis que Groq poursuivait son activité de façon indépendante sous la direction de Simon Edwards, GroqCloud fonctionnant sans interruption. Les informations sur la valeur de l'accord ont été instables : le chiffre de 20 milliards de dollars, largement repris, n'a pas été vérifié de manière indépendante, et les termes de la licence non exclusive n'ont jamais été divulgués. La série A d'août 2026 valorisait l'entreprise à 3,5 milliards de dollars, soit environ la moitié des 6,9 milliards retenus lors de sa levée de septembre 2025. La continuité de service a été maintenue tout du long, mais les équipes qui envisagent des engagements d'infrastructure pluriannuels devraient peser les changements d'actionnariat et de direction au même titre que la technologie.
Les données d'avis utilisateurs indépendantes sont maigres. Groq bénéficie d'une large couverture presse mais de très peu de retours structurés sur les plateformes d'évaluation — la fiche G2 ne compte qu'un nombre négligeable d'avis, et les annuaires tiers classent Groq parmi les API d'IA, les grands modèles de langage et les modèles d'IA open source plutôt que comme un agent conversationnel grand public, sans volume d'avis significatif là non plus. La meilleure preuve indépendante disponible relève du test comparatif et non du témoignage d'utilisateur : les affirmations sur la qualité du support ou la fiabilité à long terme doivent donc être considérées comme non vérifiées.
À ne pas confondre avec Grok. Groq (groq.com) est une infrastructure d'inférence éditée par Groq LLC. Grok (grok.com) est un assistant conversationnel grand public d'xAI, l'entreprise d'Elon Musk. Les noms ne diffèrent que par la position d'une lettre et les produits n'ont rien en commun : entreprises différentes, publics différents, modèles économiques différents.
Oui, il existe un palier développeur gratuit qui ne demande pas de carte bancaire et donne accès au catalogue de modèles avec des limites de débit réduites, ce qui suffit au prototypage et aux projets à faible volume. L'ajout d'un moyen de paiement relève sensiblement ces limites et débloque les paliers flex et par lots ; il n'y a pas de frais d'abonnement, seulement une facturation à l'usage au token.
Ce sont des produits sans lien, fréquemment confondus en raison d'une orthographe presque identique. Groq, sur groq.com, est un cloud d'inférence pour l'IA bâti sur du matériel LPU et vendu aux développeurs sous forme d'API. Grok, sur grok.com, est un assistant conversationnel grand public d'xAI. Entreprises différentes, produits différents, modèles tarifaires différents.
Dans la plupart des cas oui, moyennant deux changements : définir l'URL de base sur https://api.groq.com/openai/v1 et fournir une clé d'API Groq. Quelques paramètres ne sont pas pris en charge et renvoient une erreur 400 — logprobs, logit_bias, top_logprobs et messages[].name — et n doit valoir 1 : testez donc vos propres schémas d'appel plutôt que de présumer d'une bascule sans accroc.
Groq sert des modèles à poids ouverts plutôt que des modèles propriétaires de pointe. Le catalogue de production s'organise autour d'openai/gpt-oss-120b et openai/gpt-oss-20b pour le texte, ainsi que de whisper-large-v3 et de sa variante turbo pour la voix, avec des emplacements en préversion pour des modèles comme Qwen3.6 27B, des classificateurs de sécurité et les voix Orpheus. La liste à jour est toujours disponible dans la documentation des modèles et via le point de terminaison /openai/v1/models.
Les mesures indépendantes d'Artificial Analysis placent le modèle le plus rapide sur Groq, gpt-oss-20b en effort de raisonnement élevé, à une médiane de 949 tokens par seconde, avec un délai minimal jusqu'au premier token d'environ 0,77 seconde. Les chiffres matériels de Groq évoquent jusqu'à 1 000 tokens par seconde et par utilisateur. Le débit réel varie selon le modèle, la longueur de l'invite, le palier de service et la charge.
Groq indique ne pas conserver les données client pour les requêtes d'inférence par défaut. Les données ne sont conservées que pour les fonctionnalités qui l'exigent, comme les traitements par lots et le fine-tuning, ou temporairement pour le diagnostic de fiabilité et les enquêtes sur les abus, auquel cas elles sont gardées jusqu'à 30 jours. Tous les clients peuvent activer la rétention zéro, ce qui désactive en contrepartie les fonctionnalités reposant sur la persistance.
L'inférence s'exécute dans treize centres de données sur quatre continents, mais toute donnée client conservée est stockée dans des compartiments Google Cloud Platform situés aux États-Unis, les transferts étant couverts le cas échéant par des clauses contractuelles types. Les organisations soumises à des exigences régionales strictes doivent vérifier ce point au regard de leurs propres règles.
Non. Les limites s'appliquent au niveau de l'organisation, si bien que les clés supplémentaires partagent le même quota. Pour gagner de la marge, ajoutez un moyen de paiement afin de passer aux limites du palier développeur, utilisez le palier flex pour les traitements à haut débit, ou négociez une capacité dédiée avec le service commercial.
L'usage est facturé au token pour les modèles de texte et à l'heure d'audio pour la transcription, sans composante d'abonnement. Les prélèvements sont d'abord progressifs : le compte est débité lorsque l'usage cumulé franchit 1 $, 10 $, 100 $, 500 $ et 1 000 $, après quoi la facturation devient purement mensuelle. Les factures inférieures à 0,50 $ ne sont pas émises, et des limites de dépense avec alertes budgétaires sont configurables dans la console.
GroqCloud a fonctionné sans interruption à travers des changements majeurs, dont l'accord de licence avec NVIDIA, le départ du fondateur et une transition à la direction, et l'entreprise a levé 350 millions de dollars en série A en août 2026 sur une valorisation de 3,5 milliards. Le risque concret tient moins à une disparition de l'entreprise qu'au renouvellement des modèles : construisez avec des identifiants de modèles configurables, surveillez les avis de dépréciation et gardez un second fournisseur disponible derrière la même interface.
Comment utiliser Groq
Créez un compte sur la console Groq. Inscrivez-vous, vérifiez votre adresse e-mail, et vous rejoignez une organisation — ce point compte, car les quotas sont suivis au niveau de l'organisation et non par utilisateur.
Générez une clé d'API. Créez une clé dans la console et stockez-la dans une variable d'environnement telle que
GROQ_API_KEY. Ne la versionnez jamais dans votre dépôt : cette clé autorise des dépenses au nom de votre organisation.Pointez votre client vers Groq. Si vous utilisez déjà le SDK OpenAI, définissez
base_urlsurhttps://api.groq.com/openai/v1et passez votre clé Groq commeapi_key. Si vous partez de zéro, installez le paquet officielgroqpour Python ougroq-sdkpour TypeScript. Une première requête est un appel de complétion de discussion classique avec un identifiant de modèle tel queopenai/gpt-oss-20b.Choisissez le bon modèle pour la tâche. Lisez la page des modèles pris en charge avant de trancher : elle indique la vitesse en tokens par seconde, le prix au million de tokens, les limites de débit, la fenêtre de contexte et le nombre maximal de tokens de complétion pour chaque modèle. Privilégiez les modèles de production pour tout ce que vous comptez livrer — les modèles en préversion existent à des fins d'évaluation et peuvent être retirés à bref délai.
Choisissez un palier de service et gérez les limites de débit. Laissez
service_tiernon défini pour le comportement à la demande par défaut, ou fixez-le àflexpour les travaux à haut débit une fois sur une formule payante. Lisez les en-têtes de réponsex-ratelimit-remaining-tokensetx-ratelimit-remaining-requests, et implémentez des reprises avec temporisation aléatoire sur les codes HTTP 429 et, pour flex, HTTP 498.Mettez en place les garde-fous de facturation avant de passer à l'échelle. Associez un moyen de paiement pour lever les plafonds du palier gratuit, puis définissez une limite de dépense et des alertes d'usage dans la console. Surveillez la consommation dans Dashboard → Usage pendant votre première semaine en production, lorsque les estimations sont les moins fiables.