Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Cerebras est une plateforme d'inférence IA qui exécute des modèles de langage à poids ouverts sur les processeurs à l'échelle de la tranche (wafer-scale) conçus par l'entreprise. Les développeurs y accèdent via Cerebras Inference, une API cloud dotée d'un Playground dans le navigateur ; les grandes organisations peuvent réserver une capacité Dedicated ou installer des systèmes Cerebras dans leurs propres centres de données, et le même matériel sert aussi aux services d'entraînement et de fine-tuning.
Le niveau cloud public propose, sur un point de terminaison partagé appelé avec une clé API, une gamme de modèles régulièrement mise à jour.
La vitesse est l'argument central. Cerebras présente son dernier système à l'échelle du rack, le CS-4, comme offrant une inférence jusqu'à 30 fois plus rapide que les GPU, un chiffre du fournisseur et non une mesure indépendante.
L'entreprise derrière le produit, Cerebras Systems, a levé 5,5 milliards de dollars lors d'une introduction en bourse en mai 2026, et la presse économique indépendante cite OpenAI, G42, la Mohamed bin Zayed University of Artificial Intelligence et Amazon Web Services parmi ses clients.
La fidélité des modèles est documentée avec un niveau de détail inhabituel. Cerebras affirme que chaque modèle de Shared Inference est la version originale, non élaguée. Les poids sont stockés avec une quantification sélective des seuls poids, dans des formats partiels 16, 8 ou 4 bits, tandis que les couches sensibles restent en pleine précision et que les activations, l'attention et le cache KV ne sont pas quantifiés. Pour qui compare des fournisseurs d'inférence IA rapide, cela précise ce qui est réellement servi derrière les chiffres de vitesse.
La mise en cache des prompts s'applique automatiquement à toutes les requêtes API prises en charge, sans points d'arrêt de cache ni modification du code. Cerebras garantit une durée de vie (TTL) du cache de 5 minutes, et les entrées peuvent persister jusqu'à 1 heure selon la charge du système. Le gain porte sur la capacité plutôt que sur le prix : les tokens en cache sont exclus de la limite de débit hors cache, mais ne bénéficient d'aucune remise.
Dedicated Inference réserve de la capacité à une seule organisation ; c'est l'option que Cerebras indique pour les charges de production qui exigent des performances prévisibles. Elle permet aussi de déployer des poids fine-tunés aux côtés des versions standard des modèles. Chaque déploiement peut être ajusté en capacité, modèles de brouillon (draft models), configuration du modèle et quantification, et ajoute le fine-tuning, la gestion des poids et le contrôle des niveaux de service à toutes les capacités de Shared Inference. Côté dédié, les familles prises en charge incluent Qwen 3.8, Qwen3 et Qwen3-Coder, Llama 3 et Llama 4, GLM 4.X et 5.X, Kimi K2.X et DeepSeek V3.X.
La Batch API traite des lots de requêtes de manière asynchrone, et l'exécution des requêtes par lots est garantie sous 24 heures.
Cerebras Code est un abonnement de programmation conçu pour être utilisé depuis votre propre éditeur. Sa page produit indique qu'il exécute GLM 4.7 pour générer du code à plus de 1 000 tokens par seconde, mais le journal des abandons de l'API raconte une autre histoire.
Cerebras Training Cloud est présenté comme un moyen d'entraîner et de fine-tuner des modèles de 1 milliard à plusieurs dizaines de billions de paramètres avec le même code simple.
Le système CS-4 repose sur le processeur WSE-3 Turbo, que Cerebras décrit comme doté de quatre billions de transistors et de 900 000 cœurs IA, pour 250 PFLOPS de puissance de calcul et 43,2 pétaoctets par seconde de bande passante mémoire. La page du CS-4 indique que les premières livraisons commencent ce trimestre, sans préciser de date.
Cerebras articule ses cas d'usage autour des charges de travail où l'attente des tokens nuit au produit :
Le déploiement le plus visible est externe. En février 2026, la presse technologique indépendante a rapporté que GPT-5.3-Codex-Spark d'OpenAI, un modèle Codex plus petit conçu pour une inférence plus rapide et la collaboration en temps réel, tourne sur le Wafer Scale Engine 3 de Cerebras.
Cerebras convient aux équipes pour qui la vitesse de réponse change le produit, mais le bon point d'entrée dépend du stade :
Le support diffère aussi selon le niveau : les comptes Developer s'appuient sur un Discord communautaire, tandis que les clients Enterprise disposent d'une équipe de compte dédiée.
L'outil convient moins à qui attend un niveau gratuit permanent, de très longues fenêtres de contexte sur le point de terminaison en libre-service ou un large choix de modèles en libre-service ; les détails figurent dans les sections tarifs, limitations et fonctionnalités.
Les tarifs de l'API Cerebras sur le niveau Developer en libre-service sont à l'usage et commencent par un crédit gratuit de $5, tandis que les tarifs Enterprise sont communiqués sur demande.
| Modèle (niveau Developer) | Entrée | Sortie |
|---|---|---|
| GPT OSS 120B | $0.35 par million de tokens | $0.75 par million de tokens |
| Qwen 3.8 27B | $0.99 par million de tokens | $1.49 par million de tokens |
Cerebras Code Pro est affiché à $50 pour jusqu'à 24 millions de tokens par jour, à destination des développeurs indépendants et des projets du week-end. Cerebras Code Max est affiché à $200 pour jusqu'à 120 millions de tokens par jour, à destination du développement à plein temps et des systèmes multi-agents. Les deux forfaits payants étaient indiqués comme épuisés lors de la capture du 4 octobre 2026, et les fiches de forfait vérifiées pour cette page ne précisent pas de période de facturation.
Training Cloud est vendu soit à l'heure, Cerebras dimensionnant le temps nécessaire à une charge de travail soumise, soit par modèle, des experts Cerebras concevant et fine-tunant un modèle sur votre jeu de données ; la page Training Cloud liste ces options sans tarifs.
D'autres fournisseurs conçoivent eux aussi des puces sur mesure pour l'inférence rapide au lieu de louer des GPU standard :
Face à eux, Cerebras se distingue par son processeur à l'échelle de la tranche, une API compatible OpenAI avec un essai en libre-service de $5 et la possibilité d'installer des systèmes CS-4 sur site, mais son catalogue en libre-service se limite à deux modèles.
Les retours d'utilisateurs vont dans le même sens. Dans une discussion publique entre développeurs sur le lancement de Qwen 3.8 27B chez Cerebras, plusieurs développeurs ont jugé le contexte de 128k autorisé par Cerebras trop petit pour de longues tâches agentiques ou de programmation. D'autres, dans le même fil, ont estimé que la limite de 150 000 TPM du point de terminaison public rend le modèle difficile à utiliser pour de nombreuses tâches de programmation. Une chronique d'opinion d'un média informatique de septembre 2025, écrite alors que Cerebras Code tournait sous Qwen3 Coder, rapportait que la génération filait pendant 10 à 20 secondes avant que le plafond de tokens par minute ne déclenche des erreurs 429 jusqu'à la réinitialisation de la minute.
Cerebras indique que ses comparaisons de performance reposent sur des benchmarks tiers ou des tests internes, et que les gains de vitesse observés par rapport aux systèmes GPU peuvent varier selon la charge de travail, la configuration, la date et le modèle.
L'accès à l'API et au Playground s'arrête, mais les clés API, les projets et les paramètres sont conservés, et un achat à l'usage réactive l'accès sur le niveau Developer, qui n'impose aucun plafond de tokens horaire ou journalier.
Cerebras affirme servir les poids d'origine sans modification pour les ID de modèle existants et publierait d'éventuelles variantes élaguées futures sous des ID de modèle distincts.
Oui. Le champ model compatible OpenAI prend un ID de modèle exact sur Shared Inference et votre ID de point de terminaison stable sur Dedicated Inference, qui achemine chaque requête vers son déploiement actif.