Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
Cerebras é uma plataforma de inferência de IA que executa modelos de linguagem de pesos abertos nos processadores em escala de wafer da própria empresa. Os desenvolvedores acessam a plataforma pelo Cerebras Inference, uma API em nuvem com um Playground no navegador; organizações maiores podem reservar capacidade Dedicated ou instalar sistemas Cerebras em seus próprios data centers, e o mesmo hardware também sustenta serviços de treinamento e ajuste fino.
O nível de nuvem pública oferece uma linha de modelos atualizada regularmente em um endpoint compartilhado, chamado com uma chave de API.
A velocidade é o argumento central. A Cerebras apresenta seu sistema em escala de rack mais recente, o CS-4, como capaz de entregar inferência até 30 vezes mais rápida que GPUs, um número do fornecedor, e não uma medição independente.
A empresa por trás do produto, a Cerebras Systems, levantou 5,5 bilhões de dólares em um IPO em maio de 2026, e reportagens de negócios independentes listam OpenAI, G42, a Mohamed bin Zayed University of Artificial Intelligence e a Amazon Web Services entre seus clientes.
A fidelidade dos modelos é documentada com um detalhamento incomum. A Cerebras afirma que todo modelo do Shared Inference é a versão original, sem poda. Os pesos são armazenados com quantização seletiva apenas dos pesos em formatos parciais de 16, 8 ou 4 bits, enquanto as camadas sensíveis permanecem em precisão total e as ativações, a atenção e o cache KV não são quantizados. Para quem compara provedores de inferência de IA rápida, isso deixa claro o que de fato é servido por trás dos números de velocidade.
O cache de prompts funciona automaticamente em todas as requisições de API compatíveis, sem pontos de interrupção de cache nem mudanças de código. A Cerebras garante um tempo de vida (TTL) de cache de 5 minutos, e as entradas podem persistir por até 1 hora, conforme a carga do sistema. O ganho é de capacidade, não de preço: tokens em cache ficam fora do limite de taxa sem cache, mas não recebem desconto.
O Dedicated Inference reserva capacidade para uma única organização e é a opção que a Cerebras indica para trabalhos de produção que precisam de desempenho previsível. Ele também permite implantar pesos ajustados ao lado das versões padrão dos modelos. Cada implantação pode ser ajustada em capacidade, modelos de rascunho (draft), configuração do modelo e quantização, e acrescenta ajuste fino, gerenciamento de pesos e controle de níveis de serviço a todos os recursos do Shared Inference. As famílias compatíveis no lado dedicado incluem Qwen 3.8, Qwen3 e Qwen3-Coder, Llama 3 e Llama 4, GLM 4.X e 5.X, Kimi K2.X e DeepSeek V3.X.
A Batch API processa grupos de requisições de forma assíncrona, e as requisições em lote têm conclusão garantida em até 24 horas.
O Cerebras Code é uma assinatura de programação feita para ser usada no seu próprio editor. A página do produto diz que ele roda o GLM 4.7 para gerar código a mais de 1.000 tokens por segundo, embora o registro de descontinuações da API conte outra história.
O Cerebras Training Cloud é descrito como uma forma de treinar e ajustar modelos de 1 bilhão a dezenas de trilhões de parâmetros com o mesmo código simples.
O sistema CS-4 roda no processador WSE-3 Turbo, que a Cerebras descreve com quatro trilhões de transistores e 900.000 núcleos de IA, entregando 250 PFLOPS de computação e 43,2 petabytes por segundo de largura de banda de memória. A página do CS-4 diz que as primeiras remessas começam neste trimestre, mas não informa uma data.
A Cerebras organiza seus casos de uso em torno de cargas de trabalho em que esperar por tokens prejudica o produto:
A implantação mais visível é externa. Em fevereiro de 2026, a imprensa de tecnologia independente noticiou que o GPT-5.3-Codex-Spark da OpenAI, um modelo Codex menor projetado para inferência mais rápida e colaboração em tempo real, roda no Wafer Scale Engine 3 da Cerebras.
A Cerebras atende equipes para as quais a velocidade de resposta muda o produto, mas o ponto de entrada certo depende do estágio:
O suporte também varia por nível: contas Developer dependem de um Discord da comunidade, enquanto clientes Enterprise contam com uma equipe de conta dedicada.
É uma opção mais fraca para quem espera um nível gratuito permanente, janelas de contexto muito longas no endpoint self-service ou uma ampla escolha de modelos self-service; os detalhes estão nas seções de preços, limitações e funcionalidades.
Os preços da API Cerebras no nível Developer self-service são pagos conforme o uso e começam com um crédito gratuito de $5, enquanto os preços Enterprise são cotados sob consulta.
| Modelo (nível Developer) | Entrada | Saída |
|---|---|---|
| GPT OSS 120B | $0.35 por milhão de tokens | $0.75 por milhão de tokens |
| Qwen 3.8 27B | $0.99 por milhão de tokens | $1.49 por milhão de tokens |
O Cerebras Code Pro aparece por $50 para até 24 milhões de tokens por dia, voltado a desenvolvedores independentes e projetos de fim de semana. O Cerebras Code Max aparece por $200 para até 120 milhões de tokens por dia, voltado a desenvolvimento em tempo integral e sistemas multiagente. Os dois planos pagos estavam marcados como esgotados na captura de 4 de outubro de 2026, e os cards de planos verificados para esta página não informam o período de cobrança.
O Training Cloud é vendido por hora, com a Cerebras dimensionando o tempo de que uma carga de trabalho enviada precisa, ou por modelo, com especialistas da Cerebras projetando e ajustando um modelo no seu conjunto de dados; a página do Training Cloud lista essas opções sem valores.
Outros fornecedores também constroem silício próprio para inferência rápida em vez de alugar GPUs padrão:
Em comparação, a Cerebras se destaca pelo processador em escala de wafer, por uma API compatível com OpenAI com teste self-service de $5 e pela opção de instalar sistemas CS-4 on-premise, embora seu catálogo self-service se limite a dois modelos.
Relatos de usuários apontam na mesma direção. Em uma discussão pública entre desenvolvedores sobre o lançamento do Qwen 3.8 27B na Cerebras, vários desenvolvedores disseram que o contexto de 128k permitido pela Cerebras é pequeno demais para tarefas longas de agentes ou de programação. Outros no mesmo tópico disseram que o limite de 150.000 TPM no endpoint público dificulta o uso do modelo em muitas tarefas de programação. Uma coluna de opinião de um veículo de TI de setembro de 2025, escrita quando o Cerebras Code rodava o Qwen3 Coder, relatou que a geração voava por 10 a 20 segundos antes de o teto de tokens por minuto disparar erros 429 até o minuto ser redefinido.
A Cerebras diz que suas comparações de desempenho se baseiam em benchmarks de terceiros ou testes internos, e que os ganhos de velocidade observados em relação a sistemas com GPU podem variar conforme a carga de trabalho, a configuração, a data e o modelo.
O acesso à API e ao Playground para, mas as chaves de API, os projetos e as configurações continuam intactos, e uma compra paga conforme o uso reativa o acesso no nível Developer, que não tem tetos de tokens por hora ou por dia.
A Cerebras diz que serve os pesos originais sem modificação para IDs de modelo existentes e que lançaria eventuais variantes podadas futuras com IDs de modelo separados.
Sim. O campo model compatível com OpenAI recebe um ID de modelo exato no Shared Inference e o seu ID de endpoint estável no Dedicated Inference, que encaminha cada requisição para a implantação ativa.