Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Ferramentas de desenvolvimento
  4. Cerebras
Prévia da interface do Cerebras
Logotipo do Cerebras

Cerebras

A Cerebras roda modelos de pesos abertos como GPT OSS 120B e Qwen 3.8 27B em seus próprios processadores em escala de wafer por meio de uma API compatível com OpenAI, com tokens pagos conforme o uso, capacidade Dedicated reservada e sistemas CS-4 on-premise.

Ferramentas de desenvolvimentoDesenvolvimento de IAPlataforma de Treinamento de IA#Empresarial#LLM#API compatível com OpenAI
Ver Preços
Salvos
Visitas
Visualizações
Preço
Pago
Publicado
4 de out. de 2026
Domínio
cerebras.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Cerebras

Ver Preços
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Pago
Publicado
4 de out. de 2026
Domínio
cerebras.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Ver Preços

O que é Cerebras?

Cerebras é uma plataforma de inferência de IA que executa modelos de linguagem de pesos abertos nos processadores em escala de wafer da própria empresa. Os desenvolvedores acessam a plataforma pelo Cerebras Inference, uma API em nuvem com um Playground no navegador; organizações maiores podem reservar capacidade Dedicated ou instalar sistemas Cerebras em seus próprios data centers, e o mesmo hardware também sustenta serviços de treinamento e ajuste fino.

O nível de nuvem pública oferece uma linha de modelos atualizada regularmente em um endpoint compartilhado, chamado com uma chave de API.

A velocidade é o argumento central. A Cerebras apresenta seu sistema em escala de rack mais recente, o CS-4, como capaz de entregar inferência até 30 vezes mais rápida que GPUs, um número do fornecedor, e não uma medição independente.

A empresa por trás do produto, a Cerebras Systems, levantou 5,5 bilhões de dólares em um IPO em maio de 2026, e reportagens de negócios independentes listam OpenAI, G42, a Mohamed bin Zayed University of Artificial Intelligence e a Amazon Web Services entre seus clientes.

Principais funcionalidades

API Shared Inference

  • API compatível com OpenAI: a API da Cerebras funciona com as bibliotecas cliente da OpenAI em muitos fluxos de trabalho comuns, então um aplicativo existente pode fazer a mudança trocando a chave de API, a URL base e o modelo de destino.
  • Catálogo self-service enxuto: o Shared Inference lista atualmente gpt-oss-120b (120 bilhões de parâmetros, contexto de 65k no teste gratuito e de 131k nos níveis pagos, cerca de 3.000 tokens por segundo) e qwen-3.8-27b (27 bilhões de parâmetros, contexto de 64k/128k, cerca de 1.850 tokens por segundo).
  • Catálogo mais amplo por contrato: outras famílias de modelos só estão disponíveis pelo Dedicated Inference.
  • Entrada de imagens: no Shared Inference, o qwen-3.8-27b aceita imagens, enquanto gemma-4-31b e outros modelos com suporte a imagem exigem o Dedicated Inference.
  • Controle de raciocínio: no qwen-3.8-27b, o esforço de raciocínio pode ser definido como none, low, medium ou high, com high como padrão, e o raciocínio é retornado separadamente da resposta.

A fidelidade dos modelos é documentada com um detalhamento incomum. A Cerebras afirma que todo modelo do Shared Inference é a versão original, sem poda. Os pesos são armazenados com quantização seletiva apenas dos pesos em formatos parciais de 16, 8 ou 4 bits, enquanto as camadas sensíveis permanecem em precisão total e as ativações, a atenção e o cache KV não são quantizados. Para quem compara provedores de inferência de IA rápida, isso deixa claro o que de fato é servido por trás dos números de velocidade.

Cache de prompts

O cache de prompts funciona automaticamente em todas as requisições de API compatíveis, sem pontos de interrupção de cache nem mudanças de código. A Cerebras garante um tempo de vida (TTL) de cache de 5 minutos, e as entradas podem persistir por até 1 hora, conforme a carga do sistema. O ganho é de capacidade, não de preço: tokens em cache ficam fora do limite de taxa sem cache, mas não recebem desconto.

Dedicated Inference

O Dedicated Inference reserva capacidade para uma única organização e é a opção que a Cerebras indica para trabalhos de produção que precisam de desempenho previsível. Ele também permite implantar pesos ajustados ao lado das versões padrão dos modelos. Cada implantação pode ser ajustada em capacidade, modelos de rascunho (draft), configuração do modelo e quantização, e acrescenta ajuste fino, gerenciamento de pesos e controle de níveis de serviço a todos os recursos do Shared Inference. As famílias compatíveis no lado dedicado incluem Qwen 3.8, Qwen3 e Qwen3-Coder, Llama 3 e Llama 4, GLM 4.X e 5.X, Kimi K2.X e DeepSeek V3.X.

Batch API

A Batch API processa grupos de requisições de forma assíncrona, e as requisições em lote têm conclusão garantida em até 24 horas.

Cerebras Code

O Cerebras Code é uma assinatura de programação feita para ser usada no seu próprio editor. A página do produto diz que ele roda o GLM 4.7 para gerar código a mais de 1.000 tokens por segundo, embora o registro de descontinuações da API conte outra história.

Treinamento e ajuste fino

O Cerebras Training Cloud é descrito como uma forma de treinar e ajustar modelos de 1 bilhão a dezenas de trilhões de parâmetros com o mesmo código simples.

Hardware CS-4 e WSE-3 Turbo

O sistema CS-4 roda no processador WSE-3 Turbo, que a Cerebras descreve com quatro trilhões de transistores e 900.000 núcleos de IA, entregando 250 PFLOPS de computação e 43,2 petabytes por segundo de largura de banda de memória. A página do CS-4 diz que as primeiras remessas começam neste trimestre, mas não informa uma data.

Guia

Primeiros passos com a API

  1. Abra o Cloud Console, cadastre-se ou faça login e crie uma chave em API Keys, na navegação à esquerda.
  2. Adicione um método de pagamento, porque sem ele o acesso ao Playground e à API continua inativo.
  3. Instale o SDK oficial, publicado como cerebras_cloud_sdk para Python via pip e como @cerebras/cerebras_cloud_sdk para Node.js via npm, ou aponte um cliente OpenAI existente para a URL base da Cerebras.
  4. Use o Playground para avaliar modelos, iterar prompts, testar chamadas de ferramentas, ajustar parâmetros e exportar uma requisição funcional como código. Após cada resposta, ele mostra o uso de tokens, o tempo de inferência, os tokens por segundo e o tempo de ida e volta, o que permite conferir rapidamente a velocidade real com seus próprios prompts.
  5. Defina max_completion_tokens com um valor realista. A Cerebras estima cada requisição a partir do prompt mais esse parâmetro ou de sua própria estimativa de saída, e uma requisição cuja estimativa excede a cota restante é limitada antes do início do processamento.

Casos de uso e exemplos da Cerebras

A Cerebras organiza seus casos de uso em torno de cargas de trabalho em que esperar por tokens prejudica o produto:

  • Assistentes de programação: a Cerebras promete ciclos instantâneos de escrita, depuração e refatoração de código, com a Cognition como estudo de caso publicado.
  • Agentes de várias etapas: os fluxos de agentes visam rodar sem atrasos nem timeouts, com a NinjaTech como exemplo.
  • Busca, copilotos e análise: a promessa aqui é raciocínio complexo em menos de um segundo, com a AlphaSense como exemplo.
  • Interfaces de voz: o argumento são respostas de voz instantâneas e precisas, com a Tavus como exemplo.
  • Busca corporativa dentro do aplicativo: a Notion diz que a Cerebras alimenta recursos em tempo real, como a busca corporativa.
  • Agentes de pesquisa em ciências da vida: a GSK diz que usa a velocidade de inferência da Cerebras para criar aplicações como agentes de pesquisa inteligentes para seus pesquisadores e para o trabalho de descoberta de medicamentos.
  • Tarefas em massa offline: a documentação da Batch API cita pipelines de avaliação, rotulagem de dados, geração de conteúdo em massa e análise de pesquisa.

A implantação mais visível é externa. Em fevereiro de 2026, a imprensa de tecnologia independente noticiou que o GPT-5.3-Codex-Spark da OpenAI, um modelo Codex menor projetado para inferência mais rápida e colaboração em tempo real, roda no Wafer Scale Engine 3 da Cerebras.

Para Quem É

A Cerebras atende equipes para as quais a velocidade de resposta muda o produto, mas o ponto de entrada certo depende do estágio:

  • Desenvolvedores avaliando velocidade: o nível Developer self-service é voltado a desenvolvimento, avaliação e experimentação, não ao uso em produção.
  • Equipes de produção: o Enterprise acrescenta capacidade pronta para produção, a melhor prioridade, limites de taxa mais altos e opções de latência aprimoradas que o nível Developer não inclui.
  • Operadores de data centers e de IA de fronteira: o CS-4 foi projetado para ser implantado em hiperescala como infraestrutura para IA de fronteira.

O suporte também varia por nível: contas Developer dependem de um Discord da comunidade, enquanto clientes Enterprise contam com uma equipe de conta dedicada.

É uma opção mais fraca para quem espera um nível gratuito permanente, janelas de contexto muito longas no endpoint self-service ou uma ampla escolha de modelos self-service; os detalhes estão nas seções de preços, limitações e funcionalidades.

Plataformas

  • SDKs: a Cerebras oferece SDKs dedicados para Python e TypeScript, além do acesso compatível com OpenAI.
  • Canais parceiros: o Cerebras Inference também é vendido pelo AWS Marketplace e pode ser acessado pela API unificada do OpenRouter.
  • Hugging Face e Vercel: modelos com tecnologia Cerebras podem ser chamados a partir do Hugging Face Hub, e endpoints de inferência da Cerebras podem ser implantados na Vercel.
  • Ferramentas de programação: o Cerebras Code funciona com qualquer editor ou agente que aceite uma chave de API, incluindo Cline, OpenCode e Crush.
  • Locais de implantação: os modelos são oferecidos na nuvem e on-premise, e a Cerebras diz que a inferência roda na região para ajudar com latência, residência de dados e obrigações de conformidade.
  • Acesso da equipe: as organizações atribuem os papéis Organization Admin, Project Admin ou Project Member, e os administradores de projeto gerenciam as chaves de API nos projetos atribuídos a eles.

Preços

Os preços da API Cerebras no nível Developer self-service são pagos conforme o uso e começam com um crédito gratuito de $5, enquanto os preços Enterprise são cotados sob consulta.

Modelo (nível Developer)EntradaSaída
GPT OSS 120B$0.35 por milhão de tokens$0.75 por milhão de tokens
Qwen 3.8 27B$0.99 por milhão de tokens$1.49 por milhão de tokens
  • O crédito de $5 é um crédito promocional único que exige um método de pagamento válido e expira 30 dias após a ativação; adicionar o cartão não inscreve você no uso pago, e o acesso à API e ao Playground é pausado quando o crédito expira ou acaba, a menos que você compre créditos pagos conforme o uso.
  • Não há nível gratuito permanente, já que o teste gratuito é limitado tanto pelo tempo quanto pelo crédito.
  • O cache de prompts não custa nada a mais, mas os tokens de entrada em cache são cobrados pela tarifa padrão de tokens de entrada.
  • A recarga automática vem desativada por padrão e pode ser ativada na aba Pay as you go.
  • A aba Subscriptions do Cloud Console gerencia planos de inferência por modelo, cada um oferecido em níveis com valores mensais diferentes.
  • Pesos de modelos personalizados e serviços de ajuste fino ou treinamento são recursos Enterprise disponíveis apenas mediante acordo.

Planos do Cerebras Code

O Cerebras Code Pro aparece por $50 para até 24 milhões de tokens por dia, voltado a desenvolvedores independentes e projetos de fim de semana. O Cerebras Code Max aparece por $200 para até 120 milhões de tokens por dia, voltado a desenvolvimento em tempo integral e sistemas multiagente. Os dois planos pagos estavam marcados como esgotados na captura de 4 de outubro de 2026, e os cards de planos verificados para esta página não informam o período de cobrança.

Training Cloud

O Training Cloud é vendido por hora, com a Cerebras dimensionando o tempo de que uma carga de trabalho enviada precisa, ou por modelo, com especialistas da Cerebras projetando e ajustando um modelo no seu conjunto de dados; a página do Training Cloud lista essas opções sem valores.

Alternativas à Cerebras

Outros fornecedores também constroem silício próprio para inferência rápida em vez de alugar GPUs padrão:

  • Groq: a Groq se descreve como uma neocloud de inferência rápida construída sobre sua LPU, que agora funciona ao lado de GPUs NVIDIA por meio do LPX.
  • SambaNova SambaCloud: a SambaNova diz que seu chip RDU permite que a SambaCloud entregue inferência rápida nos maiores modelos. A SambaCloud oferece suporte a famílias de código aberto como DeepSeek, Llama e Qwen.

Em comparação, a Cerebras se destaca pelo processador em escala de wafer, por uma API compatível com OpenAI com teste self-service de $5 e pela opção de instalar sistemas CS-4 on-premise, embora seu catálogo self-service se limite a dois modelos.

Limitações

Limites de taxa e janelas de contexto

  • No teste gratuito, cada modelo do Shared Inference é limitado a 5 requisições por minuto, 30.000 tokens sem cache por minuto, 90.000 tokens totais por minuto e 1 milhão de tokens por hora e por dia, e o qwen-3.8-27b aceita 2 imagens por requisição dentro de um payload de 10 MiB.
  • No nível Developer, o gpt-oss-120b permite 1 milhão de tokens sem cache por minuto e 1.000 requisições por minuto, enquanto o qwen-3.8-27b permite 150.000 tokens sem cache por minuto e 300 requisições por minuto, com seu limite total elevado temporariamente de 450.000 para 750.000.
  • Os limites valem por organização, e não por usuário, e variam conforme o modelo.
  • A capacidade é reabastecida continuamente por um algoritmo de balde de tokens (token bucket), em vez de ser redefinida em intervalos fixos, e um erro 429 informa se foi excedido o limite de tokens sem cache ou o limite total.
  • Tokens em cache não contam para o limite sem cache, e o limite total é, por padrão, o triplo do limite sem cache, então a taxa de acerto do cache determina diretamente a vazão.

Relatos de usuários apontam na mesma direção. Em uma discussão pública entre desenvolvedores sobre o lançamento do Qwen 3.8 27B na Cerebras, vários desenvolvedores disseram que o contexto de 128k permitido pela Cerebras é pequeno demais para tarefas longas de agentes ou de programação. Outros no mesmo tópico disseram que o limite de 150.000 TPM no endpoint público dificulta o uso do modelo em muitas tarefas de programação. Uma coluna de opinião de um veículo de TI de setembro de 2025, escrita quando o Cerebras Code rodava o Qwen3 Coder, relatou que a geração voava por 10 a 20 segundos antes de o teto de tokens por minuto disparar erros 429 até o minuto ser redefinido.

Mudanças no catálogo e recursos em prévia

  • Desde 3 de setembro de 2026, o gemma-4-31b não está mais disponível no Shared Inference, embora continue no Dedicated Inference.
  • O registro de descontinuações lista o zai-glm-4.7 como descontinuado em 2026-08-17, enquanto a página do Cerebras Code ainda anuncia o GLM 4.7, de modo que as duas páginas oficiais não batem.
  • O Batch está em Private Preview sem suporte de SDK, por isso os jobs em lote são enviados com cURL ou requisições HTTP diretas.
  • Níveis de serviço para priorizar requisições não estão disponíveis no Shared Inference.

Lacunas de compatibilidade da API

  • Apenas n: 1 é suportado, e as imagens precisam ser enviadas como data URIs PNG ou JPEG em base64, porque URLs de imagens HTTPS externas não são suportadas.
  • O gpt-oss-120b rejeita requisições que combinam tools com response_format.
  • O texto embutido em uma imagem entra no contexto do prompt, então uma imagem com instruções adversariais pode levar o modelo a segui-las quando o prompt pede uma resposta com base na imagem.

Alegações de desempenho

A Cerebras diz que suas comparações de desempenho se baseiam em benchmarks de terceiros ou testes internos, e que os ganhos de velocidade observados em relação a sistemas com GPU podem variar conforme a carga de trabalho, a configuração, a data e o modelo.

Privacidade, uso de dados e termos

  • A política de privacidade diz que a Cerebras não retém entradas e saídas de seus serviços de treinamento, inferência e chatbot, e exclui os logs relacionados quando deixam de ser necessários para prestar o serviço.
  • A Cerebras afirma que requisições do Playground e da API nunca são usadas para treinar modelos.
  • Separadamente, a documentação do Batch diz que os resultados dos lotes são retidos por 7 dias após a conclusão e depois excluídos automaticamente.
  • O Trust Center lista SOC 2 Type 2, GDPR e CCPA em conformidade, com documentação de segurança disponível mediante solicitação.
  • No uso da API, a propriedade da saída do modelo é regida pelos termos dos modelos de terceiros, e a Cerebras não reivindica essa propriedade.
  • As contas exigem que os usuários tenham pelo menos 13 anos ou a idade mínima de consentimento digital do seu país.
  • O Cloud Console não oferece exclusão de conta self-service, então os pedidos de exclusão vão para o suporte.

FAQ

Q1. O que acontece quando o crédito de teste de $5 acaba?

O acesso à API e ao Playground para, mas as chaves de API, os projetos e as configurações continuam intactos, e uma compra paga conforme o uso reativa o acesso no nível Developer, que não tem tetos de tokens por hora ou por dia.

Q2. A Cerebras pode trocar o modelo por trás de um ID de modelo existente?

A Cerebras diz que serve os pesos originais sem modificação para IDs de modelo existentes e que lançaria eventuais variantes podadas futuras com IDs de modelo separados.

Q3. O SDK da OpenAI funciona com o Dedicated Inference?

Sim. O campo model compatível com OpenAI recebe um ID de modelo exato no Shared Inference e o seu ID de endpoint estável no Dedicated Inference, que encaminha cada requisição para a implantação ativa.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos