¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Cerebras es una plataforma de inferencia de IA que ejecuta modelos de lenguaje de pesos abiertos en los procesadores a escala de oblea (wafer-scale) de la propia empresa. Los desarrolladores acceden a ella mediante Cerebras Inference, una API en la nube con un Playground en el navegador; las organizaciones más grandes pueden reservar capacidad Dedicated o instalar sistemas Cerebras en sus propios centros de datos, y el mismo hardware respalda también servicios de entrenamiento y ajuste fino.
El nivel de nube pública ofrece una gama de modelos actualizada con regularidad en un endpoint compartido al que se llama con una clave de API.
La velocidad es el argumento central. Cerebras presenta su sistema a escala de rack más reciente, el CS-4, como capaz de una inferencia hasta 30 veces más rápida que las GPU, una cifra del proveedor y no una medición independiente.
La empresa detrás del producto, Cerebras Systems, recaudó 5.500 millones de dólares en una salida a bolsa en mayo de 2026, y la prensa económica independiente cita a OpenAI, G42, la Mohamed bin Zayed University of Artificial Intelligence y Amazon Web Services entre sus clientes.
La fidelidad de los modelos está documentada con un detalle poco habitual. Cerebras afirma que todos los modelos de Shared Inference son la versión original, sin poda. Los pesos se almacenan con cuantización selectiva solo de pesos en formatos parciales de 16, 8 o 4 bits, mientras que las capas sensibles conservan la precisión completa y las activaciones, la atención y la caché KV no se cuantizan. Para quien compare proveedores de inferencia de IA rápida, esto aclara qué se sirve realmente detrás de las cifras de velocidad.
La caché de prompts funciona automáticamente en todas las solicitudes de API compatibles, sin puntos de corte de caché ni cambios de código. Cerebras garantiza un tiempo de vida (TTL) de caché de 5 minutos, y las entradas pueden persistir hasta 1 hora según la carga del sistema. La ventaja es de capacidad, no de precio: los tokens en caché quedan excluidos del límite de tasa sin caché, pero no tienen descuento.
Dedicated Inference reserva capacidad para una sola organización y es la opción que Cerebras señala para trabajos de producción que necesitan un rendimiento predecible. También permite desplegar pesos ajustados junto a las versiones estándar de los modelos. Cada despliegue puede ajustarse en capacidad, modelos borrador (draft), configuración del modelo y cuantización, y añade ajuste fino, gestión de pesos y control de niveles de servicio a todas las capacidades de Shared Inference. Las familias compatibles en el lado dedicado incluyen Qwen 3.8, Qwen3 y Qwen3-Coder, Llama 3 y Llama 4, GLM 4.X y 5.X, Kimi K2.X y DeepSeek V3.X.
La Batch API procesa grupos de solicitudes de forma asíncrona, y se garantiza que las solicitudes por lotes se completen en 24 horas.
Cerebras Code es una suscripción de programación pensada para usarse desde tu propio editor. Su página de producto dice que ejecuta GLM 4.7 para generar código a más de 1000 tokens por segundo, aunque el registro de obsolescencias de la API cuenta otra historia.
Cerebras Training Cloud se describe como una forma de entrenar y ajustar modelos desde 1000 millones hasta decenas de billones de parámetros con el mismo código sencillo.
El sistema CS-4 funciona con el procesador WSE-3 Turbo, que Cerebras describe con cuatro billones de transistores y 900.000 núcleos de IA que ofrecen 250 PFLOPS de cómputo y 43,2 petabytes por segundo de ancho de banda de memoria. La página del CS-4 dice que los primeros envíos comienzan este trimestre, pero no indica una fecha.
Cerebras plantea sus casos de uso en torno a cargas de trabajo en las que esperar tokens perjudica al producto:
El despliegue más visible es externo. En febrero de 2026, la prensa tecnológica independiente informó de que GPT-5.3-Codex-Spark de OpenAI, un modelo Codex más pequeño diseñado para una inferencia más rápida y la colaboración en tiempo real, funciona sobre el Wafer Scale Engine 3 de Cerebras.
Cerebras encaja con equipos para los que la velocidad de respuesta cambia el producto, pero el punto de entrada adecuado depende de la etapa:
El soporte también varía según el nivel: las cuentas Developer dependen de un Discord comunitario, mientras que los clientes Enterprise cuentan con un equipo de cuenta dedicado.
Encaja peor con quien espere un nivel gratuito permanente, ventanas de contexto muy largas en el endpoint de autoservicio o una amplia elección de modelos en autoservicio; los detalles están en las secciones de precios, limitaciones y funciones.
Los precios de la API de Cerebras en el nivel Developer de autoservicio son de pago por uso y empiezan con un crédito gratuito de $5, mientras que los precios Enterprise se cotizan bajo solicitud.
| Modelo (nivel Developer) | Entrada | Salida |
|---|---|---|
| GPT OSS 120B | $0.35 por millón de tokens | $0.75 por millón de tokens |
| Qwen 3.8 27B | $0.99 por millón de tokens | $1.49 por millón de tokens |
Cerebras Code Pro figura a $50 por hasta 24 millones de tokens al día, orientado a desarrolladores independientes y proyectos de fin de semana. Cerebras Code Max figura a $200 por hasta 120 millones de tokens al día, orientado al desarrollo a tiempo completo y a sistemas multiagente. Ambos planes de pago aparecían como agotados en la captura del 4 de octubre de 2026, y las fichas de planes revisadas para esta página no indican un periodo de facturación.
Training Cloud se vende por horas, con Cerebras dimensionando el tiempo que necesita una carga de trabajo enviada, o por modelo, con expertos de Cerebras diseñando y ajustando un modelo con tu conjunto de datos; la página de Training Cloud enumera estas opciones sin tarifas.
Otros proveedores también fabrican silicio propio para inferencia rápida en lugar de alquilar GPU estándar:
Frente a ellos, Cerebras destaca por su procesador a escala de oblea, una API compatible con OpenAI con una prueba de autoservicio de $5 y la opción de instalar sistemas CS-4 on-premise, aunque su catálogo de autoservicio se limita a dos modelos.
Los informes de usuarios apuntan en la misma dirección. En una discusión pública entre desarrolladores sobre el lanzamiento de Qwen 3.8 27B en Cerebras, varios desarrolladores dijeron que el contexto de 128k que permite Cerebras es demasiado pequeño para tareas largas de agentes o de programación. Otros en el mismo hilo dijeron que el límite de 150.000 TPM del endpoint público dificulta usar el modelo para muchas tareas de programación. Una columna de opinión de un medio de TI de septiembre de 2025, escrita cuando Cerebras Code funcionaba con Qwen3 Coder, relataba que la generación volaba durante 10 a 20 segundos antes de que el tope de tokens por minuto provocara errores 429 hasta que se reiniciaba el minuto.
Cerebras dice que sus comparaciones de rendimiento se basan en benchmarks de terceros o pruebas internas, y que las mejoras de velocidad observadas frente a sistemas GPU pueden variar según la carga de trabajo, la configuración, la fecha y el modelo.
El acceso a la API y al Playground se detiene, pero las claves de API, los proyectos y la configuración se mantienen, y una compra de pago por uso reactiva el acceso en el nivel Developer, que no tiene topes de tokens por hora ni por día.
Cerebras dice que sirve los pesos originales sin modificar para los ID de modelo existentes y que publicaría cualquier variante podada futura con ID de modelo independientes.
Sí. El campo model compatible con OpenAI recibe un ID de modelo exacto en Shared Inference y tu ID de endpoint estable en Dedicated Inference, que dirige cada solicitud a su despliegue activo.