Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Herramientas de desarrollo
  4. Cerebras
Vista previa de la interfaz de Cerebras
Logotipo de Cerebras

Cerebras

Cerebras ejecuta modelos de pesos abiertos como GPT OSS 120B y Qwen 3.8 27B en sus propios procesadores a escala de oblea mediante una API compatible con OpenAI, con tokens de pago por uso, capacidad Dedicated reservada y sistemas CS-4 on-premise.

Herramientas de desarrolloDesarrollo de IAPlataforma de Entrenamiento de IA#Empresarial#LLM#API compatible con OpenAI
Ver precios
Guardados
Visitas
Vistas
Precio
De pago
Publicado
4 oct 2026
Dominio
cerebras.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Cerebras

Ver precios
Información de la herramienta
Guardados
Visitas
Vistas
Precio
De pago
Publicado
4 oct 2026
Dominio
cerebras.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Ver precios

¿Qué es Cerebras?

Cerebras es una plataforma de inferencia de IA que ejecuta modelos de lenguaje de pesos abiertos en los procesadores a escala de oblea (wafer-scale) de la propia empresa. Los desarrolladores acceden a ella mediante Cerebras Inference, una API en la nube con un Playground en el navegador; las organizaciones más grandes pueden reservar capacidad Dedicated o instalar sistemas Cerebras en sus propios centros de datos, y el mismo hardware respalda también servicios de entrenamiento y ajuste fino.

El nivel de nube pública ofrece una gama de modelos actualizada con regularidad en un endpoint compartido al que se llama con una clave de API.

La velocidad es el argumento central. Cerebras presenta su sistema a escala de rack más reciente, el CS-4, como capaz de una inferencia hasta 30 veces más rápida que las GPU, una cifra del proveedor y no una medición independiente.

La empresa detrás del producto, Cerebras Systems, recaudó 5.500 millones de dólares en una salida a bolsa en mayo de 2026, y la prensa económica independiente cita a OpenAI, G42, la Mohamed bin Zayed University of Artificial Intelligence y Amazon Web Services entre sus clientes.

Funciones principales

API de Shared Inference

  • API compatible con OpenAI: la API de Cerebras funciona con las bibliotecas cliente de OpenAI en muchos flujos de trabajo habituales, así que una aplicación existente puede cambiar modificando la clave de API, la URL base y el modelo de destino.
  • Catálogo de autoservicio reducido: Shared Inference incluye actualmente gpt-oss-120b (120.000 millones de parámetros, contexto de 65k en la prueba gratuita y de 131k en los niveles de pago, unos 3000 tokens por segundo) y qwen-3.8-27b (27.000 millones de parámetros, contexto de 64k/128k, unos 1850 tokens por segundo).
  • Catálogo más amplio por contrato: otras familias de modelos solo están disponibles mediante Dedicated Inference.
  • Entrada de imágenes: en Shared Inference, qwen-3.8-27b admite imágenes, mientras que gemma-4-31b y otros modelos con capacidad de imagen requieren Dedicated Inference.
  • Control del razonamiento: en qwen-3.8-27b, el esfuerzo de razonamiento puede fijarse en none, low, medium o high, con high por defecto, y el razonamiento se devuelve por separado de la respuesta.

La fidelidad de los modelos está documentada con un detalle poco habitual. Cerebras afirma que todos los modelos de Shared Inference son la versión original, sin poda. Los pesos se almacenan con cuantización selectiva solo de pesos en formatos parciales de 16, 8 o 4 bits, mientras que las capas sensibles conservan la precisión completa y las activaciones, la atención y la caché KV no se cuantizan. Para quien compare proveedores de inferencia de IA rápida, esto aclara qué se sirve realmente detrás de las cifras de velocidad.

Caché de prompts

La caché de prompts funciona automáticamente en todas las solicitudes de API compatibles, sin puntos de corte de caché ni cambios de código. Cerebras garantiza un tiempo de vida (TTL) de caché de 5 minutos, y las entradas pueden persistir hasta 1 hora según la carga del sistema. La ventaja es de capacidad, no de precio: los tokens en caché quedan excluidos del límite de tasa sin caché, pero no tienen descuento.

Dedicated Inference

Dedicated Inference reserva capacidad para una sola organización y es la opción que Cerebras señala para trabajos de producción que necesitan un rendimiento predecible. También permite desplegar pesos ajustados junto a las versiones estándar de los modelos. Cada despliegue puede ajustarse en capacidad, modelos borrador (draft), configuración del modelo y cuantización, y añade ajuste fino, gestión de pesos y control de niveles de servicio a todas las capacidades de Shared Inference. Las familias compatibles en el lado dedicado incluyen Qwen 3.8, Qwen3 y Qwen3-Coder, Llama 3 y Llama 4, GLM 4.X y 5.X, Kimi K2.X y DeepSeek V3.X.

Batch API

La Batch API procesa grupos de solicitudes de forma asíncrona, y se garantiza que las solicitudes por lotes se completen en 24 horas.

Cerebras Code

Cerebras Code es una suscripción de programación pensada para usarse desde tu propio editor. Su página de producto dice que ejecuta GLM 4.7 para generar código a más de 1000 tokens por segundo, aunque el registro de obsolescencias de la API cuenta otra historia.

Entrenamiento y ajuste fino

Cerebras Training Cloud se describe como una forma de entrenar y ajustar modelos desde 1000 millones hasta decenas de billones de parámetros con el mismo código sencillo.

Hardware CS-4 y WSE-3 Turbo

El sistema CS-4 funciona con el procesador WSE-3 Turbo, que Cerebras describe con cuatro billones de transistores y 900.000 núcleos de IA que ofrecen 250 PFLOPS de cómputo y 43,2 petabytes por segundo de ancho de banda de memoria. La página del CS-4 dice que los primeros envíos comienzan este trimestre, pero no indica una fecha.

Guía

Primeros pasos con la API

  1. Abre la Cloud Console, regístrate o inicia sesión y crea una clave en API Keys, en la navegación de la izquierda.
  2. Añade un método de pago, porque sin él el acceso al Playground y a la API sigue inactivo.
  3. Instala el SDK oficial, publicado como cerebras_cloud_sdk para Python mediante pip y como @cerebras/cerebras_cloud_sdk para Node.js mediante npm, o apunta un cliente de OpenAI existente a la URL base de Cerebras.
  4. Usa el Playground para evaluar modelos, iterar prompts, probar la llamada a herramientas, ajustar parámetros y exportar una solicitud funcional a código. Tras cada respuesta muestra el uso de tokens, el tiempo de inferencia, los tokens por segundo y el tiempo de ida y vuelta, lo que permite comprobar rápido la velocidad real con tus propios prompts.
  5. Fija max_completion_tokens en un valor realista. Cerebras estima cada solicitud a partir del prompt más ese parámetro o su propia estimación de salida, y una solicitud cuya estimación supera la cuota restante se limita antes de que empiece el procesamiento.

Casos de uso y ejemplos de Cerebras

Cerebras plantea sus casos de uso en torno a cargas de trabajo en las que esperar tokens perjudica al producto:

  • Asistentes de programación: Cerebras promete ciclos instantáneos de escritura, depuración y refactorización de código, con Cognition como caso de estudio publicado.
  • Agentes de varios pasos: los flujos de agentes buscan ejecutarse sin retrasos ni timeouts, con NinjaTech como ejemplo.
  • Búsqueda, copilotos y análisis: aquí la promesa es razonamiento complejo en menos de un segundo, con AlphaSense como ejemplo.
  • Interfaces de voz: el argumento son respuestas de voz instantáneas y precisas, con Tavus como ejemplo.
  • Búsqueda empresarial dentro de la aplicación: Notion dice que Cerebras impulsa funciones en tiempo real como la búsqueda empresarial.
  • Agentes de investigación en ciencias de la vida: GSK dice que usa la velocidad de inferencia de Cerebras para crear aplicaciones como agentes de investigación inteligentes para sus investigadores y su trabajo de descubrimiento de fármacos.
  • Trabajos masivos sin conexión: la documentación de la Batch API menciona pipelines de evaluación, etiquetado de datos, generación masiva de contenido y análisis de investigación.

El despliegue más visible es externo. En febrero de 2026, la prensa tecnológica independiente informó de que GPT-5.3-Codex-Spark de OpenAI, un modelo Codex más pequeño diseñado para una inferencia más rápida y la colaboración en tiempo real, funciona sobre el Wafer Scale Engine 3 de Cerebras.

Para quién es

Cerebras encaja con equipos para los que la velocidad de respuesta cambia el producto, pero el punto de entrada adecuado depende de la etapa:

  • Desarrolladores que evalúan la velocidad: el nivel Developer de autoservicio está pensado para desarrollo, evaluación y experimentación, no para uso en producción.
  • Equipos de producción: Enterprise añade capacidad lista para producción, la mejor prioridad, límites de tasa más altos y opciones de latencia mejoradas que el nivel Developer no incluye.
  • Operadores de centros de datos y de IA de frontera: el CS-4 está diseñado para desplegarse a hiperescala como infraestructura para la IA de frontera.

El soporte también varía según el nivel: las cuentas Developer dependen de un Discord comunitario, mientras que los clientes Enterprise cuentan con un equipo de cuenta dedicado.

Encaja peor con quien espere un nivel gratuito permanente, ventanas de contexto muy largas en el endpoint de autoservicio o una amplia elección de modelos en autoservicio; los detalles están en las secciones de precios, limitaciones y funciones.

Plataformas

  • SDK: Cerebras ofrece SDK dedicados para Python y TypeScript junto con el acceso compatible con OpenAI.
  • Canales de socios: Cerebras Inference también se vende a través de AWS Marketplace y es accesible mediante la API unificada de OpenRouter.
  • Hugging Face y Vercel: los modelos impulsados por Cerebras pueden llamarse desde Hugging Face Hub, y los endpoints de inferencia de Cerebras pueden desplegarse en Vercel.
  • Herramientas de programación: Cerebras Code funciona con cualquier editor o agente que acepte una clave de API, incluidos Cline, OpenCode y Crush.
  • Ubicaciones de despliegue: los modelos se ofrecen en la nube y on-premise, y Cerebras dice que la inferencia se ejecuta en la región para ayudar con la latencia, la residencia de datos y las obligaciones de cumplimiento.
  • Acceso de equipo: las organizaciones asignan los roles Organization Admin, Project Admin o Project Member, y los administradores de proyecto gestionan las claves de API en sus proyectos asignados.

Precios

Los precios de la API de Cerebras en el nivel Developer de autoservicio son de pago por uso y empiezan con un crédito gratuito de $5, mientras que los precios Enterprise se cotizan bajo solicitud.

Modelo (nivel Developer)EntradaSalida
GPT OSS 120B$0.35 por millón de tokens$0.75 por millón de tokens
Qwen 3.8 27B$0.99 por millón de tokens$1.49 por millón de tokens
  • El crédito de $5 es un crédito promocional único que requiere un método de pago válido y caduca 30 días después de su activación; añadir la tarjeta no te da de alta en el uso de pago, y el acceso a la API y al Playground se pausa cuando el crédito caduca o se agota, salvo que compres créditos de pago por uso.
  • No existe un nivel gratuito permanente, ya que la prueba gratuita está limitada tanto en tiempo como en crédito.
  • La caché de prompts no cuesta nada extra, pero los tokens de entrada en caché se facturan a la tarifa estándar de tokens de entrada.
  • La recarga automática está desactivada por defecto y puede activarse desde la pestaña Pay as you go.
  • La pestaña Subscriptions de la Cloud Console gestiona planes de inferencia por modelo, cada uno ofrecido en niveles con distintas tarifas mensuales.
  • Los pesos de modelos personalizados y los servicios de ajuste fino o entrenamiento son funciones Enterprise disponibles solo mediante acuerdo.

Planes de Cerebras Code

Cerebras Code Pro figura a $50 por hasta 24 millones de tokens al día, orientado a desarrolladores independientes y proyectos de fin de semana. Cerebras Code Max figura a $200 por hasta 120 millones de tokens al día, orientado al desarrollo a tiempo completo y a sistemas multiagente. Ambos planes de pago aparecían como agotados en la captura del 4 de octubre de 2026, y las fichas de planes revisadas para esta página no indican un periodo de facturación.

Training Cloud

Training Cloud se vende por horas, con Cerebras dimensionando el tiempo que necesita una carga de trabajo enviada, o por modelo, con expertos de Cerebras diseñando y ajustando un modelo con tu conjunto de datos; la página de Training Cloud enumera estas opciones sin tarifas.

Alternativas a Cerebras

Otros proveedores también fabrican silicio propio para inferencia rápida en lugar de alquilar GPU estándar:

  • Groq: Groq se describe como una neocloud de inferencia rápida basada en su LPU, que ahora funciona junto a GPU de NVIDIA mediante LPX.
  • SambaNova SambaCloud: SambaNova dice que su chip RDU permite a SambaCloud ofrecer inferencia rápida en los modelos más grandes. SambaCloud admite familias de código abierto como DeepSeek, Llama y Qwen.

Frente a ellos, Cerebras destaca por su procesador a escala de oblea, una API compatible con OpenAI con una prueba de autoservicio de $5 y la opción de instalar sistemas CS-4 on-premise, aunque su catálogo de autoservicio se limita a dos modelos.

Limitaciones

Límites de tasa y ventanas de contexto

  • En la prueba gratuita, cada modelo de Shared Inference está limitado a 5 solicitudes por minuto, 30.000 tokens sin caché por minuto, 90.000 tokens totales por minuto y 1 millón de tokens por hora y por día, y qwen-3.8-27b acepta 2 imágenes por solicitud dentro de una carga útil de 10 MiB.
  • En el nivel Developer, gpt-oss-120b permite 1 millón de tokens sin caché por minuto y 1000 solicitudes por minuto, mientras que qwen-3.8-27b permite 150.000 tokens sin caché por minuto y 300 solicitudes por minuto, con su límite total elevado temporalmente de 450.000 a 750.000.
  • Los límites se aplican por organización y no por usuario, y varían según el modelo.
  • La capacidad se repone continuamente con un algoritmo de cubeta de tokens (token bucket) en lugar de reiniciarse a intervalos fijos, y un error 429 indica si se superó el límite de tokens sin caché o el límite total.
  • Los tokens en caché no cuentan para el límite sin caché, y el límite total equivale por defecto al triple del límite sin caché, así que la tasa de aciertos de caché determina directamente el rendimiento.

Los informes de usuarios apuntan en la misma dirección. En una discusión pública entre desarrolladores sobre el lanzamiento de Qwen 3.8 27B en Cerebras, varios desarrolladores dijeron que el contexto de 128k que permite Cerebras es demasiado pequeño para tareas largas de agentes o de programación. Otros en el mismo hilo dijeron que el límite de 150.000 TPM del endpoint público dificulta usar el modelo para muchas tareas de programación. Una columna de opinión de un medio de TI de septiembre de 2025, escrita cuando Cerebras Code funcionaba con Qwen3 Coder, relataba que la generación volaba durante 10 a 20 segundos antes de que el tope de tokens por minuto provocara errores 429 hasta que se reiniciaba el minuto.

Cambios de catálogo y funciones en vista previa

  • Desde el 3 de septiembre de 2026, gemma-4-31b ya no está disponible en Shared Inference, aunque sigue en Dedicated Inference.
  • El registro de obsolescencias marca zai-glm-4.7 como obsoleto el 2026-08-17, mientras que la página de Cerebras Code aún anuncia GLM 4.7, de modo que las dos páginas oficiales no coinciden.
  • Batch está en Private Preview sin soporte de SDK, por lo que los trabajos por lotes se envían con cURL o solicitudes HTTP directas.
  • Los niveles de servicio para priorizar solicitudes no están disponibles con Shared Inference.

Brechas de compatibilidad de la API

  • Solo se admite n: 1, y las imágenes deben enviarse como data URI PNG o JPEG en base64, porque no se admiten URL de imágenes HTTPS externas.
  • gpt-oss-120b rechaza las solicitudes que combinan tools con response_format.
  • El texto incrustado en una imagen entra en el contexto del prompt, por lo que una imagen con instrucciones adversarias puede llevar al modelo a seguirlas cuando el prompt pide responder a partir de la imagen.

Afirmaciones de rendimiento

Cerebras dice que sus comparaciones de rendimiento se basan en benchmarks de terceros o pruebas internas, y que las mejoras de velocidad observadas frente a sistemas GPU pueden variar según la carga de trabajo, la configuración, la fecha y el modelo.

Privacidad, uso de datos y condiciones

  • La política de privacidad dice que Cerebras no conserva las entradas ni las salidas de sus servicios de entrenamiento, inferencia y chatbot, y elimina los registros relacionados cuando ya no son necesarios para prestar el servicio.
  • Cerebras afirma que las solicitudes del Playground y de la API nunca se usan para entrenar modelos.
  • Por separado, la documentación de Batch dice que los resultados de los lotes se conservan 7 días tras completarse y luego se eliminan automáticamente.
  • El Trust Center incluye SOC 2 Type 2, el RGPD (GDPR) y la CCPA en cumplimiento, con documentación de seguridad disponible bajo solicitud.
  • Para el uso de la API, la propiedad de la salida del modelo se rige por las condiciones de los modelos de terceros, y Cerebras no reclama su propiedad.
  • Las cuentas exigen que los usuarios tengan al menos 13 años o la edad mínima de consentimiento digital de su país.
  • La Cloud Console no ofrece eliminación de cuenta en autoservicio, así que las solicitudes de eliminación se envían a soporte.

Preguntas frecuentes

Q1. ¿Qué pasa cuando se agota el crédito de prueba de $5?

El acceso a la API y al Playground se detiene, pero las claves de API, los proyectos y la configuración se mantienen, y una compra de pago por uso reactiva el acceso en el nivel Developer, que no tiene topes de tokens por hora ni por día.

Q2. ¿Puede Cerebras cambiar el modelo detrás de un ID de modelo existente?

Cerebras dice que sirve los pesos originales sin modificar para los ID de modelo existentes y que publicaría cualquier variante podada futura con ID de modelo independientes.

Q3. ¿Funciona el SDK de OpenAI con Dedicated Inference?

Sí. El campo model compatible con OpenAI recibe un ID de modelo exacto en Shared Inference y tu ID de endpoint estable en Dedicated Inference, que dirige cada solicitud a su despliegue activo.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas