¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Fireworks (escrito Fireworks AI en su documentación) es una plataforma en la nube para ejecutar y entrenar modelos de IA abiertos. Los desarrolladores llaman a modelos alojados mediante una API de inferencia LLM, alquilan GPU dedicadas para sus propios despliegues o hacen ajuste fino de modelos abiertos con sus propios datos y sirven el resultado en la misma infraestructura.
El proveedor presenta la plataforma como «la infraestructura fundamental para la inteligencia especializada»: un ciclo de aprendizaje propiedad del cliente que convierte los principales modelos de código abierto y los datos de un cliente en una ventaja que se afina con cada iteración. Fireworks no crea modelos fundacionales desde cero: la cofundadora y CEO Lin Qiao ha descrito el negocio como ayudar a las empresas a hacer ajuste fino de modelos existentes para sus necesidades concretas. Qiao dirigió anteriormente el equipo de desarrollo de la plataforma de IA en Meta.
En cuanto a escala, la prensa tecnológica independiente informó en septiembre de 2026 de que Fireworks anunció en julio que sus ingresos anualizados habían alcanzado 1.000 millones de dólares, cinco veces más que el año anterior.
Estas opciones convierten el ajuste fino de modelos abiertos en una canalización hacia el servicio, no en un producto aparte: la página de inicio afirma que cada checkpoint se despliega en producción en segundos.
Un primer proyecto típico pasa de las pruebas sin servidor al control de costes:
firectl quota list para consultar los límites de velocidad, las cuotas de GPU, los límites de gasto y el uso actuales de la cuenta antes de planificar un lanzamiento.Las citas de clientes en la página de inicio de Fireworks son testimonios seleccionados por el proveedor, no estudios de caso independientes, pero muestran las cargas de trabajo que busca la plataforma:
Encaja peor en dos casos. Los equipos que necesitan una versión de modelo fija sacan menos partido del modo sin servidor, porque esos modelos los gestiona el equipo de Fireworks y pueden actualizarse o quedar obsoletos a medida que se lanzan nuevos modelos. Los términos prohíben el uso por menores salvo que lo supervise un padre, una madre o un tutor legal.
La facturación es prepago: la recarga automática puede reponer el saldo por sí sola y un límite de gasto mensual pone tope al uso. Los clientes con contrato pueden tener la opción de pasar a facturación pospago.
Los precios están en USD por 1 millón de tokens, mostrados como entrada / entrada en caché / salida, según los datos tomados el 5 de octubre de 2026.
| Modelo | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
Los modelos de texto y visión que no aparecen individualmente se cobran según su tamaño: menos de 4B parámetros cuesta $0.10, de 4B a 16B $0.20 y más de 16B $0.90 por 1M de tokens, sin tarifa de caché aparte. La inferencia por lotes se factura al 50 % de los precios sin servidor tanto en la entrada como en la salida. Desde el 1 de septiembre de 2026, los modelos lanzados solo para EE. UU. cuestan 1,5 veces los precios sin servidor del modelo base.
Los despliegues bajo demanda se facturan por segundo de GPU, sin cargos adicionales por los tiempos de arranque.
| GPU | Por minuto | Por hora |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
Los despliegues restringidos por región tienen un recargo de 1,5 veces y se gestionan a través de ventas.
El ajuste fino gestionado supervisado y por preferencias se cobra por cada 1M de tokens de entrenamiento:
| Tamaño del modelo base | LoRA SFT | LoRA DPO | SFT de parámetros completos | DPO de parámetros completos |
|---|---|---|---|---|
| Hasta 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| De 16,1B a 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| De 80B a 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| Más de 300B | $10.00 | $20.00 | $20.00 | $40.00 |
Los tokens de entrenamiento se estiman como el número de tokens del conjunto de datos de entrenamiento multiplicado por el número de épocas. Los trabajos de la Dedicated Training API se cobran por hora de GPU a las tarifas bajo demanda.
El coste de servir modelos se lee distinto según la página. La página de precios dice que puedes servir modelos ajustados al mismo precio que los modelos base, mientras que la FAQ de facturación dice que los modelos LoRA entrenados requieren un despliegue dedicado para servirse, facturado por segundo de GPU.
Fireworks factura las GPU dedicadas por segundo, mientras que Baseten mide por minuto, una diferencia que importa sobre todo en despliegues cortos y con picos.
Por defecto, Fireworks no registra ni almacena datos de prompts ni de generación de ningún modelo abierto sin el consentimiento explícito del usuario (opt-in); sí registra metadatos de solicitud, como el número de tokens. Con la caché de prompts activa, algunos datos de prompts pueden quedar varios minutos en memoria volátil.
La Response API es una excepción: almacena las conversaciones por defecto, y las conversaciones almacenadas se eliminan automáticamente a los 30 días. Los términos también limitan el compromiso de retención cero de datos a la inferencia; no cubre funciones que conservan datos por diseño, como el entrenamiento, el ajuste fino o las funciones de agentes.
Sobre el uso para entrenamiento, los dos documentos difieren en su redacción. Los Términos de Servicio dicen que Fireworks no usará tu Contenido para entrenar sus propios modelos ni para mejorar el Servicio. El Aviso de Privacidad dice que Fireworks no usa prompts, datos de entrenamiento ni entradas de la API para entrenar o mejorar sus modelos sin tu consentimiento explícito (opt-in). Entre las partes, eres titular de todos los derechos, títulos e intereses sobre tu Contenido, que los términos definen como tus entradas y salidas.
Los administradores Enterprise pueden activar una política de retención cero de datos para toda la cuenta, que rechaza todo lo que conservaría contenido del cliente, como trabajos de inferencia por lotes, de ajuste fino y RL, subidas de conjuntos de datos y modelos virtuales de FireRouter. Cuando FireRouter envía un turno a Claude o GPT, el modelo cerrado se ejecuta en tu propia cuenta de Anthropic u OpenAI.
Son declaraciones del proveedor, no auditorías independientes:
No aparece ningún plan gratuito en las páginas de precios consultadas. Más allá del crédito de $1 mencionado en la FAQ de facturación, el uso continuado requiere un método de pago y créditos prepagados.
No. Los modelos LoRA necesitan un despliegue bajo demanda facturado por tiempo de GPU; un despliegue puede alojar hasta 100 adaptadores LoRA, lo que reparte ese coste.
Los precios de inferencia sin servidor cobran cada token, así que el tiempo inactivo no cuesta nada. Los despliegues bajo demanda se describen como más baratos con una utilización alta; se facturan por segundo de GPU en lugar de por token.