Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Herramientas de desarrollo
  4. Fireworks
Vista previa de la interfaz de Fireworks
Logotipo de Fireworks

Fireworks

Fireworks sirve modelos abiertos mediante API sin servidor facturadas por token y despliegues dedicados facturados por segundo de GPU, y añade ajuste fino gestionado para que los equipos de desarrollo entrenen y alojen sus propias variantes de modelos.

Herramientas de desarrolloDesarrollo de IAPlataforma de Entrenamiento de IA#Procesamiento por lotes#LLM#API compatible con OpenAI
Probar gratis
Guardados
Visitas
Vistas
Precio
Gratis
Publicado
5 oct 2026
Dominio
fireworks.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Fireworks

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Gratis
Publicado
5 oct 2026
Dominio
fireworks.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Fireworks?

Fireworks (escrito Fireworks AI en su documentación) es una plataforma en la nube para ejecutar y entrenar modelos de IA abiertos. Los desarrolladores llaman a modelos alojados mediante una API de inferencia LLM, alquilan GPU dedicadas para sus propios despliegues o hacen ajuste fino de modelos abiertos con sus propios datos y sirven el resultado en la misma infraestructura.

El proveedor presenta la plataforma como «la infraestructura fundamental para la inteligencia especializada»: un ciclo de aprendizaje propiedad del cliente que convierte los principales modelos de código abierto y los datos de un cliente en una ventaja que se afina con cada iteración. Fireworks no crea modelos fundacionales desde cero: la cofundadora y CEO Lin Qiao ha descrito el negocio como ayudar a las empresas a hacer ajuste fino de modelos existentes para sus necesidades concretas. Qiao dirigió anteriormente el equipo de desarrollo de la plataforma de IA en Meta.

En cuanto a escala, la prensa tecnológica independiente informó en septiembre de 2026 de que Fireworks anunció en julio que sus ingresos anualizados habían alcanzado 1.000 millones de dólares, cinco veces más que el año anterior.

Funciones principales

Inferencia sin servidor

  • Acceso con pago por token: el modo sin servidor se factura por token, con opciones Priority y Fast, y la API se describe como compatible con OpenAI y Anthropic.
  • Modo Priority: el nivel Priority tiene prioridad sobre el tráfico Standard y es menos propenso al descarte de carga (503 server overloaded).
  • Modo Fast: las variantes Fast apuntan a más de 100 tokens por segundo de rendimiento de generación, y la documentación indica que una variante Fast no es otro modelo y que la calidad del modelo no cambia.
  • Catálogo de modelos: la documentación enumera más de 100 modelos compatibles de texto, visión, audio, imagen y embeddings.
  • Trabajos por lotes: la Batch API procesa grandes volúmenes de solicitudes de forma asíncrona; cada trabajo se ejecuta con un límite de tiempo elegido de 12, 24, 48 o 72 horas, y las solicitudes completadas se guardan si el trabajo caduca.

Despliegues dedicados

  • Despliegues bajo demanda: despliegues dedicados multirregión que admiten modelos posentrenados.
  • Pesos personalizados: puedes subir tus propios modelos (para arquitecturas compatibles) desde Hugging Face u otras fuentes.
  • Capacidad reservada: las cuentas Enterprise pueden comprar capacidad reservada, normalmente con compromisos de 1 año, para obtener capacidad garantizada, cuotas más altas y precios por hora de GPU más bajos.
  • Muchos adaptadores en un despliegue: el despliegue Multi-LoRA carga hasta 100 modelos LoRA como complementos sobre un único despliegue de modelo base.

Entrenamiento y ajuste fino

  • Tres puntos de entrada: una vía guiada (describir la tarea, revisar el plan y el coste, aprobar la ejecución), una vía basada en configuración en la que Fireworks se encarga de la programación y el paso a producción, y una vía de código en la que escribes tu propia función de pérdida, tu entrenador y tu bucle de RL en las GPU de Fireworks.
  • Escala: el ajuste fino supervisado y por refuerzo se ofrece para modelos de hasta 1T+ parámetros.
  • Serverless Training API: un grupo de entrenadores compartido y siempre activo para entrenamiento LoRA en modelos de lanzamiento, sin aprovisionamiento ni coste por inactividad.

Estas opciones convierten el ajuste fino de modelos abiertos en una canalización hacia el servicio, no en un producto aparte: la página de inicio afirma que cada checkpoint se despliega en producción en segundos.

Nexus y FireRouter

  • Nexus: lleva modelos abiertos y enrutadores de modelos a entornos de agentes de programación, agentes y pasarelas LLM, con visibilidad del uso y topes de gasto por usuario para los modelos sin servidor compatibles.
  • FireRouter: expone un solo ID de modelo y elige un modelo para cada nuevo turno del usuario, de modo que los turnos fáciles pueden ir a un modelo abierto de Fireworks y los más difíciles a un modelo cerrado como Claude Opus.
  • Promesa de ahorro: Fireworks promociona Nexus como un sustituto directo de las API de modelos cerrados que puede recortar entre un 50 y un 75 % el gasto en programación con IA, una cifra del proveedor.

Guía

Un primer proyecto típico pasa de las pruebas sin servidor al control de costes:

  1. Añade un método de pago válido y una dirección de facturación y, después, compra créditos; el uso del modo sin servidor, los despliegues bajo demanda y el entrenamiento se descuenta de ese saldo.
  2. Usa la biblioteca cliente de Python de OpenAI para interactuar con Fireworks cambiando la URL base y la clave de API.
  3. Para el tráfico que debe resistir los periodos de máxima demanda, establece el nivel de servicio de la solicitud en Priority; para funciones sensibles a la latencia, cambia el ID del modelo a una variante Fast cuando exista.
  4. Establece un límite de gasto mensual. Por defecto, Fireworks envía un correo de aviso cuando el uso alcanza el 80 % de ese límite, y se pueden añadir más umbrales de alerta en la página de facturación.
  5. Ejecuta firectl quota list para consultar los límites de velocidad, las cuotas de GPU, los límites de gasto y el uso actuales de la cuenta antes de planificar un lanzamiento.
  6. Cuando necesites un modelo LoRA entrenado, un modelo personalizado o una versión fija, crea un despliegue bajo demanda en lugar de depender del modo sin servidor.

Casos de uso y ejemplos de clientes de Fireworks

Las citas de clientes en la página de inicio de Fireworks son testimonios seleccionados por el proveedor, no estudios de caso independientes, pero muestran las cargas de trabajo que busca la plataforma:

  • Productos de programación con IA: el director de producto de Cursor afirma que Fireworks ha sido un socio clave para entrenar y servir a escala los modelos detrás de Cursor, incluidas cargas de RL de alto rendimiento e inferencia en producción para Composer.
  • Aplicaciones de consumo más rápidas: un responsable de producto de Quora informa de respuestas 3 veces más rápidas tras migrar un modelo, lo que, según la empresa, mejoró las métricas de interacción.
  • Modelos compuestos ajustados: el CTO de Vercel afirma que su modelo v0 usa un modelo de aprendizaje por refuerzo ajustado con Fireworks y que rinde sustancialmente mejor que el SOTA.
  • Agentes empresariales a través de Azure: UiPath ejecuta Fireworks en Azure Foundry para impulsar Autopilot y Delegate con modelos abiertos.
  • Cambiar un modelo cerrado por uno abierto: Gumloop trasladó un agente interno usado en toda la empresa de Opus 4.8 a GLM-5.2 e informa de que nadie notó diferencia en la experiencia.

Para quién es

  • Equipos de prototipado: el uso sin servidor de modelos populares con precios por token se presenta como ideal para pruebas de calidad a ojo y prototipado.
  • Equipos que ejecutan modelos propios o entrenados: el modo bajo demanda encaja con modelos base personalizados, modelos LoRA entrenados y cargas de trabajo con requisitos de latencia propios que necesitan control sobre el hardware y las réplicas.
  • Empresas reguladas: la política de retención cero de datos para toda la cuenta y la inferencia bloqueada por región son funciones Enterprise, no ajustes de autoservicio.

Encaja peor en dos casos. Los equipos que necesitan una versión de modelo fija sacan menos partido del modo sin servidor, porque esos modelos los gestiona el equipo de Fireworks y pueden actualizarse o quedar obsoletos a medida que se lanzan nuevos modelos. Los términos prohíben el uso por menores salvo que lo supervise un padre, una madre o un tutor legal.

Plataformas

  • API: puntos de conexión compatibles con OpenAI y Anthropic, de modo que el código SDK existente puede apuntar a Fireworks.
  • CLI: firectl crea, despliega y gestiona recursos desde la terminal y puede instalarse con Homebrew.
  • Microsoft Foundry: Fireworks AI es un proveedor de inferencia de primera parte dentro de Microsoft Foundry, con uso facturado a través de Azure que computa en un compromiso de consumo de Azure.
  • Límite de Foundry PayGo: PayGo en Foundry se limita a la US Data Zone, y el límite de rendimiento para despliegues PayGo es de 500.000 tokens por minuto.
  • Regiones: los despliegues dedicados pueden dirigirse a las multirregiones GLOBAL, US, CANADA, EUROPE y APAC.
  • Sin servidor solo en EE. UU.: un punto de conexión independiente de EE. UU. sirve inferencia exclusivamente desde allí para unos pocos modelos; el modo sin servidor solo en la UE requiere contactar con ventas.

Precios

La facturación es prepago: la recarga automática puede reponer el saldo por sí sola y un límite de gasto mensual pone tope al uso. Los clientes con contrato pueden tener la opción de pasar a facturación pospago.

Precios de inferencia sin servidor

Los precios están en USD por 1 millón de tokens, mostrados como entrada / entrada en caché / salida, según los datos tomados el 5 de octubre de 2026.

ModeloStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

Los modelos de texto y visión que no aparecen individualmente se cobran según su tamaño: menos de 4B parámetros cuesta $0.10, de 4B a 16B $0.20 y más de 16B $0.90 por 1M de tokens, sin tarifa de caché aparte. La inferencia por lotes se factura al 50 % de los precios sin servidor tanto en la entrada como en la salida. Desde el 1 de septiembre de 2026, los modelos lanzados solo para EE. UU. cuestan 1,5 veces los precios sin servidor del modelo base.

Precios de GPU bajo demanda

Los despliegues bajo demanda se facturan por segundo de GPU, sin cargos adicionales por los tiempos de arranque.

GPUPor minutoPor hora
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

Los despliegues restringidos por región tienen un recargo de 1,5 veces y se gestionan a través de ventas.

Precios del ajuste fino

El ajuste fino gestionado supervisado y por preferencias se cobra por cada 1M de tokens de entrenamiento:

Tamaño del modelo baseLoRA SFTLoRA DPOSFT de parámetros completosDPO de parámetros completos
Hasta 16B$0.50$1.00$1.00$2.00
De 16,1B a 80B$3.00$6.00$6.00$12.00
De 80B a 300B$6.00$12.00$12.00$24.00
Más de 300B$10.00$20.00$20.00$40.00

Los tokens de entrenamiento se estiman como el número de tokens del conjunto de datos de entrenamiento multiplicado por el número de épocas. Los trabajos de la Dedicated Training API se cobran por hora de GPU a las tarifas bajo demanda.

El coste de servir modelos se lee distinto según la página. La página de precios dice que puedes servir modelos ajustados al mismo precio que los modelos base, mientras que la FAQ de facturación dice que los modelos LoRA entrenados requieren un despliegue dedicado para servirse, facturado por segundo de GPU.

Créditos, niveles y reembolsos

  • Crédito inicial: la FAQ de facturación menciona un crédito de $1; una vez agotado, una cuenta sin método de pago queda suspendida hasta que se añada uno.
  • Niveles de gasto: añadir o gastar $50 en créditos lleva una cuenta a Tier 2, $500 a Tier 3 y $5.000 a Tier 4, y los niveles superiores elevan los topes de los límites de velocidad sin servidor.
  • Precios por volumen: Fireworks ofrece descuentos por compras al por mayor o prepagadas.
  • Reembolsos: los Términos de Servicio establecen que las tarifas pagadas no son reembolsables, salvo lo indicado en los términos.

Alternativas a Fireworks

  • Together AI: sus precios abarcan inferencia sin servidor, rendimiento aprovisionado, inferencia dedicada en GPU de un solo inquilino y ajuste fino LoRA o completo, la misma división de productos que vende Fireworks.
  • Baseten: combina Model APIs con despliegues dedicados en los que solo pagas el cómputo que usas, al minuto, y su plan Basic cuesta $0 al mes, con pago por uso.

Fireworks factura las GPU dedicadas por segundo, mientras que Baseten mide por minuto, una diferencia que importa sobre todo en despliegues cortos y con picos.

Limitaciones

Límites de velocidad y capacidad

  • Las cuentas nuevas están limitadas: una cuenta sin método de pago o sin créditos está limitada a 10 solicitudes por minuto, y el tope para toda la cuenta es de 6.000 solicitudes por minuto incluso con método de pago y créditos.
  • Límites sin servidor adaptativos: los límites crecen y se reducen con tu uso, y si tu tráfico aumenta demasiado rápido, recibirás errores 429.
  • Sin garantía de éxito: en el modo sin servidor puedes recibir respuestas 429 Too Many Requests o 503 Service Overloaded, y mantenerte por debajo de tus límites no evita el descarte de carga.
  • Topes según el tamaño del modelo: los topes de tokens generados van de 1,08M de tokens por minuto para modelos de menos de 600B parámetros a 216k para modelos de 1,6T parámetros o más.
  • Cuotas de GPU: la cuota bajo demanda predeterminada en la multirregión GLOBAL es de 16 GPU de cada uno de H100, H200, B200 y B300, mientras que GB300 y A100 empiezan en 0.
  • La cuota de entrenamiento requiere tarjeta: sin método de pago, la cuota de GPU de entrenamiento es 0; con uno registrado, es de 32 GPU de cada tipo.

Límites operativos

  • Retirada de modelos: Fireworks avisa con al menos 2 semanas de antelación antes de retirar un modelo sin servidor, con un aviso más largo para los modelos populares.
  • Despliegues inactivos: por defecto, los despliegues escalan a cero si no se usan durante 1 hora, y los despliegues con réplicas mínimas fijadas en 0 se eliminan tras 7 días sin tráfico.
  • Capacidad interrumpible: los despliegues interrumpibles toman prestadas GPU inactivas y pueden interrumpirse a mitad de una solicitud sin aviso, por lo que están pensados solo para evaluación y trabajo por lotes.
  • Parada total del gasto: cuando el uso alcanza el 100 % del límite de gasto mensual, todas las solicitudes de API se pausan en la inferencia sin servidor, los despliegues y el entrenamiento (las cuentas Enterprise solo reciben alertas).
  • Informe de gasto con retraso: el gasto total puede ir un día o más por detrás del tráfico en vivo, sobre todo en modelos recién lanzados.
  • Sin cumplimiento PCI: los términos indican que Fireworks no cumple con PCI y no tiene obligación de llegar a cumplirlo.

Retención de datos y uso para entrenamiento

Por defecto, Fireworks no registra ni almacena datos de prompts ni de generación de ningún modelo abierto sin el consentimiento explícito del usuario (opt-in); sí registra metadatos de solicitud, como el número de tokens. Con la caché de prompts activa, algunos datos de prompts pueden quedar varios minutos en memoria volátil.

La Response API es una excepción: almacena las conversaciones por defecto, y las conversaciones almacenadas se eliminan automáticamente a los 30 días. Los términos también limitan el compromiso de retención cero de datos a la inferencia; no cubre funciones que conservan datos por diseño, como el entrenamiento, el ajuste fino o las funciones de agentes.

Sobre el uso para entrenamiento, los dos documentos difieren en su redacción. Los Términos de Servicio dicen que Fireworks no usará tu Contenido para entrenar sus propios modelos ni para mejorar el Servicio. El Aviso de Privacidad dice que Fireworks no usa prompts, datos de entrenamiento ni entradas de la API para entrenar o mejorar sus modelos sin tu consentimiento explícito (opt-in). Entre las partes, eres titular de todos los derechos, títulos e intereses sobre tu Contenido, que los términos definen como tus entradas y salidas.

Los administradores Enterprise pueden activar una política de retención cero de datos para toda la cuenta, que rechaza todo lo que conservaría contenido del cliente, como trabajos de inferencia por lotes, de ajuste fino y RL, subidas de conjuntos de datos y modelos virtuales de FireRouter. Cuando FireRouter envía un turno a Claude o GPT, el modelo cerrado se ejecuta en tu propia cuenta de Anthropic u OpenAI.

Declaraciones de seguridad y cumplimiento

Son declaraciones del proveedor, no auditorías independientes:

  • Fireworks afirma haber obtenido las certificaciones ISO 27001, ISO 27701 e ISO 42001 y contar con SOC 2 Type II.
  • Fireworks se describe a sí misma como conforme con HIPAA.
  • Los datos se cifran en tránsito con TLS 1.2+ y en reposo con AES-256.
  • La residencia de datos, que restringe la inferencia a una región, es una función Enterprise; la opción indicada es US.

Preguntas frecuentes

Q1. ¿Hay un plan gratuito?

No aparece ningún plan gratuito en las páginas de precios consultadas. Más allá del crédito de $1 mencionado en la FAQ de facturación, el uso continuado requiere un método de pago y créditos prepagados.

Q2. ¿Puedo servir un modelo LoRA ajustado en el modo sin servidor?

No. Los modelos LoRA necesitan un despliegue bajo demanda facturado por tiempo de GPU; un despliegue puede alojar hasta 100 adaptadores LoRA, lo que reparte ese coste.

Q3. ¿Cuándo es una GPU dedicada más barata que el modo sin servidor?

Los precios de inferencia sin servidor cobran cada token, así que el tiempo inactivo no cuesta nada. Los despliegues bajo demanda se describen como más baratos con una utilización alta; se facturan por segundo de GPU en lugar de por token.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas