Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
Fireworks (grafado Fireworks AI na documentação) é uma plataforma em nuvem para executar e treinar modelos de IA abertos. Os desenvolvedores chamam modelos hospedados via uma API de inferência LLM, alugam GPUs dedicadas para suas próprias implantações ou fazem ajuste fino de modelos abertos com seus próprios dados e servem o resultado na mesma infraestrutura.
A fornecedora apresenta a plataforma como "a infraestrutura fundamental para a inteligência especializada": um ciclo de aprendizado de propriedade do cliente que transforma os principais modelos de código aberto e os dados de um cliente em uma vantagem que se aprimora a cada iteração. A Fireworks não cria modelos fundacionais do zero: a cofundadora e CEO Lin Qiao descreveu o negócio como ajudar empresas a fazer ajuste fino de modelos existentes para suas necessidades específicas. Antes, Qiao liderou a equipe de desenvolvimento da plataforma de IA da Meta.
Quanto à escala, a imprensa de tecnologia independente noticiou em setembro de 2026 que a Fireworks anunciou em julho que sua receita anualizada havia chegado a 1 bilhão de dólares, cinco vezes a do ano anterior.
Essas opções fazem do ajuste fino de modelos abertos um pipeline até o serviço, e não um produto separado: a página inicial afirma que cada checkpoint é implantado em produção em segundos.
Um primeiro projeto típico vai dos testes sem servidor ao controle de custos:
firectl quota list para verificar os limites de taxa, as cotas de GPU, os limites de gasto e o uso atuais da conta antes de planejar um lançamento.As citações de clientes na página inicial da Fireworks são depoimentos selecionados pela fornecedora, não estudos de caso independentes, mas mostram as cargas de trabalho que a plataforma mira:
A plataforma se encaixa pior em dois casos. Equipes que precisam de uma versão de modelo fixa aproveitam menos o modo sem servidor, porque esses modelos são gerenciados pela equipe da Fireworks e podem ser atualizados ou descontinuados conforme novos modelos são lançados. Os termos proíbem o uso por menores sem a supervisão de um dos pais ou de um responsável legal.
A cobrança é pré-paga: a recarga automática pode repor o saldo sozinha, e um limite de gasto mensal limita o uso. Clientes com contrato podem ter a opção de passar para cobrança pós-paga.
Os preços estão em USD por 1 milhão de tokens, mostrados como entrada / entrada em cache / saída, coletados em 5 de outubro de 2026.
| Modelo | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
Modelos de texto e visão não listados individualmente têm preço por tamanho: menos de 4B parâmetros custa $0.10, de 4B a 16B, $0.20 e mais de 16B, $0.90 por 1M de tokens, sem tarifa de cache separada. A inferência em lote é cobrada a 50% dos preços sem servidor, tanto na entrada quanto na saída. A partir de 1º de setembro de 2026, os modelos lançados exclusivos dos EUA custam 1,5 vez os preços sem servidor do modelo base.
Implantações sob demanda são cobradas por segundo de GPU, sem cobranças extras pelos tempos de inicialização.
| GPU | Por minuto | Por hora |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
Implantações restritas por região têm um acréscimo de 1,5 vez e passam por vendas.
O ajuste fino gerenciado supervisionado e por preferência é cobrado por 1M de tokens de treinamento:
| Tamanho do modelo base | LoRA SFT | LoRA DPO | SFT com todos os parâmetros | DPO com todos os parâmetros |
|---|---|---|---|---|
| Até 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| De 16,1B a 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| De 80B a 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| Acima de 300B | $10.00 | $20.00 | $20.00 | $40.00 |
Os tokens de treinamento são estimados como o número de tokens no conjunto de dados de treinamento multiplicado pelo número de épocas. As tarefas da Dedicated Training API são cobradas por hora de GPU às tarifas sob demanda.
O custo de servir modelos aparece de forma diferente conforme a página. A página de preços diz que você pode servir modelos ajustados pelo mesmo preço dos modelos base, enquanto o FAQ de cobrança diz que modelos LoRA treinados exigem uma implantação dedicada para serem servidos, cobrada por segundo de GPU.
A Fireworks cobra GPUs dedicadas por segundo, enquanto a Baseten mede por minuto, uma diferença que pesa mais em implantações curtas e com picos.
Por padrão, a Fireworks não registra nem armazena dados de prompts ou de geração de nenhum modelo aberto sem o consentimento explícito do usuário (opt-in); mas registra metadados das solicitações, como a contagem de tokens. Com o cache de prompts ativo, alguns dados de prompts podem ficar na memória volátil por vários minutos.
A Response API é uma exceção: ela armazena conversas por padrão, e as conversas armazenadas são excluídas automaticamente após 30 dias. Os termos também limitam o compromisso de retenção zero de dados à inferência; ele não cobre recursos que guardam dados por design, como treinamento, ajuste fino ou recursos de agentes.
Sobre o uso para treinamento, os dois documentos têm redação diferente. Os Termos de Serviço dizem que a Fireworks não usará o seu Conteúdo para treinar os próprios modelos nem para melhorar o Serviço. O Aviso de Privacidade diz que a Fireworks não usa prompts, dados de treinamento ou entradas da API para treinar ou melhorar seus modelos sem o seu consentimento explícito (opt-in). Entre as partes, você detém todos os direitos, títulos e interesses sobre o seu Conteúdo, que os termos definem como suas entradas e saídas.
Administradores Enterprise podem ativar uma política de retenção zero de dados para toda a conta, que rejeita tudo o que persistiria conteúdo do cliente, incluindo tarefas de inferência em lote, de ajuste fino e de RL, uploads de conjuntos de dados e modelos virtuais do FireRouter. Quando o FireRouter envia um turno ao Claude ou ao GPT, o modelo fechado é executado na sua própria conta da Anthropic ou da OpenAI.
Estas são declarações da fornecedora, não auditorias independentes:
Nenhum plano gratuito aparece nas páginas de preços verificadas. Além do crédito de $1 mencionado no FAQ de cobrança, o uso contínuo exige um método de pagamento e créditos pré-pagos.
Não. Modelos LoRA precisam de uma implantação sob demanda cobrada por tempo de GPU; uma implantação pode hospedar até 100 adaptadores LoRA, o que dilui esse custo.
Os preços de inferência sem servidor cobram cada token, então o tempo ocioso não custa nada. Implantações sob demanda são descritas como mais baratas com alta utilização; são cobradas por segundo de GPU em vez de por token.