Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Ferramentas de desenvolvimento
  4. Fireworks
Prévia da interface do Fireworks
Logotipo do Fireworks

Fireworks

A Fireworks serve modelos abertos por meio de APIs sem servidor cobradas por token e de implantações dedicadas cobradas por segundo de GPU, e oferece ajuste fino gerenciado para que equipes de desenvolvimento treinem e hospedem suas próprias variantes de modelos.

Ferramentas de desenvolvimentoDesenvolvimento de IAPlataforma de Treinamento de IA#Processamento em lote#LLM#API compatível com OpenAI
Experimentar Grátis
Salvos
Visitas
Visualizações
Preço
Grátis
Publicado
5 de out. de 2026
Domínio
fireworks.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Fireworks

Experimentar Grátis
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Grátis
Publicado
5 de out. de 2026
Domínio
fireworks.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Experimentar Grátis

O que é Fireworks?

Fireworks (grafado Fireworks AI na documentação) é uma plataforma em nuvem para executar e treinar modelos de IA abertos. Os desenvolvedores chamam modelos hospedados via uma API de inferência LLM, alugam GPUs dedicadas para suas próprias implantações ou fazem ajuste fino de modelos abertos com seus próprios dados e servem o resultado na mesma infraestrutura.

A fornecedora apresenta a plataforma como "a infraestrutura fundamental para a inteligência especializada": um ciclo de aprendizado de propriedade do cliente que transforma os principais modelos de código aberto e os dados de um cliente em uma vantagem que se aprimora a cada iteração. A Fireworks não cria modelos fundacionais do zero: a cofundadora e CEO Lin Qiao descreveu o negócio como ajudar empresas a fazer ajuste fino de modelos existentes para suas necessidades específicas. Antes, Qiao liderou a equipe de desenvolvimento da plataforma de IA da Meta.

Quanto à escala, a imprensa de tecnologia independente noticiou em setembro de 2026 que a Fireworks anunciou em julho que sua receita anualizada havia chegado a 1 bilhão de dólares, cinco vezes a do ano anterior.

Principais funcionalidades

Inferência sem servidor

  • Acesso com pagamento por token: o modo sem servidor é cobrado por token, com opções Priority e Fast, e a API é descrita como compatível com OpenAI e Anthropic.
  • Modo Priority: o nível Priority tem prioridade sobre o tráfego Standard e está menos sujeito a descarte de carga (503 server overloaded).
  • Modo Fast: as variantes Fast visam mais de 100 tokens por segundo de vazão de geração, e a documentação afirma que uma variante Fast não é outro modelo e que a qualidade do modelo se mantém.
  • Catálogo de modelos: a documentação lista mais de 100 modelos compatíveis em texto, visão, áudio, imagem e embeddings.
  • Tarefas em lote: a Batch API processa grandes volumes de solicitações de forma assíncrona; cada tarefa é executada com um limite de tempo escolhido de 12, 24, 48 ou 72 horas, e as solicitações concluídas são salvas se a tarefa expirar.

Implantações dedicadas

  • Implantações sob demanda: implantações dedicadas multirregião que oferecem suporte a modelos pós-treinados.
  • Pesos personalizados: você pode enviar seus próprios modelos (para arquiteturas compatíveis) do Hugging Face ou de outros lugares.
  • Capacidade reservada: contas Enterprise podem comprar capacidade reservada, normalmente com compromissos de 1 ano, para obter capacidade garantida, cotas maiores e preços menores por hora de GPU.
  • Muitos adaptadores em uma implantação: a implantação Multi-LoRA carrega até 100 modelos LoRA como complementos em uma única implantação de modelo base.

Treinamento e ajuste fino

  • Três pontos de entrada: um caminho guiado (descrever a tarefa, revisar o plano e o custo, aprovar a execução), um caminho orientado por configuração em que a Fireworks cuida do agendamento e da passagem para produção, e um caminho por código em que você mesmo escreve a função de perda, o treinador e o loop de RL nas GPUs da Fireworks.
  • Escala: o ajuste fino supervisionado e por reforço é oferecido para modelos de até 1T+ parâmetros.
  • Serverless Training API: um pool de treinadores compartilhado e sempre ativo para treinamento LoRA em modelos de lançamento, sem provisionamento e sem custo ocioso.

Essas opções fazem do ajuste fino de modelos abertos um pipeline até o serviço, e não um produto separado: a página inicial afirma que cada checkpoint é implantado em produção em segundos.

Nexus e FireRouter

  • Nexus: leva modelos abertos e roteadores de modelos a ambientes de agentes de programação, agentes e gateways de LLM, com visibilidade de uso e limites de gasto por usuário para os modelos sem servidor compatíveis.
  • FireRouter: expõe um único ID de modelo e escolhe um modelo para cada novo turno do usuário, de modo que turnos fáceis podem ir para um modelo aberto da Fireworks e os mais difíceis para um modelo fechado como o Claude Opus.
  • Promessa de economia: a Fireworks divulga o Nexus como um substituto direto para APIs de modelos fechados capaz de cortar de 50 a 75% os gastos com programação por IA, um número da fornecedora.

Guia

Um primeiro projeto típico vai dos testes sem servidor ao controle de custos:

  1. Adicione um método de pagamento válido e um endereço de cobrança e, depois, compre créditos; o uso do modo sem servidor, das implantações sob demanda e do treinamento é descontado desse saldo.
  2. Use a biblioteca cliente Python da OpenAI para interagir com a Fireworks alterando a URL base e a chave de API.
  3. Para tráfego que precisa resistir a períodos de pico, defina o nível de serviço da solicitação como Priority; para recursos sensíveis à latência, troque o ID do modelo por uma variante Fast quando houver.
  4. Defina um limite de gasto mensal. Por padrão, a Fireworks envia um e-mail de aviso quando o uso atinge 80% desse limite, e é possível adicionar mais limiares de alerta na página de cobrança.
  5. Execute firectl quota list para verificar os limites de taxa, as cotas de GPU, os limites de gasto e o uso atuais da conta antes de planejar um lançamento.
  6. Quando precisar de um modelo LoRA treinado, de um modelo personalizado ou de uma versão fixa, crie uma implantação sob demanda em vez de depender do modo sem servidor.

Casos de uso e exemplos de clientes da Fireworks

As citações de clientes na página inicial da Fireworks são depoimentos selecionados pela fornecedora, não estudos de caso independentes, mas mostram as cargas de trabalho que a plataforma mira:

  • Produtos de programação com IA: o diretor de produto da Cursor diz que a Fireworks tem sido uma parceira-chave para treinar e servir em escala os modelos por trás do Cursor, incluindo cargas de RL de alta vazão e inferência em produção para o Composer.
  • Apps de consumo mais rápidos: um líder de produto do Quora relata respostas 3 vezes mais rápidas após migrar um modelo, o que, segundo a empresa, impulsionou as métricas de engajamento.
  • Modelos compostos ajustados: o CTO da Vercel diz que seu modelo v0 usa um modelo de aprendizado por reforço ajustado com a Fireworks e tem desempenho substancialmente melhor que o SOTA.
  • Agentes corporativos via Azure: a UiPath executa a Fireworks no Azure Foundry para alimentar o Autopilot e o Delegate com modelos abertos.
  • Trocar um modelo fechado por um aberto: a Gumloop migrou um agente interno usado em toda a empresa do Opus 4.8 para o GLM-5.2 e relata que ninguém notou diferença na experiência.

Para Quem É

  • Equipes de prototipagem: o uso sem servidor de modelos populares com preços por token é posicionado como ideal para testes de qualidade no olho e prototipagem.
  • Equipes com modelos próprios ou treinados: o modo sob demanda serve para modelos base personalizados, modelos LoRA treinados e cargas de trabalho com requisitos de latência próprios que precisam de controle sobre hardware e réplicas.
  • Empresas reguladas: a política de retenção zero de dados para toda a conta e a inferência travada por região são recursos Enterprise, não configurações de autoatendimento.

A plataforma se encaixa pior em dois casos. Equipes que precisam de uma versão de modelo fixa aproveitam menos o modo sem servidor, porque esses modelos são gerenciados pela equipe da Fireworks e podem ser atualizados ou descontinuados conforme novos modelos são lançados. Os termos proíbem o uso por menores sem a supervisão de um dos pais ou de um responsável legal.

Plataformas

  • API: endpoints compatíveis com OpenAI e Anthropic, de modo que o código SDK existente pode ser apontado para a Fireworks.
  • CLI: o firectl cria, implanta e gerencia recursos pelo terminal e pode ser instalado com o Homebrew.
  • Microsoft Foundry: a Fireworks AI é uma provedora de inferência de primeira parte dentro do Microsoft Foundry, com uso cobrado pelo Azure e contabilizado em um compromisso de consumo do Azure.
  • Limite do Foundry PayGo: o PayGo no Foundry é limitado à US Data Zone, e o limite de vazão para implantações PayGo é de 500.000 tokens por minuto.
  • Regiões: implantações dedicadas podem ter como destino as multirregiões GLOBAL, US, CANADA, EUROPE e APAC.
  • Sem servidor só nos EUA: um endpoint separado dos EUA serve inferência exclusivamente a partir dos EUA para poucos modelos; o modo sem servidor só na UE exige contato com vendas.

Preços

A cobrança é pré-paga: a recarga automática pode repor o saldo sozinha, e um limite de gasto mensal limita o uso. Clientes com contrato podem ter a opção de passar para cobrança pós-paga.

Preços de inferência sem servidor

Os preços estão em USD por 1 milhão de tokens, mostrados como entrada / entrada em cache / saída, coletados em 5 de outubro de 2026.

ModeloStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

Modelos de texto e visão não listados individualmente têm preço por tamanho: menos de 4B parâmetros custa $0.10, de 4B a 16B, $0.20 e mais de 16B, $0.90 por 1M de tokens, sem tarifa de cache separada. A inferência em lote é cobrada a 50% dos preços sem servidor, tanto na entrada quanto na saída. A partir de 1º de setembro de 2026, os modelos lançados exclusivos dos EUA custam 1,5 vez os preços sem servidor do modelo base.

Preços de GPU sob demanda

Implantações sob demanda são cobradas por segundo de GPU, sem cobranças extras pelos tempos de inicialização.

GPUPor minutoPor hora
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

Implantações restritas por região têm um acréscimo de 1,5 vez e passam por vendas.

Preços de ajuste fino

O ajuste fino gerenciado supervisionado e por preferência é cobrado por 1M de tokens de treinamento:

Tamanho do modelo baseLoRA SFTLoRA DPOSFT com todos os parâmetrosDPO com todos os parâmetros
Até 16B$0.50$1.00$1.00$2.00
De 16,1B a 80B$3.00$6.00$6.00$12.00
De 80B a 300B$6.00$12.00$12.00$24.00
Acima de 300B$10.00$20.00$20.00$40.00

Os tokens de treinamento são estimados como o número de tokens no conjunto de dados de treinamento multiplicado pelo número de épocas. As tarefas da Dedicated Training API são cobradas por hora de GPU às tarifas sob demanda.

O custo de servir modelos aparece de forma diferente conforme a página. A página de preços diz que você pode servir modelos ajustados pelo mesmo preço dos modelos base, enquanto o FAQ de cobrança diz que modelos LoRA treinados exigem uma implantação dedicada para serem servidos, cobrada por segundo de GPU.

Créditos, níveis e reembolsos

  • Crédito inicial: o FAQ de cobrança menciona um crédito de $1; esgotado esse crédito, uma conta sem método de pagamento fica suspensa até que um seja adicionado.
  • Níveis de gasto: adicionar ou gastar $50 em créditos leva a conta ao Tier 2, $500 ao Tier 3 e $5.000 ao Tier 4, e níveis mais altos elevam os tetos dos limites de taxa sem servidor.
  • Preços por volume: a Fireworks oferece descontos para compras em grande volume ou pré-pagas.
  • Reembolsos: os Termos de Serviço afirmam que as taxas pagas não são reembolsáveis, exceto conforme previsto nos termos.

Alternativas à Fireworks

  • Together AI: seus preços abrangem inferência sem servidor, vazão provisionada, inferência dedicada em GPUs de locatário único e ajuste fino LoRA ou completo, a mesma divisão de produtos que a Fireworks vende.
  • Baseten: combina Model APIs com implantações dedicadas em que você paga apenas pela computação que usa, ao minuto, e seu plano Basic custa $0 por mês, com pagamento conforme o uso.

A Fireworks cobra GPUs dedicadas por segundo, enquanto a Baseten mede por minuto, uma diferença que pesa mais em implantações curtas e com picos.

Limitações

Limites de taxa e capacidade

  • Contas novas são limitadas: uma conta sem método de pagamento ou sem créditos fica limitada a 10 solicitações por minuto, e o teto para toda a conta é de 6.000 solicitações por minuto mesmo com método de pagamento e créditos.
  • Limites sem servidor adaptativos: os limites crescem e diminuem conforme seu uso, e se seu tráfego aumentar rápido demais, você receberá erros 429.
  • Sem garantia de sucesso: no modo sem servidor você pode receber respostas 429 Too Many Requests ou 503 Service Overloaded, e ficar abaixo dos seus limites não impede o descarte de carga.
  • Tetos por tamanho de modelo: os tetos de tokens gerados vão de 1,08M de tokens por minuto para modelos com menos de 600B parâmetros a 216k para modelos com 1,6T parâmetros ou mais.
  • Cotas de GPU: a cota sob demanda padrão na multirregião GLOBAL é de 16 GPUs de cada uma das H100, H200, B200 e B300, enquanto GB300 e A100 começam em 0.
  • Cota de treinamento exige cartão: sem método de pagamento, a cota de GPU para treinamento é 0; com um cadastrado, é de 32 GPUs de cada tipo.

Limites operacionais

  • Remoção de modelos: a Fireworks dá pelo menos 2 semanas de aviso prévio antes de remover um modelo sem servidor, com aviso mais longo para modelos populares.
  • Implantações ociosas: por padrão, as implantações escalam para zero se ficarem sem uso por 1 hora, e implantações com réplicas mínimas definidas como 0 são excluídas após 7 dias sem tráfego.
  • Capacidade preemptível: implantações preemptíveis usam GPUs ociosas emprestadas e podem ser interrompidas no meio de uma solicitação sem aviso, por isso se destinam apenas a avaliação e trabalho em lote.
  • Parada rígida de gastos: quando o uso atinge 100% do limite de gasto mensal, todas as solicitações de API são pausadas na inferência sem servidor, nas implantações e no treinamento (contas Enterprise recebem apenas alertas).
  • Relatório de gastos com atraso: o gasto total pode ficar um dia ou mais atrás do tráfego em tempo real, especialmente em modelos recém-lançados.
  • Sem conformidade PCI: os termos afirmam que a Fireworks não está em conformidade com o PCI e não tem obrigação de se tornar conforme.

Retenção de dados e uso para treinamento

Por padrão, a Fireworks não registra nem armazena dados de prompts ou de geração de nenhum modelo aberto sem o consentimento explícito do usuário (opt-in); mas registra metadados das solicitações, como a contagem de tokens. Com o cache de prompts ativo, alguns dados de prompts podem ficar na memória volátil por vários minutos.

A Response API é uma exceção: ela armazena conversas por padrão, e as conversas armazenadas são excluídas automaticamente após 30 dias. Os termos também limitam o compromisso de retenção zero de dados à inferência; ele não cobre recursos que guardam dados por design, como treinamento, ajuste fino ou recursos de agentes.

Sobre o uso para treinamento, os dois documentos têm redação diferente. Os Termos de Serviço dizem que a Fireworks não usará o seu Conteúdo para treinar os próprios modelos nem para melhorar o Serviço. O Aviso de Privacidade diz que a Fireworks não usa prompts, dados de treinamento ou entradas da API para treinar ou melhorar seus modelos sem o seu consentimento explícito (opt-in). Entre as partes, você detém todos os direitos, títulos e interesses sobre o seu Conteúdo, que os termos definem como suas entradas e saídas.

Administradores Enterprise podem ativar uma política de retenção zero de dados para toda a conta, que rejeita tudo o que persistiria conteúdo do cliente, incluindo tarefas de inferência em lote, de ajuste fino e de RL, uploads de conjuntos de dados e modelos virtuais do FireRouter. Quando o FireRouter envia um turno ao Claude ou ao GPT, o modelo fechado é executado na sua própria conta da Anthropic ou da OpenAI.

Declarações de segurança e conformidade

Estas são declarações da fornecedora, não auditorias independentes:

  • A Fireworks afirma ter obtido as certificações ISO 27001, ISO 27701 e ISO 42001 e possuir SOC 2 Type II.
  • A Fireworks se descreve como em conformidade com a HIPAA.
  • Os dados são criptografados em trânsito com TLS 1.2+ e em repouso com AES-256.
  • A residência de dados, que restringe a inferência a uma região, é um recurso Enterprise; a opção listada é US.

FAQ

Q1. Existe um plano gratuito?

Nenhum plano gratuito aparece nas páginas de preços verificadas. Além do crédito de $1 mencionado no FAQ de cobrança, o uso contínuo exige um método de pagamento e créditos pré-pagos.

Q2. Posso servir um modelo LoRA ajustado no modo sem servidor?

Não. Modelos LoRA precisam de uma implantação sob demanda cobrada por tempo de GPU; uma implantação pode hospedar até 100 adaptadores LoRA, o que dilui esse custo.

Q3. Quando uma GPU dedicada sai mais barata que o modo sem servidor?

Os preços de inferência sem servidor cobram cada token, então o tempo ocioso não custa nada. Implantações sob demanda são descritas como mais baratas com alta utilização; são cobradas por segundo de GPU em vez de por token.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos