Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Fireworks (écrit Fireworks AI dans sa documentation) est une plateforme cloud pour exécuter et entraîner des modèles d'IA ouverts. Les développeurs appellent des modèles hébergés via une API d'inférence LLM, louent des GPU dédiés pour leurs propres déploiements, ou font du fine-tuning de modèles ouverts sur leurs propres données et servent le résultat sur la même infrastructure.
L'éditeur présente la plateforme comme « l'infrastructure fondamentale de l'intelligence spécialisée » : une boucle d'apprentissage dont le client est propriétaire, qui transforme les meilleurs modèles open source et les données d'un client en un avantage qui s'affûte à chaque itération. Fireworks ne construit pas de modèles de fondation à partir de zéro : la cofondatrice et PDG Lin Qiao a décrit l'activité comme une aide aux entreprises pour affiner des modèles existants selon leurs besoins particuliers. Elle dirigeait auparavant l'équipe de développement de la plateforme d'IA chez Meta.
Côté taille, la presse technologique indépendante a rapporté en septembre 2026 que Fireworks avait annoncé en juillet un chiffre d'affaires annualisé de 1 milliard de dollars, cinq fois celui de l'année précédente.
Ces options font du fine-tuning de modèles ouverts un pipeline vers la mise en service, et non un produit séparé : la page d'accueil affirme que chaque checkpoint se déploie en production en quelques secondes.
Un premier projet type passe des tests sans serveur à la maîtrise des coûts :
firectl quota list pour vérifier les limites de débit, les quotas GPU, les limites de dépenses et l'usage actuels du compte avant de planifier un lancement.Les citations clients de la page d'accueil de Fireworks sont des témoignages sélectionnés par l'éditeur, pas des études de cas indépendantes, mais elles montrent les charges de travail que vise la plateforme :
La plateforme convient moins bien dans deux cas. Les équipes qui ont besoin d'une version de modèle figée tirent moins parti du sans serveur, car ces modèles sont gérés par l'équipe Fireworks et peuvent être mis à jour ou dépréciés à mesure que de nouveaux modèles sortent. L'usage par des mineurs est interdit par les conditions, sauf si un parent ou un tuteur légal le supervise.
La facturation est prépayée : la recharge automatique peut réapprovisionner le solde et une limite de dépenses mensuelle plafonne l'usage. Les clients sous contrat peuvent avoir la possibilité de passer à une facturation postpayée.
Les prix sont en USD par million de tokens, indiqués sous la forme entrée / entrée en cache / sortie, relevés le 5 octobre 2026.
| Modèle | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
Les modèles de texte et de vision non listés individuellement sont tarifés selon leur taille : moins de 4B paramètres coûte $0.10, de 4B à 16B $0.20 et plus de 16B $0.90 par 1M de tokens, sans tarif distinct pour le cache. L'inférence par lots est facturée à 50 % du tarif sans serveur, en entrée comme en sortie. À partir du 1er septembre 2026, les modèles lancés réservés aux États-Unis sont facturés 1,5 fois les prix sans serveur du modèle de base.
Les déploiements à la demande sont facturés à la seconde GPU, sans frais supplémentaires pour les temps de démarrage.
| GPU | Par minute | Par heure |
|---|---|---|
| H100 80 Go | $0.134 | $8.00 |
| H200 141 Go | $0.134 | $8.00 |
| B200 180 Go | $0.217 | $13.00 |
| B300 288 Go | $0.250 | $15.00 |
| GB300 288 Go | $0.334 | $20.00 |
Les déploiements restreints à une région sont facturés avec une majoration de 1,5 fois et passent par les ventes.
Le fine-tuning géré, supervisé et par préférences, est facturé par 1M de tokens d'entraînement :
| Taille du modèle de base | LoRA SFT | LoRA DPO | SFT tous paramètres | DPO tous paramètres |
|---|---|---|---|---|
| Jusqu'à 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| De 16,1B à 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| De 80B à 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| Plus de 300B | $10.00 | $20.00 | $20.00 | $40.00 |
Les tokens d'entraînement sont estimés en multipliant le nombre de tokens du jeu de données d'entraînement par le nombre d'époques. Les tâches de la Dedicated Training API sont facturées à l'heure GPU aux tarifs à la demande.
Le coût de mise en service se lit différemment selon la page. La page de tarifs indique que vous pouvez servir des modèles affinés au même prix que les modèles de base, tandis que la FAQ de facturation indique que les modèles LoRA entraînés nécessitent un déploiement dédié pour être servis, facturé à la seconde GPU.
Fireworks facture les GPU dédiés à la seconde, tandis que Baseten mesure à la minute, une différence qui compte surtout pour les déploiements courts et en rafales.
Par défaut, Fireworks n'enregistre ni ne stocke les données de prompt ou de génération pour aucun modèle ouvert, sans consentement explicite (opt-in) de l'utilisateur ; il enregistre toutefois des métadonnées de requête comme le nombre de tokens. Avec la mise en cache des prompts active, certaines données de prompt peuvent rester quelques minutes en mémoire volatile.
La Response API fait exception : elle stocke les conversations par défaut, et les conversations stockées sont automatiquement supprimées au bout de 30 jours. Les conditions limitent aussi l'engagement de conservation zéro des données à l'inférence ; il ne couvre pas les fonctions qui conservent des données par conception, comme l'entraînement, le fine-tuning ou les fonctions d'agent.
Sur l'entraînement, les deux documents sont formulés différemment. Les conditions d'utilisation indiquent que Fireworks n'utilisera pas votre Contenu pour entraîner ses propres modèles ni pour améliorer le Service. L'avis de confidentialité indique que Fireworks n'utilise pas les prompts, les données d'entraînement ni les entrées d'API pour entraîner ou améliorer ses modèles sans votre consentement explicite (opt-in). Entre les parties, vous détenez l'ensemble des droits, titres et intérêts sur votre Contenu, que les conditions définissent comme vos entrées et vos sorties.
Les administrateurs Entreprise peuvent activer une politique de conservation zéro des données à l'échelle du compte, qui rejette tout ce qui conserverait du contenu client, notamment les tâches d'inférence par lots, de fine-tuning et de RL, les importations de jeux de données et les modèles virtuels FireRouter. Lorsque FireRouter envoie un tour à Claude ou à GPT, le modèle fermé s'exécute sur votre propre compte Anthropic ou OpenAI.
Ce sont des déclarations de l'éditeur, non des audits indépendants :
Aucune formule gratuite n'apparaît sur les pages de tarifs consultées. Au-delà du crédit de $1 mentionné dans la FAQ de facturation, un usage continu exige un moyen de paiement et des crédits prépayés.
Non. Les modèles LoRA nécessitent un déploiement à la demande facturé au temps GPU ; un déploiement peut héberger jusqu'à 100 adaptateurs LoRA, ce qui répartit ce coût.
La tarification de l'inférence sans serveur facture chaque token, donc le temps d'inactivité ne coûte rien. Les déploiements à la demande sont décrits comme moins chers en cas de forte utilisation ; ils sont facturés à la seconde GPU plutôt qu'au token.