Toolso.AI
Toolso.AI
OutilsCatégoriesTendancesNouveautésTarifsBlog
Toolso.AI
Toolso.AI

💌Abonnez-vous à AI Tools Weekly

Sélection hebdomadaire des derniers et meilleurs outils IA et tendances, livrés dans votre boîte mail S'abonner

Toolso.AI
Toolso.AI

Découvrez les meilleurs outils IA pour booster votre productivité

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Catégories populaires

  • Écriture IA
  • Image IA
  • Vidéo IA
  • Codage IA
  • Plus de catégories

Explorer

  • Derniers outils
  • Outils populaires
  • Plus d'outils
  • Soumettre un outil
  • Tarifs

À propos

  • À propos de nous
  • Contact
  • Blog
  • Journal des modifications

Légal

  • Politique des cookies
  • Politique de confidentialité
  • Conditions d'utilisation
  • Politique de remboursement
© 2026 Toolso.AI Tous droits réservés
Offre limitéeOffre limitéeMise en avantExamen sous 24 h · Sans backlink · 30 jours en vedette$29.90puis $59.90Passe à $59.90 après le 31 oct.Fin dans--:--:--Soumettre
  1. Accueil
  2. Tous les outils
  3. Outils de développement
  4. Fireworks
Aperçu de l’interface de Fireworks
Logo de Fireworks

Fireworks

Fireworks sert des modèles ouverts via des API sans serveur facturées au token et des déploiements dédiés facturés à la seconde GPU, et ajoute un fine-tuning géré pour que les équipes de développement entraînent et hébergent leurs propres variantes de modèles.

Outils de développementDéveloppement IAPlateforme d'Entraînement IA#Traitement par lots#LLM#API compatible avec OpenAI
Essayer gratuitement
Favoris
Visites
Vues
Tarif
Gratuit
Publié le
5 oct. 2026
Domaine
fireworks.ai
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Informations produit Fireworks

Essayer gratuitement
Informations sur l'outil
Favoris
Visites
Vues
Tarif
Gratuit
Publié le
5 oct. 2026
Domaine
fireworks.ai
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Outils en vedette

Outils associés

Essayer gratuitement

Fireworks, qu’est-ce que c’est ?

Fireworks (écrit Fireworks AI dans sa documentation) est une plateforme cloud pour exécuter et entraîner des modèles d'IA ouverts. Les développeurs appellent des modèles hébergés via une API d'inférence LLM, louent des GPU dédiés pour leurs propres déploiements, ou font du fine-tuning de modèles ouverts sur leurs propres données et servent le résultat sur la même infrastructure.

L'éditeur présente la plateforme comme « l'infrastructure fondamentale de l'intelligence spécialisée » : une boucle d'apprentissage dont le client est propriétaire, qui transforme les meilleurs modèles open source et les données d'un client en un avantage qui s'affûte à chaque itération. Fireworks ne construit pas de modèles de fondation à partir de zéro : la cofondatrice et PDG Lin Qiao a décrit l'activité comme une aide aux entreprises pour affiner des modèles existants selon leurs besoins particuliers. Elle dirigeait auparavant l'équipe de développement de la plateforme d'IA chez Meta.

Côté taille, la presse technologique indépendante a rapporté en septembre 2026 que Fireworks avait annoncé en juillet un chiffre d'affaires annualisé de 1 milliard de dollars, cinq fois celui de l'année précédente.

Fonctionnalités principales

Inférence sans serveur

  • Accès facturé au token : l'offre sans serveur est facturée au token, avec des options Priority et Fast, et l'API est décrite comme compatible avec OpenAI et Anthropic.
  • Mode Priority : le niveau Priority passe avant le trafic Standard et risque moins le délestage de charge (503 server overloaded).
  • Mode Fast : les variantes Fast visent un débit de génération de plus de 100 tokens par seconde, et la documentation précise qu'une variante Fast n'est pas un autre modèle et que la qualité du modèle reste identique.
  • Catalogue de modèles : la documentation répertorie plus de 100 modèles pris en charge : texte, vision, audio, image et embeddings.
  • Tâches par lots : la Batch API traite en asynchrone de gros volumes de requêtes ; chaque tâche s'exécute dans une limite de temps choisie de 12, 24, 48 ou 72 heures, et les requêtes terminées sont conservées si la tâche expire.

Déploiements dédiés

  • Déploiements à la demande : des déploiements dédiés multirégions qui prennent en charge les modèles post-entraînés.
  • Poids personnalisés : vous pouvez importer vos propres modèles (pour les architectures prises en charge) depuis Hugging Face ou ailleurs.
  • Capacité réservée : les comptes Entreprise peuvent acheter de la capacité réservée, généralement avec un engagement d'un an, pour une capacité garantie, des quotas plus élevés et des prix par heure GPU plus bas.
  • Plusieurs adaptateurs sur un déploiement : le déploiement Multi-LoRA charge jusqu'à 100 modèles LoRA comme modules complémentaires sur un seul déploiement de modèle de base.

Entraînement et fine-tuning

  • Trois points d'entrée : un parcours guidé (décrire la tâche, examiner le plan et le coût, approuver l'exécution), un parcours piloté par la configuration où Fireworks gère la planification et le passage en production, et un parcours par le code où vous écrivez vous-même la fonction de perte, l'entraîneur et la boucle RL sur les GPU de Fireworks.
  • Échelle : le fine-tuning supervisé et par renforcement est proposé pour des modèles allant jusqu'à 1T+ paramètres.
  • Serverless Training API : un pool d'entraîneurs partagé et toujours actif pour l'entraînement LoRA sur les modèles de lancement, sans provisionnement ni coût d'inactivité.

Ces options font du fine-tuning de modèles ouverts un pipeline vers la mise en service, et non un produit séparé : la page d'accueil affirme que chaque checkpoint se déploie en production en quelques secondes.

Nexus et FireRouter

  • Nexus : apporte des modèles ouverts et des routeurs de modèles aux environnements d'agents de code, aux agents et aux passerelles LLM, avec visibilité sur l'usage et plafonds de dépenses par utilisateur pour les modèles sans serveur pris en charge.
  • FireRouter : expose un seul ID de modèle et choisit un modèle à chaque nouveau tour de l'utilisateur, de sorte que les tours faciles peuvent aller à un modèle ouvert de Fireworks et les plus difficiles à un modèle fermé comme Claude Opus.
  • Promesse d'économies : Fireworks présente Nexus comme un remplacement direct des API de modèles fermés, capable de réduire de 50 à 75 % les dépenses de codage IA, un chiffre de l'éditeur.

Guide

Un premier projet type passe des tests sans serveur à la maîtrise des coûts :

  1. Ajoutez un moyen de paiement valide et une adresse de facturation, puis achetez des crédits ; l'usage en sans serveur, en déploiements à la demande et en entraînement est déduit de ce solde.
  2. Utilisez la bibliothèque cliente Python d'OpenAI pour interagir avec Fireworks en changeant l'URL de base et la clé API.
  3. Pour le trafic qui doit tenir pendant les pics, réglez le niveau de service de la requête sur Priority ; pour les fonctions sensibles à la latence, basculez l'identifiant du modèle vers une variante Fast si elle existe.
  4. Définissez une limite de dépenses mensuelle. Par défaut, Fireworks envoie un e-mail d'avertissement lorsque l'usage atteint 80 % de cette limite, et d'autres seuils d'alerte peuvent être ajoutés sur la page de facturation.
  5. Exécutez firectl quota list pour vérifier les limites de débit, les quotas GPU, les limites de dépenses et l'usage actuels du compte avant de planifier un lancement.
  6. Lorsque vous avez besoin d'un modèle LoRA entraîné, d'un modèle personnalisé ou d'une version figée, créez un déploiement à la demande plutôt que le sans serveur.

Cas d'usage et exemples clients de Fireworks

Les citations clients de la page d'accueil de Fireworks sont des témoignages sélectionnés par l'éditeur, pas des études de cas indépendantes, mais elles montrent les charges de travail que vise la plateforme :

  • Produits de codage IA : le directeur produit de Cursor affirme que Fireworks a été un partenaire clé pour entraîner et servir à grande échelle les modèles derrière Cursor, y compris des charges RL à haut débit et l'inférence en production pour Composer.
  • Applications grand public plus rapides : un responsable produit de Quora fait état d'un temps de réponse 3 fois plus rapide après la migration d'un modèle, ce qui, selon l'entreprise, a amélioré les indicateurs d'engagement.
  • Modèles composites affinés : le CTO de Vercel indique que son modèle v0 utilise un modèle d'apprentissage par renforcement affiné avec Fireworks et qu'il fait nettement mieux que le SOTA.
  • Agents d'entreprise via Azure : UiPath exécute Fireworks sur Azure Foundry pour faire fonctionner Autopilot et Delegate avec des modèles ouverts.
  • Remplacer un modèle fermé par un modèle ouvert : Gumloop a fait passer un agent interne utilisé dans toute l'entreprise d'Opus 4.8 à GLM-5.2 et indique que personne n'a remarqué de différence dans l'expérience.

Pour qui

  • Équipes de prototypage : l'usage sans serveur de modèles populaires avec une tarification au token est présenté comme idéal pour les tests de qualité au ressenti et le prototypage.
  • Équipes exécutant leurs propres modèles ou des modèles entraînés : le mode à la demande convient aux modèles de base personnalisés, aux modèles LoRA entraînés et aux charges de travail ayant des exigences de latence spécifiques exigeant un contrôle du matériel et des réplicas.
  • Entreprises réglementées : la politique de conservation zéro des données à l'échelle du compte et l'inférence verrouillée par région sont des fonctions Entreprise plutôt que des réglages en libre-service.

La plateforme convient moins bien dans deux cas. Les équipes qui ont besoin d'une version de modèle figée tirent moins parti du sans serveur, car ces modèles sont gérés par l'équipe Fireworks et peuvent être mis à jour ou dépréciés à mesure que de nouveaux modèles sortent. L'usage par des mineurs est interdit par les conditions, sauf si un parent ou un tuteur légal le supervise.

Plateformes

  • API : des points de terminaison compatibles OpenAI et Anthropic, de sorte que le code SDK existant peut être redirigé vers Fireworks.
  • CLI : firectl crée, déploie et gère des ressources depuis le terminal et peut être installé avec Homebrew.
  • Microsoft Foundry : Fireworks AI est un fournisseur d'inférence interne (first-party) dans Microsoft Foundry ; l'usage est facturé via Azure et compte dans un engagement de consommation Azure.
  • Limite de Foundry PayGo : PayGo sur Foundry est limité à la US Data Zone, et la limite de débit des déploiements PayGo est de 500 000 tokens par minute.
  • Régions : les déploiements dédiés peuvent cibler les multirégions GLOBAL, US, CANADA, EUROPE et APAC.
  • Sans serveur limité aux États-Unis : un point de terminaison américain distinct sert l'inférence exclusivement depuis les États-Unis pour quelques modèles ; le sans serveur limité à l'UE nécessite de contacter les ventes.

Tarification

La facturation est prépayée : la recharge automatique peut réapprovisionner le solde et une limite de dépenses mensuelle plafonne l'usage. Les clients sous contrat peuvent avoir la possibilité de passer à une facturation postpayée.

Tarifs de l'inférence sans serveur

Les prix sont en USD par million de tokens, indiqués sous la forme entrée / entrée en cache / sortie, relevés le 5 octobre 2026.

ModèleStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

Les modèles de texte et de vision non listés individuellement sont tarifés selon leur taille : moins de 4B paramètres coûte $0.10, de 4B à 16B $0.20 et plus de 16B $0.90 par 1M de tokens, sans tarif distinct pour le cache. L'inférence par lots est facturée à 50 % du tarif sans serveur, en entrée comme en sortie. À partir du 1er septembre 2026, les modèles lancés réservés aux États-Unis sont facturés 1,5 fois les prix sans serveur du modèle de base.

Tarifs des GPU à la demande

Les déploiements à la demande sont facturés à la seconde GPU, sans frais supplémentaires pour les temps de démarrage.

GPUPar minutePar heure
H100 80 Go$0.134$8.00
H200 141 Go$0.134$8.00
B200 180 Go$0.217$13.00
B300 288 Go$0.250$15.00
GB300 288 Go$0.334$20.00

Les déploiements restreints à une région sont facturés avec une majoration de 1,5 fois et passent par les ventes.

Tarifs du fine-tuning

Le fine-tuning géré, supervisé et par préférences, est facturé par 1M de tokens d'entraînement :

Taille du modèle de baseLoRA SFTLoRA DPOSFT tous paramètresDPO tous paramètres
Jusqu'à 16B$0.50$1.00$1.00$2.00
De 16,1B à 80B$3.00$6.00$6.00$12.00
De 80B à 300B$6.00$12.00$12.00$24.00
Plus de 300B$10.00$20.00$20.00$40.00

Les tokens d'entraînement sont estimés en multipliant le nombre de tokens du jeu de données d'entraînement par le nombre d'époques. Les tâches de la Dedicated Training API sont facturées à l'heure GPU aux tarifs à la demande.

Le coût de mise en service se lit différemment selon la page. La page de tarifs indique que vous pouvez servir des modèles affinés au même prix que les modèles de base, tandis que la FAQ de facturation indique que les modèles LoRA entraînés nécessitent un déploiement dédié pour être servis, facturé à la seconde GPU.

Crédits, paliers et remboursements

  • Crédit de départ : la FAQ de facturation mentionne un crédit de $1 ; une fois épuisé, un compte sans moyen de paiement est suspendu jusqu'à l'ajout d'un moyen de paiement.
  • Paliers de dépenses : ajouter ou dépenser $50 de crédits fait passer un compte au Tier 2, $500 au Tier 3 et $5 000 au Tier 4, et les paliers supérieurs relèvent les plafonds des limites de débit en sans serveur.
  • Tarifs de volume : Fireworks propose des remises pour les achats en gros volume ou prépayés.
  • Remboursements : les conditions d'utilisation stipulent que les frais payés ne sont pas remboursables, sauf cas prévus par les conditions.

Alternatives à Fireworks

  • Together AI : sa tarification couvre l'inférence sans serveur, le débit provisionné, l'inférence dédiée sur des GPU mono-locataires et le fine-tuning LoRA ou complet, soit le même découpage de produits que Fireworks.
  • Baseten : il combine des Model APIs avec des déploiements dédiés où vous ne payez que le calcul utilisé, à la minute près, et son forfait Basic coûte $0 par mois, avec paiement à l'usage.

Fireworks facture les GPU dédiés à la seconde, tandis que Baseten mesure à la minute, une différence qui compte surtout pour les déploiements courts et en rafales.

Limitations

Limites de débit et capacité

  • Nouveaux comptes bridés : un compte sans moyen de paiement ou sans crédits est limité à 10 requêtes par minute, et le plafond à l'échelle du compte est de 6 000 requêtes par minute, même avec un moyen de paiement et des crédits.
  • Limites sans serveur adaptatives : les limites augmentent et diminuent avec votre usage, et si votre trafic monte trop vite, vous recevrez des erreurs 429.
  • Aucune garantie de succès : en sans serveur, vous pouvez recevoir des réponses 429 Too Many Requests ou 503 Service Overloaded, et rester sous vos limites n'empêche pas le délestage de charge.
  • Plafonds selon la taille du modèle : les plafonds de tokens générés vont de 1,08M de tokens par minute pour les modèles de moins de 600B paramètres à 216k pour les modèles de 1,6T paramètres ou plus.
  • Quotas GPU : le quota à la demande par défaut dans la multirégion GLOBAL est de 16 GPU pour chacun des H100, H200, B200 et B300, tandis que GB300 et A100 partent de 0.
  • Le quota d'entraînement exige une carte : sans moyen de paiement, le quota GPU d'entraînement est de 0 ; avec un moyen de paiement enregistré, 32 GPU de chaque type.

Limites opérationnelles

  • Retraits de modèles : Fireworks donne un préavis d'au moins 2 semaines avant de retirer un modèle sans serveur, avec un préavis plus long pour les modèles populaires.
  • Déploiements inactifs : par défaut, les déploiements sont réduits à zéro s'ils restent inutilisés pendant 1 heure, et ceux dont le nombre minimal de réplicas est fixé à 0 sont supprimés après 7 jours sans trafic.
  • Capacité préemptible : les déploiements préemptibles empruntent des GPU inactifs et peuvent être préemptés en cours de requête sans avertissement ; ils sont donc destinés uniquement à l'évaluation et aux traitements par lots.
  • Arrêt net des dépenses : lorsque l'usage atteint 100 % de la limite de dépenses mensuelle, toutes les requêtes API sont mises en pause pour l'inférence sans serveur, les déploiements et l'entraînement (les comptes Entreprise ne reçoivent que des alertes).
  • Suivi des dépenses en différé : le total des dépenses peut avoir un jour de retard ou plus sur le trafic réel, surtout pour les modèles récemment lancés.
  • Pas de conformité PCI : les conditions indiquent que Fireworks n'est pas conforme à la norme PCI et n'a aucune obligation de le devenir.

Conservation des données et usage pour l'entraînement

Par défaut, Fireworks n'enregistre ni ne stocke les données de prompt ou de génération pour aucun modèle ouvert, sans consentement explicite (opt-in) de l'utilisateur ; il enregistre toutefois des métadonnées de requête comme le nombre de tokens. Avec la mise en cache des prompts active, certaines données de prompt peuvent rester quelques minutes en mémoire volatile.

La Response API fait exception : elle stocke les conversations par défaut, et les conversations stockées sont automatiquement supprimées au bout de 30 jours. Les conditions limitent aussi l'engagement de conservation zéro des données à l'inférence ; il ne couvre pas les fonctions qui conservent des données par conception, comme l'entraînement, le fine-tuning ou les fonctions d'agent.

Sur l'entraînement, les deux documents sont formulés différemment. Les conditions d'utilisation indiquent que Fireworks n'utilisera pas votre Contenu pour entraîner ses propres modèles ni pour améliorer le Service. L'avis de confidentialité indique que Fireworks n'utilise pas les prompts, les données d'entraînement ni les entrées d'API pour entraîner ou améliorer ses modèles sans votre consentement explicite (opt-in). Entre les parties, vous détenez l'ensemble des droits, titres et intérêts sur votre Contenu, que les conditions définissent comme vos entrées et vos sorties.

Les administrateurs Entreprise peuvent activer une politique de conservation zéro des données à l'échelle du compte, qui rejette tout ce qui conserverait du contenu client, notamment les tâches d'inférence par lots, de fine-tuning et de RL, les importations de jeux de données et les modèles virtuels FireRouter. Lorsque FireRouter envoie un tour à Claude ou à GPT, le modèle fermé s'exécute sur votre propre compte Anthropic ou OpenAI.

Déclarations de sécurité et de conformité

Ce sont des déclarations de l'éditeur, non des audits indépendants :

  • Fireworks affirme avoir obtenu les certifications ISO 27001, ISO 27701 et ISO 42001 et détenir le SOC 2 Type II.
  • Fireworks se décrit comme conforme à HIPAA.
  • Les données sont chiffrées en transit avec TLS 1.2+ et au repos avec AES-256.
  • La résidence des données, qui restreint l'inférence à une seule région, est une fonction Entreprise ; US est l'option indiquée.

FAQ

Q1. Existe-t-il une offre gratuite ?

Aucune formule gratuite n'apparaît sur les pages de tarifs consultées. Au-delà du crédit de $1 mentionné dans la FAQ de facturation, un usage continu exige un moyen de paiement et des crédits prépayés.

Q2. Puis-je servir un modèle LoRA affiné en sans serveur ?

Non. Les modèles LoRA nécessitent un déploiement à la demande facturé au temps GPU ; un déploiement peut héberger jusqu'à 100 adaptateurs LoRA, ce qui répartit ce coût.

Q3. Quand un GPU dédié revient-il moins cher que le sans serveur ?

La tarification de l'inférence sans serveur facture chaque token, donc le temps d'inactivité ne coûte rien. Les déploiements à la demande sont décrits comme moins chers en cas de forte utilisation ; ils sont facturés à la seconde GPU plutôt qu'au token.

Connaissez-vous un outil similaire ?
Si vous connaissez d'autres excellents outils IA, n'hésitez pas à nous les soumettre