
fal est une infrastructure d'inférence destinée aux développeurs qui doivent exécuter en production des modèles génératifs d'image, de vidéo, d'audio et de 3D. Elle propose une API unifiée couvrant plus de 1 000 modèles, le déploiement serverless de vos propres modèles facturé à la seconde d'exécution, et des instances GPU dédiées à l'heure.
Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
fal est une infrastructure d'inférence pour les médias génératifs. La distinction compte : fal n'entraîne ni ne possède les modèles qu'il sert, et ce n'est pas une application que l'on ouvre pour fabriquer une image. C'est la couche contre laquelle les développeurs construisent lorsque leur produit doit exécuter de la génération d'image, de vidéo, d'audio ou de 3D en production et qu'ils préfèrent ne pas exploiter une flotte de GPU pour cela. Le positionnement officiel est sans ambiguïté : une plateforme de médias génératifs pour développeurs, réunissant en un seul endroit les meilleurs modèles de génération d'image, de vidéo et d'audio.
L'entreprise derrière le produit a grandi à un rythme peu commun. TechCrunch a rapporté en décembre 2025 que fal avait levé 140 millions de dollars en série D, menée par Sequoia avec la participation de Kleiner Perkins et de Nvidia, sur une valorisation de 4,5 milliards, et situait le chiffre d'affaires à plus de 200 millions de dollars en octobre. Les fondateurs sont Burkay Gur, ancien responsable de l'apprentissage automatique chez Coinbase, et Gorkem Yurtseven, précédemment ingénieur chez Amazon. Parmi les clients cités figurent Adobe, Shopify, Canva et Quora. Deux réserves accompagnent ces chiffres : il s'agissait de la troisième levée de l'entreprise en 2025, la valorisation ayant triplé depuis environ 1,5 milliard en juillet, et les 140 millions combinent capitaux nouveaux et vente secondaire dans laquelle des investisseurs existants ont cédé des parts — ce n'est pas intégralement de l'argent frais entrant dans l'entreprise.
Ce que vous obtenez réellement, ce sont trois lignes de produits et non une API. Model APIs vous permet d'appeler les modèles déjà présents sur la plateforme. Serverless vous permet de déployer vos propres modèles sur le même moteur, facturés à la seconde d'exécution avec mise à l'échelle automatique. Compute vous donne des instances GPU dédiées avec accès SSH complet, facturées à un tarif horaire fixe, pour l'entraînement et le fine-tuning. Choisir correctement entre les trois représente l'essentiel du travail d'adoption de fal, et les sections suivantes précisent où chacune trouve sa place.
fal run démarre l'application sur un GPU cloud temporaire pour tester sur le matériel de production ; fal deploy la promeut en un point de terminaison authentifié et persistant, avec mise à l'échelle automatique et reprises intégrées, chaque déploiement créant une révision permettant un retour arrière immédiat.def run(self, prompt: str) est interprété comme un paramètre de requête, si bien que les appelants envoyant un corps JSON — c'est-à-dire les clients officiels et tous les exemples — reçoivent une réponse HTTP 422.fal run et fal deploy pilotent le cycle de développement et de déploiement depuis le terminal.La tarification suit la répartition des produits. Les Model APIs facturent à l'unité de sortie plutôt qu'au temps GPU, ce qui constitue la principale distinction tarifaire de la plateforme : les modèles vidéo sont facturés à l'unité de sortie — par seconde ou par vidéo selon le modèle — les exemples publiés incluant Wan 2.5 à 0,05 dollar la seconde, Kling 2.5 Turbo Pro à 0,07, Veo 3 à 0,4 et Ovi à 0,2 dollar la vidéo. Les modèles d'image facturent au nombre d'images ou au mégapixel, avec Seedream V4 à 0,03 dollar l'image, Flux Kontext Pro à 0,04, Nanobanana à 0,039 et Qwen à 0,02 dollar le mégapixel. Une comparaison tierce relève que ce mode est plus prévisible que la facturation à la seconde de GPU, où le coût varie avec la durée du traitement.
Compute facture les instances GPU à l'heure, avec des prix affichés de 8,50 dollars pour une B300 (288 Go), 6,25 pour une B200 (180 Go), 4,50 pour une H200 (141 Go), 4,50 pour une H100 (80 Go) et 2,99 pour une RTX PRO 6000 (96 Go), chacune assortie d'un tarif inférieur accessible via le service commercial — jusqu'à 1,89 dollar l'heure pour la H100. Serverless facture à la seconde d'exécution. Lisez les réserves officielles en même temps que les chiffres phares : les comparaisons de production par dollar supposent une vidéo moyenne estimée à cinq secondes en 720p et varient selon le modèle, la résolution et la complexité du prompt ; les prix d'image sont normalisés à 1 MP, les résolutions supérieures étant facturées proportionnellement ; et certains modèles relèvent d'une tarification GPU plutôt qu'à la sortie selon leur architecture. Les conditions entreprise se négocient directement.
Non. fal est une infrastructure d'inférence que les développeurs appellent depuis leurs propres applications. Elle exécute, via une API, des modèles de génération d'image, de vidéo, d'audio et de 3D conçus par d'autres. Si vous voulez créer une image directement sans écrire de code, fal est la couche sous de tels outils plutôt que l'outil lui-même.
Cela dépend de la ligne de produits. Les Model APIs facturent à l'unité de sortie — par seconde ou par vidéo pour les modèles vidéo, par image ou par mégapixel pour les modèles d'image. Serverless facture à la seconde d'exécution. Compute facture les instances GPU dédiées à un tarif horaire fixe.
Une comparaison tierce indique que les nouveaux comptes Model API commencent à 2 requêtes concurrentes, avec une hausse fondée sur les factures réglées des quatre semaines précédentes et jusqu'à 40 en libre-service, l'excédent étant mis en file. Prévoyez cela avant un lancement plutôt que pendant.
Oui, via Serverless. Vous écrivez une classe Python fal.App où setup() charge les poids et où les méthodes @fal.endpoint servent les requêtes, vous déclarez le matériel à côté du code, vous validez avec fal run, puis fal deploy publie un point de terminaison persistant avec mise à l'échelle, reprises et retours arrière par révision.
Des SDK Python et JavaScript, plus une API REST. Chaque modèle accepte les appels synchrones et la file asynchrone, et beaucoup gèrent aussi le streaming et les connexions WebSocket temps réel. Attention : les paramètres de délai diffèrent entre SDK — Python utilise client_timeout en secondes, JavaScript timeout en millisecondes.
Pour les clients entreprise, le site affirme clairement que vos données restent les vôtres et que fal n'entraîne jamais ses modèles sur les données de ses clients entreprise. L'offre entreprise annonce également la certification SOC2, le SSO et l'hébergement privé de modèles. Vérifiez les conditions applicables à votre formule.
Il y en a trois, aux responsables distincts. start_timeout est imposé côté serveur avant le début du traitement et renvoie un 504 en stoppant les reprises. client_timeout ou timeout n'agit que côté client et n'interrompt pas l'exécution serveur. request_timeout est fixé par le développeur de l'application comme plafond par tentative, tuant le runner et déclenchant une reprise.
Oui. fal relance par défaut les requêtes en file échouées pour erreurs serveur, dépassements de délai ou limitation de débit. Envoyez l'en-tête X-Fal-No-Retry à la soumission pour désactiver ce comportement sur une requête donnée, ce qui compte pour les générations coûteuses ou non idempotentes.
Une comparaison indépendante la résume ainsi : fal l'emporte sur la vitesse et l'économie de la famille FLUX, Replicate sur la variété de modèles hors image et vidéo et sur les modèles personnalisés de la communauté. La facturation à la sortie rend en outre le coût par appel connu d'avance chez fal, là où la facturation à la seconde de GPU varie avec la durée de traitement.
Il publie une page de statut publique qui, au moment de la rédaction, affichait tous les systèmes opérationnels avec 100 % de disponibilité sur la fenêtre de 90 jours et aucun avis durant les sept jours précédents, et il revendique des clients entreprise dont Adobe, Shopify et Canva. C'est un instantané ponctuel et non une garantie de long terme : évaluez au regard de vos propres exigences de disponibilité et consultez vous-même l'historique de statut.
Comment utiliser fal
fal runavant de déployer. La commande démarre votre application sur un worker temporaire en exécutant setup() et vos endpoints exactement comme le ferait la production, si bien que les erreurs surgissent là plutôt que sous forme de boucle de plantage en production.fal deploy, puis ajustez min_concurrency, max_concurrency et concurrency_buffer au regard du trafic observé. Surveillez l'analyse par requête du tableau de bord, et exportez vers Prometheus ou un drain de logs HTTPS si vous disposez déjà d'une pile d'observabilité.