Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Modal est un cloud serverless qui exécute du code Python sur des GPU et des CPU facturés à la seconde ; l’entreprise le décrit comme une infrastructure cloud pour les équipes qui développent, entraînent et servent des applications d’IA à grande échelle.
Modal place votre code dans un conteneur, l’exécute dans le cloud et ajoute des conteneurs automatiquement quand le trafic croît, en mutualisant la capacité de grands clouds pour choisir où tourne chaque tâche. Les images de conteneur et les demandes de GPU s’écrivent en code Python : une application Modal n’a aucun fichier de déploiement YAML.
Modal Labs exploite modal.com. Selon la presse tech indépendante, Modal a été fondée en 2021 par Erik Bernhardsson, CEO, et Akshat Bubna, CTO ; l’entreprise affirme avoir levé plus de 466 millions de dollars auprès d’investisseurs comme General Catalyst et Redpoint Ventures. Le 28 septembre 2026, un article de presse tech citant une source anonyme indiquait que Modal Labs, qu’il présentait comme un fournisseur d’infrastructure d’inférence IA, était sur le point de boucler un tour de table de 750 millions de dollars mené par Accel, pour une valorisation de 15,75 milliards de dollars ; Modal Labs n’a pas souhaité commenter.
Modal couvre l’inférence, avec ce qu’il appelle des démarrages à froid de moins d’une seconde, les traitements par lots en parallèle, l’entraînement et le fine-tuning, des Sandboxes isolées pour le code généré par IA et des Notebooks collaboratifs avec GPU.
L’argument gpu accepte T4, L4, A10, L40S, A100 (générique, 40 Go ou 80 Go), RTX PRO 6000, H100 (ou H100!), H200, B200 (ou B200+) et B300. B300, B200, H200, H100, A100, L4, T4 et L40S autorisent jusqu’à 8 GPU par conteneur (jusqu’à 2 304 Go de mémoire GPU) ; l’A10 s’arrête à 4 GPU et 96 Go.
Deux mises à niveau automatiques comptent pour les benchmarks : une demande de H100 peut tourner sur un H200, et une d’A100 sur un A100 de 80 Go, au prix d’origine, tandis que demander H100! exclut la mise à niveau vers le H200. Une fonction peut aussi lister des types de GPU par ordre de préférence, et Modal se replie en descendant la liste.
Les Modal Sandboxes sont des conteneurs sécurisés, définis à l’exécution, pour lancer du code non fiable d’utilisateurs ou d’agents. Modal affirme qu’on peut en créer des millions par programmation en moins d’une minute, avec instantané et restauration pour un démarrage rapide.
Notebooks Jupyter hébergés : tarification serverless, arrêt automatique en cas d’inactivité, GPU de Modal et édition collaborative en temps réel.
Modal a annoncé le 1er octobre 2026 que les Modal Clusters sont disponibles pour tous via le décorateur @modal.clustered : groupes de GPU multi-nœuds avec RDMA, ordonnancés en bloc depuis un pool de capacité partagé et facturés à la seconde.
pip install modal, puis modal setup pour vous authentifier (ou python -m modal setup si la première forme échoue).@app.function(...), en indiquant l’image de conteneur et le GPU, puis lancez le fichier avec modal run path/to/file.py.Modal indique que les conteneurs démarrent en une seconde environ, mais un conteneur n’est chaud qu’une fois les imports et autres initialisations de portée globale exécutés : être prêt peut donc prendre de quelques secondes à quelques minutes. Trois réglages arbitrent entre latence et dépense à vide :
scaledown_window : garde les conteneurs inactifs en vie de deux secondes à vingt minutes ; une fenêtre plus longue réduit les démarrages à froid, mais les ressources inactives sont facturées.min_containers et buffer_containers : le premier maintient un plancher de conteneurs chauds pour que la fonction ne redescende jamais à zéro, le second ajoute des conteneurs de réserve tant qu’elle est active.us offre un pool de ressources plus vaste qu’une région étroite, améliorant le temps de démarrage à froid et la disponibilité.Modal peut déployer toute application Python conteneurisable et cible les charges gourmandes en calcul à mise à l’échelle horizontale : inférence de ML à grande échelle, entraînement et fine-tuning de modèles, pipelines de données, calcul scientifique et files de tâches.
Ces trois citations de clients sont des témoignages de la page d’accueil, pas des études de cas indépendantes.
Les signaux d’avis indépendants trouvés cette fois sont limités : sur une plateforme d’avis liée à une communauté de lancements, Modal affichait 5,0 sur la base de 61 avis, relevés le 5 octobre 2026, et son résumé IA indique que les auteurs sont surtout des fondateurs et que les avis ne contiennent presque aucune critique.
routing_region accepte aussi us-west (Oregon), eu-west (Dublin) et ap-south (Mumbai).Modal combine un forfait mensuel avec une tarification GPU à la seconde et un CPU et une mémoire mesurés à l’usage ; les prix catalogue ci-dessous ont été relevés le 5 octobre 2026.
| Forfait | Frais de plateforme | Calcul inclus | Sièges | Conteneurs / concurrence GPU | Rétention des journaux | Trafic sortant inclus |
|---|---|---|---|---|---|---|
| Starter | $0 + calcul / mois | $30 / mois | 3 | 100 / 10 | 1 jour | 1 Tio / mois |
| Team | $250 + calcul / mois | $100 / mois | Illimité | 5 000 / 50 | 30 jours | 10 Tio / mois |
| Enterprise | Sur mesure | Sur mesure | Illimité | Concurrence GPU plus élevée | Sur mesure | 100 Tio / mois |
Enterprise ajoute des remises sur volume, des services d’ingénierie ML intégrés, un support Slack privé, des journaux d’audit, le SSO Okta et HIPAA. Starter autorise 200 applications déployées et 5 tâches cron déployées, et exclut les domaines personnalisés, les retours arrière de déploiement, les budgets par environnement, le proxy à IP statique et le RBAC ; Team conserve 3 versions pour le retour arrière.
| Ressource | Prix par seconde |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 Go | $0.000694 |
| Nvidia A100, 40 Go | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, par cœur physique (2 vCPU) | $0.0000131 |
| Mémoire, par Gio | $0.00000222 |
Le CPU compte au minimum 0,125 cœur par conteneur. Sandboxes et Notebooks appliquent des tarifs CPU et mémoire plus élevés, $0.00003942 par cœur et $0.00000667 par Gio et par seconde, les GPU restant au prix standard. Les Volumes coûtent $0.09 par Gio et par mois au-delà de 1 Tio gratuit, et le trafic sortant au-delà de l’allocation du forfait coûte $0.04 par Gio. L’exemple chiffré de Modal situe Stable Diffusion sur un A10G à environ $0.491 pour 1 000 images.
nonpreemptible=True triple les prix catalogue du CPU et de la mémoire et est indisponible pour les fonctions GPU.Chaque plateforme GPU serverless ci-dessous se distingue de Modal surtout par la facturation du temps d’inactivité et l’étendue du choix de GPU.
| Option | Choix de GPU | Mise à zéro | Règle d’inactivité et de facturation |
|---|---|---|---|
| Google Cloud Run (GPU) | RTX PRO 6000 Blackwell (96 Go) ou L4 (24 Go) | Oui | Facturation à l’instance ; les instances minimales sont facturées plein tarif même inactives |
| RunPod Serverless | Non abordé ici | Oui pour les workers flex ; les workers actifs tournent 24 h/24, 7 j/7 | Facturé à la seconde du démarrage du worker à son arrêt complet, arrondi au supérieur |
| Replicate | Non abordé ici | Oui pour les modèles publics | La plupart des modèles privés tournent sur du matériel dédié et sont facturés pour le temps de configuration, d’inactivité et d’activité |
La distinction flex/actif de RunPod correspond au choix de min_containers chez Modal. Replicate facture la plupart des modèles publics au temps d’exécution et certains à l’entrée et à la sortie. Ce qui distingue Modal : une infrastructure définie en Python et des Sandboxes dans le même compte, plus une liste de GPU plus longue que celle de Cloud Run.
routing_region ne peut être défini qu’au premier déploiement d’une fonction, et les entrées et sorties de plus de 2 Mio passent toujours par le stockage objet de us-east.Le contrat de Modal interdit le minage de cryptomonnaies ou les activités blockchain connexes, les attaques par déni de service, le partage de fichiers en pair à pair et les plateformes généralistes d’hébergement de fichiers ou de diffusion de médias.
Starter n’a pas de frais de plateforme et inclut $30 de calcul par mois, mais le guide de facturation exige un moyen de paiement enregistré et les tokens des endpoints partagés sont facturés dès la première requête.
Pas une fois qu’elle est redescendue à zéro. Le maintien en activité de 60 secondes par défaut et le temps d’inactivité dans une scaledown_window plus longue sont facturés, et min_containers empêche la fonction d’atteindre zéro.
Les fonctions et les Sandboxes peuvent être épinglées sur des régions de l’UE moyennant un multiplicateur de 1,15 ou 1,75, avec un routage via eu-west, mais les journaux d’application restent aux États-Unis, les entrées et sorties volumineuses passent par us-east et les endpoints partagés ne peuvent pas être épinglés.