Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Together AI est une plateforme cloud qui permet d’exécuter, de personnaliser et d’entraîner des modèles d’IA open source et à poids ouverts via des API et une infrastructure GPU en location. L’entreprise la présente comme un cloud natif pour l’IA, une plateforme d’IA complète portée par une recherche de pointe. Pour la plupart des développeurs, le point d’entrée est une API LLM open source.
Le service est exploité par Together Computer, Inc., une société du Delaware dont les conditions couvrent les API et interfaces web servant à héberger, utiliser, affiner et entraîner de grands modèles d’IA. La presse tech indépendante a décrit Together AI comme un « neocloud » d’IA qui loue des clusters de GPU Nvidia, et a rapporté une série C de 800 millions de dollars pour une valorisation de 8,3 milliards. Selon le même article, l’entreprise revendique des milliers de clients payants, dont Cursor, Cognition et Decagon.
Trois éléments orientent la plupart des décisions : il n’existe pas d’essai gratuit et l’accès commence par un achat de $5 de crédits, les prompts sont stockés par défaut sauf si la conservation zéro des données est activée, et la capacité sans serveur partagée est fournie au mieux (best-effort).
Together AI regroupe ses produits en inférence, calcul et personnalisation des modèles, le tout facturé sur le même solde de crédits prépayés.
L’entreprise affirme avoir obtenu, pour gpt-oss-20B, une inférence sans serveur près de 2 fois plus rapide que le fournisseur le plus rapide suivant. C’est un test de performance de l’éditeur, et ce modèle a ensuite été programmé pour quitter l’offre sans serveur.
Les résultats du fine-tuning de LLM tournent donc sur du matériel dédié ou quittent la plateforme sous forme de poids, au lieu de rejoindre le catalogue sans serveur facturé au token.
Un premier appel d’API nécessite un compte approvisionné, une clé API et soit le SDK officiel, soit un client OpenAI existant :
Le coût d’un fine-tuning peut être vérifié avant toute dépense, car la CLI affiche le prix estimé et demande une confirmation avant l’envoi de la tâche.
Les chiffres clients ci-dessus sont publiés par Together AI sur ses propres pages et n’ont pas été vérifiés de manière indépendante pour cette fiche.
Together AI convient aux développeurs et aux équipes de ML à l’aise avec les API, les SDK et les outils en ligne de commande, qui veulent utiliser des modèles à poids ouverts sans exploiter leur propre pile d’inférence.
Le choix entre les deux modes d’inférence dépend du taux d’utilisation. L’inférence de modèles dédiée revient généralement moins cher si une réplique reste occupée la majeure partie de la journée ; le sans serveur, si le trafic est faible ou assez irrégulier pour qu’une réplique dédiée reste inactive la plupart du temps. La page de tarifs précise aussi que la plupart des équipes commencent par l’inférence sans serveur, puis passent aux points de terminaison dédiés à grande échelle.
L’outil convient moins à ceux qui veulent essayer des modèles avant de payer, puisqu’il n’existe pas d’essai gratuit, ainsi qu’aux applications construites sur l’API Assistants d’OpenAI, que la couche de compatibilité n’implémente pas.
Together AI s’utilise via une console web, des SDK, une CLI et une API REST plutôt que via une application grand public.
Les tarifs Together AI reposent sur l’usage et sont entièrement prépayés. Together AI ne propose actuellement pas d’essai gratuit, et l’accès à la plateforme exige un achat minimum de $5 de crédits. Un solde de crédits positif est nécessaire pour utiliser la plateforme. Les crédits du solde prépayé n’ont actuellement pas de date d’expiration. La recharge automatique peut réapprovisionner le solde d’elle-même, mais seulement si le moyen de paiement par défaut est une carte de crédit ou de débit. Selon les conditions d’utilisation, les frais payés ne sont pas remboursables, sauf disposition contraire des conditions ou d’un bon de commande.
Les prix sans serveur sont exprimés pour 1 million de tokens et changent souvent. Les lignes représentatives ci-dessous ont été relevées le 5 octobre 2026.
| Modèle | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | Non indiqué | $0.60 |
| Llama 3.3 70B | $1.04 | Non indiqué | $1.04 |
L’API de traitement par lots annonce jusqu’à 50 % de réduction sur les tarifs sans serveur et un pool de limites de débit distinct. Le tableau des modèles remisés de la documentation sur les lots ne liste toutefois qu’une variante Llama 3.3 70B Turbo et Whisper Large v3 à 50 % de réduction, et les modèles non listés sont facturés au tarif standard.
Tous les prix des clusters GPU s’entendent par GPU et par heure.
| GPU | Préemptible | À la demande | Réservé 7–30 jours | 31–90 jours | 91–180 jours | 181 jours et plus |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | Nous contacter |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | Nous contacter |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | Nous contacter |
Les réservations sont facturées pour toute la durée réservée dès que le cluster est provisionné, et l’usage au-delà de la capacité réservée est facturé au tarif à la demande. Les crédits de l’accélérateur pour startups ne s’appliquent pas aux clusters GPU réservés.
Une réplique dédiée n’est facturée que lorsqu’elle est prête et capable de servir du trafic ; provisionnement et démarrage à froid ne sont donc pas facturés. Le tarif H100 diffère d’une page officielle à l’autre : le tableau d’inférence dédiée de la page de tarifs indique $5.49 par GPU-heure à la demande. Une entrée du journal des modifications de la documentation indique en revanche que le matériel de point de terminaison dédié H100 80GB coûte désormais $3.99 de l’heure, contre $5.49 auparavant.
Le fine-tuning est facturé aux tokens traités, c’est-à-dire la taille du jeu de données d’entraînement multipliée par le nombre d’époques, plus les éventuels tokens d’évaluation, et chaque tâche comporte un montant minimum propre au modèle. Le premier tableau de fine-tuning de la page de tarifs, sous des onglets intitulés LoRA et fine-tuning complet, indique pour Qwen3.5 0.8B $0.34 pour 1 million de tokens en fine-tuning supervisé, $0.84 en DPO et un minimum de $4.00. Plus bas dans le même tableau, GLM-5.2 affiche $40.00 en fine-tuning supervisé, $100.00 en DPO et un minimum de $60.00. Les tâches annulées ou arrêtées prématurément ne sont facturées que pour les étapes terminées. L’hébergement d’un modèle affiné sur un point de terminaison dédié est facturé séparément, à la minute.
Les fournisseurs comparables d’inférence de modèles ouverts se distinguent surtout par la facturation des modèles affinés et par l’octroi ou non de crédits gratuits aux nouveaux comptes.
Face à eux, Together AI exige un premier achat de $5 sans essai gratuit et facture l’hébergement des modèles affinés à la minute sur du matériel dédié. En échange, un seul compte couvre les modèles sans serveur, les tâches par lots, les points de terminaison dédiés, les clusters GPU, les bacs à sable et le stockage.
Les sources médiatiques et d’avis indépendantes consultées pour cette page ne signalaient aucune panne ni aucun problème de sécurité au niveau du produit, et les échantillons comptaient moins de 20 avis, trop peu pour conclure sur la qualité.
Non. L’accès exige l’achat d’au moins $5 de crédits, et aucun essai gratuit n’est proposé. Les startups acceptées dans le programme d’accélération peuvent à la place recevoir des crédits de plateforme, mais ils excluent les clusters GPU réservés.
Oui, pour le chat, les complétions, la vision, la génération d’images, la synthèse vocale et les embeddings : pointez le client OpenAI vers l’URL de base de Together et passez aux identifiants de modèles avec espace de noms de Together. Les Assistants, Threads et Runs ne sont pas disponibles, et les tâches par lots utilisent l’API de traitement par lots propre à Together.
Pas par défaut. L’utilisation pour l’entraînement est un paramètre opt-in qui reste désactivé tant qu’il n’est pas activé. Les prompts et les réponses restent toutefois stockés par défaut, sauf si la conservation zéro des données est activée.
L’accès à l’API est suspendu jusqu’à ce que vous ajoutiez des crédits. Les clusters GPU à la demande sont mis en pause, puis démantelés si les crédits ne sont pas rétablis, tandis que les réservations de clusters GPU existantes restent actives jusqu’à leur date de fin prévue.
Oui. Une fois la tâche terminée, le modèle peut être servi sur un point de terminaison dédié Together ou téléchargé comme point de contrôle pour une inférence locale ou un autre hébergeur.