Toolso.AI
Toolso.AI
OutilsCatégoriesTendancesNouveautésTarifsBlog
Toolso.AI
Toolso.AI

💌Abonnez-vous à AI Tools Weekly

Sélection hebdomadaire des derniers et meilleurs outils IA et tendances, livrés dans votre boîte mail S'abonner

Toolso.AI
Toolso.AI

Découvrez les meilleurs outils IA pour booster votre productivité

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Catégories populaires

  • Écriture IA
  • Image IA
  • Vidéo IA
  • Codage IA
  • Plus de catégories

Explorer

  • Derniers outils
  • Outils populaires
  • Plus d'outils
  • Soumettre un outil
  • Tarifs

À propos

  • À propos de nous
  • Contact
  • Blog
  • Journal des modifications

Légal

  • Politique des cookies
  • Politique de confidentialité
  • Conditions d'utilisation
  • Politique de remboursement
© 2026 Toolso.AI Tous droits réservés
Offre limitéeOffre limitéeMise en avantExamen sous 24 h · Sans backlink · 30 jours en vedette$29.90puis $59.90Passe à $59.90 après le 31 oct.Fin dans--:--:--Soumettre
  1. Accueil
  2. Tous les outils
  3. Outils de développement
  4. Together AI
Aperçu de l’interface de Together AI
Logo de Together AI

Together AI

Together AI exécute des modèles à poids ouverts via une API sans serveur compatible OpenAI et y ajoute points de terminaison dédiés, fine-tuning, clusters GPU et bacs à sable, le tout payé avec des crédits prépayés.

Outils de développementDéveloppement IAPlateforme d'Entraînement IA#Traitement par lots#SDK#LLM
Essayer gratuitement
Favoris
Visites
Vues
Tarif
Freemium
Publié le
6 oct. 2026
Domaine
together.ai
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Informations produit Together AI

Essayer gratuitement
Informations sur l'outil
Favoris
Visites
Vues
Tarif
Freemium
Publié le
6 oct. 2026
Domaine
together.ai
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Outils en vedette

Outils associés

Essayer gratuitement

Together AI, qu’est-ce que c’est ?

Together AI est une plateforme cloud qui permet d’exécuter, de personnaliser et d’entraîner des modèles d’IA open source et à poids ouverts via des API et une infrastructure GPU en location. L’entreprise la présente comme un cloud natif pour l’IA, une plateforme d’IA complète portée par une recherche de pointe. Pour la plupart des développeurs, le point d’entrée est une API LLM open source.

Le service est exploité par Together Computer, Inc., une société du Delaware dont les conditions couvrent les API et interfaces web servant à héberger, utiliser, affiner et entraîner de grands modèles d’IA. La presse tech indépendante a décrit Together AI comme un « neocloud » d’IA qui loue des clusters de GPU Nvidia, et a rapporté une série C de 800 millions de dollars pour une valorisation de 8,3 milliards. Selon le même article, l’entreprise revendique des milliers de clients payants, dont Cursor, Cognition et Decagon.

Trois éléments orientent la plupart des décisions : il n’existe pas d’essai gratuit et l’accès commence par un achat de $5 de crédits, les prompts sont stockés par défaut sauf si la conservation zéro des données est activée, et la capacité sans serveur partagée est fournie au mieux (best-effort).

Fonctionnalités principales

Together AI regroupe ses produits en inférence, calcul et personnalisation des modèles, le tout facturé sur le même solde de crédits prépayés.

Options d’inférence

  • Inférence sans serveur : les développeurs appellent des modèles à poids ouverts via une API unique, sans rien déployer ni gérer, et ne paient que les tokens qu’ils consomment. Le catalogue couvre des modèles de texte, d’image, de vidéo, de code et de voix.
  • Inférence par lots : les gros travaux asynchrones peuvent monter jusqu’à 30 milliards de tokens par modèle, avec n’importe quel modèle sans serveur ou un déploiement privé.
  • Débit provisionné : capacité d’inférence engagée avec tarification au token, débit réservé et SLA de disponibilité de 99 %.
  • Points de terminaison et conteneurs dédiés : l’inférence de modèles dédiée exécute un modèle sur du matériel réservé et isolé, et l’inférence de conteneurs dédiée cible les charges de médias génératifs, comme les modèles vidéo, audio et image.

L’entreprise affirme avoir obtenu, pour gpt-oss-20B, une inférence sans serveur près de 2 fois plus rapide que le fournisseur le plus rapide suivant. C’est un test de performance de l’éditeur, et ce modèle a ensuite été programmé pour quitter l’offre sans serveur.

Fine-tuning et personnalisation des modèles

  • Apporter son modèle : Together AI affirme que tout modèle open source du Hugging Face Hub peut être affiné sans conversion de format.
  • Données d’appel d’outils : l’entraînement à l’appel d’outils accepte tels quels les journaux d’agents existants, avec définitions de fonctions et appels d’outils placés directement dans le jeu de données.
  • Fine-tuning de vision : les modèles de vision s’entraînent directement sur des images PNG, JPEG ou WEBP brutes, sans prétraitement particulier, en LoRA ou en fine-tuning complet.
  • Résultats portables : un modèle finalisé peut être hébergé sur un point de terminaison dédié Together ou téléchargé comme point de contrôle autonome.

Les résultats du fine-tuning de LLM tournent donc sur du matériel dédié ou quittent la plateforme sous forme de poids, au lieu de rejoindre le catalogue sans serveur facturé au token.

Calcul, bacs à sable et stockage

  • Clusters GPU : les clients peuvent réserver de 8 à plus de 4 000 GPU pour l’entraînement ou le service de modèles.
  • Bac à sable de code : ses VM vont de 2 à 64 vCPU et de 1 à 128 Go de RAM pour des environnements de développement d’IA.
  • Stockage géré : propose du stockage objet et des systèmes de fichiers parallèles sans frais de sortie de données.

Guide

Un premier appel d’API nécessite un compte approvisionné, une clé API et soit le SDK officiel, soit un client OpenAI existant :

  1. Inscrivez-vous dans la console Together AI et ajoutez au moins $5 de crédits depuis les paramètres de facturation.
  2. Créez une clé sur la page des clés API du projet ; les nouvelles clés ne s’affichent qu’une fois : enregistrez la valeur aussitôt.
  3. Installez le SDK officiel Python ou TypeScript, ou conservez un client OpenAI existant en modifiant son URL de base, puis définissez la clé comme variable d’environnement.
  4. Lancez l’exemple de démarrage rapide, qui envoie une requête de complétion de chat à MiniMax M3 et affiche la réponse.
  5. Pour les charges hors ligne, l’API de traitement par lots exécute en asynchrone de nombreuses requêtes indépendantes depuis un seul fichier JSONL téléversé.

Le coût d’un fine-tuning peut être vérifié avant toute dépense, car la CLI affiche le prix estimé et demande une confirmation avant l’envoi de la tâche.

Cas d’usage et exemples de Together AI

  • Travaux par lots hors ligne : les tâches par lots conviennent aux travaux tolérants à la latence, comme classer un grand jeu de données, lancer des évaluations, générer des données synthétiques et résumer hors ligne.
  • Agents vocaux en temps réel : une étude de cas client de Together AI consacrée à l’IA vocale de Decagon, qui répond en moins d’une seconde, fait état d’une réduction des coûts par tour d’un facteur 6 par rapport à gpt-5 mini.
  • API de production à faible latence : un témoignage client de Salesforce AI Research cite une latence réduite d’un facteur 2 et des coûts réduits d’environ un tiers.
  • Recherche et entraînement : les clusters GPU sont présentés comme un moyen de lancer un cluster en quelques minutes, de tester une hypothèse et de l’arrêter après l’expérience.
  • Agents de code sur modèles ouverts : Together Link fait tourner six agents de code sur des modèles hébergés par Together, dont Claude Code, Codex, OpenCode et Pi Code dans le terminal, ainsi que Claude Desktop et ChatGPT Desktop.

Les chiffres clients ci-dessus sont publiés par Together AI sur ses propres pages et n’ont pas été vérifiés de manière indépendante pour cette fiche.

Pour qui

Together AI convient aux développeurs et aux équipes de ML à l’aise avec les API, les SDK et les outils en ligne de commande, qui veulent utiliser des modèles à poids ouverts sans exploiter leur propre pile d’inférence.

  • Prototypage et trafic variable : l’inférence sans serveur est présentée comme idéale pour un trafic variable ou imprévisible, le prototypage rapide et les charges de production sensibles aux coûts ou en phase initiale.
  • Production stable et sensible à la latence : l’inférence de modèles dédiée vise le trafic prévisible, les applications sensibles à la latence et les charges de production à haut débit.
  • Startups financées : un accélérateur sur sélection offre jusqu’à 15 000 $ de crédits de plateforme aux startups ayant levé jusqu’à 5 millions de dollars, jusqu’à 30 000 $ pour 5 à 10 millions, et jusqu’à 50 000 $ au-delà de 10 millions.

Le choix entre les deux modes d’inférence dépend du taux d’utilisation. L’inférence de modèles dédiée revient généralement moins cher si une réplique reste occupée la majeure partie de la journée ; le sans serveur, si le trafic est faible ou assez irrégulier pour qu’une réplique dédiée reste inactive la plupart du temps. La page de tarifs précise aussi que la plupart des équipes commencent par l’inférence sans serveur, puis passent aux points de terminaison dédiés à grande échelle.

L’outil convient moins à ceux qui veulent essayer des modèles avant de payer, puisqu’il n’existe pas d’essai gratuit, ainsi qu’aux applications construites sur l’API Assistants d’OpenAI, que la couche de compatibilité n’implémente pas.

Plateformes

Together AI s’utilise via une console web, des SDK, une CLI et une API REST plutôt que via une application grand public.

  • SDK et API : Together AI publie des SDK officiels pour Python et TypeScript, et le SDK OpenAI ou de simples appels REST depuis n’importe quel langage fonctionnent aussi.
  • Compatibilité OpenAI : l’API est compatible avec l’API REST et les SDK d’OpenAI pour le chat, les complétions, la vision, la génération d’images, la synthèse vocale et les embeddings.
  • Outils de traitement par lots : les tâches par lots peuvent être lancées depuis la console, via l’API ou le SDK, ou avec la CLI.
  • Gestion des clusters : l’accès aux clusters GPU se gère avec un RBAC au niveau du projet via la CLI, le SDK, l’API, Terraform ou la console web.
  • Régions : les points de terminaison sans serveur ne permettent pas de choisir la région. Le réseau privé et les déploiements basés sur un VPC, y compris dans des régions de l’UE, sont disponibles via des configurations dédiées.

Tarification

Les tarifs Together AI reposent sur l’usage et sont entièrement prépayés. Together AI ne propose actuellement pas d’essai gratuit, et l’accès à la plateforme exige un achat minimum de $5 de crédits. Un solde de crédits positif est nécessaire pour utiliser la plateforme. Les crédits du solde prépayé n’ont actuellement pas de date d’expiration. La recharge automatique peut réapprovisionner le solde d’elle-même, mais seulement si le moyen de paiement par défaut est une carte de crédit ou de débit. Selon les conditions d’utilisation, les frais payés ne sont pas remboursables, sauf disposition contraire des conditions ou d’un bon de commande.

Prix des tokens sans serveur

Les prix sans serveur sont exprimés pour 1 million de tokens et changent souvent. Les lignes représentatives ci-dessous ont été relevées le 5 octobre 2026.

ModèleEntréeEntrée en cacheSortie
MiniMax M3$0.30$0.06$1.20
Kimi K3$3.00$0.30$15.00
gpt-oss-120B$0.15Non indiqué$0.60
Llama 3.3 70B$1.04Non indiqué$1.04

L’API de traitement par lots annonce jusqu’à 50 % de réduction sur les tarifs sans serveur et un pool de limites de débit distinct. Le tableau des modèles remisés de la documentation sur les lots ne liste toutefois qu’une variante Llama 3.3 70B Turbo et Whisper Large v3 à 50 % de réduction, et les modèles non listés sont facturés au tarif standard.

Clusters GPU

Tous les prix des clusters GPU s’entendent par GPU et par heure.

GPUPréemptibleÀ la demandeRéservé 7–30 jours31–90 jours91–180 jours181 jours et plus
NVIDIA HGX H100$1.99$3.99$3.69$3.45$3.19Nous contacter
NVIDIA HGX H200$2.99$5.99$4.99$4.15$3.99Nous contacter
NVIDIA HGX B200$4.09$8.19$7.99$7.79$6.79Nous contacter

Les réservations sont facturées pour toute la durée réservée dès que le cluster est provisionné, et l’usage au-delà de la capacité réservée est facturé au tarif à la demande. Les crédits de l’accélérateur pour startups ne s’appliquent pas aux clusters GPU réservés.

Inférence dédiée

Une réplique dédiée n’est facturée que lorsqu’elle est prête et capable de servir du trafic ; provisionnement et démarrage à froid ne sont donc pas facturés. Le tarif H100 diffère d’une page officielle à l’autre : le tableau d’inférence dédiée de la page de tarifs indique $5.49 par GPU-heure à la demande. Une entrée du journal des modifications de la documentation indique en revanche que le matériel de point de terminaison dédié H100 80GB coûte désormais $3.99 de l’heure, contre $5.49 auparavant.

Fine-tuning

Le fine-tuning est facturé aux tokens traités, c’est-à-dire la taille du jeu de données d’entraînement multipliée par le nombre d’époques, plus les éventuels tokens d’évaluation, et chaque tâche comporte un montant minimum propre au modèle. Le premier tableau de fine-tuning de la page de tarifs, sous des onglets intitulés LoRA et fine-tuning complet, indique pour Qwen3.5 0.8B $0.34 pour 1 million de tokens en fine-tuning supervisé, $0.84 en DPO et un minimum de $4.00. Plus bas dans le même tableau, GLM-5.2 affiche $40.00 en fine-tuning supervisé, $100.00 en DPO et un minimum de $60.00. Les tâches annulées ou arrêtées prématurément ne sont facturées que pour les étapes terminées. L’hébergement d’un modèle affiné sur un point de terminaison dédié est facturé séparément, à la minute.

Alternatives à Together AI

Les fournisseurs comparables d’inférence de modèles ouverts se distinguent surtout par la facturation des modèles affinés et par l’octroi ou non de crédits gratuits aux nouveaux comptes.

  • Fireworks AI : Fireworks AI indique que les modèles affinés sont servis au même prix que les modèles de base. Son inférence sans serveur est facturée au token, en prépayé et à l’usage.
  • Baseten : Baseten affirme que les nouveaux comptes reçoivent des crédits pour expérimenter gratuitement des déploiements. Ses déploiements dédiés ne facturent que le calcul utilisé, à la minute près.

Face à eux, Together AI exige un premier achat de $5 sans essai gratuit et facture l’hébergement des modèles affinés à la minute sur du matériel dédié. En échange, un seul compte couvre les modèles sans serveur, les tâches par lots, les points de terminaison dédiés, les clusters GPU, les bacs à sable et le stockage.

Limitations

Limites du service

  • Sans serveur au mieux : les performances sans serveur sont fournies au mieux (best-effort), et un débit engagé nécessite le débit provisionné.
  • Limitation des requêtes : en cas de forte demande, Together peut limiter les requêtes, et les clients peuvent recevoir des réponses 429 Too Many Requests ou 503 Service Unavailable.
  • Renouvellement des modèles : une entrée du journal des modifications a programmé le retrait de openai/gpt-oss-20b et d’autres modèles de l’offre sans serveur le 14 septembre 2026. Tous les modèles de cette entrée sauf un sont restés disponibles via des points de terminaison dédiés à la demande, facturés au temps matériel plutôt qu’aux tokens.
  • Compatibilité OpenAI partielle : les Assistants, Threads et Runs de l’API OpenAI ne sont pas implémentés. Les noms de modèles OpenAI comme gpt-4o ou text-embedding-3-large renvoient un 404 sur Together.
  • Plafonds des lots : un lot peut contenir jusqu’à 50 000 requêtes. Les fichiers d’entrée, de sortie et d’erreur des lots sont conservés 7 jours ; les résultats doivent donc être téléchargés dans ce délai.

Limites de facturation et de support

  • Solde à zéro : si le solde atteint zéro, l’accès à l’API est suspendu jusqu’à l’ajout de crédits.
  • Clusters à la demande : pour les clusters GPU entièrement à la demande, l’épuisement des crédits entraîne d’abord la mise en pause du cluster, puis son démantèlement si les crédits ne sont pas rétablis.
  • Niveaux de support : la page de support décrit toujours un support par niveau, avec une aide communautaire sur Discord pour les utilisateurs du niveau Build. Une entrée du journal des modifications indique cependant que les libellés de niveaux Build 1–5, Scale et Enterprise ont été supprimés.

Confidentialité, usage des données et propriété

  • Stockage par défaut : par défaut, Together stocke les prompts et les réponses des modèles et peut les utiliser pour améliorer ses produits.
  • Entraînement : l’utilisation des données clients pour entraîner des modèles relève d’un consentement distinct (opt-in), désactivé par défaut. La politique de confidentialité indique que les données collectées ne seront pas utilisées pour entraîner les modèles de l’entreprise sans consentement explicite (opt-in).
  • Conservation zéro des données : la conservation zéro des données n’est pas activée par défaut. Avec la ZDR activée, les prompts et les sorties ne sont ni stockés par Together ni utilisés à des fins secondaires. La ZDR ne s’applique qu’à partir de son activation et n’affecte pas les données traitées auparavant. Les fichiers téléversés pour le fine-tuning ou l’API de traitement par lots restent stockés jusqu’à leur suppression via l’API, la CLI ou la console web.
  • Modèles relais : les modèles relais (passthrough), qui transmettent les requêtes à un fournisseur tiers, sont autorisés par défaut et relèvent de la politique de données propre à ce fournisseur.
  • Modèles tiers hébergés : les modèles d’auteurs tiers comme DeepSeek, Qwen ou Mistral tournent sur l’infrastructure propre de Together et n’appellent pas l’auteur du modèle.
  • Propriété et conformité : selon les conditions d’utilisation, les clients sont seuls propriétaires de leur contenu et de leurs sorties. Together AI mentionne SOC 2 Type II, des options alignées sur HIPAA ainsi que le chiffrement en transit et au repos.

Les sources médiatiques et d’avis indépendantes consultées pour cette page ne signalaient aucune panne ni aucun problème de sécurité au niveau du produit, et les échantillons comptaient moins de 20 avis, trop peu pour conclure sur la qualité.

FAQ

Q1. Together AI propose-t-il une offre gratuite ou un essai gratuit ?

Non. L’accès exige l’achat d’au moins $5 de crédits, et aucun essai gratuit n’est proposé. Les startups acceptées dans le programme d’accélération peuvent à la place recevoir des crédits de plateforme, mais ils excluent les clusters GPU réservés.

Q2. Puis-je utiliser le SDK OpenAI avec Together AI ?

Oui, pour le chat, les complétions, la vision, la génération d’images, la synthèse vocale et les embeddings : pointez le client OpenAI vers l’URL de base de Together et passez aux identifiants de modèles avec espace de noms de Together. Les Assistants, Threads et Runs ne sont pas disponibles, et les tâches par lots utilisent l’API de traitement par lots propre à Together.

Q3. Together AI s’entraîne-t-il sur mes prompts ?

Pas par défaut. L’utilisation pour l’entraînement est un paramètre opt-in qui reste désactivé tant qu’il n’est pas activé. Les prompts et les réponses restent toutefois stockés par défaut, sauf si la conservation zéro des données est activée.

Q4. Que se passe-t-il quand mes crédits sont épuisés ?

L’accès à l’API est suspendu jusqu’à ce que vous ajoutiez des crédits. Les clusters GPU à la demande sont mis en pause, puis démantelés si les crédits ne sont pas rétablis, tandis que les réservations de clusters GPU existantes restent actives jusqu’à leur date de fin prévue.

Q5. Puis-je emporter un modèle affiné ailleurs ?

Oui. Une fois la tâche terminée, le modèle peut être servi sur un point de terminaison dédié Together ou téléchargé comme point de contrôle pour une inférence locale ou un autre hébergeur.

Connaissez-vous un outil similaire ?
Si vous connaissez d'autres excellents outils IA, n'hésitez pas à nous les soumettre