Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Cartesia, entreprise d’IA vocale, vend aux développeurs des modèles vocaux en temps réel et une plateforme hébergée d’agents vocaux ; elle se présente comme un laboratoire d’IA créant des modèles vocaux et des agents en temps réel. Cartesia met en avant une API unique pour la génération vocale, la transcription et les agents vocaux en production, assez rapide pour une conversation en direct.
La gamme comporte trois couches. Cartesia Sonic est le modèle de synthèse vocale, Ink le modèle de reconnaissance vocale, et les agents gérés combinent les deux avec un grand modèle de langage pour des conversations au téléphone et dans les applications. Le clonage de voix repose sur Sonic, et un modificateur de voix gratuit, dans le navigateur, accompagne l’API payante.
Les fondateurs se sont rencontrés en doctorat au Stanford AI Lab, où ils disent avoir inventé les modèles à espace d’états (SSM), l’architecture que Cartesia utilise au lieu des transformers classiques. L’entreprise attribue sa vitesse et son coût aux SSM ; c’est sa propre explication, non un résultat mesuré.
Cartesia propose deux niveaux de clonage de voix IA. Un clone vocal instantané se crée à partir de 10 secondes d’audio, Sonic 3.6 et les versions ultérieures peuvent utiliser jusqu’à 60 secondes pour conserver un accent, et les fichiers importés sont limités à 16 Mo. Un clone vocal professionnel affine le modèle sur au moins 30 minutes d’un même locuteur, et l’entraînement prend jusqu’à 3 heures. Chaque clone professionnel est entraîné sur une seule langue à la fois : une voix de marque multilingue exige donc un jeu de données enregistré à part pour chaque langue.
Les agents gérés réunissent Ink-2, un LLM choisi par le client et Sonic-3.6 en un seul agent vocal en temps réel qui gère les tours de parole, les interruptions, le streaming audio et les appels d’outils. Les agents peuvent utiliser trois types d’outils : des outils système intégrés, comme mettre fin à un appel, des outils webhook qui envoient des requêtes au serveur du client, et des outils client qui s’exécutent dans le navigateur, l’application mobile ou le serveur connecté. Cartesia gère elle-même l’intégration du LLM : inutile d’avoir un compte ou une clé API distincts chez un fournisseur de modèles. Un cadre d’évaluation intégré ajoute des tests en direct, des métriques système et des analyses d’appels personnalisées.
Via l’API, un clone vocal professionnel se crée en quatre étapes : créer un jeu de données, y importer des fichiers audio, créer un affinage à partir de ce jeu de données, puis lister les voix produites par l’affinage.
Les exemples de Cartesia portent surtout sur les agents téléphoniques et les voix clonées pour les médias.
Pour illustrer l’échelle, Cartesia cite Bolna, qui selon elle traite plus de 500 000 appels vocaux par jour dans des langues indiennes sur son infrastructure à faible latence ; c’est un témoignage client publié par l’éditeur, pas un audit indépendant.
Cartesia convient aux équipes qui intègrent la voix dans leur propre logiciel, pas aux personnes qui cherchent une application grand public prête à l’emploi.
Il convient moins aux équipes qui ont besoin de transcription en streaming en dehors des cinq langues d’Ink, à ceux qui s’attendent à du clonage de voix avec le forfait Free et aux acheteurs qui exigent des abonnements remboursables.
Cartesia facture les modèles vocaux en crédits et les appels d’agents en dollars, et chaque forfait inclut des sièges d’espace de travail illimités. Forfaits mensuels relevés le 6 octobre 2026 :
| Forfait | Prix par mois | Crédits par mois | Dollars prépayés pour les agents | Ce qu’ajoute le forfait |
|---|---|---|---|---|
| Free | $0 | 20 000 | $1 | Accès à la synthèse et à la reconnaissance vocales |
| Pro | $5 | 100 000 | $5 | Licence d’utilisation commerciale et clonage vocal instantané |
| Startup | $49 | 1 250 000 | $49 | Tout Pro, plus le clonage vocal professionnel |
| Scale | $299 | 8 000 000 | $299 | Support prioritaire et limites de simultanéité élevées |
| Enterprise | Sur devis | Sur devis | Sur devis | Tarifs dégressifs, simultanéité personnalisée, DPA et BAA, SSO |
Sur Free, Pro, Startup et Scale, les quotas de Sonic-3.6 correspondent à environ 27, 133, 1 667 et 10 667 minutes par mois, avec 2, 3, 5 et 15 requêtes de synthèse vocale simultanées. Les quotas d’Ink-2 représentent environ 1 h 51 min, 9 h 16 min, 115 h 44 min et 740 h 44 min de transcription, avec 8, 12, 20 et 60 requêtes simultanées.
Le site de Cartesia affirme que ses modèles sont n° 1 du classement d’une arène vocale tierce et d’un classement de reconnaissance vocale. Le classement de synthèse vocale avec voix des fournisseurs de cette arène indépendante, fondé sur des votes d’écoute à l’aveugle et relevé le 6 octobre 2026, plaçait Eleven v4 Turbo (Elo 1334), Eleven v4 (1321) et Qwen-Audio-3.1-TTS-Plus (1292) devant Sonic 3.6 (1278), avec Gemini 3.8 Flash TTS (1275) juste derrière. Les deux affirmations ne concordaient pas à cette date, et cette comparaison ne couvre que la vue « voix des fournisseurs » de l’arène.
Pour la transcription, Cartesia affirme qu’Ink-2 surpasse Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro et ElevenLabs Scribe-2-realtime sur des enregistrements de lignes téléphoniques, de la parole accentuée, de l’audio bruité et des conférences de résultats. Le benchmark vient de l’éditeur lui-même, mais il nomme les modèles de streaming que Cartesia considère comme ses concurrents directs.
Oui, en partie. Le modificateur de voix IA s’essaie gratuitement sans inscription ; les conversions gratuites ont une limite quotidienne, et les fichiers importés doivent être des WAV ou MP3 de moins de 15 Mo.
Non. Seules les requêtes réussies consomment des crédits, et les erreurs ne sont pas facturées.
Oui, avec une étape supplémentaire. Chaque clone instantané est créé à partir d’une seule langue : on crée donc d’abord le clone dans sa langue d’origine, puis on ajoute d’autres langues via l’API d’ajout d’accents vocaux. Chaque accent vocal ajouté coûte 225 crédits.
L’endpoint Bytes peut renvoyer de l’audio brut, du WAV ou du MP3, tandis que les endpoints SSE et WebSocket ne renvoient que de l’audio brut. Les fréquences d’échantillonnage prises en charge vont de 8 000 à 48 000 Hz.
Cartesia indique que son dispositif de conformité comprend SOC 2 Type II, l’éligibilité HIPAA avec des BAA disponibles pour les clients de la santé et la conformité au RGPD, avec la conservation zéro des données proposée aux clients entreprise sur les services éligibles.