Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Deepgram est une plateforme d’IA vocale proposée sous forme d’API pour développeurs : reconnaissance vocale pour l’audio en direct et enregistré, synthèse vocale, Voice Agent API et analyse Audio Intelligence. Deepgram réunit la reconnaissance vocale, la synthèse vocale et l’orchestration de LLM dans une seule Voice Agent API, ce qui, selon l’entreprise, réduit la complexité, la latence et les coûts.
En janvier 2026, Deepgram a annoncé avoir levé 130 millions de dollars lors d’une série C menée par AVP, pour une valorisation de 1,3 milliard de dollars. L’entreprise a aussi indiqué que plus de 1 300 organisations utilisent ses produits et modèles d’IA vocale, dont l’outil de prise de notes de réunion Granola, la start-up d’agents vocaux Vapi et Twilio.
L’API de reconnaissance vocale de Deepgram accepte de l’audio en streaming pour la transcription en temps réel ou des fichiers enregistrés pour le traitement par lots.
Les chiffres de précision et de vitesse sont communiqués par l’éditeur. Deepgram affirme que Nova-3 a un taux d’erreur sur les mots inférieur de 54,2 % en streaming et de 47,4 % en traitement par lots par rapport à ses concurrents. Il affirme aussi livrer les transcriptions en moins de 300 millisecondes. L’invite de termes clés est décrite comme améliorant la reconnaissance des mots critiques, avec un rappel des mots-clés jusqu’à 90 % plus élevé.
La Voice Agent API comprend la détection des interruptions, la prédiction des tours de parole, l’appel de fonctions et le contrôle en cours de session. Les équipes peuvent utiliser leur propre fournisseur de LLM ou de TTS tout en conservant l’orchestration et le pipeline de streaming de Deepgram.
Deepgram fournit des LLM gérés pour les types de fournisseurs OpenAI, Anthropic, Google et NVIDIA, aucun endpoint n’est donc nécessaire pour eux. Les modèles Groq et Amazon Bedrock nécessitent votre propre endpoint, car Deepgram ne gère pas ces LLM. Les modèles gérés relèvent d’un niveau tarifaire : claude-sonnet-4-5 est classé Avancé (Advanced) et claude-haiku-4-5 Standard, et le niveau fixe le tarif à la minute.
Audio Intelligence ajoute aux transcriptions le résumé, la détection de sujets, la reconnaissance d’intention et l’analyse des sentiments. L’analyse des sentiments attribue un sentiment positif, neutre ou négatif au niveau du mot, de la phrase et de la transcription entière. Ces fonctions reposent sur des modèles légers et spécialisés par tâche, affinés sur des données conversationnelles, plutôt que sur des grands modèles de langage généralistes.
L’API de reconnaissance vocale de Deepgram vise la transcription dans le support client, la santé, les médias et l’IA conversationnelle.
Deepgram est vendu sous forme d’API et de SDK, donc l’acheteur est généralement une équipe qui écrit du code.
Il convient moins à la narration dans d’autres langues que l’anglais avec Flux TTS ou aux projets qui ont besoin d’une très grande bibliothèque de voix.
Les tarifs Deepgram reposent sur l’usage et sont répartis par produit et par modèle plutôt que par poste.
Pay As You Go démarre avec un crédit gratuit de $200, puis facture à l’usage ; Growth commence à $4K+ par an. Pay As You Go n’impose ni minimum ni expiration, et aucune carte bancaire n’est requise pour commencer. Growth permet d’économiser jusqu’à 20 % grâce à des crédits annuels prépayés, imputés sur l’usage réel. Les conditions Enterprise sont chiffrées par l’équipe commerciale.
| Service | Pay As You Go | Growth |
|---|---|---|
| Reconnaissance vocale (REST / WebSocket / Whisper Cloud) | jusqu’à 50 / 150 / 5 | jusqu’à 50 / 225 / 5 |
| Synthèse vocale (REST + WebSocket) | jusqu’à 45 | jusqu’à 60 |
| Voice Agent (WebSocket) | jusqu’à 45 | jusqu’à 60 |
| Audio Intelligence (REST) | jusqu’à 10 | jusqu’à 10 |
Les tarifs de reconnaissance vocale en streaming sont actuellement présentés comme des tarifs promotionnels à durée limitée ; les prix normaux figurent donc entre parenthèses.
| Modèle | Mode | Pay As You Go | Growth |
|---|---|---|---|
| Flux anglais | Streaming | $0.0065/min (normal $0.0077) | $0.0057/min (normal $0.0065) |
| Flux multilingue | Streaming | $0.0078/min | $0.0068/min |
| Nova-3 monolingue | Streaming | $0.0048/min (normal $0.0077) | $0.0042/min (normal $0.0065) |
| Nova-3 multilingue | Streaming | $0.0058/min (normal $0.0092) | $0.0050/min (normal $0.0078) |
| Nova-3 monolingue | Préenregistré | $0.0043/min | $0.0036/min |
| Nova-3 multilingue | Préenregistré | $0.0052/min | $0.0043/min |
| Whisper Large | Préenregistré | $0.0048/min | $0.0048/min |
Les options s’ajoutent au tarif du modèle :
La facturation se fait à la seconde : un fichier de 14 secondes est facturé exactement 14 secondes. L’audio multicanal est facturé sur la durée totale traitée : un fichier stéréo de 10 minutes compte pour 20 minutes.
| Modèle | Pay As You Go | Growth |
|---|---|---|
| Flux TTS | $0.0450 pour 1 000 caractères | $0.0405 pour 1 000 caractères |
| Aura-2 | $0.030 pour 1 000 caractères | $0.027 pour 1 000 caractères |
| Aura-1 | $0.0150 pour 1 000 caractères | $0.0135 pour 1 000 caractères |
Jusqu’au 31 décembre 2026, les dépenses Flux TTS sont compensées par des crédits équivalents, jusqu’à $500, en Pay As You Go et en Growth. Une période de développement gratuite de Flux TTS a duré jusqu’au 12 septembre 2026, et la tarification standard s’applique depuis le 13 septembre 2026. La FAQ de la page produit de synthèse vocale indique que Deepgram TTS démarre à $0.15 pour 1 000 caractères, ce qui ne correspond pas au tarif Aura-1 du tableau ci-dessus.
| Niveau Voice Agent | Pay As You Go | Growth |
|---|---|---|
| Standard | $0.075/min | $0.068/min |
| Standard avec votre propre TTS | $0.065/min | $0.051/min |
| Personnalisé avec vos propres LLM et TTS | $0.050/min | $0.041/min |
| Avancé | $0.163/min | $0.146/min |
| Avancé avec votre propre TTS | $0.122/min | $0.110/min |
Les minutes Voice Agent sont calculées sur la durée de connexion WebSocket. Le résumé est facturé $0.0003 pour 1 000 tokens en entrée et $0.0006 pour 1 000 tokens en sortie en Pay As You Go.
La plupart des comparatifs publiés dans cette catégorie proviennent des éditeurs eux-mêmes.
Les requêtes API participent par défaut au Model Improvement Program (programme d’amélioration des modèles), et Deepgram les conserve. Les conditions autorisent Deepgram à utiliser les entrées et sorties des clients pour améliorer ses services, y compris pour entraîner et tester ses modèles.
Oui. Les nouveaux comptes Pay As You Go démarrent avec un crédit de $200, sans carte bancaire ; ensuite, l’usage est facturé à la minute, par tranche de 1 000 caractères ou par minute de connexion de l’agent.
Par défaut, oui : les requêtes rejoignent le Model Improvement Program et sont conservées. Ajouter mip_opt_out=true à une requête l’en exclut et met fin à la conservation de son contenu.
Deepgram propose un endpoint UE dédié dont les requêtes ne sont pas acheminées hors de l’UE. Un traitement entièrement dans la région exige aussi de refuser l’amélioration des modèles, et les modèles Whisper n’y sont pas disponibles.