Toolso.AI
Toolso.AI
OutilsCatégoriesTendancesNouveautésTarifsBlog
Toolso.AI
Toolso.AI

💌Abonnez-vous à AI Tools Weekly

Sélection hebdomadaire des derniers et meilleurs outils IA et tendances, livrés dans votre boîte mail S'abonner

Toolso.AI
Toolso.AI

Découvrez les meilleurs outils IA pour booster votre productivité

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Catégories populaires

  • Écriture IA
  • Image IA
  • Vidéo IA
  • Codage IA
  • Plus de catégories

Explorer

  • Derniers outils
  • Outils populaires
  • Plus d'outils
  • Soumettre un outil
  • Tarifs

À propos

  • À propos de nous
  • Contact
  • Blog
  • Journal des modifications

Légal

  • Politique des cookies
  • Politique de confidentialité
  • Conditions d'utilisation
  • Politique de remboursement
© 2026 Toolso.AI Tous droits réservés
Offre limitéeOffre limitéeMise en avantExamen sous 24 h · Sans backlink · 30 jours en vedette$29.90puis $59.90Passe à $59.90 après le 31 oct.Fin dans--:--:--Soumettre
  1. Accueil
  2. Tous les outils
  3. Technologie vocale
  4. Deepgram
Aperçu de l’interface de Deepgram
Logo de Deepgram

Deepgram

Deepgram vend des API de reconnaissance vocale, de synthèse vocale et Voice Agent facturées à la minute ou par tranche de 1 000 caractères, avec un crédit de départ de $200, des endpoints régionaux et l’auto-hébergement pour les entreprises éligibles.

Technologie vocaleOutils de développementDéveloppement IA#Synthèse vocale#API#Transcription
Essayer gratuitement
Favoris
Visites
Vues
Tarif
Freemium
Publié le
6 oct. 2026
Domaine
deepgram.com
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Informations produit Deepgram

Essayer gratuitement
Informations sur l'outil
Favoris
Visites
Vues
Tarif
Freemium
Publié le
6 oct. 2026
Domaine
deepgram.com
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Outils en vedette

Outils associés

Essayer gratuitement

Deepgram, qu’est-ce que c’est ?

Deepgram est une plateforme d’IA vocale proposée sous forme d’API pour développeurs : reconnaissance vocale pour l’audio en direct et enregistré, synthèse vocale, Voice Agent API et analyse Audio Intelligence. Deepgram réunit la reconnaissance vocale, la synthèse vocale et l’orchestration de LLM dans une seule Voice Agent API, ce qui, selon l’entreprise, réduit la complexité, la latence et les coûts.

En janvier 2026, Deepgram a annoncé avoir levé 130 millions de dollars lors d’une série C menée par AVP, pour une valorisation de 1,3 milliard de dollars. L’entreprise a aussi indiqué que plus de 1 300 organisations utilisent ses produits et modèles d’IA vocale, dont l’outil de prise de notes de réunion Granola, la start-up d’agents vocaux Vapi et Twilio.

Fonctionnalités principales

L’API de reconnaissance vocale de Deepgram accepte de l’audio en streaming pour la transcription en temps réel ou des fichiers enregistrés pour le traitement par lots.

Modèles de reconnaissance vocale

  • Flux STT : modèle de reconnaissance vocale conversationnelle pour les agents vocaux en temps réel, avec détection des tours de parole et gestion des interruptions intégrées dans 10 langues. Son option multilingue couvre l’anglais, l’espagnol, le français, l’allemand, l’hindi, le russe, le portugais, le japonais, l’italien et le néerlandais.
  • Nova-3 : présenté comme un modèle de transcription en production, robuste au bruit et multilingue sur plus de 50 langues. La page de tarifs donne un chiffre plus bas : plus de 45 langues pour les modèles Nova, avec diarisation des locuteurs, mise en forme intelligente, invite de termes clés et détection automatique de la langue.
  • Nova-2 : reste recommandé pour les langues que Nova-3 ne prend pas encore en charge et pour l’identification des mots de remplissage.
  • Modèles adaptés par secteur : ils ciblent le vocabulaire et la structure de domaines comme la santé, le juridique et la finance.
  • Modèles personnalisés : ils peuvent être entraînés sur des jeux de données propriétaires ou inédits pour l’audio de cas limites.

Les chiffres de précision et de vitesse sont communiqués par l’éditeur. Deepgram affirme que Nova-3 a un taux d’erreur sur les mots inférieur de 54,2 % en streaming et de 47,4 % en traitement par lots par rapport à ses concurrents. Il affirme aussi livrer les transcriptions en moins de 300 millisecondes. L’invite de termes clés est décrite comme améliorant la reconnaissance des mots critiques, avec un rappel des mots-clés jusqu’à 90 % plus élevé.

Synthèse vocale

  • Flux TTS : conserve le ton, le rythme et le registre émotionnel sur toute une session, sans SSML, balises de style ni ingénierie de prompts. Deepgram affirme que la sortie de Flux TTS démarre en seulement 80 ms, même sous charge de production. Lorsqu’un appelant interrompt l’agent, l’API indique ce que l’appelant a réellement entendu.
  • Aura-2 : le modèle de la gamme qui couvre le plus de langues, avec des voix dans sept langues.
  • Aura : modèle TTS de première génération de Deepgram, qui ne propose que des voix anglaises.

Voice Agent API

La Voice Agent API comprend la détection des interruptions, la prédiction des tours de parole, l’appel de fonctions et le contrôle en cours de session. Les équipes peuvent utiliser leur propre fournisseur de LLM ou de TTS tout en conservant l’orchestration et le pipeline de streaming de Deepgram.

Deepgram fournit des LLM gérés pour les types de fournisseurs OpenAI, Anthropic, Google et NVIDIA, aucun endpoint n’est donc nécessaire pour eux. Les modèles Groq et Amazon Bedrock nécessitent votre propre endpoint, car Deepgram ne gère pas ces LLM. Les modèles gérés relèvent d’un niveau tarifaire : claude-sonnet-4-5 est classé Avancé (Advanced) et claude-haiku-4-5 Standard, et le niveau fixe le tarif à la minute.

Audio Intelligence

Audio Intelligence ajoute aux transcriptions le résumé, la détection de sujets, la reconnaissance d’intention et l’analyse des sentiments. L’analyse des sentiments attribue un sentiment positif, neutre ou négatif au niveau du mot, de la phrase et de la transcription entière. Ces fonctions reposent sur des modèles légers et spécialisés par tâche, affinés sur des données conversationnelles, plutôt que sur des grands modèles de langage généralistes.

Guide

  1. Créer un compte : créez un compte Deepgram gratuit pour obtenir une clé API.
  2. Définir le modèle et la langue : les modèles de reconnaissance vocale utilisent l’anglais par défaut, sauf si le paramètre language indique autre chose. La synthèse vocale nécessite un modèle à chaque requête, Flux TTS étant servi sur /v2/speak, et Aura-2 et Aura sur /v1/speak.
  3. Refuser l’entraînement des modèles requête par requête : ajoutez mip_opt_out=true comme paramètre de requête pour la reconnaissance et la synthèse vocales, ou définissez "mip_opt_out": true dans le message Settings de la Voice Agent API. Les requêtes exclues affichent mip_opt_out à true sous Usage > Logs dans la Deepgram Console.
  4. Choisir le LLM de l’agent : le modèle LLM du Voice Agent se définit dans ce même message Settings.

Cas d’usage et exemples de Deepgram

L’API de reconnaissance vocale de Deepgram vise la transcription dans le support client, la santé, les médias et l’IA conversationnelle.

  • Centres de contact et analyse vocale : elle convertit l’audio en texte pour analyser les conversations et détecter l’intention.
  • Transcription médicale : elle cible les termes médicaux et les mots-clés spécialisés.
  • Médias et podcasts : elle couvre podcasts, vidéos et émissions, avec sous-titres et résumés.
  • Agents vocaux de support et sortants : l’API de synthèse vocale de Deepgram est positionnée pour les agents vocaux sortants, avec gestion des interruptions et contexte d’un tour de parole à l’autre.
  • Prise de commande en restauration : Deepgram a racheté OfOne, une start-up qui a conçu la prise de commande par IA vocale pour la restauration rapide.

Pour qui

Deepgram est vendu sous forme d’API et de SDK, donc l’acheteur est généralement une équipe qui écrit du code.

  • Développeurs et équipes produit : la formule en libre-service vise les développeurs et les équipes produit qui veulent des API flexibles.
  • Plateformes et partenaires : un parcours partenaire cible les plateformes qui intègrent l’IA vocale de Deepgram.
  • Entreprises réglementées : les modèles personnalisés et les contrats ciblent les entreprises aux flux de travail et exigences de conformité spécifiques.
  • Équipes qui prévoient l’auto-hébergement : il est conçu pour les équipes disposant déjà de ressources DevOps.

Il convient moins à la narration dans d’autres langues que l’anglais avec Flux TTS ou aux projets qui ont besoin d’une très grande bibliothèque de voix.

Plateformes

  • API cloud : l’option hébergée est un service cloud multi-locataire fonctionnant sur l’infrastructure de Deepgram. Les limites de débit de l’API sont publiées séparément pour les endpoints Amérique du Nord, Europe, Australie et Inde.
  • Dédié et VPC : la Voice Agent API peut être déployée en mode entièrement géré, en mono-locataire dédié, dans un VPC ou en auto-hébergement.
  • Auto-hébergé : proposé aux clients Premium ayant des besoins métier spécifiques. Les conteneurs auto-hébergés Enterprise s’exécutent dans le VPC du client ou sur du matériel sur site et nécessitent des GPU NVIDIA. Deepgram peut être auto-hébergé sur une infrastructure cloud, sur du bare metal ou via des offres de la marketplace Amazon SageMaker.
  • SDK : des SDK Deepgram existent pour Java, JavaScript, Python, Go et .NET.
  • Frameworks d’agents vocaux : Deepgram TTS s’intègre à LiveKit, Pipecat, Vapi et d’autres frameworks d’orchestration d’agents vocaux via des API de streaming.
  • Téléphonie : la Voice Agent API prend en charge l’audio téléphonique mu-law 8 kHz en streaming WebSocket bidirectionnel. Deepgram documente des intégrations Twilio, Genesys Cloud CX et Amazon Connect.
  • Playground : les modèles peuvent être testés dans le Playground, et des applications de démarrage sont publiées sur GitHub.

Tarification

Les tarifs Deepgram reposent sur l’usage et sont répartis par produit et par modèle plutôt que par poste.

Formules et concurrence

Pay As You Go démarre avec un crédit gratuit de $200, puis facture à l’usage ; Growth commence à $4K+ par an. Pay As You Go n’impose ni minimum ni expiration, et aucune carte bancaire n’est requise pour commencer. Growth permet d’économiser jusqu’à 20 % grâce à des crédits annuels prépayés, imputés sur l’usage réel. Les conditions Enterprise sont chiffrées par l’équipe commerciale.

ServicePay As You GoGrowth
Reconnaissance vocale (REST / WebSocket / Whisper Cloud)jusqu’à 50 / 150 / 5jusqu’à 50 / 225 / 5
Synthèse vocale (REST + WebSocket)jusqu’à 45jusqu’à 60
Voice Agent (WebSocket)jusqu’à 45jusqu’à 60
Audio Intelligence (REST)jusqu’à 10jusqu’à 10

Tarifs de reconnaissance vocale

Les tarifs de reconnaissance vocale en streaming sont actuellement présentés comme des tarifs promotionnels à durée limitée ; les prix normaux figurent donc entre parenthèses.

ModèleModePay As You GoGrowth
Flux anglaisStreaming$0.0065/min (normal $0.0077)$0.0057/min (normal $0.0065)
Flux multilingueStreaming$0.0078/min$0.0068/min
Nova-3 monolingueStreaming$0.0048/min (normal $0.0077)$0.0042/min (normal $0.0065)
Nova-3 multilingueStreaming$0.0058/min (normal $0.0092)$0.0050/min (normal $0.0078)
Nova-3 monolinguePréenregistré$0.0043/min$0.0036/min
Nova-3 multilinguePréenregistré$0.0052/min$0.0043/min
Whisper LargePréenregistré$0.0048/min$0.0048/min

Les options s’ajoutent au tarif du modèle :

  • Le caviardage (Redaction) coûte $0.0020/min en Pay As You Go et $0.0017/min en Growth.
  • L’invite de termes clés (Keyterm Prompting) coûte $0.0013/min en Pay As You Go et $0.0012/min en Growth.
  • La mise en forme intelligente (Smart Formatting) est incluse dans les deux formules.

La facturation se fait à la seconde : un fichier de 14 secondes est facturé exactement 14 secondes. L’audio multicanal est facturé sur la durée totale traitée : un fichier stéréo de 10 minutes compte pour 20 minutes.

Tarifs de synthèse vocale

ModèlePay As You GoGrowth
Flux TTS$0.0450 pour 1 000 caractères$0.0405 pour 1 000 caractères
Aura-2$0.030 pour 1 000 caractères$0.027 pour 1 000 caractères
Aura-1$0.0150 pour 1 000 caractères$0.0135 pour 1 000 caractères

Jusqu’au 31 décembre 2026, les dépenses Flux TTS sont compensées par des crédits équivalents, jusqu’à $500, en Pay As You Go et en Growth. Une période de développement gratuite de Flux TTS a duré jusqu’au 12 septembre 2026, et la tarification standard s’applique depuis le 13 septembre 2026. La FAQ de la page produit de synthèse vocale indique que Deepgram TTS démarre à $0.15 pour 1 000 caractères, ce qui ne correspond pas au tarif Aura-1 du tableau ci-dessus.

Tarifs Voice Agent et Audio Intelligence

Niveau Voice AgentPay As You GoGrowth
Standard$0.075/min$0.068/min
Standard avec votre propre TTS$0.065/min$0.051/min
Personnalisé avec vos propres LLM et TTS$0.050/min$0.041/min
Avancé$0.163/min$0.146/min
Avancé avec votre propre TTS$0.122/min$0.110/min

Les minutes Voice Agent sont calculées sur la durée de connexion WebSocket. Le résumé est facturé $0.0003 pour 1 000 tokens en entrée et $0.0006 pour 1 000 tokens en sortie en Pay As You Go.

Crédits, dépassements et remboursements

  • Rechargement automatique : il est activé par défaut et recharge $100 lorsque le crédit restant atteint $10.
  • Délai de remboursement : un remboursement peut être demandé pour les crédits inutilisés achetés au cours des 30 derniers jours. En dehors de ce cas, une résiliation ne donne pas droit au remboursement des crédits inutilisés, sauf mention contraire dans la Pricing List (grille tarifaire) en vigueur à ce moment.
  • Expiration : les crédits expirent à la fermeture du compte ou lorsque l’abonnement est annulé ou résilié.
  • Dépassements Growth : ils sont facturés au tarif Growth majoré d’une prime, au lieu de basculer sur les prix Pay As You Go. La FAQ tarifaire parle de frais de dépassement de 10 %. Ils sont débités chaque semaine à terme échu sur la carte enregistrée.
  • Transferts : la FAQ tarifaire indique que les crédits achetés peuvent être transférés, sur demande, entre comptes d’une même organisation. Les conditions d’utilisation indiquent au contraire que les crédits ne sont pas transférables et n’ont aucune valeur monétaire.
  • Start-up : les start-up acceptées dans le programme dédié peuvent recevoir jusqu’à $100,000 de crédits sur 12 mois.

Alternatives à Deepgram

La plupart des comparatifs publiés dans cette catégorie proviennent des éditeurs eux-mêmes.

  • AssemblyAI : la propre comparaison de Deepgram avec AssemblyAI indique que les deux éditeurs documentent l’auto-hébergement et une procédure de BAA, et considère un test à conditions égales sur votre propre audio comme le facteur décisif.
  • OpenAI Whisper : Whisper est aussi disponible dans Deepgram sous le nom Whisper Large pour l’audio préenregistré. Un développeur d’agents vocaux a publié un test de 13 fournisseurs de reconnaissance vocale sur 100 appels clients réels. Dans ce test, Deepgram Flux obtenait le taux d’erreur sur les mots le plus bas, à 15,86 %, et OpenAI Whisper le plus élevé, à 39,78 %. La reconnaissance des codes postaux dépassait 50 % de taux d’erreur sur les mots chez tous les fournisseurs, Deepgram compris. Il s’agit du test d’une seule équipe sur ses propres données d’appels, pas d’un classement général.
  • ElevenLabs : Deepgram positionne son TTS sur les agents vocaux en temps réel et reconnaît qu’ElevenLabs offre une bibliothèque de voix plus large et une couverture linguistique plus étendue, adaptées à la création de contenu.
  • Cartesia : Deepgram décrit Cartesia comme réputé pour sa synthèse rapide, son contrôle expressif par balises de texte et sa large bibliothèque de voix multilingues.

Limitations

Limites du produit et d’utilisation

  • Langues des voix : Flux TTS ne fonctionne qu’en anglais ; les voix en espagnol, allemand, français, néerlandais, italien et japonais nécessitent Aura-2.
  • Whisper dans l’UE : les modèles Whisper ne sont pas pris en charge sur l’endpoint UE.
  • Concurrence Whisper : la documentation des limites de débit de l’API indique pour Whisper Cloud jusqu’à 3 requêtes préenregistrées simultanées en Amérique du Nord et une indisponibilité dans les autres régions, alors que la page de tarifs affiche jusqu’à 5.
  • Projets : les limites de débit s’appliquent par projet, et les projets secondaires des comptes en libre-service sont limités à un flux simultané.
  • Au-delà de la limite : en Pay As You Go, les requêtes qui dépassent la limite de concurrence peuvent être mises en file d’attente ou rejetées.
  • Envois défectueux : les clients paient chaque fichier traité, y compris les envois défectueux causés par leurs propres systèmes.

Règles d’usage dans les conditions

  • Les conditions interdisent d’utiliser les services ou les résultats à des fins concurrentielles, notamment l’entraînement de modèles, le benchmarking et l’analyse concurrentielle.
  • Les utilisateurs ne doivent pas présenter l’audio produit comme fait par un humain et doivent fournir les mentions légalement requises indiquant qu’il est généré par IA.
  • Les résultats peuvent ne pas être uniques, et Deepgram ne déclare pas que les utilisateurs possèdent des résultats similaires créés pour d’autres clients.
  • Les informations de santé protégées ne peuvent pas être envoyées sans la signature préalable d’un accord de partenaire commercial (BAA).

Utilisation des données et confidentialité

Les requêtes API participent par défaut au Model Improvement Program (programme d’amélioration des modèles), et Deepgram les conserve. Les conditions autorisent Deepgram à utiliser les entrées et sorties des clients pour améliorer ses services, y compris pour entraîner et tester ses modèles.

  • Désactivation : définir mip_opt_out=true sur une requête l’exclut de la conservation et, sur un endpoint régional, la maintient dans la région, à l’exception des fournisseurs tiers de Voice Agent. Les requêtes exclues bénéficient d’une conservation zéro pour l’audio, le texte, les transcriptions et l’audio synthétisé une fois la réponse renvoyée. L’application de l’exclusion à l’échelle du compte ou du déploiement est possible en contactant Deepgram.
  • Journaux : les métadonnées des requêtes et les journaux d’utilisation restent consultables pendant 90 jours, et l’usage agrégé est conservé plus longtemps.
  • Résidence des données : une garantie complète de traitement dans la région exige à la fois un endpoint régional et mip_opt_out=true. Les requêtes vers l’endpoint UE ne sont jamais acheminées hors de l’UE et échouent plutôt que de basculer en mode de repli si la région est indisponible.
  • Propriété et partage : Deepgram ne revendique pas la propriété des entrées et sorties des clients. Il affirme ne pas vendre les données des clients, ne pas les utiliser pour des profils publicitaires et ne pas les redistribuer sans autorisation.
  • Portée de la politique : l’avis de confidentialité du site web ne s’applique pas au traitement des données des clients.
  • Flux de données en auto-hébergement : dans un déploiement auto-hébergé typique, aucun audio, aucune transcription ni aucun contenu permettant d’identifier une requête n’est envoyé à Deepgram.
  • Certifications : Deepgram déclare être certifié SOC 2 Type 1 et Type 2. Il signe des accords de partenaire commercial avec les clients Enterprise qui traitent des ePHI.

FAQ

Q1. Existe-t-il un moyen gratuit d’essayer Deepgram ?

Oui. Les nouveaux comptes Pay As You Go démarrent avec un crédit de $200, sans carte bancaire ; ensuite, l’usage est facturé à la minute, par tranche de 1 000 caractères ou par minute de connexion de l’agent.

Q2. Deepgram utilise-t-il mon audio pour entraîner ses modèles ?

Par défaut, oui : les requêtes rejoignent le Model Improvement Program et sont conservées. Ajouter mip_opt_out=true à une requête l’en exclut et met fin à la conservation de son contenu.

Q3. Le traitement peut-il rester dans l’UE ?

Deepgram propose un endpoint UE dédié dont les requêtes ne sont pas acheminées hors de l’UE. Un traitement entièrement dans la région exige aussi de refuser l’amélioration des modèles, et les modèles Whisper n’y sont pas disponibles.

Connaissez-vous un outil similaire ?
Si vous connaissez d'autres excellents outils IA, n'hésitez pas à nous les soumettre