Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Deepgram ist eine Voice-AI-Plattform, die als Entwickler-APIs bereitgestellt wird: Spracherkennung für Live- und aufgezeichnetes Audio, Sprachsynthese, eine Voice Agent API und Analysen über Audio Intelligence. Deepgram vereint Spracherkennung, Sprachsynthese und LLM-Orchestrierung in einer einzigen Voice Agent API, was laut Unternehmen Komplexität, Latenz und Kosten senkt.
Im Januar 2026 gab Deepgram bekannt, in einer von AVP angeführten Series-C-Runde 130 Millionen US-Dollar bei einer Bewertung von 1,3 Milliarden US-Dollar eingesammelt zu haben. Das Unternehmen gab außerdem an, dass mehr als 1.300 Organisationen seine Voice-AI-Produkte und -Modelle nutzen, darunter das Meeting-Notiztool Granola, das Sprachagenten-Start-up Vapi und Twilio.
Die Spracherkennungs-API von Deepgram nimmt Streaming-Audio für die Echtzeit-Transkription oder aufgezeichnete Dateien für die Stapelverarbeitung an.
Angaben zu Genauigkeit und Geschwindigkeit stammen vom Anbieter. Deepgram gibt an, dass Nova-3 im Vergleich zu Wettbewerbern eine um 54,2 % niedrigere Wortfehlerrate beim Streaming und eine um 47,4 % niedrigere bei der Stapelverarbeitung hat. Zudem liefere es Transkripte in unter 300 Millisekunden. Schlüsselbegriff-Prompting soll die Erkennung kritischer Wörter verbessern und die Trefferquote für Schlüsselwörter um bis zu 90 % erhöhen.
Die Voice Agent API umfasst Unterbrechungserkennung, Vorhersage von Sprecherwechseln, Funktionsaufrufe und Steuerung während der Sitzung. Teams können ihren eigenen LLM- oder TTS-Anbieter einbinden und dabei die Orchestrierung und Streaming-Pipeline von Deepgram beibehalten.
Deepgram stellt verwaltete LLMs für die Anbietertypen OpenAI, Anthropic, Google und NVIDIA bereit, sodass für diese kein Endpunkt nötig ist. Modelle von Groq und Amazon Bedrock benötigen einen eigenen Endpunkt, da Deepgram diese LLMs nicht verwaltet. Verwaltete Modelle haben eine Preisstufe: claude-sonnet-4-5 ist als Advanced (Erweitert) und claude-haiku-4-5 als Standard gelistet, und die Stufe bestimmt den Minutenpreis.
Audio Intelligence ergänzt Transkripte um Zusammenfassung, Themenerkennung, Absichtserkennung und Stimmungsanalyse. Die Stimmungsanalyse kennzeichnet positive, neutrale oder negative Stimmung auf Wort-, Satz- und Transkriptebene. Diese Funktionen laufen auf schlanken, aufgabenspezifischen Modellen, die mit Gesprächsdaten feinabgestimmt wurden, statt auf allgemeinen großen Sprachmodellen.
Die Spracherkennungs-API von Deepgram richtet sich an Transkription im Kundensupport, im Gesundheitswesen, in Medien und in der dialogorientierten KI.
Deepgram wird als APIs und SDKs verkauft, daher ist der Käufer meist ein Team, das Code schreibt.
Weniger geeignet ist es für nicht englischsprachige Vertonungen mit Flux TTS oder für Projekte, die eine sehr große Stimmenbibliothek brauchen.
Die Deepgram-Preise sind nutzungsbasiert und nach Produkt und Modell statt nach Nutzerplätzen aufgeteilt.
Pay As You Go beginnt mit einem kostenlosen Guthaben von $200 und rechnet danach nach Nutzung ab; Growth beginnt bei $4K+ pro Jahr. Pay As You Go hat keine Mindestbeträge und keinen Verfall und erfordert zum Start keine Kreditkarte. Mit Growth lassen sich durch vorausbezahlte Jahresguthaben, die mit der tatsächlichen Nutzung verrechnet werden, bis zu 20 % sparen. Enterprise-Konditionen werden vom Vertrieb angeboten.
| Dienst | Pay As You Go | Growth |
|---|---|---|
| Spracherkennung (REST / WebSocket / Whisper Cloud) | bis zu 50 / 150 / 5 | bis zu 50 / 225 / 5 |
| Sprachsynthese (REST + WebSocket) | bis zu 45 | bis zu 60 |
| Voice Agent (WebSocket) | bis zu 45 | bis zu 60 |
| Audio Intelligence (REST) | bis zu 10 | bis zu 10 |
Die Preise für Streaming-Spracherkennung sind derzeit als zeitlich begrenzte Aktionspreise ausgewiesen, daher stehen die regulären Preise in Klammern.
| Modell | Modus | Pay As You Go | Growth |
|---|---|---|---|
| Flux Englisch | Streaming | $0.0065/Min. (regulär $0.0077) | $0.0057/Min. (regulär $0.0065) |
| Flux mehrsprachig | Streaming | $0.0078/Min. | $0.0068/Min. |
| Nova-3 einsprachig | Streaming | $0.0048/Min. (regulär $0.0077) | $0.0042/Min. (regulär $0.0065) |
| Nova-3 mehrsprachig | Streaming | $0.0058/Min. (regulär $0.0092) | $0.0050/Min. (regulär $0.0078) |
| Nova-3 einsprachig | Voraufgezeichnet | $0.0043/Min. | $0.0036/Min. |
| Nova-3 mehrsprachig | Voraufgezeichnet | $0.0052/Min. | $0.0043/Min. |
| Whisper Large | Voraufgezeichnet | $0.0048/Min. | $0.0048/Min. |
Zusatzfunktionen werden zusätzlich zum Modellpreis berechnet:
Abgerechnet wird sekundengenau, eine 14-sekündige Datei kostet also genau 14 Sekunden. Mehrkanal-Audio wird nach der gesamten verarbeiteten Dauer abgerechnet, eine 10-minütige Stereodatei zählt also als 20 Minuten.
| Modell | Pay As You Go | Growth |
|---|---|---|
| Flux TTS | $0.0450 pro 1.000 Zeichen | $0.0405 pro 1.000 Zeichen |
| Aura-2 | $0.030 pro 1.000 Zeichen | $0.027 pro 1.000 Zeichen |
| Aura-1 | $0.0150 pro 1.000 Zeichen | $0.0135 pro 1.000 Zeichen |
Bis zum 31. Dezember 2026 werden Ausgaben für Flux TTS bei Pay As You Go und Growth mit Guthaben in gleicher Höhe ausgeglichen, bis zu $500. Eine kostenlose Build-Phase für Flux TTS lief bis zum 12. September 2026, seit dem 13. September 2026 gelten die Standardpreise. Die FAQ der Produktseite zur Sprachsynthese gibt an, Deepgram TTS beginne bei $0.15 pro 1.000 Zeichen, was nicht zum Aura-1-Preis in der Tabelle oben passt.
| Voice-Agent-Stufe | Pay As You Go | Growth |
|---|---|---|
| Standard | $0.075/Min. | $0.068/Min. |
| Standard mit eigenem TTS | $0.065/Min. | $0.051/Min. |
| Individuell mit eigenem LLM und TTS | $0.050/Min. | $0.041/Min. |
| Erweitert | $0.163/Min. | $0.146/Min. |
| Erweitert mit eigenem TTS | $0.122/Min. | $0.110/Min. |
Voice-Agent-Minuten werden nach der Dauer der WebSocket-Verbindung berechnet. Die Zusammenfassung kostet bei Pay As You Go $0.0003 pro 1.000 Eingabe-Tokens und $0.0006 pro 1.000 Ausgabe-Tokens.
Die meisten veröffentlichten Vergleiche in dieser Kategorie stammen von den Anbietern selbst.
API-Anfragen nehmen standardmäßig am Model Improvement Program (Programm zur Modellverbesserung) teil, und Deepgram speichert sie. Die Bedingungen erlauben Deepgram, Kundeneingaben und -ausgaben zur Verbesserung seiner Dienste zu nutzen, einschließlich Training und Tests seiner Modelle.
Ja. Neue Pay-As-You-Go-Konten starten mit $200 Guthaben und ohne Kreditkarte; danach wird pro Minute, pro 1.000 Zeichen oder pro Minute Verbindungszeit des Agenten abgerechnet.
Standardmäßig ja: Anfragen nehmen am Model Improvement Program teil und werden gespeichert. Mit mip_opt_out=true in einer Anfrage wird sie ausgenommen, und die Speicherung ihres Inhalts entfällt.
Deepgram bietet einen eigenen EU-Endpunkt, dessen Anfragen nicht außerhalb der EU geroutet werden. Eine vollständige Verarbeitung in der Region erfordert außerdem den Opt-out aus der Modellverbesserung, und Whisper-Modelle sind dort nicht verfügbar.