Deepgramは開発者向けAPIで提供される音声AIプラットフォームです。ライブ・録音音声向けの音声テキスト変換、音声合成、Voice Agent API、Audio Intelligenceによる分析を備えています。Deepgramは音声認識、音声合成、LLMオーケストレーションを1つのVoice Agent APIにまとめており、同社によれば、これで複雑さ、遅延、コストが減ります。
2026年1月、DeepgramはAVP主導のシリーズCラウンドで、評価額13億ドルで1億3,000万ドルを調達したと発表しました。会議メモツールのGranola、音声エージェントのスタートアップVapi、Twilioを含む1,300を超える組織が自社の音声AI製品とモデルを利用しているとも同社は公表しています。
Deepgramの音声認識APIは、リアルタイム文字起こし用のストリーミング音声も、バッチ処理用の録音ファイルも受け付けます。
精度と速度の数値はベンダー自身の発表です。Deepgramによると、Nova-3の単語誤り率は競合と比べてストリーミングで54.2%、バッチ処理で47.4%低いとしています。また、300ミリ秒未満で文字起こし結果を返すとしています。キーターム・プロンプティングは重要な単語の認識を改善し、キーワード再現率を最大90%高めると説明されています。
Voice Agent APIには、割り込み検出、ターンテイキング予測、関数呼び出し、セッション中の制御が含まれます。チームはDeepgramのオーケストレーションとストリーミングパイプラインを使い続けつつ、自前のLLMやTTSプロバイダーを持ち込めます。
DeepgramはOpenAI、Anthropic、Google、NVIDIAの各プロバイダータイプについてマネージドLLMを提供しており、これらにはエンドポイントが不要です。GroqとAmazon BedrockのモデルはDeepgramがそれらのLLMを管理していないため、自前のエンドポイントが必要です。マネージドモデルには料金ティアがあり、claude-sonnet-4-5はAdvanced(上位)、claude-haiku-4-5はStandard(標準)として掲載され、ティアで分単位の料金が決まります。
Audio Intelligenceは、文字起こしに要約、トピック検出、意図認識、感情分析を加えます。感情分析は単語、文、文字起こし全体の各レベルでポジティブ、ニュートラル、ネガティブの感情をラベル付けします。これらの機能は汎用の大規模言語モデルではなく、会話データで微調整した軽量なタスク特化モデルで動作します。
Deepgramの音声認識APIは、カスタマーサポート、医療、メディア、会話型AIでの文字起こしを想定しています。
DeepgramはAPIとSDKとして販売されているため、購入者は通常コードを書くチームです。
Flux TTSでの英語以外のナレーションや、非常に大きな音声ライブラリが必要なプロジェクトには、あまり向いていません。
Deepgramの料金は利用量ベースで、席数ではなく製品とモデルごとに分かれています。
Pay As You Go(従量課金)は$200の無料クレジットから始まり、その後は利用分を請求します。Growthは年額$4K+からです。Pay As You Goには最低利用額も有効期限もなく、開始時にクレジットカードも不要です。Growthは実際の利用量から差し引かれる年間前払いクレジットにより、最大20%節約できます。Enterpriseの条件は営業が見積もります。
| サービス | Pay As You Go | Growth |
|---|---|---|
| 音声認識(REST / WebSocket / Whisper Cloud) | 最大50 / 150 / 5 | 最大50 / 225 / 5 |
| 音声合成(REST + WebSocket) | 最大45 | 最大60 |
| Voice Agent(WebSocket) | 最大45 | 最大60 |
| Audio Intelligence(REST) | 最大10 | 最大10 |
ストリーミングの音声認識料金は現在、期間限定のプロモーション料金と表示されているため、通常価格を括弧内に示します。
| モデル | 方式 | Pay As You Go | Growth |
|---|---|---|---|
| Flux 英語 | ストリーミング | $0.0065/分(通常$0.0077) | $0.0057/分(通常$0.0065) |
| Flux 多言語 | ストリーミング | $0.0078/分 | $0.0068/分 |
| Nova-3 単一言語 | ストリーミング | $0.0048/分(通常$0.0077) | $0.0042/分(通常$0.0065) |
| Nova-3 多言語 | ストリーミング | $0.0058/分(通常$0.0092) | $0.0050/分(通常$0.0078) |
| Nova-3 単一言語 | 録音済み | $0.0043/分 | $0.0036/分 |
| Nova-3 多言語 | 録音済み | $0.0052/分 | $0.0043/分 |
| Whisper Large | 録音済み | $0.0048/分 | $0.0048/分 |
アドオンはモデル料金に上乗せして課金されます。
課金は秒単位のため、14秒のファイルはちょうど14秒分の請求です。マルチチャンネル音声は処理した合計時間で課金されるため、10分のステレオファイルは20分と数えます。
| モデル | Pay As You Go | Growth |
|---|---|---|
| Flux TTS | 1,000文字あたり$0.0450 | 1,000文字あたり$0.0405 |
| Aura-2 | 1,000文字あたり$0.030 | 1,000文字あたり$0.027 |
| Aura-1 | 1,000文字あたり$0.0150 | 1,000文字あたり$0.0135 |
2026年12月31日まで、Pay As You GoとGrowthでのFlux TTSの利用額と同額のクレジットが最大$500まで付与されます。Flux TTSの無料ビルド期間は2026年9月12日までで、2026年9月13日からは標準料金が適用されています。音声合成の製品ページのFAQは、Deepgram TTSが1,000文字あたり$0.15からとしており、上の表のAura-1料金と一致しません。
| Voice Agentのティア | Pay As You Go | Growth |
|---|---|---|
| 標準 | $0.075/分 | $0.068/分 |
| 標準(自前のTTS) | $0.065/分 | $0.051/分 |
| カスタム(自前のLLMとTTS) | $0.050/分 | $0.041/分 |
| 上位 | $0.163/分 | $0.146/分 |
| 上位(自前のTTS) | $0.122/分 | $0.110/分 |
Voice Agentの利用時間はWebSocketの接続時間で計算されます。Pay As You Goでの要約は、入力1,000トークンあたり$0.0003、出力1,000トークンあたり$0.0006です。
この分野で公開されている比較の多くは、ベンダー自身によるものです。
APIリクエストは初期設定でModel Improvement Program(モデル改善プログラム)に参加し、Deepgramが保持します。利用規約は、Deepgramがモデルの学習やテストを含むサービス改善に顧客の入力と出力を使うことを認めています。
はい。新規のPay As You Goアカウントは$200のクレジット付きで始まり、クレジットカードは不要です。その後は、分単位、1,000文字単位、またはエージェントの接続時間の分単位で課金されます。
初期設定では使います。リクエストはModel Improvement Programに参加し、保持されます。リクエストにmip_opt_out=trueを追加すると対象外になり、その内容の保持も停止されます。
Deepgramは、リクエストがEU外にルーティングされない専用のEUエンドポイントを提供しています。リージョン内で完全に処理するには、モデル改善からのオプトアウトも必要で、このエンドポイントではWhisperモデルを利用できません。