Toolso.AI
Toolso.AI
すべてのツールカテゴリ急上昇最新ツール料金プランブログ
Toolso.AI
Toolso.AI

💌AIツールウィークリーを購読

最新かつ最も注目されるAIツールとトレンドの週次厳選セレクションをメールボックスにお届けします 購読

Toolso.AI
Toolso.AI

生産性を向上させる最高のAIツールを発見する

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

人気カテゴリ

  • AI執筆
  • AI画像
  • AI動画
  • AIコーディング
  • 他のカテゴリ

探索

  • 最新ツール
  • 人気ツール
  • 他のツール
  • ツールを提出
  • 料金

会社概要

  • 会社概要
  • お問い合わせ
  • ブログ
  • 変更履歴

法的情報

  • クッキーポリシー
  • プライバシーポリシー
  • 利用規約
  • 返金ポリシー
© 2026 Toolso.AI 無断転載を禁じます
期間限定期間限定注目掲載24時間優先審査・被リンク不要・30日間注目表示$29.90終了後 $59.9010月31日以降 $59.90に値上げ終了まで--:--:--今すぐ投稿
  1. ホーム
  2. すべてのツール
  3. 音声技術
  4. Deepgram
Deepgramのインターフェースプレビュー
Deepgramのロゴ

Deepgram

Deepgramは、分単位または1,000文字単位で課金される音声テキスト変換、音声合成、Voice Agent APIを提供し、$200の初回クレジット、リージョン別エンドポイント、条件を満たす企業顧客向けのセルフホストを用意しています。

音声技術開発ツールAI開発#テキスト読み上げ#API#文字起こし
無料で試す
保存
アクセス数
閲覧数
価格
フリーミアム
公開日
2026年10月6日
ドメイン
deepgram.com
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

Deepgram 製品情報

無料で試す
ツール情報
保存
アクセス数
閲覧数
価格
フリーミアム
公開日
2026年10月6日
ドメイン
deepgram.com
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

注目のツール

関連ツール

無料で試す

Deepgramとは?

Deepgramは開発者向けAPIで提供される音声AIプラットフォームです。ライブ・録音音声向けの音声テキスト変換、音声合成、Voice Agent API、Audio Intelligenceによる分析を備えています。Deepgramは音声認識、音声合成、LLMオーケストレーションを1つのVoice Agent APIにまとめており、同社によれば、これで複雑さ、遅延、コストが減ります。

2026年1月、DeepgramはAVP主導のシリーズCラウンドで、評価額13億ドルで1億3,000万ドルを調達したと発表しました。会議メモツールのGranola、音声エージェントのスタートアップVapi、Twilioを含む1,300を超える組織が自社の音声AI製品とモデルを利用しているとも同社は公表しています。

主な機能

Deepgramの音声認識APIは、リアルタイム文字起こし用のストリーミング音声も、バッチ処理用の録音ファイルも受け付けます。

音声認識モデル

  • Flux STT:リアルタイム音声エージェント向けの会話型音声認識モデルで、10言語に対応するターン検出と割り込み処理を内蔵しています。多言語オプションは英語、スペイン語、フランス語、ドイツ語、ヒンディー語、ロシア語、ポルトガル語、日本語、イタリア語、オランダ語をカバーします。
  • Nova-3:本番環境での文字起こし向けと位置づけられ、ノイズ耐性と50以上の言語への対応を備えます。料金ページの数字はより少なく、Novaモデルは話者分離、スマートフォーマット、キーターム・プロンプティング、自動言語検出とともに45以上の言語に対応するとしています。
  • Nova-2:Nova-3が未対応の言語や、フィラー語の識別には引き続き推奨されています。
  • 業界特化モデル:医療、法務、金融などの分野の語彙と構造を対象にしています。
  • カスタムモデル:エッジケースの音声向けに、独自または新規のデータセットで学習させられます。

精度と速度の数値はベンダー自身の発表です。Deepgramによると、Nova-3の単語誤り率は競合と比べてストリーミングで54.2%、バッチ処理で47.4%低いとしています。また、300ミリ秒未満で文字起こし結果を返すとしています。キーターム・プロンプティングは重要な単語の認識を改善し、キーワード再現率を最大90%高めると説明されています。

音声合成

  • Flux TTS:SSML、スタイルタグ、プロンプトエンジニアリングなしで、セッション全体でトーン、ペース、感情の調子を保ちます。Deepgramによると、Flux TTSの出力は本番負荷下でも最短80msで始まります。通話相手が割り込むと、APIは相手が実際に聞いた内容を返します。
  • Aura-2:ラインアップで最も多くの言語に対応し、7言語の音声を提供します。
  • Aura:Deepgramの第1世代TTSモデルで、英語の音声のみを提供します。

Voice Agent API

Voice Agent APIには、割り込み検出、ターンテイキング予測、関数呼び出し、セッション中の制御が含まれます。チームはDeepgramのオーケストレーションとストリーミングパイプラインを使い続けつつ、自前のLLMやTTSプロバイダーを持ち込めます。

DeepgramはOpenAI、Anthropic、Google、NVIDIAの各プロバイダータイプについてマネージドLLMを提供しており、これらにはエンドポイントが不要です。GroqとAmazon BedrockのモデルはDeepgramがそれらのLLMを管理していないため、自前のエンドポイントが必要です。マネージドモデルには料金ティアがあり、claude-sonnet-4-5はAdvanced(上位)、claude-haiku-4-5はStandard(標準)として掲載され、ティアで分単位の料金が決まります。

Audio Intelligence

Audio Intelligenceは、文字起こしに要約、トピック検出、意図認識、感情分析を加えます。感情分析は単語、文、文字起こし全体の各レベルでポジティブ、ニュートラル、ネガティブの感情をラベル付けします。これらの機能は汎用の大規模言語モデルではなく、会話データで微調整した軽量なタスク特化モデルで動作します。

ガイド

  1. アカウントを作成:無料のDeepgramアカウントに登録すると、APIキーを取得できます。
  2. モデルと言語を設定:音声認識モデルは、languageパラメーターで別途指定しない限り英語がデフォルトです。音声合成は毎回のリクエストでモデル指定が必要で、Flux TTSは /v2/speak、Aura-2とAuraは /v1/speak で提供されます。
  3. リクエスト単位でモデル学習をオプトアウト:音声認識と音声合成ではmip_opt_out=trueをクエリパラメーターとして追加し、Voice AgentではSettingsメッセージで"mip_opt_out": trueを設定します。オプトアウトしたリクエストは、Deepgram ConsoleのUsage > Logsでmip_opt_outがtrueと表示されます。
  4. エージェントのLLMを選択:Voice AgentのLLMモデルも同じSettingsメッセージで設定します。

Deepgramの活用シーンと事例

Deepgramの音声認識APIは、カスタマーサポート、医療、メディア、会話型AIでの文字起こしを想定しています。

  • コンタクトセンターと音声分析:音声をテキストに変換して会話を分析し、意図を検出します。
  • 医療文字起こし:医療用語や専門キーワードを対象にしています。
  • メディアとポッドキャスト:ポッドキャスト、動画、放送を対象に、字幕と要約も提供します。
  • サポートとアウトバウンドの音声エージェント:Deepgramの音声合成APIは、割り込み処理とターンをまたぐ文脈保持を備えたアウトバウンド音声エージェント向けと位置づけられています。
  • レストランの注文:Deepgramは、クイックサービスレストラン向けに音声AI注文受付を開発したスタートアップOfOneを買収しました。

対象ユーザー

DeepgramはAPIとSDKとして販売されているため、購入者は通常コードを書くチームです。

  • 開発者とプロダクトチーム:セルフサービス経路は、柔軟なAPIを求める開発者とプロダクトチーム向けです。
  • プラットフォームとパートナー:パートナー経路は、Deepgramの音声AIを組み込むプラットフォーム向けです。
  • 規制業種の企業:カスタムモデルと契約は、独自のワークフローやコンプライアンス要件を持つ企業向けです。
  • セルフホストを計画するチーム:既存のDevOpsリソースを持つチーム向けに作られています。

Flux TTSでの英語以外のナレーションや、非常に大きな音声ライブラリが必要なプロジェクトには、あまり向いていません。

プラットフォーム

  • クラウドAPI:ホスト型は、Deepgramのインフラ上で動くマルチテナントのクラウドサービスです。APIのレート制限は北米、欧州、オーストラリア、インドのエンドポイント別に公開されています。
  • 専用環境とVPC:Voice Agent APIは、フルマネージド、専用シングルテナント、VPC内、セルフホストのいずれでも導入できます。
  • セルフホスト:独自のビジネス要件を持つPremium顧客が利用できます。Enterprise向けセルフホストコンテナは顧客のVPCまたはオンプレミスのハードウェアで動作し、NVIDIA GPUが必要です。Deepgramはクラウドインフラ、ベアメタル、またはAmazon SageMakerのマーケットプレイス掲載製品を通じてセルフホストできます。
  • SDK:Java、JavaScript、Python、Go、.NET向けのDeepgram SDKがあります。
  • 音声エージェントフレームワーク:Deepgram TTSはストリーミングAPIを通じて、LiveKit、Pipecat、Vapiなどの音声エージェント・オーケストレーションフレームワークと連携します。
  • 電話:Voice Agent APIは、双方向WebSocketストリーミングによる8kHz mu-lawの電話音声に対応します。DeepgramはTwilio、Genesys Cloud CX、Amazon Connectとの連携をドキュメント化しています。
  • Playground:Playgroundでモデルを試せ、スターターアプリはGitHubで公開されています。

価格

Deepgramの料金は利用量ベースで、席数ではなく製品とモデルごとに分かれています。

プランと同時接続数

Pay As You Go(従量課金)は$200の無料クレジットから始まり、その後は利用分を請求します。Growthは年額$4K+からです。Pay As You Goには最低利用額も有効期限もなく、開始時にクレジットカードも不要です。Growthは実際の利用量から差し引かれる年間前払いクレジットにより、最大20%節約できます。Enterpriseの条件は営業が見積もります。

サービスPay As You GoGrowth
音声認識(REST / WebSocket / Whisper Cloud)最大50 / 150 / 5最大50 / 225 / 5
音声合成(REST + WebSocket)最大45最大60
Voice Agent(WebSocket)最大45最大60
Audio Intelligence(REST)最大10最大10

音声認識の料金

ストリーミングの音声認識料金は現在、期間限定のプロモーション料金と表示されているため、通常価格を括弧内に示します。

モデル方式Pay As You GoGrowth
Flux 英語ストリーミング$0.0065/分(通常$0.0077)$0.0057/分(通常$0.0065)
Flux 多言語ストリーミング$0.0078/分$0.0068/分
Nova-3 単一言語ストリーミング$0.0048/分(通常$0.0077)$0.0042/分(通常$0.0065)
Nova-3 多言語ストリーミング$0.0058/分(通常$0.0092)$0.0050/分(通常$0.0078)
Nova-3 単一言語録音済み$0.0043/分$0.0036/分
Nova-3 多言語録音済み$0.0052/分$0.0043/分
Whisper Large録音済み$0.0048/分$0.0048/分

アドオンはモデル料金に上乗せして課金されます。

  • 秘匿化(Redaction)は、Pay As You Goで$0.0020/分、Growthで$0.0017/分です。
  • キーターム・プロンプティング(Keyterm Prompting)は、Pay As You Goで$0.0013/分、Growthで$0.0012/分です。
  • スマートフォーマット(Smart Formatting)は両プランに含まれています。

課金は秒単位のため、14秒のファイルはちょうど14秒分の請求です。マルチチャンネル音声は処理した合計時間で課金されるため、10分のステレオファイルは20分と数えます。

音声合成の料金

モデルPay As You GoGrowth
Flux TTS1,000文字あたり$0.04501,000文字あたり$0.0405
Aura-21,000文字あたり$0.0301,000文字あたり$0.027
Aura-11,000文字あたり$0.01501,000文字あたり$0.0135

2026年12月31日まで、Pay As You GoとGrowthでのFlux TTSの利用額と同額のクレジットが最大$500まで付与されます。Flux TTSの無料ビルド期間は2026年9月12日までで、2026年9月13日からは標準料金が適用されています。音声合成の製品ページのFAQは、Deepgram TTSが1,000文字あたり$0.15からとしており、上の表のAura-1料金と一致しません。

Voice AgentとAudio Intelligenceの料金

Voice AgentのティアPay As You GoGrowth
標準$0.075/分$0.068/分
標準(自前のTTS)$0.065/分$0.051/分
カスタム(自前のLLMとTTS)$0.050/分$0.041/分
上位$0.163/分$0.146/分
上位(自前のTTS)$0.122/分$0.110/分

Voice Agentの利用時間はWebSocketの接続時間で計算されます。Pay As You Goでの要約は、入力1,000トークンあたり$0.0003、出力1,000トークンあたり$0.0006です。

クレジット、超過利用、返金

  • 自動チャージ:初期設定でオンで、残りクレジットが$10になると$100を再チャージします。
  • 返金期間:過去30日以内に購入した未使用クレジットは返金を申請できます。それ以外では、解約しても、その時点のPricing List(料金表)に記載がある場合を除き、未使用クレジットの返金を受ける権利はありません。
  • 失効:アカウントが閉鎖されるか、サブスクリプションがキャンセルまたは終了されると失効します。
  • Growthの超過利用:Pay As You Goの料金に切り替わらず、Growthの料金にプレミアムを上乗せして請求されます。料金FAQはこれを10%の超過料金と呼んでいます。超過分は毎週、後払いで登録済みのカードに請求されます。
  • 譲渡:料金FAQによると、購入したクレジットは依頼に応じて同じ組織内のアカウント間で移せます。一方、利用規約はクレジットを譲渡不可で現金価値なしと定めています。
  • スタートアップ:スタートアッププログラムに採択されると、12か月間で最大$100,000のクレジットを受け取れます。

Deepgramの代替ツール

この分野で公開されている比較の多くは、ベンダー自身によるものです。

  • AssemblyAI:Deepgram自身のAssemblyAI比較ページは、両社ともセルフホストとBAA締結の手段をドキュメント化しているとしたうえで、自前の音声を使った同条件のテストを決め手と位置づけています。
  • OpenAI Whisper:WhisperはDeepgram内でも、録音済み音声向けのWhisper Largeとして利用できます。ある音声エージェント開発者が、実際の顧客通話100件で音声認識プロバイダー13社を比べたテストを公開しました。このテストでは、単語誤り率はDeepgram Fluxが15.86%で最も低く、OpenAI Whisperが39.78%で最も高い結果でした。郵便番号の認識では、Deepgramを含むすべてのプロバイダーで単語誤り率が50%を超えました。これは1つのチームが自社の通話データで行ったテストで、一般的なランキングではありません。
  • ElevenLabs:DeepgramはTTSをリアルタイム音声エージェント向けと位置づけたうえで、ElevenLabsの方が音声ライブラリが大きく対応言語も広く、コンテンツ制作に向いていると認めています。
  • Cartesia:DeepgramはCartesiaについて、高速な合成、テキストタグによる表現制御、幅広い多言語音声ライブラリで知られていると説明しています。

制限事項

製品と利用上の制限

  • 音声の言語:Flux TTSは英語のみで、スペイン語、ドイツ語、フランス語、オランダ語、イタリア語、日本語の音声にはAura-2が必要です。
  • EUでのWhisper:EUエンドポイントではWhisperモデルはサポートされていません。
  • Whisperの同時接続数:APIのレート制限ドキュメントでは、Whisper Cloudは北米で録音済みの同時リクエスト最大3件、他のリージョンでは利用不可とされる一方、料金ページでは最大5件としています。
  • プロジェクト:レート制限はプロジェクト単位で適用され、セルフサービスアカウントのセカンダリプロジェクトは同時ストリーム1本までです。
  • 上限超過:Pay As You Goでは、同時接続数の上限を超えたリクエストはキューに入るか拒否される場合があります。
  • 不良アップロード:顧客は、自社システムに起因する不良アップロードを含め、処理された全ファイルの料金を支払います。

利用規約上のルール

  • 利用規約は、モデルの学習、ベンチマーク、競合分析を含め、サービスや出力を競争目的で使うことを禁じています。
  • ユーザーは音声出力を人間が作ったものとして示してはならず、法律で求められるAI生成の告知を行う必要があります。
  • 出力は一意でない場合があり、Deepgramは他の顧客向けに生成された類似の出力をユーザーが所有するとは表明していません。
  • 事業提携契約(BAA)を締結していない限り、保護対象の医療情報を送信してはなりません。

データ利用とプライバシー

APIリクエストは初期設定でModel Improvement Program(モデル改善プログラム)に参加し、Deepgramが保持します。利用規約は、Deepgramがモデルの学習やテストを含むサービス改善に顧客の入力と出力を使うことを認めています。

  • オプトアウト:リクエストにmip_opt_out=trueを設定すると保持の対象外になり、リージョンのエンドポイントでは、サードパーティのVoice Agentプロバイダーを除いてリクエストがそのリージョン内にとどまります。オプトアウトしたリクエストは、レスポンスが返された後、音声、テキスト、文字起こし、合成音声のデータ保持がゼロになります。アカウント全体またはデプロイ全体へのオプトアウト強制適用は、Deepgramへの問い合わせで利用できます。
  • ログ:リクエストのメタデータと利用ログは90日間取得でき、集計後の利用状況はより長く保持されます。
  • データ所在地:リージョン内での処理を完全に保証するには、リージョンのエンドポイントとmip_opt_out=trueの両方が必要です。EUエンドポイントのリクエストがEU外にルーティングされることはなく、リージョンが利用できない場合はフォールバックせずに失敗します。
  • 所有権と共有:Deepgramは顧客の入力と出力の所有権を主張しません。また、顧客データを販売せず、広告プロファイルに使わず、許可なく再配布しないとしています。
  • ポリシーの範囲:ウェブサイトのプライバシー通知は、顧客データの処理には適用されません。
  • セルフホスト時のデータの流れ:一般的なセルフホスト環境では、音声、文字起こし、リクエストを特定できる内容はDeepgramに送信されません。
  • 認証:DeepgramはSOC 2 Type 1およびType 2の認証を取得しているとしています。ePHIを扱うEnterprise顧客とは事業提携契約を結びます。

よくある質問

Q1. Deepgramを無料で試す方法はありますか?

はい。新規のPay As You Goアカウントは$200のクレジット付きで始まり、クレジットカードは不要です。その後は、分単位、1,000文字単位、またはエージェントの接続時間の分単位で課金されます。

Q2. Deepgramは私の音声をモデルの学習に使いますか?

初期設定では使います。リクエストはModel Improvement Programに参加し、保持されます。リクエストにmip_opt_out=trueを追加すると対象外になり、その内容の保持も停止されます。

Q3. 処理をEU内にとどめられますか?

Deepgramは、リクエストがEU外にルーティングされない専用のEUエンドポイントを提供しています。リージョン内で完全に処理するには、モデル改善からのオプトアウトも必要で、このエンドポイントではWhisperモデルを利用できません。

類似のツールをご存知ですか?
他の素晴らしいAIツールをご存知でしたら、ぜひ私たちに提出してください