Toolso.AI
Toolso.AI
所有工具分类热门榜单最新工具价格博客
Toolso.AI
Toolso.AI

💌订阅 AI 工具周报

每周精选最新、最热门的AI工具和行业动态,直达您的邮箱 订阅

Toolso.AI
Toolso.AI

发现最好的AI工具,提升你的工作效率

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

热门分类

  • AI写作
  • AI图像
  • AI视频
  • AI编程
  • 更多分类

探索发现

  • 最新收录
  • 热门推荐
  • 更多工具
  • 提交工具
  • 价格

关于

  • 关于我们
  • 联系我们
  • 博客
  • 更新日志

法律

  • Cookie政策
  • 隐私政策
  • 服务条款
  • 退款政策
© 2026 Toolso.AI 保留所有权利
限时推广限时推广加速推广24h 优先审核 · 无需反链 · 30 天推荐展示$29.90到期后 $59.9010月31日后涨价至 $59.90距结束--:--:--立即提交
  1. 首页
  2. 所有工具
  3. 语音技术
  4. Deepgram
Deepgram界面预览
Deepgram标志

Deepgram

Deepgram 提供语音转文字、文字转语音和 Voice Agent API,按分钟或每 1,000 字符计费,附 $200 起步额度、区域端点,并为符合条件的企业客户提供自托管。

语音技术开发工具AI开发#文字转语音#API#转录
免费试用
收藏
访问次数
浏览次数
定价
免费增值
发布日期
2026年10月6日
域名
deepgram.com
用户评分

用过这个工具吗?给它评分

为这个工具评分

Deepgram 工具信息

免费试用
工具信息
收藏
访问次数
浏览次数
定价
免费增值
发布日期
2026年10月6日
域名
deepgram.com
用户评分

用过这个工具吗?给它评分

为这个工具评分

推荐工具

相关工具推荐

免费试用

Deepgram 是什么?

Deepgram 是以开发者 API 形式提供的语音 AI 平台:面向实时与录制音频的语音转文字、文字转语音、Voice Agent API,以及 Audio Intelligence 音频分析。Deepgram 把语音转文字、文字转语音和 LLM 编排整合进同一个 Voice Agent API,公司称这能降低复杂度、延迟和成本。

2026 年 1 月,Deepgram 称已完成由 AVP 领投的 1.3 亿美元 C 轮融资,估值 13 亿美元。公司还称有超过 1,300 家组织在使用其语音 AI 产品和模型,包括会议笔记工具 Granola、语音智能体初创公司 Vapi 以及 Twilio。

核心功能

Deepgram 的语音转文字 API 既接收流式音频做实时转写,也接收录制文件做批量处理。

语音转文字模型

  • Flux STT:Flux STT 是面向实时语音智能体的对话式语音识别模型,内置覆盖 10 种语言的话轮检测和打断处理。其多语言选项覆盖英语、西班牙语、法语、德语、印地语、俄语、葡萄牙语、日语、意大利语和荷兰语。
  • Nova-3:Nova-3 定位于生产级转写,具备抗噪能力,多语言支持覆盖 50 多种语言。价格页给出的数字更低:称 Nova 系列模型支持 45 种以上语言,并提供说话人分离、智能格式化、关键词提示和自动语言检测。
  • Nova-2:对于 Nova-3 尚未支持的语言以及填充词识别,仍推荐使用 Nova-2。
  • 行业调优模型:行业调优模型针对医疗、法律、金融等领域的词汇和结构。
  • 定制模型:定制模型可基于专有或新型数据集训练,用于边缘场景音频。

准确率和速度数据均为厂商自述。Deepgram 称,与竞品相比,Nova-3 的词错率在流式处理中低 54.2%,在批处理中低 47.4%;还称转写结果可在 300 毫秒以内返回。据介绍,关键词提示能改善关键术语的识别,关键词召回率最多提高 90%。

文字转语音

  • Flux TTS:Flux TTS 在整个会话中保持语气、节奏和情绪基调,无需 SSML、风格标签或提示词工程。Deepgram 称,即使在生产负载下,Flux TTS 的输出最快 80ms 即可开始。来电者中途插话时,API 会报告对方实际听到的内容。
  • Aura-2:Aura-2 是该产品线中语言覆盖最广的模型,提供七种语言的语音。
  • Aura:Aura 是 Deepgram 第一代 TTS 模型,只提供英语语音。

Voice Agent API

Voice Agent API 包含插话检测、话轮预测、函数调用和会话中控制。团队可以自带 LLM 或 TTS 服务商,同时保留 Deepgram 的编排与流式管道。

Deepgram 为 OpenAI、Anthropic、Google 和 NVIDIA 这几类服务商提供托管 LLM,因此使用这些时无需提供端点。Groq 和 Amazon Bedrock 的模型需要自备端点,因为 Deepgram 不托管这些 LLM。托管模型带有价格档位:claude-sonnet-4-5 列为高级(Advanced)档,claude-haiku-4-5 列为标准(Standard)档,档位决定每分钟费率。

Audio Intelligence

Audio Intelligence 在转写文本之上提供摘要、主题检测、意图识别和情感分析。情感分析可在词、句和整篇转写三个层级标注正面、中性或负面情感。这些功能运行在基于对话数据微调的轻量级专用模型上,而不是通用大语言模型。

使用指南

  1. 创建账户:注册免费的 Deepgram 账户即可获得 API 密钥。
  2. 设置模型和语言:语音转文字模型默认使用英语,除非 language 参数另有指定。文字转语音的每个请求都需要指定模型,其中 Flux TTS 通过 /v2/speak 提供,Aura-2 和 Aura 通过 /v1/speak 提供。
  3. 按请求退出模型训练:语音转文字和文字转语音可将 mip_opt_out=true 作为查询参数添加,Voice Agent 则在 Settings 消息中设置 "mip_opt_out": true。已退出的请求会在 Deepgram Console 的 Usage > Logs中显示 mip_opt_out 为 true。
  4. 选择智能体的 LLM:Voice Agent 的 LLM 模型也在同一条 Settings 消息中设置。

Deepgram 使用场景与示例

Deepgram 的语音转文字 API 面向客服、医疗、媒体和对话式 AI 中的转写需求。

  • 呼叫中心与语音分析:语音分析把音频转成文字,用于分析对话并识别意图。
  • 医疗转写:医疗转写针对医学术语和专业关键词。
  • 媒体与播客:媒体转写覆盖播客、视频和广播,并提供字幕和摘要。
  • 客服与外呼语音智能体:Deepgram 文字转语音 API 定位于外呼语音智能体,支持打断处理和跨轮上下文。
  • 餐厅点餐:Deepgram 收购了 OfOne,这家初创公司为快餐店打造了语音 AI 点餐。

适用人群

Deepgram 以 API 和 SDK 形式销售,因此买方通常是写代码的团队。

  • 开发者与产品团队:自助渠道面向需要灵活 API 的开发者和产品团队。
  • 平台与合作伙伴:合作伙伴渠道面向嵌入 Deepgram 语音 AI 的平台。
  • 受监管企业:定制模型和合同面向有独特工作流和合规需求的企业。
  • 计划自托管的团队:自托管为已有 DevOps 资源的团队而设。

对于需要在 Flux TTS 上做非英语旁白、或需要超大语音库的项目,它的契合度较低。

支持平台

  • 云 API:托管方案是运行在 Deepgram 基础设施上的多租户云服务。北美、欧洲、澳大利亚和印度端点的 API 速率限制分别公布。
  • 专属与 VPC:Voice Agent API 可以全托管、专属单租户、部署在 VPC 内或自托管。
  • 自托管:自托管面向有独特业务需求的 Premium 客户。企业版自托管容器运行在客户 VPC 或本地硬件上,需要 NVIDIA GPU。Deepgram 可以自托管在云基础设施、裸机上,或通过 Amazon SageMaker 市场上架版本部署。
  • SDK:Deepgram 提供 Java、JavaScript、Python、Go 和 .NET SDK。
  • 语音智能体框架:Deepgram TTS 通过流式 API 与 LiveKit、Pipecat、Vapi 及其他语音智能体编排框架集成。
  • 电话:Voice Agent API 支持通过双向 WebSocket 流传输 8kHz mu-law 电话音频。Deepgram 提供 Twilio 集成文档,另有 Genesys Cloud CX 和 Amazon Connect 的集成文档。
  • Playground:可在 Playground 中测试模型,GitHub 上也发布了入门应用。

价格套餐

Deepgram 价格按用量计费,按产品和模型拆分,而不是按席位。

套餐与并发

Pay As You Go(按量付费)套餐先提供 $200 免费额度,之后按用量计费;Growth 套餐起价为每年 $4K+。Pay As You Go 无最低消费、无过期期限,开始使用无需信用卡。Growth 通过预付年度额度最多可节省 20%,额度按实际用量抵扣。Enterprise 条款由销售报价。

服务Pay As You GoGrowth
语音转文字(REST / WebSocket / Whisper Cloud)最多 50 / 150 / 5最多 50 / 225 / 5
文字转语音(REST + WebSocket)最多 45最多 60
Voice Agent(WebSocket)最多 45最多 60
Audio Intelligence(REST)最多 10最多 10

语音转文字费率

流式语音转文字费率目前标注为限时优惠价,括号内为常规价。

模型模式Pay As You GoGrowth
Flux 英语流式$0.0065/分钟(常规 $0.0077)$0.0057/分钟(常规 $0.0065)
Flux 多语言流式$0.0078/分钟$0.0068/分钟
Nova-3 单语言流式$0.0048/分钟(常规 $0.0077)$0.0042/分钟(常规 $0.0065)
Nova-3 多语言流式$0.0058/分钟(常规 $0.0092)$0.0050/分钟(常规 $0.0078)
Nova-3 单语言预录$0.0043/分钟$0.0036/分钟
Nova-3 多语言预录$0.0052/分钟$0.0043/分钟
Whisper Large预录$0.0048/分钟$0.0048/分钟

附加功能在模型费率之外另行收费:

  • 脱敏(Redaction):Pay As You Go 为 $0.0020/分钟,Growth 为 $0.0017/分钟。
  • 关键词提示(Keyterm Prompting):Pay As You Go 为 $0.0013/分钟,Growth 为 $0.0012/分钟。
  • 智能格式化(Smart Formatting):两个套餐均已包含。

计费按秒进行,因此 14 秒的文件正好按 14 秒收费。多声道音频按处理总时长计费,因此 10 分钟的立体声文件计为 20 分钟。

文字转语音费率

模型Pay As You GoGrowth
Flux TTS每千字符 $0.0450每千字符 $0.0405
Aura-2每千字符 $0.030每千字符 $0.027
Aura-1每千字符 $0.0150每千字符 $0.0135

截至 2026 年 12 月 31 日,Pay As You Go 和 Growth 上的 Flux TTS 消费可获得等额赠送额度,最高 $500。Flux TTS 免费构建期持续到 2026 年 9 月 12 日,自 2026 年 9 月 13 日起执行标准价格。文字转语音产品页的 FAQ 称 Deepgram TTS 起价为每 1,000 字符 $0.15,这与上表中的 Aura-1 费率不一致。

Voice Agent 与 Audio Intelligence 费率

Voice Agent 档位Pay As You GoGrowth
标准$0.075/分钟$0.068/分钟
标准(自带 TTS)$0.065/分钟$0.051/分钟
自定义(自带 LLM 和 TTS)$0.050/分钟$0.041/分钟
高级$0.163/分钟$0.146/分钟
高级(自带 TTS)$0.122/分钟$0.110/分钟

Voice Agent 分钟数按 WebSocket 连接时长计算。在 Pay As You Go 上,摘要按每千输入 token $0.0003、每千输出 token $0.0006 计价。

额度、超额与退款

  • 自动充值:自动充值默认开启,剩余额度降至 $10 时自动充值 $100。
  • 退款窗口:最近 30 天内购买的未使用额度可申请退款。除此之外,取消服务并不让你获得未使用额度的退款,除非当时的价格表(Pricing List)另有规定。
  • 到期:账户关闭,或订阅被取消或终止时,额度即失效。
  • Growth 超额:Growth 超额按 Growth 费率加收溢价计费,而不是改按 Pay As You Go 价格。价格 FAQ 将其称为 10% 超额费。超额费用每周事后从已保存的支付卡扣款。
  • 转让:价格 FAQ 称,已购额度可应要求在同一组织内的账户之间转移。而服务条款则写明额度不可转让,且无现金价值。
  • 初创公司:通过初创公司计划获批的初创公司,可在 12 个月内获得最多 $100,000 额度。

Deepgram 替代方案

这一类别中公开的大多数对比都来自厂商自己。

  • AssemblyAI:Deepgram 自己的 AssemblyAI 对比页称,两家厂商都提供了自托管和商业伙伴协议(BAA)途径的文档,并把用你自己的音频做同等条件测试视为决定因素。
  • OpenAI Whisper:Whisper 也以 Whisper Large 的形式在 Deepgram 内提供,用于预录音频。一位语音智能体开发者发布了一项测试,用 100 通真实客户电话测试了 13 家语音转文字服务商。在该测试中,Deepgram Flux 的词错率最低,为 15.86%;OpenAI Whisper 最高,为 39.78%。邮政编码识别的词错率对所有服务商都超过 50%,Deepgram 也不例外。这只是一个团队基于自家通话数据的测试,并非通用排名。
  • ElevenLabs:Deepgram 将自家 TTS 定位于实时语音智能体,并承认 ElevenLabs 的语音库更大、语言覆盖更广,适合内容创作。
  • Cartesia:Deepgram 称 Cartesia 以快速合成、可通过文本标签实现的表现力控制,以及广泛的多语言语音库著称。

注意事项

产品与使用限制

  • 语音语言:Flux TTS 仅支持英语;西班牙语、德语、法语、荷兰语、意大利语和日语语音需要使用 Aura-2。
  • 欧盟的 Whisper:EU 端点不支持 Whisper 模型。
  • Whisper 并发:API 速率限制文档列出 Whisper Cloud 在北美最多 3 个并发预录请求、其他区域不可用,而价格页显示最多 5 个。
  • 项目:速率限制按项目计算,自助账户中的次要项目限一个并发流。
  • 超出限制:在 Pay As You Go 上,超出并发限制的请求可能被排队或拒绝。
  • 故障上传:客户需为每个已处理的文件付费,包括因自身系统导致的故障上传。

服务条款中的使用规则

  • 服务条款禁止将服务或输出用于竞争目的,包括模型训练、基准测试和竞品分析。
  • 用户不得把音频输出说成人工制作,并须按法律要求告知其为 AI 生成。
  • 输出可能并不独特,Deepgram 并不声明用户拥有为其他客户生成的类似输出。
  • 除非已签署商业伙伴协议,否则不得发送受保护的健康信息。

数据使用与隐私

API 请求默认加入模型改进计划(Model Improvement Program),并由 Deepgram 留存。服务条款允许 Deepgram 使用客户输入和输出来改进服务,包括训练和测试其模型。

  • 选择退出:在请求中设置 mip_opt_out=true 可使其不被留存;在区域端点上,还能让请求留在该区域内,第三方 Voice Agent 服务商除外。选择退出的请求在响应返回后,音频、文本、转写和合成音频均零数据留存。联系 Deepgram 可在账户或部署范围内强制执行退出。
  • 日志:请求元数据和使用日志在 90 天内可检索,汇总的用量数据保留更久。
  • 数据驻留:要完全保证数据不出区域,需要同时使用区域端点并设置 mip_opt_out=true。EU 端点的请求绝不会被路由到欧盟以外;若该区域不可用,请求会直接失败而不是回退。
  • 所有权与共享:Deepgram 不主张对客户输入和输出的所有权。Deepgram 称不会出售客户数据、不会将其用于广告画像,也不会未经许可再分发。
  • 政策范围:网站隐私声明不适用于客户数据的处理。
  • 自托管数据流:在典型的自托管部署中,不会向 Deepgram 发送任何音频、转写或可识别请求的内容。
  • 认证:Deepgram 称已通过 SOC 2 Type 1 和 Type 2 认证。Deepgram 会为处理 ePHI 的企业版客户签署商业伙伴协议。

FAQ

Q1. 有免费试用 Deepgram 的方式吗?

有。新的 Pay As You Go 账户附带 $200 额度,且无需信用卡;之后按分钟、按每 1,000 字符或按智能体连接分钟数计费。

Q2. Deepgram 会用我的音频训练模型吗?

默认会:请求会加入模型改进计划并被留存。在请求中添加 mip_opt_out=true 即可将其排除,并停止留存其内容。

Q3. 处理能否留在欧盟境内?

Deepgram 提供专用 EU 端点,其请求不会被路由到欧盟以外。完全在区域内处理还需要选择退出模型改进,且该端点不提供 Whisper 模型。

发现类似工具?
如果你知道其他优秀的AI工具,欢迎提交给我们