Toolso.AI
Toolso.AI
ИнструментыКатегорииПопулярныеНовинкиЦеныБлог
Toolso.AI
Toolso.AI

💌Подпишитесь на AI Tools Weekly

Еженедельно отобранная подборка последних и самых популярных AI-инструментов и трендов, доставляемая на вашу почту Подписаться

Toolso.AI
Toolso.AI

Откройте для себя лучшие AI-инструменты для повышения вашей продуктивности

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Популярные категории

  • AI-письмо
  • AI-изображения
  • AI-видео
  • AI-кодирование
  • Больше категорий

Исследовать

  • Новые инструменты
  • Популярные инструменты
  • Больше инструментов
  • Предложить инструмент
  • Цены

О нас

  • О нас
  • Контакты
  • Блог
  • История изменений

Правовая информация

  • Политика использования файлов cookie
  • Политика конфиденциальности
  • Условия использования
  • Политика возврата
© 2026 Toolso.AI Все права защищены
АкцияОграниченное предложениеПродвигаемое размещениеПроверка за 24 ч · Без обратной ссылки · 30 дней продвижения$29.90затем $59.90После 31 окт. цена вырастет до $59.90До конца--:--:--Отправить
  1. Главная
  2. Все инструменты
  3. Голосовые технологии
  4. Deepgram
Предпросмотр интерфейса Deepgram
Логотип Deepgram

Deepgram

Deepgram продаёт API распознавания речи, синтеза речи и Voice Agent с оплатой за минуту или за 1 000 символов, стартовым кредитом $200, региональными эндпоинтами и самостоятельным хостингом для подходящих корпоративных клиентов.

Голосовые технологииИнструменты разработкиРазработка ИИ#Текст в речь#API#Транскрипция
Попробовать бесплатно
Сохранений
Посещений
Просмотров
Цена
Freemium
Опубликовано
6 окт. 2026 г.
Домен
deepgram.com
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Информация о продукте Deepgram

Попробовать бесплатно
Информация об инструменте
Сохранений
Посещений
Просмотров
Цена
Freemium
Опубликовано
6 окт. 2026 г.
Домен
deepgram.com
Оценка пользователей

Пользовались этим инструментом? Оцените его

Оценить этот инструмент

Рекомендуемые инструменты

Похожие инструменты

Попробовать бесплатно

Что такое Deepgram?

Deepgram — платформа голосового ИИ, которая предоставляется в виде API для разработчиков: распознавание речи для живого и записанного аудио, синтез речи, Voice Agent API и анализ Audio Intelligence. Deepgram объединяет распознавание речи, синтез речи и оркестрацию LLM в едином Voice Agent API, что, по словам компании, снижает сложность, задержку и затраты.

В январе 2026 года Deepgram сообщила, что привлекла 130 млн долларов в раунде серии C под руководством AVP при оценке в 1,3 млрд долларов. Компания также сообщила, что её продуктами и моделями голосового ИИ пользуются более 1 300 организаций, в том числе сервис для заметок на встречах Granola, стартап голосовых агентов Vapi и Twilio.

Ключевые функции

API распознавания речи Deepgram принимает потоковое аудио для транскрибации в реальном времени или записанные файлы для пакетной обработки.

Модели распознавания речи

  • Flux STT: разговорная модель распознавания речи для голосовых агентов реального времени со встроенным определением смены реплик и обработкой перебиваний на 10 языках. Её многоязычный вариант охватывает английский, испанский, французский, немецкий, хинди, русский, португальский, японский, итальянский и нидерландский.
  • Nova-3: Nova-3 позиционируется для транскрибации в продакшене: устойчива к шуму и поддерживает более 50 языков. Страница цен приводит меньшую цифру: там сказано, что модели Nova поддерживают более 45 языков с разделением дикторов, умным форматированием, подсказками ключевых терминов и автоматическим определением языка.
  • Nova-2: по-прежнему рекомендуется для языков, которые Nova-3 пока не поддерживает, и для распознавания слов-паразитов.
  • Отраслевые модели: нацелены на лексику и структуру в таких областях, как здравоохранение, право и финансы.
  • Индивидуальные модели: их можно обучать на собственных или новых наборах данных для нестандартного аудио.

Показатели точности и скорости приводит сам поставщик. Deepgram утверждает, что у Nova-3 доля ошибок в словах на 54,2 % ниже, чем у конкурентов, при потоковой обработке и на 47,4 % ниже при пакетной. Также компания заявляет, что выдаёт транскрипты быстрее чем за 300 миллисекунд. Подсказки ключевых терминов, как утверждается, улучшают распознавание важных слов и повышают полноту по ключевым словам до 90 %.

Синтез речи

  • Flux TTS: Flux TTS сохраняет тон, темп и эмоциональный регистр на протяжении всей сессии без SSML, тегов стиля и промпт-инжиниринга. По словам Deepgram, вывод Flux TTS начинается всего через 80 мс даже при производственной нагрузке. Когда звонящий перебивает, API сообщает, что звонящий на самом деле услышал.
  • Aura-2: модель с самым широким языковым охватом в линейке, с голосами на семи языках.
  • Aura: TTS-модель Deepgram первого поколения, предлагает только английские голоса.

Voice Agent API

Voice Agent API включает обнаружение перебиваний, прогнозирование смены реплик, вызов функций и управление по ходу сессии. Команды могут подключить собственного поставщика LLM или TTS, сохранив оркестрацию и потоковый конвейер Deepgram.

Deepgram предоставляет управляемые LLM для типов поставщиков OpenAI, Anthropic, Google и NVIDIA, поэтому для них эндпоинт не нужен. Для моделей Groq и Amazon Bedrock нужен собственный эндпоинт, так как Deepgram этими LLM не управляет. У управляемых моделей есть ценовой уровень: claude-sonnet-4-5 указана как Advanced («Расширенный»), claude-haiku-4-5 — как Standard («Стандартный»), и уровень определяет поминутную ставку.

Audio Intelligence

Audio Intelligence добавляет к транскриптам суммаризацию, определение тем, распознавание намерений и анализ тональности. Анализ тональности помечает положительную, нейтральную или отрицательную тональность на уровне слова, предложения и всего транскрипта. Эти функции работают на лёгких специализированных моделях, дообученных на разговорных данных, а не на универсальных больших языковых моделях.

Руководство

  1. Создание аккаунта: зарегистрируйте бесплатный аккаунт Deepgram, чтобы получить API-ключ.
  2. Выбор модели и языка: модели распознавания речи по умолчанию работают с английским, если параметр language не указывает иное. Синтезу речи нужна модель в каждом запросе: Flux TTS обслуживается на /v2/speak, а Aura-2 и Aura — на /v1/speak.
  3. Отказ от обучения моделей для отдельного запроса: добавьте mip_opt_out=true как параметр запроса для распознавания и синтеза речи или задайте "mip_opt_out": true в сообщении Settings для Voice Agent. У запросов с отказом в разделе Usage > Logs в Deepgram Console параметр mip_opt_out отображается как true.
  4. Выбор LLM для агента: модель LLM для Voice Agent задаётся в том же сообщении Settings.

Сценарии использования и примеры Deepgram

API распознавания речи Deepgram ориентирован на транскрибацию в поддержке клиентов, здравоохранении, медиа и разговорном ИИ.

  • Контакт-центры и речевая аналитика: преобразует аудио в текст, чтобы анализировать разговоры и определять намерения.
  • Медицинская транскрибация: ориентирована на медицинские термины и специализированные ключевые слова.
  • Медиа и подкасты: охватывает подкасты, видео и трансляции, с субтитрами и сводками.
  • Поддержка и исходящие голосовые агенты: API синтеза речи Deepgram позиционируется для исходящих голосовых агентов, с обработкой перебиваний и сохранением контекста между репликами.
  • Заказы в ресторанах: Deepgram приобрела OfOne — стартап, создавший голосовой ИИ для приёма заказов в ресторанах быстрого обслуживания.

Для кого предназначен

Deepgram продаётся в виде API и SDK, поэтому покупатель — обычно команда, которая пишет код.

  • Разработчики и продуктовые команды: вариант самообслуживания рассчитан на разработчиков и продуктовые команды, которым нужны гибкие API.
  • Платформы и партнёры: партнёрский вариант рассчитан на платформы, встраивающие голосовой ИИ Deepgram.
  • Регулируемые компании: индивидуальные модели и договоры рассчитаны на компании с особыми рабочими процессами и требованиями к соответствию нормам.
  • Команды, планирующие самостоятельный хостинг: он рассчитан на команды с уже имеющимися ресурсами DevOps.

Сервис хуже подходит для озвучки не на английском языке через Flux TTS или для проектов, которым нужна очень большая библиотека голосов.

Платформы

  • Облачный API: размещённый вариант — мультитенантный облачный сервис на инфраструктуре Deepgram. Ограничения частоты запросов API публикуются отдельно для эндпоинтов в Северной Америке, Европе, Австралии и Индии.
  • Выделенный вариант и VPC: Voice Agent API можно развернуть как полностью управляемый сервис, выделенный однотенантный вариант, в VPC или на собственной инфраструктуре.
  • Самостоятельный хостинг: доступен клиентам Premium с особыми бизнес-требованиями. Контейнеры Enterprise для самостоятельного хостинга работают в VPC клиента или на локальном оборудовании и требуют GPU NVIDIA. Deepgram можно развернуть самостоятельно в облачной инфраструктуре, на физических серверах (bare metal) или через предложения в маркетплейсе Amazon SageMaker.
  • SDK: SDK Deepgram есть для Java, JavaScript, Python, Go и .NET.
  • Фреймворки голосовых агентов: Deepgram TTS интегрируется с LiveKit, Pipecat, Vapi и другими фреймворками оркестрации голосовых агентов через потоковые API.
  • Телефония: Voice Agent API поддерживает телефонное аудио 8 кГц mu-law через двунаправленную потоковую передачу по WebSocket. Deepgram документирует интеграции с Twilio, а также интеграции для Genesys Cloud CX и Amazon Connect.
  • Playground: модели можно протестировать в Playground, а стартовые приложения опубликованы на GitHub.

Ценообразование

Тарификация основана на использовании: цены Deepgram разделены по продуктам и моделям, а не по рабочим местам.

Тарифы и параллельные подключения

Pay As You Go начинается с бесплатного кредита $200, после чего оплата идёт по факту использования; Growth стоит от $4K+ в год. У Pay As You Go нет минимальных платежей и срока действия, а для начала не нужна банковская карта. Growth позволяет сэкономить до 20 % за счёт предоплаченных годовых кредитов, которые списываются по фактическому использованию. Условия Enterprise рассчитывает отдел продаж.

СервисPay As You GoGrowth
Распознавание речи (REST / WebSocket / Whisper Cloud)до 50 / 150 / 5до 50 / 225 / 5
Синтез речи (REST + WebSocket)до 45до 60
Voice Agent (WebSocket)до 45до 60
Audio Intelligence (REST)до 10до 10

Цены на распознавание речи

Цены на потоковое распознавание речи сейчас обозначены как временные промотарифы, поэтому обычные цены указаны в скобках.

МодельРежимPay As You GoGrowth
Flux английскийПотоковый$0.0065/мин (обычно $0.0077)$0.0057/мин (обычно $0.0065)
Flux многоязычныйПотоковый$0.0078/мин$0.0068/мин
Nova-3 одноязычныйПотоковый$0.0048/мин (обычно $0.0077)$0.0042/мин (обычно $0.0065)
Nova-3 многоязычныйПотоковый$0.0058/мин (обычно $0.0092)$0.0050/мин (обычно $0.0078)
Nova-3 одноязычныйПредзаписанный$0.0043/мин$0.0036/мин
Nova-3 многоязычныйПредзаписанный$0.0052/мин$0.0043/мин
Whisper LargeПредзаписанный$0.0048/мин$0.0048/мин

Дополнительные функции оплачиваются сверх ставки модели:

  • Маскирование данных (Redaction) стоит $0.0020/мин на Pay As You Go и $0.0017/мин на Growth.
  • Подсказки ключевых терминов (Keyterm Prompting) стоят $0.0013/мин на Pay As You Go и $0.0012/мин на Growth.
  • Умное форматирование (Smart Formatting) включено в оба тарифа.

Оплата посекундная, поэтому 14-секундный файл тарифицируется ровно как 14 секунд. Многоканальное аудио тарифицируется по общей обработанной длительности, поэтому 10-минутный стереофайл считается как 20 минут.

Цены на синтез речи

МодельPay As You GoGrowth
Flux TTS$0.0450 за 1 000 символов$0.0405 за 1 000 символов
Aura-2$0.030 за 1 000 символов$0.027 за 1 000 символов
Aura-1$0.0150 за 1 000 символов$0.0135 за 1 000 символов

До 31 декабря 2026 года расходы на Flux TTS на тарифах Pay As You Go и Growth компенсируются кредитами в том же размере, но не более $500. Бесплатный период разработки на Flux TTS длился до 12 сентября 2026 года, а с 13 сентября 2026 года действуют стандартные цены. В FAQ на странице продукта синтеза речи сказано, что Deepgram TTS стоит от $0.15 за 1 000 символов, что не совпадает со ставкой Aura-1 в таблице выше.

Цены на Voice Agent и Audio Intelligence

Уровень Voice AgentPay As You GoGrowth
Стандартный$0.075/мин$0.068/мин
Стандартный со своим TTS$0.065/мин$0.051/мин
Индивидуальный со своими LLM и TTS$0.050/мин$0.041/мин
Расширенный$0.163/мин$0.146/мин
Расширенный со своим TTS$0.122/мин$0.110/мин

Минуты Voice Agent считаются по времени WebSocket-подключения. Суммаризация на Pay As You Go стоит $0.0003 за 1 000 входных токенов и $0.0006 за 1 000 выходных токенов.

Кредиты, перерасход и возвраты

  • Автопополнение: включено по умолчанию и пополняет баланс на $100, когда остаток кредитов достигает $10.
  • Срок для возврата: возврат можно запросить за неиспользованные кредиты, купленные в последние 30 дней. В остальных случаях отмена не даёт права на возврат неиспользованных кредитов, кроме случаев, указанных в действующем на тот момент Pricing List (прайс-листе).
  • Срок действия: кредиты сгорают при закрытии аккаунта либо при отмене или прекращении подписки.
  • Перерасход на Growth: оплачивается по ставке Growth с надбавкой, а не по ценам Pay As You Go. В FAQ по ценам это названо 10-процентной платой за перерасход. Перерасход списывается еженедельно постфактум с привязанной карты.
  • Передача: в FAQ по ценам сказано, что купленные кредиты можно по запросу перенести между аккаунтами одной организации. В условиях обслуживания, напротив, указано, что кредиты не подлежат передаче и не имеют денежной стоимости.
  • Стартапы: принятые в стартап-программу компании могут получить до $100,000 кредитов в течение 12 месяцев.

Альтернативы Deepgram

Большинство опубликованных сравнений в этой категории исходят от самих поставщиков.

  • AssemblyAI: собственное сравнение Deepgram с AssemblyAI указывает, что оба поставщика документируют самостоятельный хостинг и путь к заключению BAA, и считает решающим фактором тест в равных условиях на вашем собственном аудио.
  • OpenAI Whisper: Whisper также доступен внутри Deepgram как Whisper Large для предзаписанного аудио. Разработчик голосовых агентов опубликовал тест 13 поставщиков распознавания речи на 100 реальных звонках клиентов. В этом тесте у Deepgram Flux была самая низкая доля ошибок в словах — 15,86 %, а у OpenAI Whisper самая высокая — 39,78 %. При распознавании почтовых индексов доля ошибок в словах превысила 50 % у всех поставщиков, включая Deepgram. Это тест одной команды на собственных данных звонков, а не общий рейтинг.
  • ElevenLabs: Deepgram позиционирует свой TTS для голосовых агентов реального времени и признаёт, что у ElevenLabs больше библиотека голосов и шире языковой охват, что подходит для создания контента.
  • Cartesia: Deepgram описывает Cartesia как сервис, известный быстрым синтезом, выразительным управлением через текстовые теги и широкой многоязычной библиотекой голосов.

Ограничения

Ограничения продукта и использования

  • Языки голосов: Flux TTS работает только на английском; для голосов на испанском, немецком, французском, нидерландском, итальянском и японском нужна Aura-2.
  • Whisper в ЕС: модели Whisper не поддерживаются на эндпоинте ЕС.
  • Параллельность Whisper: документация по ограничениям частоты запросов API указывает для Whisper Cloud до 3 параллельных запросов с предзаписанным аудио в Северной Америке и недоступность в других регионах, тогда как страница цен показывает до 5.
  • Проекты: ограничения частоты действуют на уровне проекта, а дополнительные проекты в аккаунтах самообслуживания ограничены одним параллельным потоком.
  • Сверх лимита: на Pay As You Go запросы сверх лимита параллельных подключений могут ставиться в очередь или отклоняться.
  • Ошибочные загрузки: клиенты платят за каждый обработанный файл, включая ошибочные загрузки, вызванные их собственными системами.

Правила использования в условиях

  • Условия запрещают использовать сервисы или результаты в конкурентных целях, включая обучение моделей, бенчмаркинг и конкурентный анализ.
  • Пользователи не должны выдавать аудиовывод за созданный человеком и обязаны давать требуемые законом уведомления о том, что он сгенерирован ИИ.
  • Результаты могут быть неуникальными, и Deepgram не заявляет, что пользователям принадлежат похожие результаты, созданные для других клиентов.
  • Защищённую медицинскую информацию нельзя отправлять, пока не подписано соглашение с деловым партнёром (BAA).

Использование данных и конфиденциальность

API-запросы по умолчанию участвуют в Model Improvement Program (программе улучшения моделей), и Deepgram их хранит. Условия позволяют Deepgram использовать входные и выходные данные клиентов для улучшения сервисов, в том числе для обучения и тестирования своих моделей.

  • Отказ: параметр mip_opt_out=true в запросе исключает его из хранения, а на региональном эндпоинте удерживает его в регионе, за исключением сторонних поставщиков Voice Agent. Для запросов с отказом после возврата ответа действует нулевое хранение аудио, текста, транскриптов и синтезированного аудио. Принудительное применение отказа на уровне всего аккаунта или развёртывания доступно по запросу в Deepgram.
  • Журналы: метаданные запросов и журналы использования доступны для получения в течение 90 дней, а сводные данные об использовании хранятся дольше.
  • Резидентность данных: полная гарантия обработки в регионе требует одновременно регионального эндпоинта и mip_opt_out=true. Запросы к эндпоинту ЕС никогда не маршрутизируются за пределы ЕС и при недоступности региона завершаются ошибкой, а не переключаются на резервный вариант.
  • Право собственности и передача: Deepgram не претендует на право собственности на входные и выходные данные клиентов. Deepgram заявляет, что не продаёт данные клиентов, не использует их для рекламных профилей и не распространяет их без разрешения.
  • Сфера действия политики: уведомление о конфиденциальности на сайте не распространяется на обработку данных клиентов.
  • Поток данных при самостоятельном хостинге: при типичном таком развёртывании в Deepgram не отправляются ни аудио, ни транскрипты, ни содержимое, позволяющее идентифицировать запросы.
  • Сертификация: Deepgram заявляет о сертификации SOC 2 Type 1 и Type 2. Deepgram подписывает соглашения с деловым партнёром с клиентами Enterprise, которые обрабатывают ePHI.

ЧаВо

Q1. Можно ли попробовать Deepgram бесплатно?

Да. Новые аккаунты Pay As You Go получают кредит $200 без привязки банковской карты; после этого использование тарифицируется поминутно, за 1 000 символов или за минуту подключения агента.

Q2. Использует ли Deepgram моё аудио для обучения моделей?

По умолчанию да: запросы участвуют в Model Improvement Program и хранятся. Добавление mip_opt_out=true к запросу исключает его и прекращает хранение его содержимого.

Q3. Может ли обработка оставаться в пределах ЕС?

Deepgram предлагает отдельный эндпоинт ЕС, запросы к которому не маршрутизируются за пределы ЕС. Для полной обработки в регионе нужно также отказаться от участия в улучшении моделей, а модели Whisper там недоступны.

Знаете похожий инструмент?
Если вы знаете другие отличные AI-инструменты, не стесняйтесь предлагать их нам