Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Deepgram — платформа голосового ИИ, которая предоставляется в виде API для разработчиков: распознавание речи для живого и записанного аудио, синтез речи, Voice Agent API и анализ Audio Intelligence. Deepgram объединяет распознавание речи, синтез речи и оркестрацию LLM в едином Voice Agent API, что, по словам компании, снижает сложность, задержку и затраты.
В январе 2026 года Deepgram сообщила, что привлекла 130 млн долларов в раунде серии C под руководством AVP при оценке в 1,3 млрд долларов. Компания также сообщила, что её продуктами и моделями голосового ИИ пользуются более 1 300 организаций, в том числе сервис для заметок на встречах Granola, стартап голосовых агентов Vapi и Twilio.
API распознавания речи Deepgram принимает потоковое аудио для транскрибации в реальном времени или записанные файлы для пакетной обработки.
Показатели точности и скорости приводит сам поставщик. Deepgram утверждает, что у Nova-3 доля ошибок в словах на 54,2 % ниже, чем у конкурентов, при потоковой обработке и на 47,4 % ниже при пакетной. Также компания заявляет, что выдаёт транскрипты быстрее чем за 300 миллисекунд. Подсказки ключевых терминов, как утверждается, улучшают распознавание важных слов и повышают полноту по ключевым словам до 90 %.
Voice Agent API включает обнаружение перебиваний, прогнозирование смены реплик, вызов функций и управление по ходу сессии. Команды могут подключить собственного поставщика LLM или TTS, сохранив оркестрацию и потоковый конвейер Deepgram.
Deepgram предоставляет управляемые LLM для типов поставщиков OpenAI, Anthropic, Google и NVIDIA, поэтому для них эндпоинт не нужен. Для моделей Groq и Amazon Bedrock нужен собственный эндпоинт, так как Deepgram этими LLM не управляет. У управляемых моделей есть ценовой уровень: claude-sonnet-4-5 указана как Advanced («Расширенный»), claude-haiku-4-5 — как Standard («Стандартный»), и уровень определяет поминутную ставку.
Audio Intelligence добавляет к транскриптам суммаризацию, определение тем, распознавание намерений и анализ тональности. Анализ тональности помечает положительную, нейтральную или отрицательную тональность на уровне слова, предложения и всего транскрипта. Эти функции работают на лёгких специализированных моделях, дообученных на разговорных данных, а не на универсальных больших языковых моделях.
API распознавания речи Deepgram ориентирован на транскрибацию в поддержке клиентов, здравоохранении, медиа и разговорном ИИ.
Deepgram продаётся в виде API и SDK, поэтому покупатель — обычно команда, которая пишет код.
Сервис хуже подходит для озвучки не на английском языке через Flux TTS или для проектов, которым нужна очень большая библиотека голосов.
Тарификация основана на использовании: цены Deepgram разделены по продуктам и моделям, а не по рабочим местам.
Pay As You Go начинается с бесплатного кредита $200, после чего оплата идёт по факту использования; Growth стоит от $4K+ в год. У Pay As You Go нет минимальных платежей и срока действия, а для начала не нужна банковская карта. Growth позволяет сэкономить до 20 % за счёт предоплаченных годовых кредитов, которые списываются по фактическому использованию. Условия Enterprise рассчитывает отдел продаж.
| Сервис | Pay As You Go | Growth |
|---|---|---|
| Распознавание речи (REST / WebSocket / Whisper Cloud) | до 50 / 150 / 5 | до 50 / 225 / 5 |
| Синтез речи (REST + WebSocket) | до 45 | до 60 |
| Voice Agent (WebSocket) | до 45 | до 60 |
| Audio Intelligence (REST) | до 10 | до 10 |
Цены на потоковое распознавание речи сейчас обозначены как временные промотарифы, поэтому обычные цены указаны в скобках.
| Модель | Режим | Pay As You Go | Growth |
|---|---|---|---|
| Flux английский | Потоковый | $0.0065/мин (обычно $0.0077) | $0.0057/мин (обычно $0.0065) |
| Flux многоязычный | Потоковый | $0.0078/мин | $0.0068/мин |
| Nova-3 одноязычный | Потоковый | $0.0048/мин (обычно $0.0077) | $0.0042/мин (обычно $0.0065) |
| Nova-3 многоязычный | Потоковый | $0.0058/мин (обычно $0.0092) | $0.0050/мин (обычно $0.0078) |
| Nova-3 одноязычный | Предзаписанный | $0.0043/мин | $0.0036/мин |
| Nova-3 многоязычный | Предзаписанный | $0.0052/мин | $0.0043/мин |
| Whisper Large | Предзаписанный | $0.0048/мин | $0.0048/мин |
Дополнительные функции оплачиваются сверх ставки модели:
Оплата посекундная, поэтому 14-секундный файл тарифицируется ровно как 14 секунд. Многоканальное аудио тарифицируется по общей обработанной длительности, поэтому 10-минутный стереофайл считается как 20 минут.
| Модель | Pay As You Go | Growth |
|---|---|---|
| Flux TTS | $0.0450 за 1 000 символов | $0.0405 за 1 000 символов |
| Aura-2 | $0.030 за 1 000 символов | $0.027 за 1 000 символов |
| Aura-1 | $0.0150 за 1 000 символов | $0.0135 за 1 000 символов |
До 31 декабря 2026 года расходы на Flux TTS на тарифах Pay As You Go и Growth компенсируются кредитами в том же размере, но не более $500. Бесплатный период разработки на Flux TTS длился до 12 сентября 2026 года, а с 13 сентября 2026 года действуют стандартные цены. В FAQ на странице продукта синтеза речи сказано, что Deepgram TTS стоит от $0.15 за 1 000 символов, что не совпадает со ставкой Aura-1 в таблице выше.
| Уровень Voice Agent | Pay As You Go | Growth |
|---|---|---|
| Стандартный | $0.075/мин | $0.068/мин |
| Стандартный со своим TTS | $0.065/мин | $0.051/мин |
| Индивидуальный со своими LLM и TTS | $0.050/мин | $0.041/мин |
| Расширенный | $0.163/мин | $0.146/мин |
| Расширенный со своим TTS | $0.122/мин | $0.110/мин |
Минуты Voice Agent считаются по времени WebSocket-подключения. Суммаризация на Pay As You Go стоит $0.0003 за 1 000 входных токенов и $0.0006 за 1 000 выходных токенов.
Большинство опубликованных сравнений в этой категории исходят от самих поставщиков.
API-запросы по умолчанию участвуют в Model Improvement Program (программе улучшения моделей), и Deepgram их хранит. Условия позволяют Deepgram использовать входные и выходные данные клиентов для улучшения сервисов, в том числе для обучения и тестирования своих моделей.
Да. Новые аккаунты Pay As You Go получают кредит $200 без привязки банковской карты; после этого использование тарифицируется поминутно, за 1 000 символов или за минуту подключения агента.
По умолчанию да: запросы участвуют в Model Improvement Program и хранятся. Добавление mip_opt_out=true к запросу исключает его и прекращает хранение его содержимого.
Deepgram предлагает отдельный эндпоинт ЕС, запросы к которому не маршрутизируются за пределы ЕС. Для полной обработки в регионе нужно также отказаться от участия в улучшении моделей, а модели Whisper там недоступны.