Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Cartesia — компания в области голосового ИИ, которая продаёт разработчикам речевые модели реального времени и размещённую платформу голосовых агентов, а себя называет ИИ-лабораторией, создающей голосовые модели и агентов реального времени. Cartesia предлагает единый API для генерации речи, транскрибации и рабочих голосовых агентов, достаточно быстрый для живого разговора.
Линейка продуктов состоит из трёх уровней. Cartesia Sonic — модель синтеза речи, Ink — модель распознавания речи, а управляемые агенты объединяют обе с большой языковой моделью для телефонных разговоров и разговоров в приложениях. Клонирование голоса построено поверх Sonic, а рядом с платным API есть бесплатный браузерный модулятор голоса.
Основатели познакомились во время аспирантуры в Stanford AI Lab, где, по их словам, изобрели модели пространства состояний (SSM) — архитектуру, которую Cartesia использует вместо стандартных трансформеров. Компания связывает свою скорость и стоимость с SSM, но это её собственное объяснение, а не результат измерений.
Cartesia предлагает ИИ-клонирование голоса двух уровней. Мгновенный клон создаётся из 10 секунд аудио, Sonic 3.6 и новее могут использовать до 60 секунд, чтобы сохранить акцент, а загружаемые файлы ограничены 16 МБ. Профессиональный клон дообучает модель минимум на 30 минутах записи одного диктора, а обучение занимает до 3 часов. Каждый профессиональный клон обучается только на одном языке за раз, поэтому многоязычному голосу бренда нужен отдельно записанный набор данных для каждого языка.
Управляемые голосовые агенты объединяют Ink-2, выбранную клиентом LLM и Sonic-3.6 в одного агента реального времени, который управляет очерёдностью реплик, перебиваниями, потоковой передачей аудио и вызовами инструментов. Агенты могут использовать три вида инструментов: встроенные системные, например завершение звонка; webhook-инструменты, отправляющие запросы на сервер клиента; и клиентские инструменты, которые работают в подключённом браузере, мобильном приложении или на сервере. Интеграцию LLM Cartesia обслуживает сама, поэтому отдельный аккаунт или API-ключ у поставщика модели не нужен. Встроенная система оценки добавляет живое тестирование, системные метрики и настраиваемую аналитику звонков.
Через API профессиональный клон голоса создаётся в четыре шага: создать набор данных, загрузить в него аудиофайлы, создать на его основе дообучение, затем получить список голосов, созданных дообучением.
Примеры Cartesia сосредоточены на телефонных агентах и клонированных голосах для медиа.
Для масштаба Cartesia приводит Bolna, которая, по словам Cartesia, обрабатывает более 500 000 голосовых звонков в день на индийских языках на низколатентной инфраструктуре Cartesia; это опубликованная вендором история клиента, а не независимый аудит.
Cartesia подходит командам, которые встраивают голос в собственное ПО, а не тем, кто ищет готовое потребительское приложение.
Хуже подходит командам, которым нужна потоковая транскрибация вне пяти языков Ink, тем, кто ждёт клонирования голоса на тарифе Free, и покупателям, которым нужны подписки с возвратом средств.
Cartesia тарифицирует голосовые модели в кредитах, а звонки агентов — в долларах; каждый тариф включает неограниченное число мест в рабочем пространстве. Месячные тарифы на 6 октября 2026 года:
| Тариф | Цена в месяц | Кредитов в месяц | Предоплаченные доллары для агентов | Что добавляет тариф |
|---|---|---|---|---|
| Free | $0 | 20 000 | $1 | Доступ к синтезу и распознаванию речи |
| Pro | $5 | 100 000 | $5 | Лицензия на коммерческое использование и мгновенное клонирование голоса |
| Startup | $49 | 1 250 000 | $49 | Всё из Pro плюс профессиональное клонирование голоса |
| Scale | $299 | 8 000 000 | $299 | Приоритетная поддержка и высокие лимиты параллельности |
| Enterprise | Индивидуально | Индивидуально | Индивидуально | Объёмные цены, настраиваемая параллельность, DPA и BAA, SSO |
На Free, Pro, Startup и Scale квоты Sonic-3.6 соответствуют примерно 27, 133, 1667 и 10 667 минутам в месяц при 2, 3, 5 и 15 параллельных запросах синтеза речи. Квоты Ink-2 составляют около 1 ч 51 мин, 9 ч 16 мин, 115 ч 44 мин и 740 ч 44 мин транскрибации при 8, 12, 20 и 60 параллельных запросах.
Сайт Cartesia утверждает, что её модели занимают первое место в рейтинге сторонней речевой арены и в рейтинге распознавания речи. Но рейтинг синтеза речи этой независимой арены для голосов провайдеров, основанный на слепом голосовании слушателей и зафиксированный 6 октября 2026 года, ставил Eleven v4 Turbo (Elo 1334), Eleven v4 (1321) и Qwen-Audio-3.1-TTS-Plus (1292) выше Sonic 3.6 (1278), а Gemini 3.8 Flash TTS (1275) шёл сразу за ней. На эту дату два утверждения не совпадали, и это сравнение охватывает только раздел арены с голосами провайдеров.
Для транскрибации Cartesia заявляет, что Ink-2 превосходит Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro и ElevenLabs Scribe-2-realtime на записях телефонных линий, речи с акцентом, зашумлённом аудио и звонках по финансовым результатам. Бенчмарк проведён самим вендором, но он называет потоковые модели, которые Cartesia считает прямыми конкурентами.
Да, частично. ИИ-модулятор голоса можно бесплатно попробовать без регистрации; у бесплатных преобразований есть дневной лимит, а загружать можно файлы WAV или MP3 меньше 15 МБ.
Нет. Кредиты расходуют только успешные запросы, а ошибки не тарифицируются.
Да, но с дополнительным шагом. Каждый мгновенный клон создаётся на одном языке, поэтому сначала клон делается на исходном языке, а другие языки добавляются через API добавления голосовых акцентов. Каждый добавленный голосовой акцент стоит 225 кредитов.
Эндпоинт Bytes может возвращать сырое аудио, WAV или MP3, а эндпоинты SSE и WebSocket — только сырое аудио. Поддерживаются частоты дискретизации от 8000 до 48 000 Гц.
Cartesia заявляет, что её система соответствия включает SOC 2 Type II, пригодность для HIPAA с BAA для клиентов из сферы здравоохранения и соответствие GDPR, а нулевое хранение данных доступно корпоративным клиентам для подходящих сервисов.