
Fish Audio — платформа синтеза речи и клонирования голоса, построенная вокруг управления эмоцией на уровне отдельного слова. Она клонирует голос по десятисекундному образцу, передаёт поток с задержкой менее 300 миллисекунд и публикует веса модели S2 — правда, по лицензии, ограниченной исследованиями и некоммерческим применением. Оператор — Hanabi AI Inc.
Пользовались этим инструментом? Оцените его
Пользовались этим инструментом? Оцените его
Fish Audio — это платформа речевого искусственного интеллекта, выстроенная вокруг одного ключевого убеждения: правильно произнести слова и правильно подать фразу — две разные задачи, и почти все системы синтеза речи до сих пор решали только первую. Главная страница сводит возможности к трём направлениям — синтез речи, клонирование голоса и распознавание речи, — и все три опираются на семейство моделей под названием S2.
По-настоящему определяющая черта этого продукта — управление выразительностью на уровне отдельного слова. Система не зачитывает ваш текст ровным тоном, а принимает встроенные в него метки на естественном языке, и именно они задают, как произнести тот или иной фрагмент. Демонстрационная область на главной странице открыто показывает весь набор эмоциональных меток: гнев и грусть, смущение, акцент, шёпот, мягкость, придыхание, воодушевление, — а рядом отдельная группа особых меток охватывает смех, усмешку, откашливание, всхлипывание, вздох, тяжёлое дыхание, а также короткие и длинные паузы. Техническое описание в собственном репозитории проекта точнее рекламного текста: там говорится о тонком управлении просодией и эмоцией ниже уровня слова с помощью меток на естественном языке при встроенной поддержке нескольких говорящих и многоходовых диалогов.
Оператор не анонимен, но с наименованиями стоит разобраться. В нижнем колонтитуле сайта указано, что права принадлежат Hanabi AI Inc. При этом файл лицензии с открытым исходным кодом требует указания авторства другого субъекта, и в оригинале он назван 39 AI, INC. Эта статья фиксирует оба имени, не сводя их воедино, поскольку сайт не поясняет связь между ними.
Сведения о финансировании и масштабе взяты из собственного объявления компании. Fish Audio привлекла 52 миллиона долларов посевных инвестиций к своей первой годовщине. Раунд возглавили совместно два института: первый называется Coreline Ventures, второй — Capital Today. Среди прочих участников значатся, в частности, 359 Capital и Play Time, а также HF0 и 645 Ventures. Тот же текст сообщает о росте команды с трёх до двадцати двух человек, о годовой регулярной выручке, поднявшейся с нуля до 21 миллиона долларов, о более чем 8 миллионах авторов и разработчиков на платформе и о более чем 2 миллионах голосовых моделей в общедоступной библиотеке. Все эти деловые показатели заявлены самой компанией и не проходили независимого аудита, поэтому читать их следует как утверждения компании, а не как проверенные величины. В том же тексте названы и руководители: генеральный директор Rissa Cao, ссылающаяся на несколько лет работы над речевым ИИ в Amazon и Meta, и главный научный сотрудник Shijia Liao, бывший инженер-исследователь NVIDIA, который начинал обучать модели у себя в комнате на одной видеокарте 4090.
В этом продукте есть две вещи, заслуживающие более строгой проверки, чем перечень функций, и статья разбирает обе подробно, а не вскользь. Первая: что платформа на самом деле требует в части согласия, когда вы клонируете чужой голос. Вторая: что здесь означает «открытый исходный код», ведь лицензия не относится к тому разрешительному типу, который обычно подразумевает это выражение. Ни один из ответов не является поводом отказаться от продукта, но оба меняют то, как им следует пользоваться.
Заявления о клонировании конкретны и, что редкость для этой категории, опираются на числа, а не на прилагательные. Страница продукта указывает, что достаточно десяти секунд эталонного аудио, что сквозная задержка потоковой передачи составляет менее 300 миллисекунд и что клонирование работает без предварительных примеров на тринадцати языках. То есть клонируете один раз, и тот же голос говорит на остальных поддерживаемых языках без переобучения и без второй сессии записи.
Именно это последнее свойство сильнее всего меняет рабочий процесс. Традиционный дубляж требует либо двуязычного актёра, либо отдельного голоса на каждый язык, и в результате один и тот же материал в каждом рынке звучит как другой человек. Межъязыковое клонирование без примеров означает, что однажды записанная голосовая идентичность может пройти через весь каталог.
Именно на стороне синтеза система эмоциональных меток раскрывается полностью. Вместо выбора из закрытого перечня «стилей» вы размечаете сам текст, и метки срабатывают ровно там, где стоят. Поэтому важна оговорка об уровне ниже слова: поставить акцент на конкретном слове внутри фразы — не то же самое, что задать настроение всей фразе, и именно здесь пролегает граница между чтением, которое звучит как чтение, и чтением, которое звучит как исполнение.
Платформа заметно шире одной точки доступа синтеза. В меню продуктов перечислены восемь самостоятельных инструментов: синтез речи, распознавание речи, клонирование голоса, изменение голоса, Story Studio, разделение вокала, перевод аудио и генерация звуковых эффектов. Про распознавание сказано, что расшифровка включает разделение говорящих, эмоциональные метки и описание на естественном языке, то есть на выходе получается структурированная расшифровка, а не просто блок текста.
Платформа содержит обширную библиотеку голосов, загруженных пользователями, — по собственному счёту более 2 000 000, — и описывает её как пригодную для художественного повествования, рекламы и аудиокниг. По широте это подлинное отличие от конкурентов. Одновременно именно эта часть продукта теснее всего переплетена с вопросами согласия, разбираемыми ниже, поскольку библиотеку такого размера наполняют пользователи, а не компания, отбирающая записи поштучно.
Веса открытой модели S2 опубликованы, и сайт продвигает самостоятельное развёртывание наравне с размещённым интерфейсом. По меркам сообщества репозиторий далеко не рядовой: на момент сбора данных он показывал 32 400 звёзд, 2 800 ответвлений, 101 участника и 14 выпусков, а сам себя описывает как проект синтеза речи с открытым исходным кодом высшего уровня. Что эта лицензия допускает в действительности, разбирается в отдельном разделе ниже, и ответ оказывается заметно уже, чем принято подразумевать под этим выражением.
Аудиокниги и длинная закадровая начитка. Сама компания формулирует это так: пять секунд — легко, пять минут — вот испытание. Синтез речи на уровне одной фразы годится уже десятилетие, но с ростом длительности проступают трещины. Длинная начитка — как раз то поле, где эмоциональные метки и управление темпом оправдывают себя, ведь ровное чтение становится невыносимым задолго до второй главы.
Озвучивание видео в темпе производства. Превратить сценарий в закадровый текст, совпадающий с картинкой, не бронируя студию, — самое массовое применение подобных инструментов. Возможность сменить интонацию и добавить эмоцию без перезаписи и делает правки дешёвыми.
Голоса персонажей для игр и анимации. Платформа прямо нацелена на эту область, и совпадение действительно есть: интерактивным медиа нужно много различающихся голосов, зачастую больше, чем проект способен оплатить живыми актёрами, и всё приходится создавать заново при каждой правке реплик.
Диалоговые агенты и поддержка клиентов. Здесь задержка потоковой передачи менее 300 миллисекунд — не витринный показатель. Голосовой агент, заметно запинающийся перед каждым ответом, воспринимается как сломанный, каким бы красивым ни был голос, поэтому задержка становится функциональным требованием, а не приятным дополнением.
Многоязычная локализация с одной записи. Межъязыковое клонирование без примеров позволяет записать один раз и сохранить ту же голосовую идентичность на поддерживаемых языках. Это полезно авторам с аудиторией в разных регионах, но раздел о количестве языков ниже стоит прочитать заранее.
Самостоятельное развёртывание ради задержек или требований к данным. Поскольку веса опубликованы, команды со строгими требованиями к месту хранения данных или с собственной инфраструктурой вывода могут запускать модель сами, не отправляя аудио третьей стороне. Однако допустимо ли именно ваше применение, определяет лицензия, и в этом суть соответствующего раздела.
Шаг 1 — попробуйте демонстрацию до регистрации. На главной странице есть рабочее поле синтеза с заранее вписанным текстом, показывающим систему меток, с ограничением в 30 000 знаков и открытыми наборами эмоциональных и особых меток. Это самый быстрый способ понять, работает ли такое управление выразительностью для вашей задачи.
Шаг 2 — заведите бесплатный аккаунт. Бесплатный тариф не требует платёжной карты и даёт 8 000 кредитов в месяц, до семи минут генерации, не более 500 знаков за раз и три общедоступных голосовых слота.
Шаг 3 — сначала решите: готовая библиотека или собственное клонирование. Для многих задач готовая библиотека быстрее и полностью обходит вопрос согласия. Клонирование нужно тогда, когда вам действительно требуется определённая голосовая идентичность — в идеале ваша собственная или та, на которую у вас есть документально оформленное разрешение.
Шаг 4 — запишите или подберите чистый десятисекундный образец. Десять секунд — заявленный минимум. Качество эталона важнее его длительности: чем чище источник, тем лучше клон, и страница продукта признаёт, что для очень выразительных голосов более длинный образец может помочь.
Шаг 5 — пишите текст с метками, а не только словами. Этот шаг новички используют меньше всего. Поставить акцент именно на том слове, которое действительно несёт смысл фразы, или длинную паузу там, где человек взял бы дыхание, — вот что отделяет результат, звучащий машинно, от результата, звучащего как исполнение.
Шаг 6 — до публикации проверьте свои коммерческие права. Это не необязательная формальность. Как разобрано ниже, коммерческий статус бесплатного тарифа изложен на сайте противоречиво, и ошибка означает публикацию монетизируемого материала без соответствующих прав.
Шаг 7 — переходите на интерфейс, когда это оправдано объёмом. Документация для разработчиков и справочник интерфейса размещены на отдельном поддомене, а платные тарифы дают доступ с оплатой по факту использования.
Ставьте метки скупо и точно. Эмоциональные метки — режиссёрский инструмент, а не украшение. Разметка каждой части предложения делает исполнение неровным; отметка лишь тех двух-трёх мест, что действительно несут эмоциональный вес отрывка, наоборот, звучит осмысленно.
Вкладывайтесь в эталонную запись, а не в повторные генерации. Клон наследует акустику своего источника. Десять секунд, записанные приличным микрофоном в тихой комнате, лучше минуты шумного телефонного аудио, и никакая повторная генерация не исправит изначально дефектный эталон.
Считайте в кредитах, а не в минутах. Опубликованное соотношение — примерно 600–625 кредитов на минуту генерации. При 8 000 кредитов бесплатного тарифа это почти в точности даёт заявленные семь минут. Зная соотношение, вы сравниваете тарифы расчётом, а не на глаз.
Помните, что кредиты не переносятся. Месячные квоты обнуляются в начале каждого расчётного периода, а неиспользованные минуты на следующий месяц не переходят, поэтому тариф, подобранный под пиковый месяц, в спокойные месяцы пропадает зря.
Проверьте свой язык до того, как связывать себя обязательствами. Как разобрано ниже, языковая поддержка изложена на страницах сайта четырьмя разными способами, а в открытом репозитории есть действующие сообщения об ошибках по отдельным письменностям. Несколько кредитов на представительный образец в целевом языке окончательно закрывают этот вопрос.
Для всего чувствительного используйте приватные голосовые слоты. Лицензионные условия для публичных материалов заметно шире, чем для приватных, а публичное содержимое может оставаться доступным и после удаления аккаунта. Выбор слота — решение о правах, а не вопрос упорядочивания.
Авторам, работающим на объёме. Видеоавторы, ведущие подкастов и создатели курсов, регулярно начитывающие материал, получают самую очевидную отдачу, поскольку экономия растёт вместе с объёмом.
Игровым и анимационным командам с большим числом ролей. Проекты с обширным составом персонажей или часто меняющимися репликами выигрывают заметнее, чем проекты с небольшим неизменным сценарием.
Разработчикам голосовых агентов. Сочетание документированного интерфейса, потоковой передачи менее 300 миллисекунд и опубликованных весов покрывает и размещённый, и самостоятельный архитектурный путь.
Командам локализации. Межъязыковое клонирование отвечает на реальную и дорогостоящую проблему многорыночного контента.
Исследователям и любителям. Опубликованные веса действительно применимы для исследований и некоммерческой работы — ровно тот случай, ради которого писалась лицензия.
Кому стоит быть осторожнее. Всякому, кто планирует коммерческое самостоятельное развёртывание, следует сначала прочитать раздел о лицензии ниже, поскольку ответ там по умолчанию отрицательный. Всякому, чьи требования соответствия нормам предполагают явные обязательства поставщика по обращению с биометрическими данными, стоит обратить внимание и на то, что политика конфиденциальности говорит, и ещё больше на то, о чём она умалчивает. А тому, кто собирается клонировать не свой голос, раздел о согласии нужнее любого перечня функций.
Fish Audio — прежде всего веб-приложение, работающее в любом современном браузере без установки. Путь для разработчиков — документированный интерфейс в стиле REST и наборы средств разработки; документация и справочник интерфейса размещены на отдельном поддомене.
Мобильные приложения существуют: в условиях обслуживания есть отдельный раздел, признающий, что их доступность зависит от сторонних магазинов, прямо называющий App Store компании Apple и магазин приложений Android и требующий соблюдать также собственные правила этих магазинов.
Самостоятельное развёртывание — официально продвигаемый третий путь. Страница продукта прямо перечисляет варианты: развернуть модель самому, обратиться к потоковой конечной точке с задержкой менее 300 миллисекунд или встроить голоса в ваши агенты и приложения. Какие из этих вариантов открыты именно вам, определяет лицензия.
Варианты корпоративного развёртывания вынесены отдельно и включают размещение на собственных мощностях, отказ от хранения данных и соответствие SOC2, с индивидуальной ценой по объёму и ежегодным выставлением счёта.
Ещё одно замечание о доступе: файл robots.txt сайта полностью открывает доступ поисковым роботам Google, Apple и Bing, но закрывает обычным роботам пути авторизации и синтеза речи.
Цены проверены непосредственно на странице тарифов. Важно учесть: на момент сбора данных накладывались две акции — три бесплатных месяца при годовой оплате и юбилейная скидка 50 процентов. Приведённые ниже месячные эквиваленты отражают эти акции, а базовые цены указаны рядом.
Бесплатный тариф. 0 долларов, платёжная карта не нужна. Включает 8 000 кредитов в месяц, до семи минут генерации, не более 500 знаков за раз, три общедоступных голосовых слота, обычную скорость генерации и улучшенное клонирование голоса.
Plus. В пересчёте 5,5 доллара в месяц при годовом счёте на 66 долларов против базовой месячной цены в 15 долларов. Включает 250 000 кредитов в месяц, до 200 минут, не более 15 000 знаков за раз, неограниченные публичные и десять приватных слотов, приоритетную генерацию, доступ к Voice Design и один профессиональный слот.
Pro. В пересчёте 37,5 доллара в месяц при годовом счёте на 450 долларов против базовых 100 долларов. Включает 2 000 000 кредитов в месяц, до 1 620 минут, три места для команды, не более 30 000 знаков за раз, неограниченные слоты, пять профессиональных слотов и семидневную гарантию возврата.
Max. В пересчёте 749 долларов в месяц при годовом счёте на 8 988 долларов против базовых 999 долларов. Включает 25 000 000 кредитов в месяц, до 6 250 минут, десять мест для команды и пятнадцать профессиональных слотов.
Корпоративный. Индивидуальная цена по объёму с ежегодным счётом для организаций с требованиями соответствия, с оплатой по факту использования и управлением на уровне организации, отказом от хранения данных, размещением на собственных мощностях и соответствием SOC2.
Опубликованное соотношение — примерно 600–625 кредитов на минуту генерации. Месячные квоты обнуляются в начале каждого расчётного периода, неиспользованные минуты не переносятся.
Этот пункт следует назвать прямо, потому что он напрямую решает, вправе ли вы публиковать созданное, — а сайт противоречит сам себе в пределах одной страницы.
В перечне возможностей бесплатного тарифа на странице цен присутствует пункт «коммерческое использование». Расположенные ниже на той же странице частые вопросы утверждают обратное: платные подписчики могут использовать в коммерческих целях принадлежащие им проверенные голоса, тогда как пользователи бесплатного тарифа вправе применять созданное только в личных некоммерческих проектах. Частые вопросы на главной странице поддерживают эту ограничительную трактовку и высказываются ещё определённее: бесплатный тариф предназначен только для личного использования, а для монетизации или коммерческого применения голосов необходимо перейти на платный тариф и получить полные коммерческие права.
Итак, два официальных высказывания утверждают, что бесплатный тариф ограничен личным использованием, а один официальный перечень возможностей говорит противоположное. Эта статья приводит обе трактовки, не примиряя их, поскольку примирение свелось бы к догадке. Разумно исходить из ограничительной трактовки и уточнить у поставщика до любой монетизации результатов бесплатного тарифа: последствия ошибки целиком ложатся на того, кто публикует.
Чаще всего в этой категории сравнивают с ElevenLabs, и Fish Audio участвует в этом сравнении напрямую: на сайте есть отдельный раздел сравнений, а в собственной карте сайта присутствует страница, позиционирующая продукт как альтернативу этому конкуренту. Явно поставить себя напротив этого закрепившегося игрока — осознанный выбор, и потенциальным пользователям стоит помнить, что сравнительная страница, выпущенная поставщиком о своём конкуренте, является рекламным материалом, а не независимым исследованием.
Утверждения компании в этой области заявлены ею самой и должны читаться соответственно: в сообщении о финансировании говорится, что S2.1 Pro в слепых тестах прослушивания предпочли 66 процентов слушателей по сравнению с ведущими конкурирующими моделями. Ни методика, ни размер выборки, ни состав слушателей в сообщении не приводятся, поэтому по одному этому источнику показатель независимо не проверяется.
Однако подлинная ось альтернатив — не другой размещённый поставщик, а выбор между собственной разработкой и покупкой, который открывают опубликованные веса. Для исследований и некоммерческой работы запуск модели своими силами — реальная возможность, которой большинство конкурентов не предоставляет. Для коммерческой работы эта возможность требует отдельной лицензии, и сравнение снова сводится к обычной оценке размещённого сервиса.
Это самый важный вопрос, и честный ответ таков: ответственность почти целиком лежит на пользователе, а платформа не проводит никакой предварительной проверки.
Наиболее ясная формулировка содержится в частых вопросах страницы клонирования и заслуживает точного изложения: именно вы отвечаете за подтверждение того, что располагаете необходимыми правами, согласиями и раскрытиями в отношении любого клонируемого голоса, и за соблюдение применимого права, включая нормы об имени, изображении и материалах, созданных ИИ, в вашем регионе. Тот же ответ описывает и подход к принуждению: платформа не согласовывает отдельные случаи использования заранее и может удалять материалы или аккаунты, нарушающие её условия либо закон. То есть механизм — последующее снятие, а не заслон перед клонированием.
Примечательно, что в юридически обязывающих документах требования о согласии как раз нет. Раздел условий обслуживания о разрешениях и ограничениях перечисляет семнадцать запретов от (a) до (q), и ни один из них не касается согласия на клонирование голоса отдельно. Ближе всего общая оговорка (a), запрещающая предоставлять что-либо, нарушающее права интеллектуальной собственности или иные права других лиц. Гарантия в отношении пользовательских материалов столь же обща: она запрещает материалы, нарушающие авторские или иные права третьих лиц, например права на товарный знак или на неприкосновенность частной жизни. Ни та, ни другая не устанавливает конкретной обязанности иметь документально оформленное согласие на клонируемый голос.
Между формулировкой о согласии и рекламным текстом на той же странице существует и напряжение. Заголовочный текст страницы клонирования приглашает ровно к тому применению, от которого предостерегает формулировка о согласии: поручить действующему главе государства озвучить ваше приложение для знакомств, представить вашу худшую идею голосом технологического миллиардера или собрать передачу целиком из вымышленных участников. Частые вопросы той же страницы усиливают это ожидание, отмечая, что большинство фрагментов с публичными лицами, отрывков передач или записей телефонного качества срабатывают с первой попытки. Выставлять клонирование узнаваемых публичных лиц на самое видное место в качестве достоинства и рядом помещать оговорку о необходимости получить их согласие — это действительно существующее несоответствие, и читателю следует взвесить обе стороны.
Одна смежная обязанность в условиях всё же есть: не распространять материалы вводящим в заблуждение образом, включая представление их как полностью созданных человеком. Платформа призывает по собственной инициативе раскрывать использование технологий ИИ, но формулирует это как пожелание, а не как обязанность. В нижнем колонтитуле предусмотрен канал сообщения о злоупотреблениях.
Практический вывод ясен. Если вы клонируете собственный голос, ничто из перечисленного вас не ограничивает. Если чужой — платформа не остановит вас и ничего не проверит, но одновременно снимет с себя ответственность и целиком переложит юридические риски на вас, а в отдельных правопорядках эти риски весьма значительны.
Сайт снова и снова подчёркивает открытость: открытая модель S2 подана как заголовочное достоинство, самостоятельное развёртывание — как поддерживаемый путь, а репозиторий называет себя проектом синтеза речи с открытым исходным кодом высшего уровня, за которым стоят 32 400 звёзд. Веса действительно опубликованы, и это правда. Но лицензия не разрешительная, и это различие имеет решающее коммерческое значение.
Репозиторий говорит недвусмысленно: эта кодовая база и сопутствующие веса модели выпущены по FISH AUDIO RESEARCH LICENSE, с предупреждением о мерах против любых нарушений. Эта лицензия, последний раз обновлённая 7 марта 2026 года, излагает своё намерение уже во введении: соглашение призвано бесплатно допустить исследовательское и некоммерческое использование материалов, а любое коммерческое использование требует отдельной лицензии от Fish Audio.
Раздел III устраняет всякую неопределённость: любое использование материалов или производных работ в коммерческих целях требует отдельного письменного лицензионного соглашения с Fish Audio, и настоящее соглашение не предоставляет никаких коммерческих прав. Коммерческие лицензии обсуждаются по указанному в лицензии деловому адресу.
Определение «коммерческой цели» достаточно широко, чтобы охватить большинство корпоративных сценариев: сюда входят создание, изменение или распространение вашего продукта либо услуги, в том числе через размещённый сервис или программный интерфейс; внутренняя деятельность вашей компании или организации; и любое использование в связи с продуктом или услугой, за которые вы взимаете плату либо получаете доход, прямо или косвенно. Одного лишь внутреннего применения в компании уже достаточно — перепродавать модель не требуется.
Ещё два отличия от разрешительных лицензий заслуживают внимания. Исследовательское разрешение описано как неисключительное, всемирное, непередаваемое, не допускающее сублицензирования, отзывное и безвозмездное; отзывность здесь ключевое слово, и в привычных разрешительных условиях ей нет соответствия. А распространение сопровождается обязанностями по указанию авторства: файл уведомления с закреплением авторских прав за 39 AI, INC. и заметное размещение надписи «Built with Fish Audio» на связанном сайте или в документации продукта. Лицензия также запрещает использовать материалы либо их выводы для создания или улучшения любой базовой генеративной модели ИИ.
Один пробел стоит зафиксировать. Лицензия включает по ссылке политику допустимого использования и делает её соблюдение условием лицензии, однако этот документ найти не удалось. Несколько возможных путей неизменно возвращают ошибку 404, и в собственной статической карте сайта такой страницы нет; там перечислены лишь главная, раздел обзора, генератор голоса, страница клиентов, корпоративная страница, страница альтернативы конкуренту, условия, конфиденциальность и юридические сведения для Японии. То, что обязывающее условие отсылает к документу, недоступному пользователям, — проблема документации, которую стоит прояснить у поставщика прежде, чем опираться на эту лицензию.
Коротко: открытые веса — да; открытый исходный код в разрешительном смысле — нет. Исследования и любительское применение бесплатны и действительно разрешены. Любое коммерческое использование, включая внутреннее корпоративное, требует отдельного платного соглашения, что бы ни подразумевала рекламная страница.
В политике конфиденциальности указана дата вступления в силу 28 августа 2024 года. Полнотекстовая проверка не обнаружила в её тексте ни одного вхождения слов «voice», «biometric» и «train». Для продукта, чья основная функция состоит в захвате и воспроизведении человеческих голосов, отсутствие каких-либо положений о голосе или биометрических данных является существенным пробелом; это также означает, что политика ничего не сообщает о том, используются ли пользовательские материалы для обучения или улучшения моделей. Исходя из имеющихся данных, честная формулировка состоит в том, что политика по этим вопросам молчит, а не в том, что некая защита существует или отсутствует.
Загруженное аудио попадает в общую категорию пользовательского содержимого, определяемую политикой как персональные сведения, содержащиеся во вводимых данных, загружаемых файлах или отзывах, направляемых сервису. Среди перечисленных для этой категории третьих лиц значатся поставщики услуг, рекламные партнёры, аналитические партнёры и деловые партнёры.
Условия куда конкретнее описывают права, которые вы отдаёте, чем те, что сохраняете. Предоставляемые платформе лицензии на пользовательские материалы являются безвозмездными, бессрочными, допускающими сублицензирование, безотзывными и всемирными.
Удаление, соответственно, ограничено. При удалении аккаунта платформа перестаёт показывать ваши материалы другим пользователям, за прямо оговорённым исключением публичных материалов, которые могут оставаться полностью доступными; условия к тому же признают, что полностью удалить это содержимое из их записей может оказаться невозможным.
Публичные материалы несут самые широкие условия из всех: они включают право использовать, отображать, исполнять и распространять публичный материал в маркетинговых и рекламных целях, а также лицензию всем прочим пользователям на доступ к нему и осуществление прав в отношении него. Именно поэтому выбор между приватным и публичным слотом является решением о правах. Это же служит полезным фоном для понимания общедоступной библиотеки из более чем 2 миллионов голосов: она существует ровно потому, что публичные загрузки несут эти условия.
Официальные страницы приводят четыре несовместимых числа, и эта статья приводит все четыре, не усредняя. Страница клонирования говорит о межъязыковой работе без примеров на тринадцати языках. Раздел об интерфейсе на главной странице упоминает более тридцати языков. Частые вопросы страницы синтеза перечисляют лишь восемь — английский, японский, корейский, китайский, французский, немецкий, арабский и испанский — и отдельно рекламируют автоматическую поддержку восьми языков с родным произношением. Сообщение о финансировании заявляет более 83 языков с родной интонацией.
Возможно, эти утверждения описывают разное: клонирование против синтеза либо полную поддержку против поддержки по мере возможности. Но сайт этого различия не поясняет, поэтому проверяйте свой язык опытным путём, а не полагайтесь на отдельно взятое число.
Сообщения сообщества подкрепляют эту осторожность. В открытом репозитории есть действующие обращения о том, что ввод на гурмукхи для панджаби неверно обрабатывает знаки удвоения согласного и назализации, а также связанная просьба улучшить произношение панджаби за счёт латинской транслитерации с учётом диакритики либо преобразования графем в фонемы. На момент сбора данных репозиторий показывал 7 открытых обращений против 684 закрытых — здоровое соотношение сопровождения, но одновременно свидетельство неравномерного качества по языкам.
Проверки материалов до публикации нет. Собственная правовая оговорка репозитория гласит: ответственность за любое противоправное использование кодовой базы не принимается, и следует обращаться к местным законам, в частности об авторском праве в цифровую эпоху. Вместе с отказом от предварительного согласования ответственность последовательно смещается вниз по цепочке.
Обратная разработка и конкурирующие модели запрещены. Условия запрещают попытки получить исходный код, лежащие в основе компоненты моделей или алгоритмы, а также отдельно запрещают использовать выводы сервиса для разработки конкурирующих моделей.
Возрастные требования. Пользователям должно быть не менее 13 лет, лицам младше 18 требуется согласие родителей, а платформа заявляет, что не собирает сознательно идентифицирующие сведения о детях младше 16 лет.
Данные каталогов устаревают быстро. Сохранённая для этой записи категория значилась как «мода», а среди меток были «мода» и «шаблоны» — очевидно ошибочные для продукта синтеза речи, — и сохранённое описание упоминало более 1 000 голосов, тогда как сайт теперь заявляет более 2 000 000. Быстро развивающиеся продукты обгоняют собственные каталожные записи; текущие цифры сверяйте на сайте.
Существует настоящий бесплатный тариф без платёжной карты, дающий 8 000 кредитов в месяц, до семи минут генерации, ограничение в 500 знаков за раз и три общедоступных голосовых слота. Вправе ли вы использовать полученное коммерчески, по сайту действительно неясно: перечень возможностей бесплатного тарифа упоминает коммерческое использование, тогда как частые вопросы на той же странице и на главной странице оба указывают, что результаты бесплатного тарифа предназначены только для личных некоммерческих целей. Исходите из ограничительной трактовки и уточните у поставщика прежде, чем что-либо монетизировать.
Платформа возлагает эту ответственность целиком на вас и не проводит предварительной проверки. Частые вопросы её страницы клонирования указывают, что именно вы отвечаете за подтверждение наличия необходимых прав, согласий и раскрытий в отношении любого клонируемого голоса и за соблюдение норм об имени, изображении и материалах, созданных ИИ, в вашем регионе. Там же сказано, что отдельные случаи использования заранее не согласовываются, а материалы или аккаунты могут быть удалены впоследствии. Важно: обязывающие условия обслуживания не содержат положения, прямо требующего согласия на клонирование голоса, — есть лишь общие запреты нарушать права других, — тогда как рекламный текст той же страницы продукта активно подсказывает клонировать публичных лиц. Юридически риск ваш.
Веса и правда опубликованы, но лицензия не разрешительная. И кодовая база, и веса модели выпущены по исследовательской лицензии Fish Audio, которая во введении указывает, что призвана бесплатно допустить исследовательское и некоммерческое применение, тогда как любое коммерческое использование требует отдельной лицензии. Её раздел III не предоставляет никаких коммерческих прав вовсе. Бесплатно для исследований, учёбы и любительского применения; отдельное платное соглашение для всего остального.
По публичной лицензии нет. Её определение коммерческой цели прямо включает создание, изменение или распространение вашего продукта либо услуги, в том числе через размещённый сервис или интерфейс, внутреннюю деятельность вашей организации и любое использование, связанное с продуктом или услугой, приносящими доход прямо либо косвенно. Одного внутреннего корпоративного применения достаточно. Требуется отдельное письменное соглашение, которое можно получить по указанному в лицензии деловому адресу. Учтите также, что исследовательское разрешение отзывно, в отличие от привычных разрешительных лицензий.
Заявленный минимум — десять секунд чистой речи, причём страница продукта отмечает, что для очень выразительных голосов более длинный образец может помочь. Качество эталона важнее длительности: чистый короткий образец лучше длинной шумной записи. Платформа также указывает, что клонирование межъязыковое и работает без примеров на тринадцати языках, поэтому одна запись переносится на остальные поддерживаемые языки без переобучения.
Сайт даёт четыре разных ответа, и эта статья не выбирает за вас. Страница клонирования называет тринадцать языков для межъязыкового клонирования, главная страница — более тридцати, частые вопросы страницы синтеза перечисляют восемь языков и рекламируют автоматическую поддержку восьми языков с родным произношением, а сообщение о финансировании заявляет более 83. Вероятно, речь идёт о разных возможностях, но сайт не поясняет, о каких именно. Прежде чем связывать себя обязательствами, создайте пробный образец на целевом языке: в открытом репозитории есть действующие сообщения об ошибках по отдельным письменностям, включая обработку знаков удвоения согласного и назализации в гурмукхи для панджаби.
На момент сбора данных было четыре платных тарифа с наложением акций. Plus выходит в 5,5 доллара в месяц при годовом счёте на 66 долларов против базовых 15 долларов, с 250 000 кредитов в месяц. Pro — 37,5 доллара в месяц при годовом счёте на 450 долларов против базовых 100 долларов, с 2 000 000 кредитов и тремя местами для команды. Max — 749 долларов в месяц при годовом счёте на 8 988 долларов против базовых 999 долларов, с 25 000 000 кредитов и десятью местами. Корпоративный тариф индивидуален и выставляется ежегодно. Примерно 600–625 кредитов соответствуют минуте генерации, а неиспользованные кредиты не переносятся.
Политика конфиденциальности об этом не говорит. Полнотекстовая проверка не выявила ни «train», ни «voice», ни «biometric»; документ вступил в силу 28 августа 2024 года. То есть публичных обязательств по этому вопросу нет ни в одну, ни в другую сторону, и было бы неверно утверждать защиту, которой в документе не содержится. Загруженное аудио попадает в общую категорию пользовательского содержимого, среди перечисленных получателей которой значатся поставщики услуг, рекламные, аналитические и деловые партнёры. Если этот вопрос важен для вашего соответствия нормам, обратитесь к поставщику напрямую и учтите, что корпоративный тариф выносит отказ от хранения данных в отдельную возможность.
Удаление частичное, а не полное. Условия указывают, что при удалении аккаунта платформа перестаёт показывать ваши материалы другим пользователям, но прямо исключают публичные материалы, которые могут оставаться полностью доступными, и признают, что полное удаление из их записей может оказаться невозможным. Поскольку предоставляемые лицензии бессрочны, допускают сублицензирование и безотзывны, а публичные материалы дополнительно дают рекламные права и доступ всем прочим пользователям, выбор приватного, а не публичного слота — содержательное решение, а не вопрос упорядочивания.
В нижнем колонтитуле указана Hanabi AI Inc., тогда как лицензия с открытым исходным кодом требует указания авторства 39 AI, INC. Оба имени зафиксированы здесь, а сайт связь между ними не поясняет. Компания объявила о 52 миллионах долларов посевных инвестиций к своей первой годовщине; один из ведущих институтов этого раунда носит название Coreline Ventures, а другой ведущий институт — Capital Today. Собственное сообщение называет команду из двадцати двух человек, годовую регулярную выручку в 21 миллион долларов, более 8 миллионов пользователей платформы и более 2 миллионов голосовых моделей сообщества, а также поимённо указывает генерального директора Rissa Cao и главного научного сотрудника Shijia Liao. Эти деловые показатели заявлены самой компанией и независимого аудита не проходили.