このツールを使いましたか?評価してください
Fish Audioは、ひとつの核心的な判断の上に築かれた音声AIプラットフォームです。言葉を正しく読むことと、話を届けることは別々の問題であり、大半の音声合成システムはこれまで前者しか解いてこなかった、という判断です。公式サイトのトップページは能力を三つの筋に整理しています。テキスト読み上げ、声のクローン、そして音声認識です。この三つはS2という名のモデル群を共有しています。
この製品を本当に特徴づけているのは、単語単位での表現の制御です。システムは原稿を平坦に読み下すのではなく、文中に埋め込まれた自然言語のタグを受け取り、そのタグがその箇所をどう読むかを指示します。トップページのデモ領域は感情タグの一式をそのまま見せています。怒りや悲しみ、戸惑い、強調、ささやき、柔らかさ、息づかい、高揚などが含まれ、別に用意された特殊タグの一群が笑いや含み笑い、咳払い、すすり泣き、ため息、荒い息、そして短い間と長い間までを扱います。プロジェクト自身のコードリポジトリが示す技術的な説明は、宣伝文句よりも正確です。自然言語のタグを使って部分語のレベルで韻律と感情を細かく制御し、同時に複数話者と複数ターンの対話生成を標準で扱う、という内容です。
運営会社は匿名ではありませんが、名称は一度整理しておく必要があります。サイトのフッターにはHanabi AI Inc.が著作権を保有すると記されています。一方、オープンソースのライセンスファイルが求める著作権表示は別の主体を指しており、原文では39 AI, INC.となっています。本記事は両方の名称をそのまま記録し、まとめることはしません。公式サイトが両者の関係を説明していないからです。
資金調達と規模は、会社自身の発表で確認できます。Fish Audioは創業一周年に5,200万ドルのシード資金を調達しました。このラウンドは二つの機関が共同で主導しています。一方の機関の名はCoreline Venturesといい、もう一方はCapital Todayです。追加の出資者としては359 CapitalやPlay Timeなどが名を連ね、HF0や645 Venturesなども参加しています。同じ記事は、チームが3人から22人に増えたこと、年間経常収益がゼロから2,100万ドルになったこと、プラットフォーム上に800万人を超える制作者と開発者がいること、コミュニティの音声ライブラリに200万を超える音声モデルがあることを述べています。これらの事業指標はいずれも会社の自己申告であり独立した監査を受けていないため、検証済みの数値ではなく会社の主張として読むべきものです。同じ記事は中核メンバーも実名で明かしています。最高経営責任者のRissa Cao氏はアマゾンとメタで長年音声AIに携わったと述べ、主任科学者のShijia Liao氏はエヌビディアの研究エンジニア出身で、当初は自室で4090のグラフィックスカード一枚でモデルを学習させていました。
この製品には、機能一覧よりも厳しい検討に値することが二つあり、本記事はどちらも下で個別に扱います。ひとつめは、他人の声をクローンするときにプラットフォームが実際に何を求めているのかということ。ふたつめは、ここで言う「オープンソース」が正確に何を意味するのかということです。このライセンスは、その言葉が普通に含意する寛容な種類のものではないからです。どちらの答えもこの製品を使わない理由にはなりませんが、どう使うべきかは変えます。
クローン側の訴求は具体的で、この分野では珍しく形容詞ではなく数字を出しています。製品ページは、参照音声は10秒あれば足りること、端から端までのストリーミング遅延が300ミリ秒未満であること、そしてクローンが13言語にまたがるゼロショットの言語横断方式であることを明記しています。一度クローンしてしまえば同じ声が対応する他の言語を話せるようになり、再学習も二度目の収録も要らないという意味です。
この最後の性質が、作業の流れを最も大きく変えます。従来の吹き替えは二言語を話す演者を探すか、言語ごとに別の人を立てるしかなく、その結果、同じ作品が市場ごとに別人のように聞こえていました。ゼロショットの言語横断クローンは、一度録った声の同一性が作品群全体を貫けることを意味します。
テキスト読み上げの側こそ、感情タグの体系が働く場所です。固定された「スタイル」の一覧から選ぶのではなく、原稿そのものに注記を入れ、タグはそれが現れた位置で効きます。部分語のレベルという言い方が重要な理由はここにあります。文中の特定の一語に強調を置くことと、文全体にひとつの気分を設定することは別の能力であり、それがすなわち「原稿を読んでいるように聞こえる」結果と「演じているように聞こえる」結果を分ける差です。
このプラットフォームは音声合成の一機能よりずっと広い範囲を持ちます。製品メニューには八つの独立したツールが並びます。テキスト読み上げ、音声認識、声のクローン、ボイスチェンジャー、Story Studio、ボーカル分離、音声翻訳、効果音生成です。音声認識の側は、書き起こしの結果に複数話者と感情タグ、自然言語による説明が含まれると謳っています。つまり出てくるのは素のテキストの塊ではなく、構造化された書き起こしだということです。
プラットフォームは利用者が投稿した膨大な音声ライブラリを抱えており、公式の集計では200万件を超え、創作的な語りや広告、オーディオブックに向くと紹介されています。幅という点でこれは本物の差別化要素です。同時にこの部分は、後で扱う同意の問題と最も深く絡んでもいます。この規模のライブラリは、会社が一件ずつ選んで並べたものではなく、利用者が埋めたものだからです。
S2のオープンソースモデルの重みは公開されており、公式サイトもセルフホストをホスト型のAPIと並ぶ選択肢として打ち出しています。コミュニティの指標で見ればこのリポジトリは軽いものではありません。取得時点で星が3万2,400、フォークが2,800、貢献者が101人、リリースが14本あり、リポジトリは自らを最高水準のオープンソース音声合成プロジェクトと称しています。ただしこのライセンスが実際に何を許すのかは下に節を設けてあり、その答えは「オープンソース」という語が普通に含意するよりずっと狭いものです。
オーディオブックと長尺のナレーション。 会社自身の言い方では、五秒は簡単で、五分が試金石です。音声合成は一文の水準なら十年前から使い物になっていましたが、長くなると綻びが出ます。長尺のナレーションこそ、感情タグと間の制御が値打ちを示す場所です。平板な読みは第二章に届く前に聞くのがつらくなるからです。
制作の速度に合わせた動画のナレーション。 原稿を場面に合ったナレーションに変えつつ収録スタジオを押さえずに済むことが、この種のツールの最も量の多い使い道です。録り直さずに口調を変え、感情を足せることが、繰り返しの修正を安くします。
ゲームとアニメーションのキャラクターボイス。 プラットフォームが明確に狙っている領域であり、実際によく噛み合います。インタラクティブな媒体は互いに異なる声を大量に必要とし、多くの場合その全てに実演者を立てる予算はなく、台詞が変わるたびに作り直す必要があるからです。
対話型エージェントとカスタマーサポート。 この場面では300ミリ秒未満のストリーミング遅延は見栄えのための数字ではありません。返答のたびに目に見えて詰まる音声エージェントは、声がどれだけ良くても壊れているように感じられるので、遅延はおまけではなく機能上の要件です。
一度の収録による多言語のローカライズ。 ゼロショットの言語横断クローンは、一度録れば対応言語のあいだで同じ声の同一性を保てるという意味です。読者が地域をまたぐ制作者には有用ですが、言語数についての下の節を先に読んでおくとよいでしょう。
遅延やデータの都合によるセルフホスト。 重みが公開されているため、データの所在に厳しい要件を持つ、あるいは自前の推論基盤を持つチームは、音声を第三者に送らずに自分でモデルを動かせます。ただしあなたの具体的な用途が許されるかどうかはライセンスが決めるものであり、それが下の節の要点です。
手順1 — 登録の前にトップページのデモを試す。 トップページには実際に動くテキスト読み上げの入力欄があり、タグの体系を示す原稿があらかじめ入っていて、文字数の上限は3万、感情タグと特殊タグの一覧がそのまま見えます。この表現の制御があなたの用途で本当に効くかを判断する最短の方法です。
手順2 — 無料アカウントを作る。 無料プランはクレジットカードが不要で、毎月8,000クレジット、最長7分の生成、一回あたり最大500文字、公開の音声枠を3つ提供します。
手順3 — 既存のライブラリを使うか自分でクローンするかを先に決める。 多くの仕事では既存のライブラリのほうが速く、しかも同意の問題を丸ごと迂回できます。クローンは特定の声の同一性がどうしても必要な場面のためのものであり、その声は自分自身のものか、書面での許諾を得たものであるべきです。
手順4 — きれいな10秒の参照音声を録るか選ぶ。 10秒は公式が示した下限です。参照音声は長さより品質が効きます。元が澄んでいるほどクローンは良くなり、製品ページも表現の豊かな声には長めのサンプルが役に立つと認めています。
手順5 — 原稿は言葉だけでなくタグも書く。 新しい利用者が最も使いこなせていない手順です。その一文の意味を実際に支えている語に強調のタグを置くこと、人なら息を継ぐところに長い間を入れることこそ、機械が作ったように聞こえる出力と、誰かが演じたように聞こえる出力を分ける境目です。
手順6 — 公開する前に商用の権利を確かめる。 これは省いてよい雑務ではありません。下に整理したとおり、無料プランの商用可否はサイトの複数の場所で食い違って書かれており、判断を誤れば権利のないまま収益化した内容を公開することになります。
手順7 — 量が増えたらAPIに移す。 開発者向けの文書とAPIリファレンスは文書用のサブドメインで提供され、有料プランは従量課金のAPI利用を提供します。
タグは少なく、的確に。 感情タグは演出の道具であって装飾ではありません。節ごとにタグを付けると演技が不安定に聞こえます。その一段落の感情の重みを実際に背負っている二、三か所だけを示してこそ、意図されたものに聞こえます。
作り直しの回数ではなく参照録音に手をかける。 クローンは元の音声の音響的な性質をそのまま受け継ぎます。静かな部屋でまともなマイクで録った10秒は、雑音の混じった電話の録音一分に勝りますし、もともと難のある参照音声はいくら作り直しても救えません。
分ではなくクレジットで予算を組む。 公開されている換算は、生成一分あたりおよそ600から625クレジットです。無料プランの毎月8,000クレジットに当てはめると、そのプランが掲げる7分とほぼぴったり合います。この換算を知っておけば、プランの比較は当て推量ではなく計算になります。
クレジットは繰り越されないことを覚えておく。 毎月の割り当ては請求周期の初めに戻り、使い残した分は翌月に持ち越されないため、繁忙月に合わせて選んだプランは閑散期には無駄になります。
投じる前に自分の言語で試す。 下に整理したとおり、このプラットフォームの言語対応は自身のページ群で四通りに述べられており、公開リポジトリには特定の文字についての未解決の不具合報告があります。クレジットをいくらか使って対象言語で代表的なサンプルを作れば、この問いには決着がつきます。
機微な内容にはすべて非公開の音声枠を使う。 公開した投稿のライセンス条件は非公開のものより目に見えて広く、公開した内容はアカウント削除の後も残る場合があります。枠の選択は整理の好みではなく権利上の判断です。
量を出す制作者。 日常的にナレーションを載せる動画制作者やポッドキャストの配信者、講座の制作者が最も明確に得をします。浮く費用が産出量に比例して大きくなるからです。
多数の声が要るゲームとアニメーションのチーム。 大所帯の配役が必要な、あるいは台詞が頻繁に変わる企画のほうが、小さく固定された脚本の企画より得るものが大きくなります。
音声エージェントを作る開発者。 文書の整ったAPI、300ミリ秒未満のストリーミング、公開された重みという三点が、ホスト型とセルフホストという二つの設計上の選択肢を両方とも覆います。
ローカライズのチーム。 言語横断のクローンは、多市場の作品において実在し、しかも高くつく問題に応えます。
研究者と趣味の利用者。 公開された重みは研究と非商用の作業に本当に使えます。まさにその場合こそ、このライセンスが許すために書かれた状況です。
慎重になるべき人。 商用のセルフホスト運用を考えている人は、まず下のライセンスの節を読む必要があります。既定の答えが不可だからです。生体情報の取り扱いについて事業者の明示的な約束が必要な法令順守の環境にあるなら、プライバシーポリシーが何を述べ、何を述べていないかの両方に目を向けるべきです。そして自分のものでない声をクローンしようとしている人には、機能一覧よりも下の同意に関する節のほうが必要です。
Fish Audioは主にウェブアプリケーションで、最近のブラウザであれば導入作業なしに使えます。開発者向けの通り道は文書の整ったREST形式のインターフェースとSDKであり、文書とAPIリファレンスは自社の文書用サブドメインにあります。
モバイルアプリケーションも存在します。利用規約にはモバイルアプリケーションの条項があり、その入手可否が第三者のストアに依存することを認め、アップルのApp Storeとアンドロイドのアプリ市場を名指しし、利用者がそれらのストア自身の規約にも従うことを求めています。
セルフホストは公式が推す三つめの道です。製品ページは選択肢をそのまま並べています。モデルを自分で配置するか、300ミリ秒未満のストリーミング用の接続先を呼ぶか、声をあなたのエージェントやアプリケーションに載せるかです。この三つのうちどこまでがあなたに開かれているかは、ライセンスが定めます。
企業向けの導入の選択肢は別に示され、オンプレミスでの配置とデータを保持しない運用、SOC2への準拠を含み、価格は数量に応じた個別見積もりを年単位で請求する形です。
もうひとつ、参照の可否についての記録を添えます。サイトのrobots.txtはグーグルとアップル、ビングのクローラーには全面的に開いている一方、一般のクローラーには認証用の経路とテキスト読み上げの経路への参照を禁じています。
料金はプランのページで直接確認しました。留意すべきは、取得した時点で二つの割引が重なっていたことです。年払いで三か月無料という施策と、周年記念の五割引です。したがって以下の月額換算は割引後の金額であり、月払いの定価も併記します。
無料プラン。 月額0ドル、クレジットカード不要。毎月8,000クレジット、最長7分の生成、一回あたり最大500文字、公開の音声枠3つ、標準の生成速度、強化された声のクローンを含みます。
Plus。 月額換算5.5ドル、年間66ドルの請求、月払いの定価は15ドル。毎月25万クレジット、最長200分の生成、一回あたり最大15,000文字、無制限の公開枠と非公開枠10、優先的な生成に加えて、Voice Designという機能を利用する権限と、専門用途の音声枠を1つ含みます。
Pro。 月額換算37.5ドル、年間450ドルの請求、定価100ドル。毎月200万クレジット、最長1,620分、チーム席3、一回あたり最大30,000文字、無制限の音声枠、専門用途の音声枠5つ、7日間の返金保証を含みます。
Max。 月額換算749ドル、年間8,988ドルの請求、定価999ドル。毎月2,500万クレジット、最長6,250分、チーム席10、専門用途の音声枠15を含みます。
エンタープライズ。 個別見積もりを年単位で請求し、法令順守の要件を持つ組織を対象に、組織単位の統制が付いた従量課金とデータを保持しない運用、オンプレミスでの配置、SOC2への準拠を挙げています。
公開されている換算は、生成一分あたりおよそ600から625クレジットです。毎月の割り当ては請求周期の初めに戻り、使い残した分は繰り越されません。
この点ははっきり指摘しておく必要があります。生成したものを公開できるかどうかを直に左右するのに、サイトが同じページの中で自ら食い違っているからです。
プランのページの無料プランの機能一覧には、商用利用という項目が入っています。ところが同じプランのページの下にあるよくある質問は逆のことを述べます。有料の契約者は自分が所有する検証済みの音声を商用目的に使えるが、無料プランの利用者は生成した内容を個人的で非商用の用途にしか使えない、という内容です。トップページのよくある質問もこの制限的な読み方と一致し、さらに明確です。無料プランは個人利用に限られ、収益化したり商用に使ったりするには有料プランに上げて初めて完全な商用の権利を得る、というものです。
つまり二か所の公式の記述は無料が個人利用限定だと述べ、一か所の公式の機能一覧は逆を述べています。本記事は両方の読み方をそのまま伝え、すり合わせません。すり合わせた時点で推測になるからです。安全な進め方は制限的な読み方を前提に運用し、無料プランの成果物を収益化する前に事業者に確認することです。判断を誤ったときの不利益は、まるごと公開する側が負います。
この分野で最もよく引き合いに出される比較対象はElevenLabsであり、Fish Audioはその比較に自ら加わっています。サイトには専用の比較の区画があり、自身のサイトマップにも競合の代替を扱うページが入っています。この既存の強者の向かいに自らを置くのは意図された選択であり、見込みの利用者としても、ある事業者が競合について公開した比較ページは独立した検証ではなく販促の資料である点を踏まえておくのが賢明です。
この領域における会社の主張は自己申告であり、そのように読むべきものです。資金調達の発表文は、S2.1 Proが盲検の試聴テストで主要な競合モデルよりも聴取者の66%に好まれたと述べています。ただしその発表文には手法や標本の規模、聴取者の構成が併記されていないため、この出典だけでは独立に検証できません。
もっとも、本当の代替の軸は別のホスト型事業者ではなく、公開された重みが開く自前構築と購入のあいだの選択です。研究と非商用の作業であれば、モデルを自分で動かすことは多くの競合が提供していない本物の選択肢です。商用の作業であれば、その選択肢には別途のライセンスが要り、その時点で比較はごく普通のホスト型サービスの評価へと戻ります。
これが最も重要な問いであり、正直な答えはこうです。責任はほぼ全面的に利用者にあり、プラットフォームは事前の確認を一切行いません。
最も明快な記述は声のクローンのページのよくある質問にあり、そのまま引く価値があります。クローンしようとするどの声についても、必要な権利と同意、開示を得ているかを確認する責任は利用者にあり、自分の地域における氏名や肖像、AI生成物に関する法律を含めて適用される法に従わなければならない、という内容です。同じ回答は運用の姿勢も示しています。個別の用途を事前に承認することはなく、規約や法に反する内容やアカウントを事後に削除することがある、というものです。つまり仕組みはクローンの前に立つ関門ではなく、事後の取り下げです。
目を引くのは、拘束力のある法的文書の側にはむしろ同意の要件が見当たらないことです。利用規約の許諾と制限を扱う節は(a)から(q)まで十七の禁止行為を並べていますが、そのうち声のクローンの同意を名指しで扱う条項はひとつもありません。最も近いのは、他人の知的財産権やその他の権利を侵害するものを一切提供させないという包括的な(a)項です。利用者の投稿に関する保証条項も同じく包括的で、第三者の著作権やその他の権利、たとえば商標やプライバシーの権利を侵害する投稿を禁じるにとどまります。どちらも、クローンする声について文書化された同意を保持せよという具体的な義務を課してはいません。
同意の文言と、同じページの販促の文言のあいだにも緊張があります。声のクローンのページの見出しの文案は、その同意の文言が戒めているまさにその用途を誘います。現職の大統領にあなたのマッチングアプリの語りをさせ、技術界の億万長者の口ぶりであなたの最悪の着想の発表会を開き、架空の出演者だけの番組を作る、といった具合です。同じページのよくある質問は、著名人の切り抜きや番組の編集音源、電話品質の録音でもたいてい一度目でうまくいくと付け加え、その期待をさらに強めています。見分けのつく著名人のクローンを最も目立つ位置で売りにしながら、その脇に相手の同意を得よという免責の一文を置くのは、実在する食い違いであり、読者は両面を秤にかけるべきです。
規約には関連する義務がひとつあります。内容を誤解を招く形で配布してはならず、そこには内容が完全に人間によって作られたと表現することが含まれます。プラットフォームはAI技術で作られた旨を進んで開示するよう勧めていますが、それを義務ではなく推奨として書いています。フッターには濫用の報告窓口があります。
実際の結論は明快です。自分の声をクローンするのであれば、以上は何の制約にもなりません。他人の声をクローンするのであれば、プラットフォームは止めもしなければ確認もしませんが、同時に自らの責任を免れ、法的な負担をまるごとあなたの側に置きます。そして法域によっては、その負担は相当に重いものになります。
公式サイトは開放性を繰り返し前面に出します。オープンソースのS2モデルを見出し級の特長として掲げ、セルフホストを支援された経路として示し、コードリポジトリは最高水準のオープンソース音声合成プロジェクトを名乗り、その背後に3万2,400の星があります。重みが公開されているのは事実であり、その点は本物です。しかしライセンスは寛容ではなく、この違いは商用の面で決定的です。
リポジトリははっきりと記しています。このコードベースとそれに付随するモデルの重みはFISH AUDIO RESEARCH LICENSEのもとで公開され、違反には措置を取ると警告しています。2026年3月7日に最終更新されたこのライセンスは、序文で自らの意図を述べています。本契約は研究と非商用の用途に限り素材を無償で使えるようにするためのものであり、いかなる商用利用にもFish Audioからの別途のライセンスが必要である、という内容です。
第三節は曖昧さを完全に取り除きます。素材または派生物を商用目的で使用するには、Fish Audioとの別途の書面によるライセンス契約が必要であり、本契約はいかなる商用の権利も与えない、というものです。商用のライセンスはライセンス中に記された事業用の連絡先を通じて相談します。
そして「商用目的」の定義は大半の事業活動を覆うほど広いものです。ホスト型のサービスやアプリケーション・プログラミング・インターフェースを通じたものを含め、あなたの製品やサービスを作り、改変し、配布すること。あなたの企業や組織の内部の運営。そして直接か間接かを問わず料金を取り、あるいは収益を生む製品やサービスに関わる一切の使用。これらが含まれます。社内で使うだけでも既に該当します。モデルを転売する必要すらありません。
寛容なライセンスとの違いはもう二点あります。研究向けの許諾は、非独占的、全世界、譲渡不可、再許諾不可、撤回可能、無償と記されています。撤回可能という語が要点であり、広く通用する寛容なライセンスの条件にこれに当たるものはありません。そして配布には表示の義務が伴います。著作権が39 AI, INC.にある旨を記した告知ファイルと、関連するウェブサイトや製品文書の目立つ位置にBuilt with Fish Audioの表示を掲げることです。このライセンスはさらに、素材やその出力を用いて基盤となる生成AIモデルを作ることや改善することも禁じています。
記録しておくべき空白がひとつあります。このライセンスは受入可能利用方針を引用によって組み込み、その遵守をライセンスの条件としています。ところがその文書が見つかりませんでした。候補となる複数の経路はいずれも404を返し、サイト自身の静的なサイトマップにも該当する項目がありません。そのサイトマップに載っているのは、トップ、ディスカバリー、AI音声生成、顧客事例、企業向け、競合の代替、規約、プライバシー、日本の法的情報の各ページだけです。拘束力のある条件が利用者に見つけられない文書を指しているのは、このライセンスに頼る前に事業者へ確かめておく価値のある文書上の問題です。
短くまとめるとこうです。重みは公開されている、はい。寛容な意味でのオープンソースか、いいえ。研究と趣味の利用は無償で、実際に許されています。社内利用を含むあらゆる商用の用途には、販促のページが何を含意していようと、別途の有償契約が必要です。
このプライバシーポリシーに記された発効日は2024年8月28日です。本文全体を調べたところ、音声を意味するvoiceという語の出現回数はゼロでした。生体情報を意味するbiometricも同様にゼロであり、学習を意味するtrainという語も一度も現れませんでした。人の声を取り込んで再現することが中核機能である製品において、音声に特化した条項も生体情報の条項も一切ないことは実質的な空白です。またこれは、利用者の内容がモデルの学習や改善に使われるかどうかについて、この方針が何ら述べていないことも意味します。得られた根拠に照らせば、正直な言い方は、この方針がこれらの点について沈黙している、というものであって、何らかの保護があるともないとも言えません。
投稿された音声は包括的な利用者コンテンツの区分に入り、方針はこれを利用者がサービスに提供する入力やファイルの投稿、意見に含まれる個人情報と定義しています。その区分と併記された第三者には、役務の提供者と広告の提携先、分析の提携先、事業の提携先が挙がっています。
規約は、あなたが保持する権利よりも、あなたが差し出す権利のほうをずっと具体的に書いています。利用者の投稿についてプラットフォームに与えられる許諾は、無償、永続、再許諾可能、撤回不能、全世界を対象とするものです。
削除もそれに応じて限界があります。アカウントを削除すると、プラットフォームはあなたの投稿を他の利用者に表示しなくなりますが、公開の投稿は明示的に例外とされ、引き続き完全に利用可能な場合があるとされ、規約は自社の記録からその内容を完全に削除することができない場合があると認めています。
公開の投稿が負う条件は、あらゆる区分の中で最も広いものです。販促や宣伝の目的で公開の投稿を使用し、表示し、実演し、配布する権利、そして他のすべての利用者がそこに接し権利を行使できる許諾が含まれます。非公開の枠と公開の枠のあいだの選択が権利上の判断である具体的な理由がここにあります。200万件規模のコミュニティの音声ライブラリを理解する背景としても有用です。あのライブラリが存在するのは、公開の投稿がこうした条件を負っているからです。
公式のページ群が互いに食い違う四つの数字を出しており、本記事は平均を取らずに四つとも書き出します。声のクローンのページは13言語にまたがるゼロショットの言語横断だと述べます。トップページのインターフェースの区画は30を超える言語を話すと述べます。テキスト読み上げのページのよくある質問は八つの言語だけを挙げ、加えて八言語の母語話者らしい訛りへの自動対応を掲げています。資金調達の発表文は母語話者のような呼吸を伴う83以上の言語を主張します。
これらは別々のことを指している可能性があります。クローンと合成の違いかもしれませんし、完全な対応と可能な範囲での対応の違いかもしれません。しかしサイトはその区別を説明していないので、どれか一つの数字を信じるのではなく、自分の言語で実際に試して確かめてください。
コミュニティからの報告もこの慎重さを裏づけます。公開リポジトリには、パンジャーブ語のグルムキー文字の入力が重子音の記号と鼻音化の記号を誤って扱うという未解決の課題があり、付加記号を考慮したラテン文字への転写や書記素から音素への変換によってパンジャーブ語の発音を改善しようという関連の要望もあります。取得時点でリポジトリは未解決の課題が7件、解決済みが684件でした。保守の比率としては健全ですが、言語ごとの品質が一様でないことの証拠でもあります。
公開前の内容審査はありません。 リポジトリ自身の法的免責はこう述べています。コードベースのいかなる違法な使用についても責任を負わず、デジタルミレニアム著作権法など各自の地域の関連法を参照するように、という内容です。事前の承認を行わないという姿勢と合わせると、責任は一貫して下流へ寄せられています。
リバースエンジニアリングと競合モデルは禁じられています。 規約は、ソースコードやモデルの基礎的な構成要素、アルゴリズムを得ようとする試みを禁じ、さらにサービスの出力を用いて競合するモデルを開発することも別に禁じています。
年齢の要件。 利用者は13歳以上である必要があり、18歳未満は保護者の許可が要り、プラットフォームは16歳未満の子どもの識別可能な個人情報を知りながら収集することはないと述べています。
ディレクトリの情報は早く古びます。 この掲載記録に保存されていた分類は「ファッション」で、タグにも「ファッション」と「テンプレート」が入っていました。音声合成の製品としては明らかに誤りです。保存されていた説明は1,000を超える音声に言及していますが、サイトは今や200万件超と述べています。動きの速い製品は自らのディレクトリ項目を追い越していきます。現在の数値はサイトで確かめてください。
クレジットカード不要の本物の無料プランがあり、毎月8,000クレジット、最長7分の生成、一回500文字の上限、公開の音声枠3つを提供します。ただしその成果物を商用に使えるかどうかは、サイトを見る限り本当にはっきりしません。プランのページの無料プランの機能一覧には商用利用が入っている一方、同じページのよくある質問とトップページのよくある質問はどちらも、無料プランの成果物は個人的で非商用の用途に限ると書いています。制限的な読み方を前提に運用し、無料プランの成果物を収益化する前に事業者に確認してください。
プラットフォームはその責任を全面的にあなたに置き、事前の確認を行いません。クローンのページのよくある質問は、クローンしようとするどの声についても必要な権利と同意、開示を得ているかを確認する責任は利用者にあり、自分の地域の氏名や肖像、AI生成物に関する法に従わなければならないと述べています。あわせて、個別の用途を事前に承認することはなく、事後に内容やアカウントを削除する場合があるとも述べています。留意すべきは、拘束力のある利用規約には声のクローンの同意を名指しで求める条項が存在しないことです。他人の権利を侵害するなという包括的な禁止があるだけで、しかも同じ製品ページの販促は著名人のクローンを積極的に勧めています。法的に見れば、危険を負うのはあなたです。
重みは実際に公開されていますが、ライセンスは寛容ではありません。コードベースとモデルの重みはいずれもFish Audioの研究用ライセンスのもとで公開されており、そのライセンスは序文で研究と非商用の用途を無償で許すためのものであり、いかなる商用利用にも別途のライセンスが必要だと述べています。第三節はいかなる商用の権利も与えません。研究と学習、趣味の利用は無償で、それ以外の用途には別途の有償契約が要ります。
公開されているライセンスのもとでは不可です。このライセンスの商用目的の定義には、ホスト型のサービスやインターフェースを通じて自社の製品やサービスを作り、改変し、配布すること、自組織の内部の運営、そして直接か間接かを問わず収益を生む製品やサービスに関わる一切の使用が明示的に含まれます。社内での利用だけでも該当します。別途の書面による契約が必要で、ライセンスに記された事業用の連絡先から相談できます。研究向けの許諾が撤回可能である点も、広く通用する寛容なライセンスとは異なります。
公式が示す最低限はきれいな音声10秒で、製品ページは表現の豊かな声には長めのサンプルが役立つと述べています。参照音声は長さより品質が効きます。きれいな短いサンプルのほうが、長くて雑音の多い録音より優れます。プラットフォームはクローンが13言語にまたがるゼロショットの言語横断であるとも述べており、一度の収録が再学習なしに対応する他の言語へと広がります。
サイトは四つの異なる答えを出しており、本記事が代わりに一つを選ぶことはしません。クローンのページは言語横断のクローンで13、トップページは30以上、テキスト読み上げのページのよくある質問は八つの言語を挙げて八言語の母語話者らしい訛りへの自動対応を掲げ、資金調達の発表文は83以上と述べます。別々の能力を指している可能性が高いものの、サイトはどれがどれとは説明していません。投じる前に対象の言語で試しのサンプルを作ってください。公開リポジトリには、パンジャーブ語のグルムキー文字における重子音の記号と鼻音化の記号の扱いを含め、特定の文字についての未解決の不具合報告があります。
取得時点では四つの有料プランがあり、割引が重なっていました。Plusは月額換算5.5ドルで年間66ドルの請求、定価は15ドル、毎月25万クレジットです。Proは月額換算37.5ドルで年間450ドルの請求、定価100ドル、200万クレジットとチーム席3つを含みます。Maxは月額換算749ドルで年間8,988ドルの請求、定価999ドル、2,500万クレジットとチーム席10を含みます。エンタープライズは個別見積もりを年単位で請求します。およそ600から625クレジットが生成一分に相当し、使い残したクレジットは繰り越されません。
プライバシーポリシーは述べていません。本文全体を調べましたが、学習を意味するtrainという語は現れませんでした。音声を意味するvoiceも生体情報を意味するbiometricも同様に見当たらず、この方針の発効日は2024年8月28日です。つまりこの点について公開された約束は存在せず、文書にない保護があると主張するのは適切ではありません。投稿された音声は包括的な利用者コンテンツの区分に入り、その区分に併記された共有先には役務の提供者と広告、分析、事業の提携先が含まれます。この点が法令順守の上で重要なら、事業者に直接お尋ねください。エンタープライズのプランがデータを保持しない運用を独立した特長として掲げている点にも留意してください。
削除は完全ではなく部分的です。規約は、アカウントを削除するとプラットフォームがあなたの投稿を他の利用者に表示しなくなると述べつつ、公開の投稿は明示的に例外として引き続き完全に利用可能な場合があるとし、自社の記録から完全に削除することができない場合があると認めています。与えられる許諾が永続かつ再許諾可能で撤回不能であるうえ、公開の投稿はさらに販促の権利と他のすべての利用者への接する権利まで与えるため、公開ではなく非公開の音声枠を選ぶことは整理の好みではなく実質的な判断です。
サイトのフッターはHanabi AI Inc.を挙げ、オープンソースのライセンスが求める表示は39 AI, INC.を指しています。本記事は両方の名称を記録しますが、サイトは両者の関係を説明していません。会社は創業一周年に5,200万ドルのシード資金の調達を発表しており、このラウンドを主導した一社の名はCoreline Venturesといいます。もう一方の主導機関はCapital Todayです。自社の発表文はチーム22人、年間経常収益2,100万ドル、プラットフォームの利用者800万人超、コミュニティの音声モデル200万件超を挙げ、最高経営責任者のRissa Cao氏と主任科学者のShijia Liao氏を実名で示しています。これらの事業の数値は自己申告であり、独立した監査を受けていません。