このツールを使いましたか?評価してください
Voice.ai は米国法人 Voice AI, Inc. が運営する音声技術プラットフォームです。サイトの全ページのフッターには Voice.ai® および Voice Universe® が登録商標である旨が記載されています。この製品は当初、今よりもずっと狭い形で始まりました。ゲーマーや配信者が Discord やゲームのボイスチャットで話しているあいだ、自分の声色をリアルタイムで置き換えるデスクトップアプリケーションだったのです。その最初のリアルタイム変声器は今も残っており、多くの人がこのドメインを訪れる理由であり続けています。しかしこのプラットフォームは現在、ひとつのアカウントのもとで四種類の異なるものを販売しており、自分に本当に必要なのがそのどれなのかを見極めることが、登録前に整理しておくべき最も重要な作業になっています。
四つの製品ラインは、リアルタイム変声器と音声合成エンジン、即時の音声クローン、そして電話応対を担う音声エージェントです。公式サイトの見出しはこのうち二つを並べており、無料の AI 変声器であり音声エージェント基盤でもあるという組み合わせはかなり異例です。というのも、この二つの利用者層はほとんど重なりません。一方はマインクラフトのサーバーでアニメのキャラクターのように聞こえたい十代の若者であり、もう一方は深夜三時にかかってくる営業電話にも誰かが応対してほしい運用責任者です。Voice.ai はひとつのコードベースとひとつのクレジット残高で両者を相手にしており、この二重の性格が、この製品を使ったときに感じられる多くのことを説明してくれます。
同社が掲げる技術的な立ち位置は、どんな声でも複製できるという主張よりも狭く、そしてより興味深いものです。創業者兼最高経営責任者の Heath Ahrens は TechCrunch に対してこう述べています。自社の音声から音声への人工知能の中核的な価値は、特定の人物を完璧に複製することにあるのではなく、話し手の感情と話す速さと強弱という中核的な要素を保ったまま声の音色だけを置き換え、まったく新しい結果をリアルタイムで生み出すことにある、というものです。これは再現精度を前面に出す音声変換企業群と意図的に距離を取る宣言です。Voice.ai が最適化しているのは、変換結果が自然に聞こえてリアルタイムで動くことであって、クローンが鑑識レベルで判別不能になることではありません。
創業者の経歴は同社の主張を読み解くうえで役立ちます。Ahrens は 2007 年に iSpeech を創業しており、会社紹介ページはこれを世界初のクラウド型音声合成プラットフォームだと説明しています。2009 年にはショートメッセージを読み上げる初のアプリである DriveSafe.ly を市場に出しました。彼は顔認識企業の Haystack も創業しています。二十年近く音声インターフェースを作ってきた創業者だと考えれば、近年の開発者向け API と法人向け音声エージェントへの展開は、方向転換というより本来の持ち場に戻ったように見えます。
規模感を与える数字が二つありますが、どちらも時点が明確です。TechCrunch が 2023 年 6 月に初の外部資金調達を報じた時点で、Voice.ai は 48 万人を超える利用者と 5 万を超える音声フィルターを擁しており、それ以前は 300 万ドルの自己資金と口コミだけで成長し、Discord のコミュニティは 12 万人を超えていました。当時 Mucker Capital と M13 が 600 万ドルの調達を主導し、M13 は現在もこの会社をシード段階の投資先として掲載しています。一方、現在の App Store のページが説明しているのは、利用者が作った 2 万件を超える音声のコミュニティライブラリです。これらの数字は異なる時点の異なる対象を数えたものであり、ひとつの傾向線につなぎ合わせるべきではありません。
Voice.ai を一般的な音声合成ベンダーと本当に隔てているのは、音声ライブラリの大部分が同社自身のものではないという事実です。Voice Universe は利用者が自作の音声を投稿し、他の利用者がそこから取り出して使うコミュニティライブラリです。この名称が商標登録されているという一点だけでも、同社の自己認識のなかで占める位置がうかがえます。形態としては、精選された公式の音色カタログというより取引市場や改造コミュニティに近く、まさにこの点がこのプラットフォーム最大の強みと最も厄介な問題を同時に生み出しています。
強みは幅と速さです。数万人の貢献者が積み上げた目録は、社内のどんな収録スタジオでも追いつけない速度で育ち、はるかに細かい隙間まで覆います。問題は品質のばらつきと出所の適法性です。誰でも投稿できるため品質は不揃いで、ある第三者のレビュアーは音質が全体的に途切れがちだと指摘し、アニメ調の少女の声とされるものの多くは実際には音の高さを調整しただけに見えると評しました。また投稿物が利用者の制作物である以上、それぞれの音声が本人の同意を得ているかという問題はプラットフォームではなく投稿者の側に置かれます。利用規約がこの問題にこれほど多くの分量を割いている理由は、まさにここにあります。
リアルタイム変声は最初の製品であり、要求が最も厳しい機能でもあります。デスクトップでは Live Mode という名前で動作し、ローカルのグラフィックスカードで音声処理を終えたあと、Ahrens が仮想オーディオケーブルと表現した経路を通して変換後の音を他のアプリケーションへ送り込みます。このローカル処理の構造ゆえに会話が成り立つほど遅延が短いのですが、同時にハードウェア要件が名目上のものではなく実質的な制約であることも意味します。
公式 FAQ はこの点について珍しく率直です。Live Mode を使うのに必要な最低限のグラフィックスカードは何かという専用の項目があり、グラフィックスカードが Live Mode に対応していないという警告メッセージについての項目も別に用意されています。ベンダーが特定のハードウェア障害のために文書化されたエラー案内を書くのは、そこに突き当たる利用者が相当数いるからにほかなりません。ある第三者レビューは、Nvidia GTX 980 や AMD RX 580 より下の等級のグラフィックスカードを積んだ機械では音が途切れて遅延が出ると伝え、このアプリケーションがグラフィックスカードの資源を八十七パーセント占有していたという利用者の証言を引用しています。Live Mode は誰もが使える汎用的な機能ではなく、ハードウェアの下限を持つ機能として理解するのが正確です。
音声合成エンジンは近年最も開発資源が投じられてきた領域であり、料金モデルにおける主たる計量対象でもあります。公式サイトは 15 以上の言語に対応すると述べ、英語とフランス語およびヒンディー語とウクライナ語、日本語と韓国語およびスウェーデン語、中南米スペイン語とブラジルポルトガル語、中国語とオランダ語およびトルコ語、ドイツ語とイタリア語を挙げています。同社が掲げる目標はひとつの音色を任意のアクセントや言語に現地化することであり、音色そのものと言語を分離可能な二つの軸として扱うという意味です。
有料の段階は、無料段階が押しとどめている実務上の必需品を返してくれます。無料段階は一回の変換を 500 文字に制限しており、これは短い段落ほどの分量です。Starter 段階はこれを 5,000 文字に引き上げ、そして何より生成したファイルを保存する行為そのものを解放します。このほかサイトのナビゲーションで新着と表示されている TTS Lite という軽量の入口があり、Starter 段階からは Text to Speech Studio が含まれます。
音声クローンは無制限の機能ではなく段階ごとの割り当てとして商品化されており、同社が各顧客層にどれくらいの利用量を見込んでいるかを読み取りやすくなっています。無料段階には即時の音声クローンがないと明記されています。Starter は 5 件、Launch は 10 件、Core は 50 件、Scale は 200 件、Business は 2,200 件です。この割り当ての階段は、各段階が誰に向けて設計されたのかを示す最も明快な信号のひとつです。
とくに書き留めておきたい細部がひとつあります。公式サイトの二つのページが互いに食い違っているのです。トップページはわずか 10 秒の音声だけで驚くほど自然な音声クローンができると書き、音声クローン専用のページはわずか 15 秒でクローンが完了すると書いています。どちらも同じ時期に掲載された公式の記述であり、互いを参照することも、その差を説明することもありません。長いほうの数字を基準に計画し、短いほうは技術仕様ではなく宣伝上の下限とみなすのが安全です。
音声エージェントは最も新しい製品ラインであり、現在最も商業的な比重が置かれている軸でもあって、サイトのナビゲーションの先頭に新着表示とともに置かれています。中心的な主張は、エージェントが着信と発信を代わりに処理することで企業が電話を取りこぼさなくなるというものです。同社はエージェントが電話を自動でかけて受け、質問に答え、予定を予約し、会話全体を最後まで管理すると説明しています。連携先としては Salesforce と HubSpot および Zendesk と Slack が名指しされています。
この製品ラインが宣伝用のページではなく実際の商品として読める理由は、電話業務に固有の単位で計量されているからです。料金プラン間の差は同時通話数と電話番号の数に表れます。Starter は同時通話 2 回線と番号 1 件、Launch は 4 回線と 3 件、Core は 8 回線と 10 件、Scale は 16 回線と 20 件、Business は同時通話 30 回線と番号 50 件です。これらは実演用の製品ではなく実際の通話基盤が持つ制約です。
四つの主力製品のほかに、サイトはブラウザで使える無料の音声ツールを九つ提供しています。音声合成とオンライン変声器、音質向上とボーカル除去およびエコー除去、人工知能によるステム分離、楽曲のキーと BPM の検出、リバーブ除去、そして音声形式の変換です。これらは事業の柱というより流入の入口に近く、同じクレジットで計量されます。無料段階は一回あたり 5 分に制限し、段階が上がるにつれて 180 分まで伸びます。
API は約束ではなく実在する製品ラインであり、その根拠は主張よりも細部にあります。開発者向けページは音声合成と音声エージェントおよび音声クローンという三つのインターフェースを公開しており、dev.voice.ai/api/v1/tts/speech という実在のエンドポイントと、実行可能な Python の例に含まれる voiceai-tts-v1-latest という具体的なモデル識別子が示されています。Python と TypeScript の二つの SDK に加えて REST の例が揃い、ウェブと iOS および Android を網羅し、リアルタイム音声の技術者が実際に使っているオープンソースの枠組みである LiveKit ならびに Pipecat との互換性を明示しています。
プラットフォームは対話的なやり取りの応答時間が 150 ミリ秒未満だと宣伝しています。これはベンダーが自ら公表した数値であり、試験条件も第三者による基準測定も付されていないため、検証済みの実測値ではなく設計目標とみなすべきです。配備の形はクラウド上の API と自社設備への導入、顧客自身の VPC 内のプライベートクラウド、そして低遅延のローカル配備という四種類が提供されます。API は MCP に対応したエージェントの処理の流れや、動的な知識参照のための RAG 連携およびツール呼び出しにも対応し、音声生成の完了とエージェント応答の折り返し、会話状態の更新、エラーおよび再試行の通知といった時点で発火する webhook も備えます。
見落としやすく、しかし気づくのが遅れると代償の大きい前提条件がひとつあります。利用規約は、事業用と法人用および API またはその他の商業的利用には Voice.ai との別途の契約が必要だと明記しています。セルフサービスの手続きで API キーを取得したことは、契約上その上で製品を出してよいという意味ではありません。
ゲームと配信およびバーチャル配信。 このプラットフォームの歴史的な中心であり、今も最大の実利用者層です。TechCrunch は、ゲーマーとコンテンツ制作者およびバーチャルユーチューバーが TikTok と Zoom、Discord とマインクラフト、GTA5 とフォートナイト、ヴァロラントとリーグ・オブ・レジェンド、Among Us と Skype および WhatsApp でこの製品を採り入れていると伝えました。公式 FAQ は、Discord と Skype、WhatsApp と Zoom、PUBG とフォートナイト、Google Meet とリーグ・オブ・レジェンド、ワールド・オブ・ウォークラフトと Among Us、マインクラフトと TeamSpeak、Telegram および Viber それぞれについての導入トラブル対応項目でこれを裏づけています。自分の利用環境がこの一覧にあるなら、すでに誰かが失敗の型を書き残してくれているということです。
着信と発信の電話対応。 音声エージェントの製品ラインは、電話を取りこぼして商機を失っている企業を狙っています。同時通話数と番号数の段階分けのおかげで、規模の見積もりを正直に行えます。試しに導入してみる単一店舗は Starter の同時通話 2 回線に十分収まり、番号が 50 件必要な規模なら Business の領域です。
ナレーションと吹き替えの制作。 音声クローンのページはポッドキャストとビデオゲームおよび業務用ナレーションを名指しし、自分で話さずに数千時間分のナレーションを作れると説明しています。これを実際に可能にする敷居は Starter 段階にあります。ファイルの保存と商用ライセンスがこの段階から提供されるからで、保存できなければ無料段階はいかなる実際の制作工程にも接続できません。
多言語への現地化。 音色と言語が分離可能な軸として扱われるため、同じ音色を名前の挙がっている十四の言語のあいだでアクセントや言語の単位で現地化できます。複数の市場でひとつのチャンネル人格を保ちたい制作者にとっては、言語ごとに無関係な既製音色を選ぶよりはるかに有用です。
アクセシビリティと自己表現。 倫理のページは二つの集団に明示的に言及しています。この技術がトランスジェンダー当事者に対し、発声訓練や医療的介入なしに望む声を得る手段を与えると述べ、喉頭がんや筋萎縮性側索硬化症またはパーキンソン病といった疾患で声を失った人々にとっては従来の音声合成より優れた選択肢になりうると記しています。TechCrunch も前者を、プライバシーを重んじる利用者や新しいオンライン人格を模索する利用者と並ぶ新興の利用者層として独自に確認しています。
プライバシー目的の声の隠蔽。 娯楽用途とは性格の異なる需要です。ボイスチャットには参加したいが自分の実際の声は明かしたくない、という場合ですね。感情と話す速さは残して音色だけを替えるという同社の技術的方向性は、機械的なフィルターよりもこの目的に適しています。
クローン用の素材はきれいに録ります。 クローン品質の上限は元の素材が決めます。静かな部屋とマイクとの一定した距離、そして単語の羅列ではなく自然な文の音読で作った模型は、雑音のなかで録った短い断片よりも明らかに優れます。
最低の長さより余裕をもって録ります。 公式サイトが示す二つの最低時間である 10 秒と 15 秒が食い違っている以上、どちらも下限とみなすのが安全です。長く、内容の多様な標本ほど、模型が参照できる音素の範囲が広がります。
自分の声のクローンを公開するかは慎重に決めます。 投稿するということは、その音声が他人が取り出して使うライブラリに入るという意味です。Comparitech の中核的な安全上の助言は、本人の声で学習させた模型を投稿しないことであり、その根拠は他人が音声詐欺に悪用しうるという点にあります。ただし同じ記事は、これがこの製品固有の問題ではなく音声クローン基盤全般に共通する事柄だとも述べています。あるクローンが非公開だと決めつける前に、アカウントの公開範囲の設定をまず確認してください。
metamodel 学習の設定を確認します。 規約は、サービスを利用することで同社が利用者のハードウェアを metamodel の学習と計算に用いることに同意したものとみなし、すべての利用者がいつでもこれを無効にできると記しています。ただしこの設定の初期値が有効か無効かは書かれていないため、推測せず自分で確かめる必要があります。
ゲームと変声を同時に行うならグラフィックスカードに余裕を持たせます。 Live Mode はゲームと同じグラフィックスカードを奪い合います。余裕の乏しいカードでは、ゲームのフレーム低下と音声の歪みが同時に起こります。
契約したあとではなく契約する前に確かめます。 複数の独立したレビュアーが同じ点を指摘しています。導入を終えるまで価格が見えないというものです。料金ページ自体は公開されていて詳細なので、何かを導入する前にブラウザで先に読んでおいてください。
第三者の声については同意の証跡を保管します。 他人の声をクローンするなら、規約はその人からの明示的な法的許諾を求めており、補償条項はこれを誤ったときの結果を利用者に負わせます。書面の許諾を記録として残しておくことが、この要求を実務的に満たす形です。
成果物で競合する音声製品を作ってはいけません。 規約は、その出力を用いて音声模型を学習・開発・改良する行為、新たな合成音声や派生製品を作る行為、競合製品を支える行為を明示的に禁じています。
十分なハードウェアを備えたゲーマーと配信者およびバーチャル配信者 が、リアルタイム機能の側で最も相性のよい層です。中位以上のゲーム用グラフィックスカードがあり、Discord や多人数のボイスチャットで過ごす時間が長いなら、ここがこの製品の本拠地であり、コミュニティの音声ライブラリもこの領域で最も厚くなっています。
中程度の分量のナレーション制作者 は Starter 段階から十分な支えを得られます。保存と商用ライセンスがこの段階から提供されるからです。名前の挙がっている十四の言語は、複数市場に向けて公開する制作者にとって現実的な選択肢を作ります。
着信を取りこぼしている小規模事業者 が音声エージェントの製品ラインの想定顧客です。下位の段階は実際の試験導入の費用を負担可能な水準に抑えてくれます。月 5 ドルで番号ひとつと同時通話 2 回線を確保することは、本格的な投資の前に自動応対が自分の事業に合うかを確かめる現実的な方法です。
リアルタイム音声機能を作る開発者 は、文書と名前の明示された SDK および枠組みとの互換性を備えた API を得られます。ただし規約が求める別途の商業契約を結ぶことが前提です。
自己認識やアクセシビリティのために別の声を必要とする人々 は倫理のページで明示的に扱われており、TechCrunch もこれを成長中の利用者層として独自に確認しています。
別の選択肢を探すべき場合: 内蔵グラフィックスや古いノートパソコンでリアルタイム変換を望む人は、どの料金プランもハードウェアの下限を埋め合わせてはくれません。成果物の権利帰属と非侵害について契約上の確実性が必要な人は、規約がまさにその部分を免責しています。そして厳格な返金不可の方針を受け入れられない人も同様です。
デスクトップアプリケーションは機能が最も完全なクライアントであり、Live Mode のリアルタイム変換が動く唯一の場所で、サイト独自のインストーラーで配布されます。その性能上限は契約段階だけでなく機械のグラフィックスカードが決めます。
ウェブ版は音声合成と音声エージェントの管理画面および九つのオンライン音声ツールを網羅し、処理がサーバー側で行われるためローカルのハードウェア要件がありません。事前評価にはこちらが適した入口です。
モバイルでは iOS アプリケーションを Voice AI Inc. が公開しています。アップルの公式インターフェースのデータによれば、評価は 189 件で 4.0、コンテンツ区分は 12 歳以上、無料で入手でき、iOS 18.0 以降を必要とし、2023 年 5 月に初公開されて 2026 年 7 月に 2.0.5 版へ更新されています。同社自身の FAQ に記録された機能の差がひとつあります。モバイルアプリでリアルタイム変声ができるのか、そしてなぜモバイルアプリにはまだリアルタイム変声がないのかという二つの項目があり、モバイルとデスクトップが同等ではないことを示しています。TechCrunch は 2023 年の記事で Mac と PC および Android と iOS を網羅すると伝えましたが、現在のサイトの入手経路には Windows のインストーラーと App Store への導線が示されており、Android の現状は執筆時点で公式の経路から確認できなかったため、サイトで直接お確かめください。
プログラムからの利用では、API がウェブと iOS および Android を網羅し、配備の形としてクラウド上の提供と自社設備への導入、顧客自身の VPC 内のプライベートクラウド、低遅延のローカル配備が用意されています。
料金はサイトの料金ページで公開されており、月間クレジット枠で計量される七段階の構造で、年払いは二か月無料として案内されています。
| 段階 | 月額 | 月間クレジット | 即時音声クローン | 同時通話 | 電話番号 |
|---|---|---|---|---|---|
| Free | 0 ドル | 5k | なし | — | — |
| Starter | 5 ドル | 15k | 5 件 | 2 回線 | 1 件 |
| Launch | 24 ドル(初月 12 ドル) | 200k | 10 件 | 4 回線 | 3 件 |
| Core | 99 ドル | 1M | 50 件 | 8 回線 | 10 件 |
| Scale | 330 ドル | 4M | 200 件 | 16 回線 | 20 件 |
| Business | 880 ドル | 22M | 2,200 件 | 30 回線 | 50 件 |
| Enterprise | 個別見積 | 個別 | — | — | — |
クレジットの仕組みはきちんと理解しておく価値のある部分です。クレジットは複数の機能にまたがって共通に使われつつ、機能ごとに異なる比率で消費される単位だからです。Core 段階では、同じ百万クレジットが音声合成の 1,000 分になるか、音声エージェント通話の 1,000 分になるか、音声ツール処理の 15,000 分になります。音声合成とエージェント通話の単価は互いに同等で、音声ツール処理の一分あたりの費用は前の二つのおよそ十五分の一の水準です。無料段階の枠は実運用ではかなり厳しく、5,000 クレジットは音声合成 5 分か音声ツール 3 回の利用にとどまります。
段階に連動する他の制限も、クレジットの量に劣らず体験を左右します。一回の変換の文字数は無料段階の 500 文字から Starter 以上の 5,000 文字へ上がります。音声ツールの一回あたりの長さの上限は無料段階の 5 分から 10 分と 20 分および 60 分を経て 180 分まで伸びます。音声合成の同時生成数は Starter の 3 件から Scale および Business の 15 件へ増えます。Enterprise 段階には DPA と SLA に関する個別条件、HIPAA 顧客向けの BAA、個別の SSO、引き上げられた同時処理上限および優先支援が加わります。
契約前に支払いについて強調しておきたいことが二つあります。規約は、購入時に別段の記載があるか法が求める場合を除き、すべての支払いが返金されないと述べています。定期料金と従量料金および一回限りの購入がいずれも該当し、例外は同社の裁量であって義務ではありません。また複数の独立したレビュアーが導入後にしか価格が見えないと指摘していますが、公開された料金ページがある以上その状況を受け入れる理由はありません。先に読めばよいのです。
ElevenLabs はクローンの再現度と表現力ある音声合成の基準点です。TechCrunch の記事は Voice.ai を同じ大きな分類に置きつつ、ElevenLabs が恐ろしいほど巧みな音声クローンで知られていると述べています。最高品質の合成ナレーションが必要でリアルタイム変換が不要なら、そちらのほうが直接的な選択肢です。
Respeecher は業務用の音声から音声への領域の反対側に位置し、映画と放送の制作で実績があります。リアルタイム変換ではなく特定の対象話者を放送水準で再現する必要があるときに、より適切な比較対象になります。
Voicemod はリアルタイムのゲーム変声の側で最も直接的な競合であり、Trustpilot のページの他の人はこちらも見ていますという欄が両者を並べ、Voicemod を 456 件で 1.7、Voice.ai を 233 件で 2.0 と表示しています。どちらの点数も低く、両方の掲載情報が後述する標本の偏りの問題を抱えています。
Murf と Acapela は TechCrunch が既存の音声模倣ベンダーとして名指しした先で、リアルタイム変換よりも従来型のナレーション制作に近い性格を持ちます。
専用の音声エージェント基盤 は電話業務の軸に限った比較対象です。通話の自動化だけが必要で変声が無関係なら、音声ライブラリの大きさではなく同時処理能力と電話機能および法令順守の文書を基準に、Voice.ai のエージェント段階を専門の対話基盤と見比べるべきです。
リアルタイム変換にはハードウェアの下限があります。 Live Mode はローカルのグラフィックスカード処理に依存します。同社は最低限のグラフィックスカード要件と非対応カードへの専用の警告をともに文書化しており、第三者の試験はおおよそ GTX 980 や RX 580 より下の等級のハードウェアで音が途切れると伝え、ある利用者はグラフィックスカードの占有率八十七パーセントを報告しています。どの契約段階もこの制約を取り除きません。
モバイルはデスクトップと同等ではありません。 公式 FAQ が自ら、なぜモバイルアプリにまだリアルタイム変声がないのかを問い、答えています。携帯電話でのリアルタイム変換が中心的な用途である利用者は、支払う前に現在の状況を確認してください。
クローンに要する時間について公式の数字が二つあり食い違っています。 トップページは 10 秒、クローンのページは 15 秒で、同じ時期に掲載され調整されていません。
コミュニティの評価は低く、標本は中立ではありません。 Trustpilot は 233 件で 2.0 を示し、分布ははっきり二極化しています。1 点が八十二パーセント、5 点が十四パーセントで、中間帯はほとんど空です。この掲載情報は 2023 年 8 月から企業が所有権を確認しており、同社は顧客に積極的に評価を依頼し、否定的な評価の百パーセントに返信しています。依頼によって形成された標本は自然に集まった標本と体系的に異なるため、この点数は他の経路の代わりではなく併せて読むべきものです。App Store の 189 件で 4.0 という結果は、同程度の標本規模ではっきりと好意的であり、Trustpilot が直近の評価 59 件をまとめた要約は、中核の音質ではなく自動契約と想定外の更新請求および応答のない顧客対応に集中しています。
請求に関する不満は複数の独立した出所で一致しています。 Comparitech は導入後にしか契約価格が表示されない点と、別途の登録を求める厳格で煩雑な返金手続きを指摘します。Onerep は不明瞭な価格と試用枠、そして解約後も請求された事例を伝えます。規約自体が返金不可を既定とすることを裏づけています。
製品はいまだベータとして説明されています。 Onerep は 2026 年 1 月の評価で、2026 年現在も Voice.ai がベータ段階にあると述べ、これを利用者が遭遇する不具合の説明として示しています。
商業的権利の記述が一貫していません。 料金ページは Starter 段階から商用ライセンスを提供すると書いていますが、規約は二か所で、サービスは個人的で非商業的な用途にのみ提供され、事業用と法人用および API またはその他の商業的利用には別途の契約が必要だと明記しています。サイトはこの二つがどう噛み合うのかを説明していません。商業展開を計画するなら、この点を書面で確認しておくべきです。
成果物と音声資産にいかなる保証もありません。 規約は、いかなる出力も音声資産も非侵害であるとも意図した用途に許諾されているとも特定の目的に適合するとも保証せず、プラットフォームのすべての音声は利用者の制作物であり同社は責任を負わないと述べています。補償条項は第三者の権利主張の結果を利用者の側に置きます。
入力は模型の学習に使われます。 投稿した入力は、永続的で取り消し不能かつ全世界に及び、使用料が不要で再許諾可能なライセンスを付与し、その用途には同社の模型の学習と改良および新製品の開発が明示的に含まれます。同社は明示的な許諾なしに利用者の声を単独で商業化しないと約束していますが、これは学習に使わないという約束よりずっと狭いものです。
計算資源の提供が利用条件の一部です。 サービスの利用には、同社が利用者のハードウェアを metamodel の学習に用いることへの同意が伴います。いつでも無効にできますが初期値は明示されていません。
プライバシー関連の文書に具体性が欠けます。 Onerep は暗号化の方式が明示されず保存期間も示されておらず、カリフォルニア州外の利用者にはデータ削除の選択肢がないと伝えます。Comparitech はこのサービスが Do Not Track に応答しないと指摘します。ただし Comparitech の総合的な結論は、一定の予防措置を前提に製品は安全だというものであり、データ漏洩や法的紛争は見つかりませんでした。
法令順守の主張に裏づけ資料がありません。 サイトは GDPR と SOC 2 および HIPAA を含む主要な企業向け規制のすべてに完全に準拠すると述べていますが、監査報告書や認証番号は公開していません。法人の購買担当者は根拠となる文書を求めるべきです。
年齢と管轄。 利用には満 18 歳以上であることが必要です。準拠法はデラウェア州法で、デラウェア州の裁判所が専属管轄を持ちます。これは米国外の利用者にとって実質的な考慮事項です。
実際に無料段階は存在しますが範囲は狭いです。毎月 5,000 クレジットが提供され、これは音声合成でおよそ 5 分か音声ツール 3 回分に相当します。一回の変換は 500 文字に制限され、即時の音声クローンはまったく含まれず、生成したファイルを保存することもできません。有料段階は月額 5 ドルから始まります。無料の変声器という宣伝と有料の壁の向こうにある内容との隔たりを複数の独立したレビュアーが批判してきたので、無料段階は実用的な運用案ではなく評価の手段とみなすのが妥当です。
この部分は実際に曖昧なので、頼りにする前に書面で整理しておくのが賢明です。料金ページは商用ライセンスを Starter 段階から含まれる特典として記載しています。一方で利用規約は二か所で、サービスは個人的で非商業的な用途にのみ提供され、事業用と法人用および API またはその他の商業的利用には同社との別途の契約が必要だと述べています。サイトはこの二つの記述を調整していません。さらに規約は、成果物が非侵害であることや意図した用途に許諾されていることの保証も免責しています。
必要です。規約は三つの条件でのみ音声内容の投稿や生成を認めています。本人の声を使う場合、声の持ち主から明示的な法的許諾を得ている場合、またはパロディや風刺のように関連法で明確に認められる用途である場合です。存命かどうかを問わず実在の人物を欺いたり詐取したり誤導したりする目的でなりすます行為は禁じられており、即座の利用停止と法的措置および捜査機関への協力につながりうるとされています。ここで App Store の説明との隔たりに注意が必要です。ストアの文言は著名人から架空の登場人物まで誰のようにも聞こえるという点を売りにしていますが、拘束力を持つのはストアの文言ではなく規約です。
そうではなく、この点で多くの人がつまずきます。規約には No License to Voices という表題の専用条項があり、他の利用者が投稿した音声を含め、プラットフォーム上のいかなる音声や音声模型または音声クローンや音声としての同一性についても利用者にいかなる権利も付与せず、ある音声資産が公開状態にあるという事実がそれを使用したり複製したり配布したり商業化したりする許可を与えるものではないと明記しています。Voice Universe で見えることはライセンスではありません。
独立したグラフィックスカードが必要で、性能もある程度は求められます。Live Mode はグラフィックスカード上で音声をローカルに処理し、公式 FAQ は最低限のグラフィックスカード要件と非対応カードへの明示的な警告をともに文書化しています。第三者の試験報告によれば、おおよそ Nvidia GTX 980 や AMD RX 580 より下の等級のハードウェアでは途切れて遅れる出力になり、ある利用者はグラフィックスカードの占有率八十七パーセントを報告しました。一方でサーバー側の機能である音声合成と音声ツールおよび音声エージェントには、こうした要件はありません。
公式サイトは 15 以上の言語に対応すると述べ、英語とフランス語およびヒンディー語とウクライナ語、日本語と韓国語およびスウェーデン語、中南米スペイン語とブラジルポルトガル語、中国語とオランダ語およびトルコ語、ドイツ語とイタリア語を名前を挙げて示し、ひとつの音色を別のアクセントや言語に現地化できると説明しています。
同社は安全に関する案内ページでこの二つの疑いに直接答えています。アプリケーションを McAfee と Google および Avast を含むウイルス対策ベンダーへ定期的に提出して検証を受け VirusTotal の結果を公開していると述べ、分散計算の機能は暗号資産や採掘とは無関係で、提供された計算資源は音声を作り模型を学習させ、性能の低い機器の音声処理を助けるためだけに使われると説明しています。二件の独立した評価もおおむね同意しています。Comparitech は予防措置を前提に製品は安全だと結論づけデータ漏洩や法的紛争を見つけず、Onerep はウイルスでも採掘プログラムでもなく利用が違法でもないと結論づけました。ただし両者とも請求の透明性とプライバシー文書については別の懸念を示しており、Comparitech の主要な安全上の助言は本人の声で学習させた模型を投稿しないことです。
投稿した入力は同社に対し、永続的で取り消し不能かつ全世界に及び、使用料が不要で再許諾可能な非独占のライセンスを付与します。その範囲にはサービスの運営と同社の模型の学習および改良、新機能と新製品の開発が含まれます。同社は明示的な許諾なしに利用者の声を単独で商業化しないと述べています。またサービスの利用には、利用者のハードウェアを metamodel の学習に用いることへの同意が伴い、この機能はいつでも無効にできます。第三者のレビュアーは、プライバシーの方針が暗号化の方式や保存期間を明示せず、削除の権利はカリフォルニア州の居住者にのみ提供されていると指摘しています。
既定では受けられません。規約は、購入時に別段の記載があるか関連法が求める場合を除き、定期料金と従量料金および一回限りの購入を含むすべての支払いが返金されないと述べ、例外は同社の裁量であってそうする義務はないと記しています。独立したレビュアーは返金手続きが厳格で別途の登録を求めると説明しており、契約と更新に関する不満は Trustpilot の直近の評価の要約で最も集中している主題です。
主な違いは何を最適化したかにあります。Ahrens はこれを明確に述べています。中核的な価値は特定の人物を完璧に複製することではなく、リアルタイムで音色を替えながら話し手の感情と話す速さと強弱を保つことにある、というものです。ElevenLabs と Respeecher は完成した内容物のために目標となる音色の再現度を中心に作られています。Voice.ai はリアルタイム変換とコミュニティが共に積み上げた音声ライブラリ、そして今では電話の音声エージェントを中心に作られています。特定の話し手ひとりを放送水準で再現する必要があるなら専門のベンダーのほうが適していますし、ゲームや通話の最中にリアルタイムで別人のように聞こえる必要があるなら、ここが本拠地です。