Toolso.AI
Toolso.AI
すべてのツールカテゴリ急上昇最新ツール料金プランブログ
Toolso.AI
Toolso.AI

💌AIツールウィークリーを購読

最新かつ最も注目されるAIツールとトレンドの週次厳選セレクションをメールボックスにお届けします 購読

Toolso.AI
Toolso.AI

生産性を向上させる最高のAIツールを発見する

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

人気カテゴリ

  • AI執筆
  • AI画像
  • AI動画
  • AIコーディング
  • 他のカテゴリ

探索

  • 最新ツール
  • 人気ツール
  • 他のツール
  • ツールを提出
  • 料金

会社概要

  • 会社概要
  • お問い合わせ
  • ブログ
  • 変更履歴

法的情報

  • クッキーポリシー
  • プライバシーポリシー
  • 利用規約
  • 返金ポリシー
© 2026 Toolso.AI 無断転載を禁じます
期間限定期間限定注目掲載24時間優先審査・被リンク不要・30日間注目表示$29.90終了後 $59.9010月31日以降 $59.90に値上げ終了まで--:--:--今すぐ投稿
  1. ホーム
  2. すべてのツール
  3. 音声技術
  4. Cartesia
Cartesiaのインターフェースプレビュー
Cartesiaのロゴ

Cartesia

Cartesiaは、44言語対応のSonic音声合成、Inkのストリーミング音声認識、音声クローン、マネージド音声エージェントを1つのAPIで提供し、ライブ通話に耐える速さの音声を必要とする開発者向けに作られています。

音声技術開発ツール音声生成#テキスト読み上げ#音声クローン#リアルタイム
価格を見る
保存
アクセス数
閲覧数
価格
有料
公開日
2026年10月6日
ドメイン
cartesia.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

Cartesia 製品情報

価格を見る
ツール情報
保存
アクセス数
閲覧数
価格
有料
公開日
2026年10月6日
ドメイン
cartesia.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

注目のツール

関連ツール

価格を見る

Cartesiaとは?

Cartesiaは、リアルタイム音声モデルとホスト型の音声エージェント基盤を開発者向けに販売する音声AI企業で、自らをリアルタイム音声モデルとエージェントを開発するAIラボと称しています。Cartesiaは、音声生成、文字起こし、本番運用向けの音声エージェントを1つのAPIで提供し、ライブ会話に使える速さを打ち出しています。

製品ラインは3層構成です。Cartesia Sonicが音声合成モデル、Inkが音声認識モデルで、マネージドエージェントはこの2つを大規模言語モデルと組み合わせ、電話やアプリ内の会話を処理します。音声クローンはSonic上に構築され、有料APIとは別に無料のブラウザ版ボイスチェンジャーもあります。

創業チームはスタンフォードAIラボの博士課程で出会い、そこで状態空間モデル(SSM)を発明したと述べています。SSMは、Cartesiaが標準的なTransformerの代わりに採用しているアーキテクチャです。同社は速度とコストをSSMのおかげとしていますが、測定結果ではなく同社自身の説明です。

主な機能

Sonic音声合成

  • 44言語:Sonic 3.6は、Cartesiaで最も高速かつ自然な音声合成モデルとされ、44言語にネイティブ対応しています。
  • レイテンシ:Cartesiaによると、Sonicのモデルレイテンシは90ミリ秒未満で、ストリーミングにより応答全体が生成される前に再生を始められます。
  • 表現豊かな読み上げ:Sonicは初期設定で原稿の感情のニュアンスを読み取って話し方を調整し、笑い声のような非言語音も原稿に直接書き込めます。
  • 発音の制御:カスタム発音辞書で、固有名詞や専門用語の読み方を設定できます。
  • バージョンの固定:モデルIDのsonic-3.6は常に最新の安定版スナップショットを指し、日付付きのスナップショットは公開後は変わりません。sonic-previewは本番利用を想定していないベータ版モデルです。

Ink音声認識

  • ターン検出を内蔵:Ink 2は別途の音声区間検出器が不要です。開始、更新、早期終了、再開、終了といったターンイベントを出力し、エージェントにいつ聞いていつ応答すべきかを伝えるためです。
  • 構造化データ:Cartesiaによると、Inkはストリーミング音声認識モデルの中で単語誤り率が最も低く、電話番号、日付、メールアドレス、通貨、UUIDをネイティブに処理します。

音声クローン

Cartesiaは2段階のAI音声クローンを提供しています。インスタント音声クローンは10秒の音声から作成でき、Sonic 3.6以降ではアクセントを保つために最長60秒まで使え、アップロードできるファイルは16MBまでです。プロ音声クローンは、1人の話者の音声を30分以上使ってモデルをファインチューニングし、学習には最長3時間かかります。プロクローンは1回につき1言語でしか学習されないため、多言語のブランドボイスには言語ごとに別録りのデータセットが必要です。

マネージドエージェント

マネージドエージェントは、Ink-2、顧客が選んだLLM、Sonic-3.6を1つのリアルタイム音声エージェントにまとめ、発話の交代、割り込み、音声ストリーミング、ツール呼び出しを処理します。エージェントが使えるツールは3種類で、通話終了などの組み込みシステムツール、顧客のサーバーにリクエストを送るWebhookツール、接続中のブラウザやモバイルアプリ、サーバーで動くクライアントツールがあります。LLMとの連携はCartesia自身が運用するため、モデル提供元の別アカウントやAPIキーは不要です。組み込みの評価フレームワークでは、ライブテスト、システム指標、カスタム通話分析も利用できます。

ガイド

インスタント音声クローンを作成して使う

  1. 自分の声である話者か、クローン作成の明確な許可を得ている話者を選びます。
  2. 音楽、反響、背景ノイズのない静かな部屋で話者1人だけを録音し、クローンに使わせたい言語とスタイルで話してもらいます。クリップの雰囲気はインスタントクローンの声に反映されます。
  3. Playgroundでインスタント音声クローンを開き、クリップを録音またはアップロードして話している言語を選ぶか、クローン作成がアプリケーションの一部である場合はクローンAPIを呼び出します。
  4. PlaygroundとAPIのどちらで作成した声でも、音声合成リクエストではそのクローンのボイスIDを使います。

APIでプロ音声クローンを学習させる

APIでプロ音声クローンを作る手順は4段階です。データセットを作成し、そこに音声ファイルをアップロードし、そのデータセットからファインチューニングを作成して、最後にファインチューニングで生成されたボイスを一覧表示します。

Cartesiaのユースケースと事例

Cartesiaが挙げる事例は、電話エージェントとメディア向けのクローン音声が中心です。

  • カスタマーサポート:エージェントが発信者を認証し、最新のアカウントデータを取得して、請求の質問、注文状況、アカウントの問題を保留や転送なしで解決します。
  • 採用:エージェントが応募者にすぐ電話をかけて選考し、通話が終わる前に適格性の要約を応募者追跡システムに送ります。
  • 不正検知:疑わしい取引に対してエージェントがリアルタイムで確認の発信を行い、ステップアップ認証を処理します。
  • ゲーム:スタジオは声優のクローンでキャラクターのセリフを作り、ストーリーの変化に合わせて新しいセリフをテキストから読み上げられます。
  • 吹き替え:カスタムボイスが対応言語で翻訳済みの台本を読み上げ、音声を動画に入れる前に発音とタイミングを確認します。

規模の例としてCartesiaはBolnaを挙げ、同社がCartesiaの低レイテンシ基盤上で、インドの複数言語にわたる1日50万件以上の音声通話を処理していると述べています。これは独立した監査ではなく、ベンダーが公開した顧客事例です。

対象ユーザー

Cartesiaは、完成した消費者向けアプリを探している人ではなく、自社ソフトウェアに音声を組み込むチームに向いています。

  • アーリーステージの企業:助成プログラムはあらゆる段階のスタートアップを受け付け、学生や単発のプロジェクトは個別に検討されます。採択されたスタートアップは、Scaleプランを12か月利用でき、毎月SonicとInkで共有する800万クレジットに加え、月$299分のマネージドエージェント用クレジットを受け取ります。見返りとして、参加者は自社ロゴを提供し、Cartesiaがマーケティングで参加者の名前とロゴを使うことを認めます。
  • 規制業界、大量利用、公共部門の購入者:5,000万クレジットを超えて利用する、オンプレミス・VPC・OEMでの導入が必要、BAAやデータ保持ゼロが必要、または政府向けに購入する、といったチームはCartesiaから営業窓口に案内されます。

Inkの5言語以外でストリーミング文字起こしを必要とするチーム、Freeプランで音声クローンを期待する人、返金可能なサブスクリプションを求める購入者にはあまり向いていません。

プラットフォーム

  • ブラウザのPlayground:すべてのモデルをブラウザで試せ、APIキーもここで作成します。
  • APIエンドポイント:Sonicの音声合成APIは、/tts/bytes、/tts/sse、/tts/websocketの3つのエンドポイントで提供されます。
  • SDK:公式SDKは、JavaScript/TypeScriptとPythonでTTS、STT、ボイスの各APIに対応しています。
  • コーディングエージェント:Cartesia MCPはCursor、Claude CodeなどのMCPクライアントで動作し、独自スクリプトなしでボイスの一覧表示、TTSとSTTの実行、発音辞書の管理ができます。
  • エージェントフレームワーク:LiveKit連携では、CartesiaプラグインまたはLiveKit Inferenceを通じてリアルタイムのルームとエージェントを利用できます。Pipecatは、音声・マルチモーダルエージェント向けに公式のCartesia TTSとSTTのサービスを提供しています。
  • 電話:エージェントは、Cartesiaが払い出した番号、Twilioから取り込んだ番号、SIPキャリア経由の番号に接続できます。
  • デプロイ:クラウドのトラフィックはリージョンごとのAPIエンドポイントを通り、リージョン内で処理されます。モデルは顧客のデータセンターやカスタムハードウェアでも動かせます。エンタープライズ契約では、Sonic-3.6をオンプレミス(エアギャップ環境を含む)、AWS・GCP・Azure上の顧客VPCにデプロイするか、OEMライセンスで組み込めます。
  • マーケットプレイス:CartesiaはSonic、Ink、音声エージェントをまとめた1つのサブスクリプションをAWS Marketplaceでも販売しています。

価格

Cartesiaは音声モデルをクレジットで、エージェント通話をドルで課金し、すべてのプランにワークスペースのシートが無制限で含まれます。2026年10月6日に確認した月額プランは次のとおりです。

プラン月額料金月間クレジット前払いのエージェント用ドルプランで追加される内容
Free$02万$1音声合成と音声認識の利用
Pro$510万$5商用利用ライセンスとインスタント音声クローン
Startup$49125万$49Proの全内容に加えてプロ音声クローン
Scale$299800万$299優先サポートと高い同時実行上限
Enterpriseカスタムカスタムカスタムボリューム価格、カスタム同時実行数、DPAとBAA、SSO

Free、Pro、Startup、Scaleでは、Sonic-3.6の枠は月約27分、133分、1,667分、10,667分に相当し、音声合成の同時リクエスト数は2、3、5、15です。Ink-2の枠は文字起こし時間でおよそ1時間51分、9時間16分、115時間44分、740時間44分で、同時リクエスト数は8、12、20、60です。

  • 音声合成の計量:Sonic音声1分あたり750〜800クレジットを使います。1クレジットが1文字に相当するためです。
  • 音声認識の計量:Ink-2は音声1秒あたり3クレジットです。料金はモデルと、エンドポイントがバッチかリアルタイムかで異なり、文字起こし結果が返らない場合でも無音部分が課金されます。
  • 音声エージェント:通話は1分あたり$0.06で、Cartesiaが提供する電話番号を使う場合は1分あたり$0.014が加算されます。前払いのエージェント用ドルは、マネージド電話番号の費用を除いて、Freeで約17分、Proで1時間23分、Startupで13時間37分、Scaleで83時間3分分です。
  • 超過利用:有料ユーザーは超過利用を有効にでき、100万クレジットあたりProで$65、Startupで$45、Scaleで$38です。超過利用がオフの場合、クレジットを使い切ると新しいリクエストはブロックされます。
  • 繰り越し:未使用のクレジットは、月間プラン付与量の2倍まで繰り越されます。
  • プロ音声クローンの枠:プロクローンの学習は無料で、その音声には1文字あたり1クレジットかかります。Startupには2枠、Scaleには4枠が含まれ、FreeとProにはありません。
  • 更新と解約:サブスクリプションは購入日から毎月更新され、期間途中で解約やダウングレードをしても、期間終了まで元のプランが維持されます。
  • 返金:規約で別段の定めがある場合を除き、サブスクリプションの支払いは返金されず、一部のみ利用した期間も差額は充当されません。

Cartesiaの音声合成・文字起こしの代替ツール

Cartesiaのサイトは、自社モデルが第三者の音声アリーナのリーダーボードと音声認識のリーダーボードで1位だと述べています。一方、ブラインドの聴取投票に基づくその独立アリーナのプロバイダー音声による音声合成リーダーボードでは、2026年10月6日の確認時点で、Eleven v4 Turbo(Elo 1334)、Eleven v4(1321)、Qwen-Audio-3.1-TTS-Plus(1292)がSonic 3.6(1278)より上位にあり、Gemini 3.8 Flash TTS(1275)がすぐ後ろに続いていました。2つの主張はその日一致しておらず、この比較はアリーナのプロバイダー音声の表示だけを対象にしています。

文字起こしについてCartesiaは、電話回線の録音、なまりのある音声、ノイズの多い音声、決算説明会の通話で、Ink-2がDeepgram Flux、Soniox RT-V4、AssemblyAI RT Pro、ElevenLabs Scribe-2-realtimeを上回ると主張しています。このベンチマークはベンダー自身によるものですが、Cartesiaが直接の競合とみなすストリーミングモデルを示しています。

制限事項

  • クローンの利用条件の記載が食い違う:音声クローンのページでは、クローン作成には有料プランが必要で、インスタント音声クローンはProから、プロ音声クローンはStartupからとされています。一方でSonicのFAQは、Free層を評価と個人利用向けとし、インスタント音声クローンを含むと説明しています。同じFAQはプロ音声クローンに必要な参照音声を15〜30分としていますが、クローンのドキュメントでは30分が最低条件です。
  • プロクローンは速度と音量が固定:プロ音声クローンはデータセットから話すペースと音量を学習するため、リクエスト時の速度や音量の制御は効きません。
  • 文字起こしは5言語:Ink-2が対応するのは英語、スペイン語、フランス語、ヒンディー語、日本語で、Sonicの44言語よりはるかに少数です。
  • エージェントのLLM料金が不明確:エージェントのLLMドキュメントには2026年10月1日までLLMの利用が無料と書かれていますが、これは今回の確認より前の日付です。料金ページには、UIで作成したエージェントの通話中のLLM利用が期間限定で無料と今も記載されています。モデルごとのトークン価格、プロバイダー、平均レイテンシは、エージェントのモデル用エンドポイントが返します。
  • 払い出せる番号は米国のみ:Cartesiaが払い出すのは米国の電話番号だけで、他国の番号はTwilioまたはSIPキャリア経由で用意します。
  • 通話のコンプライアンスは顧客の責任:すべての通話、テキストメッセージ、録音済みメッセージを、電話消費者保護法や電話勧誘拒否のルールを含む適用法に適合させる責任は、顧客だけが負います。
  • クローンの安全対策の当時と現在:2024年12月、独立系のITメディアは、Sonicの音声クローン機能には目に見える安全対策がほとんどなく、利用規約への同意のチェックボックスしか求められないと報じました。Cartesiaは当時、自動と人手によるレビューを行っており、音声の検証と電子透かしにも取り組んでいると説明しました。現在Cartesiaは、すべての音声クローンに話者の検証済みの同意が必要で、著名人や同意のない他人のクローン作成は禁止されているとしています。2026年10月6日に確認したクローン関連ページのいずれにも、その同意をどう検証するかは書かれていません。
  • レビューの基盤が薄い:あるクラウドマーケットプレイスの掲載ページは、2026年10月6日の確認時点で41件の評価から5点満点中4.3点を表示していましたが、すべて外部のビジネスソフトウェアレビューサイトから取り込まれたもので、マーケットプレイス上で書かれたレビューはありませんでした。

プライバシー、データ利用、音声の権利

  • 顧客コンテンツでの学習:別途の合意がない限り、Cartesiaは入力、出力、ユーザーとのやり取りをモデルの学習と改善に使うことがあります。オンラインフォームで自分のコンテンツのうち特定カテゴリーを除外できますが、このオプトアウトは今後にのみ適用され、過去の利用は取り消されません。
  • データ保持ゼロ:データ保持ゼロはEnterpriseの顧客だけがTTSとSTTのAPIで利用でき、音声クローン、プロ音声クローン、ボイス作成は対象外です。
  • アプリの開示義務:Cartesiaを使って作ったアプリは、エンドユーザーに対し、人間ではなくAIと話していること、会話が録音され、Cartesiaとその第三者LLMプロバイダーに共有される場合があることを伝えなければなりません。
  • 商用利用:サブスクリプションのプランが明示的に認めていない限り、出力は商用利用できません。プラン表では、商用利用ライセンスはProからです。
  • 声となりすましのルール:許容利用ポリシーは、著名人を含むあらゆる個人や企業へのなりすましを禁止し、自分の声か、明示的な同意を得た他人の声だけを認めています。規約はさらに、明示的な許可なく故人や政治候補者の声を投稿することも禁じています。
  • 未成年者と政治:出力は18歳未満の人に関するものや、その人を表すものであってはなりません。ポリシーは正当な政治広告、選挙運動、ロビー活動、資金集めも禁じています。

よくある質問

Q1. アカウントを作らずにCartesiaを試せますか?

一部は可能です。AIボイスチェンジャーは登録なしで無料で試せます。無料の変換には1日あたりの上限があり、アップロードできるのは15MB未満のWAVまたはMP3ファイルです。

Q2. 失敗したAPIリクエストでもクレジットは消費されますか?

いいえ。クレジットを消費するのは成功したリクエストだけで、エラーには課金されません。

Q3. クローンした声でほかの言語を話せますか?

はい、ただし手順が1つ増えます。インスタントクローンはそれぞれ1つの言語から作られるため、まず元の言語でクローンを作り、ボイスアクセント追加APIでほかの言語を加えます。ボイスアクセントを1つ追加するごとに225クレジットかかります。

Q4. Sonicはどの音声形式を返しますか?

Bytesエンドポイントは未加工の音声、WAV、MP3を返せますが、SSEとWebSocketのエンドポイントが返すのは未加工の音声だけです。対応するサンプリングレートは8000〜48000Hzです。

Q5. CartesiaはSOC 2やHIPAAに準拠していますか?

Cartesiaは、自社のコンプライアンス体制にSOC 2 Type II、医療機関の顧客向けにBAAを提供できるHIPAA適格性、GDPR準拠が含まれ、対象サービスではエンタープライズ顧客にデータ保持ゼロを提供していると述べています。

類似のツールをご存知ですか?
他の素晴らしいAIツールをご存知でしたら、ぜひ私たちに提出してください