Cartesiaは、リアルタイム音声モデルとホスト型の音声エージェント基盤を開発者向けに販売する音声AI企業で、自らをリアルタイム音声モデルとエージェントを開発するAIラボと称しています。Cartesiaは、音声生成、文字起こし、本番運用向けの音声エージェントを1つのAPIで提供し、ライブ会話に使える速さを打ち出しています。
製品ラインは3層構成です。Cartesia Sonicが音声合成モデル、Inkが音声認識モデルで、マネージドエージェントはこの2つを大規模言語モデルと組み合わせ、電話やアプリ内の会話を処理します。音声クローンはSonic上に構築され、有料APIとは別に無料のブラウザ版ボイスチェンジャーもあります。
創業チームはスタンフォードAIラボの博士課程で出会い、そこで状態空間モデル(SSM)を発明したと述べています。SSMは、Cartesiaが標準的なTransformerの代わりに採用しているアーキテクチャです。同社は速度とコストをSSMのおかげとしていますが、測定結果ではなく同社自身の説明です。
Cartesiaは2段階のAI音声クローンを提供しています。インスタント音声クローンは10秒の音声から作成でき、Sonic 3.6以降ではアクセントを保つために最長60秒まで使え、アップロードできるファイルは16MBまでです。プロ音声クローンは、1人の話者の音声を30分以上使ってモデルをファインチューニングし、学習には最長3時間かかります。プロクローンは1回につき1言語でしか学習されないため、多言語のブランドボイスには言語ごとに別録りのデータセットが必要です。
マネージドエージェントは、Ink-2、顧客が選んだLLM、Sonic-3.6を1つのリアルタイム音声エージェントにまとめ、発話の交代、割り込み、音声ストリーミング、ツール呼び出しを処理します。エージェントが使えるツールは3種類で、通話終了などの組み込みシステムツール、顧客のサーバーにリクエストを送るWebhookツール、接続中のブラウザやモバイルアプリ、サーバーで動くクライアントツールがあります。LLMとの連携はCartesia自身が運用するため、モデル提供元の別アカウントやAPIキーは不要です。組み込みの評価フレームワークでは、ライブテスト、システム指標、カスタム通話分析も利用できます。
APIでプロ音声クローンを作る手順は4段階です。データセットを作成し、そこに音声ファイルをアップロードし、そのデータセットからファインチューニングを作成して、最後にファインチューニングで生成されたボイスを一覧表示します。
Cartesiaが挙げる事例は、電話エージェントとメディア向けのクローン音声が中心です。
規模の例としてCartesiaはBolnaを挙げ、同社がCartesiaの低レイテンシ基盤上で、インドの複数言語にわたる1日50万件以上の音声通話を処理していると述べています。これは独立した監査ではなく、ベンダーが公開した顧客事例です。
Cartesiaは、完成した消費者向けアプリを探している人ではなく、自社ソフトウェアに音声を組み込むチームに向いています。
Inkの5言語以外でストリーミング文字起こしを必要とするチーム、Freeプランで音声クローンを期待する人、返金可能なサブスクリプションを求める購入者にはあまり向いていません。
Cartesiaは音声モデルをクレジットで、エージェント通話をドルで課金し、すべてのプランにワークスペースのシートが無制限で含まれます。2026年10月6日に確認した月額プランは次のとおりです。
| プラン | 月額料金 | 月間クレジット | 前払いのエージェント用ドル | プランで追加される内容 |
|---|---|---|---|---|
| Free | $0 | 2万 | $1 | 音声合成と音声認識の利用 |
| Pro | $5 | 10万 | $5 | 商用利用ライセンスとインスタント音声クローン |
| Startup | $49 | 125万 | $49 | Proの全内容に加えてプロ音声クローン |
| Scale | $299 | 800万 | $299 | 優先サポートと高い同時実行上限 |
| Enterprise | カスタム | カスタム | カスタム | ボリューム価格、カスタム同時実行数、DPAとBAA、SSO |
Free、Pro、Startup、Scaleでは、Sonic-3.6の枠は月約27分、133分、1,667分、10,667分に相当し、音声合成の同時リクエスト数は2、3、5、15です。Ink-2の枠は文字起こし時間でおよそ1時間51分、9時間16分、115時間44分、740時間44分で、同時リクエスト数は8、12、20、60です。
Cartesiaのサイトは、自社モデルが第三者の音声アリーナのリーダーボードと音声認識のリーダーボードで1位だと述べています。一方、ブラインドの聴取投票に基づくその独立アリーナのプロバイダー音声による音声合成リーダーボードでは、2026年10月6日の確認時点で、Eleven v4 Turbo(Elo 1334)、Eleven v4(1321)、Qwen-Audio-3.1-TTS-Plus(1292)がSonic 3.6(1278)より上位にあり、Gemini 3.8 Flash TTS(1275)がすぐ後ろに続いていました。2つの主張はその日一致しておらず、この比較はアリーナのプロバイダー音声の表示だけを対象にしています。
文字起こしについてCartesiaは、電話回線の録音、なまりのある音声、ノイズの多い音声、決算説明会の通話で、Ink-2がDeepgram Flux、Soniox RT-V4、AssemblyAI RT Pro、ElevenLabs Scribe-2-realtimeを上回ると主張しています。このベンチマークはベンダー自身によるものですが、Cartesiaが直接の競合とみなすストリーミングモデルを示しています。
一部は可能です。AIボイスチェンジャーは登録なしで無料で試せます。無料の変換には1日あたりの上限があり、アップロードできるのは15MB未満のWAVまたはMP3ファイルです。
いいえ。クレジットを消費するのは成功したリクエストだけで、エラーには課金されません。
はい、ただし手順が1つ増えます。インスタントクローンはそれぞれ1つの言語から作られるため、まず元の言語でクローンを作り、ボイスアクセント追加APIでほかの言語を加えます。ボイスアクセントを1つ追加するごとに225クレジットかかります。
Bytesエンドポイントは未加工の音声、WAV、MP3を返せますが、SSEとWebSocketのエンドポイントが返すのは未加工の音声だけです。対応するサンプリングレートは8000〜48000Hzです。
Cartesiaは、自社のコンプライアンス体制にSOC 2 Type II、医療機関の顧客向けにBAAを提供できるHIPAA適格性、GDPR準拠が含まれ、対象サービスではエンタープライズ顧客にデータ保持ゼロを提供していると述べています。