Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Cartesia ist ein Unternehmen für Sprach-KI, das Entwicklern Echtzeit-Sprachmodelle und eine gehostete Plattform für Sprachagenten verkauft, und bezeichnet sich selbst als KI-Labor, das Echtzeit-Sprachmodelle und Agenten entwickelt. Cartesia wirbt mit einer API für Sprachgenerierung, Transkription und produktive Sprachagenten, die schnell genug für Live-Gespräche ist.
Die Produktlinie hat drei Ebenen. Cartesia Sonic ist das Sprachsynthesemodell, Ink das Spracherkennungsmodell, und verwaltete Agenten kombinieren beide mit einem großen Sprachmodell, um Telefon- und In-App-Gespräche zu führen. Das Stimmklonen baut auf Sonic auf, und neben der kostenpflichtigen API wird ein kostenloser Stimmverzerrer im Browser angeboten.
Das Gründungsteam lernte sich während der Promotion am Stanford AI Lab kennen, wo es nach eigener Aussage Zustandsraummodelle (SSMs) erfunden hat, die Architektur, die Cartesia anstelle herkömmlicher Transformer nutzt. Das Unternehmen führt seine Geschwindigkeit und seine Kosten auf SSMs zurück; das ist seine eigene Erklärung und kein gemessenes Ergebnis.
Cartesia bietet KI-Stimmklonen in zwei Stufen an. Ein Sofort-Klon entsteht ab 10 Sekunden Audio, Sonic 3.6 und neuer können bis zu 60 Sekunden nutzen, um einen Akzent zu erhalten, und hochgeladene Dateien sind auf 16 MB begrenzt. Ein Pro-Stimmklon trainiert das Modell mit mindestens 30 Minuten Audio einer einzelnen Person nach, und das Training dauert bis zu 3 Stunden. Jeder Pro-Klon wird jeweils nur auf eine Sprache trainiert, daher braucht eine mehrsprachige Markenstimme für jede Sprache einen separat aufgenommenen Datensatz.
Verwaltete Agenten verbinden Ink-2, ein vom Kunden gewähltes LLM und Sonic-3.6 zu einem Echtzeit-Sprachagenten, der Sprecherwechsel, Unterbrechungen, Audio-Streaming und Tool-Aufrufe übernimmt. Agenten können drei Arten von Tools nutzen: integrierte System-Tools wie das Beenden eines Anrufs, Webhook-Tools, die Anfragen an den Server des Kunden senden, und Client-Tools, die im verbundenen Browser, in der mobilen App oder auf dem Server laufen. Die LLM-Integration betreibt Cartesia selbst, sodass kein separates Konto und kein API-Schlüssel bei einem Modellanbieter nötig sind. Ein integriertes Evaluierungs-Framework ergänzt Live-Tests, Systemmetriken und eigene Anrufanalysen.
Über die API entsteht ein Pro-Stimmklon in vier Schritten: einen Datensatz anlegen, Audiodateien in ihn hochladen, aus diesem Datensatz ein Fine-Tuning erstellen und dann die Stimmen auflisten, die das Fine-Tuning erzeugt hat.
Cartesias Beispiele drehen sich um Telefonagenten und geklonte Stimmen für Medien.
Zur Größenordnung verweist Cartesia auf Bolna, das nach Cartesias Angaben auf seiner latenzarmen Infrastruktur täglich mehr als 500.000 Sprachanrufe in indischen Sprachen abwickelt; das ist eine vom Anbieter veröffentlichte Kundengeschichte und kein unabhängiges Audit.
Cartesia passt zu Teams, die Sprache in ihre eigene Software einbauen, nicht zu Leuten, die eine fertige Verbraucher-App suchen.
Weniger geeignet ist es für Teams, die Streaming-Transkription außerhalb der fünf Ink-Sprachen brauchen, für alle, die Stimmklonen im Free-Tarif erwarten, und für Käufer, die erstattungsfähige Abonnements benötigen.
Cartesia rechnet Sprachmodelle in Credits und Agentenanrufe in Dollar ab, und jeder Tarif enthält unbegrenzt viele Workspace-Plätze. Monatstarife, erfasst am 6. Oktober 2026:
| Tarif | Preis pro Monat | Credits pro Monat | Vorausbezahlte Agenten-Dollar | Was der Tarif hinzufügt |
|---|---|---|---|---|
| Free | $0 | 20.000 | $1 | Zugang zu Sprachsynthese und Spracherkennung |
| Pro | $5 | 100.000 | $5 | Lizenz zur kommerziellen Nutzung und Sofort-Stimmklonen |
| Startup | $49 | 1.250.000 | $49 | Alles aus Pro plus Pro-Stimmklonen |
| Scale | $299 | 8.000.000 | $299 | Priorisierter Support und hohe Parallelitätslimits |
| Enterprise | Individuell | Individuell | Individuell | Mengenpreise, individuelle Parallelität, DPAs und BAAs, SSO |
In Free, Pro, Startup und Scale entsprechen die Sonic-3.6-Kontingente etwa 27, 133, 1.667 und 10.667 Minuten pro Monat bei 2, 3, 5 und 15 parallelen Sprachsynthese-Anfragen. Die Ink-2-Kontingente ergeben rund 1 Std. 51 Min., 9 Std. 16 Min., 115 Std. 44 Min. und 740 Std. 44 Min. Transkription bei 8, 12, 20 und 60 parallelen Anfragen.
Laut Cartesias Website stehen die Modelle des Unternehmens auf der Bestenliste einer externen Sprach-Arena und einer Spracherkennungs-Bestenliste auf Platz 1. Die Sprachsynthese-Bestenliste dieser unabhängigen Arena für Anbieterstimmen, die auf Blindhör-Abstimmungen beruht und am 6. Oktober 2026 erfasst wurde, führte Eleven v4 Turbo (Elo 1334), Eleven v4 (1321) und Qwen-Audio-3.1-TTS-Plus (1292) vor Sonic 3.6 (1278), mit Gemini 3.8 Flash TTS (1275) knapp dahinter. Die beiden Aussagen stimmten an diesem Tag nicht überein, und dieser Vergleich deckt nur die Ansicht der Arena mit Anbieterstimmen ab.
Bei der Transkription behauptet Cartesia, Ink-2 übertreffe Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro und ElevenLabs Scribe-2-realtime bei Telefonleitungsaufnahmen, Sprache mit Akzent, verrauschtem Audio und Telefonkonferenzen zu Geschäftszahlen. Der Benchmark stammt vom Anbieter selbst, benennt aber die Streaming-Modelle, die Cartesia als direkte Konkurrenten betrachtet.
Ja, teilweise. Der KI-Stimmverzerrer lässt sich ohne Registrierung kostenlos testen; kostenlose Umwandlungen haben ein Tageslimit, und Uploads müssen WAV- oder MP3-Dateien unter 15 MB sein.
Nein. Nur erfolgreiche Anfragen verbrauchen Credits, Fehler werden nicht berechnet.
Ja, mit einem zusätzlichen Schritt. Jeder Sofort-Klon entsteht aus einer Sprache, daher wird der Klon zuerst in seiner Ausgangssprache erstellt, und weitere Sprachen kommen über die API zum Hinzufügen von Stimmakzenten dazu. Jeder hinzugefügte Stimmakzent kostet 225 Credits.
Der Bytes-Endpunkt kann Rohaudio, WAV oder MP3 liefern, die SSE- und WebSocket-Endpunkte dagegen nur Rohaudio. Unterstützt werden Abtastraten von 8.000 bis 48.000 Hz.
Cartesia gibt an, dass seine Compliance SOC 2 Type II, HIPAA-Eignung mit BAAs für Kunden aus dem Gesundheitswesen und DSGVO-Konformität umfasst, wobei Unternehmenskunden bei berechtigten Diensten eine Option ohne Datenaufbewahrung nutzen können.