Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsPreiseBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
BefristetZeitlich begrenztHervorgehobener EintragPrüfung in 24 Std. · Kein Backlink · 30 Tage hervorgehoben$29.90danach $59.90Nach dem 31. Okt. steigt der Preis auf $59.90Endet in--:--:--Jetzt einreichen
  1. Startseite
  2. Alle Tools
  3. Sprachtechnologie
  4. Cartesia
Oberflächenvorschau von Cartesia
Logo von Cartesia

Cartesia

Cartesia bietet über eine API die Sprachsynthese Sonic in 44 Sprachen, Streaming-Spracherkennung mit Ink, Stimmklonen und gehostete Sprachagenten – für Entwickler, die Sprache schnell genug für Live-Gespräche brauchen.

SprachtechnologieEntwicklertoolsSprachgenerierung#Text-zu-Sprache#Stimmklonen#Echtzeit
Preise ansehen
Gespeichert
Besuche
Aufrufe
Preis
Kostenpflichtig
Veröffentlicht
6. Okt. 2026
Domain
cartesia.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Cartesia Produktinformationen

Preise ansehen
Tool-Informationen
Gespeichert
Besuche
Aufrufe
Preis
Kostenpflichtig
Veröffentlicht
6. Okt. 2026
Domain
cartesia.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Empfohlene Tools

Verwandte Tools

Preise ansehen

Was ist Cartesia?

Cartesia ist ein Unternehmen für Sprach-KI, das Entwicklern Echtzeit-Sprachmodelle und eine gehostete Plattform für Sprachagenten verkauft, und bezeichnet sich selbst als KI-Labor, das Echtzeit-Sprachmodelle und Agenten entwickelt. Cartesia wirbt mit einer API für Sprachgenerierung, Transkription und produktive Sprachagenten, die schnell genug für Live-Gespräche ist.

Die Produktlinie hat drei Ebenen. Cartesia Sonic ist das Sprachsynthesemodell, Ink das Spracherkennungsmodell, und verwaltete Agenten kombinieren beide mit einem großen Sprachmodell, um Telefon- und In-App-Gespräche zu führen. Das Stimmklonen baut auf Sonic auf, und neben der kostenpflichtigen API wird ein kostenloser Stimmverzerrer im Browser angeboten.

Das Gründungsteam lernte sich während der Promotion am Stanford AI Lab kennen, wo es nach eigener Aussage Zustandsraummodelle (SSMs) erfunden hat, die Architektur, die Cartesia anstelle herkömmlicher Transformer nutzt. Das Unternehmen führt seine Geschwindigkeit und seine Kosten auf SSMs zurück; das ist seine eigene Erklärung und kein gemessenes Ergebnis.

Kernfunktionen

Sprachsynthese mit Sonic

  • 44 Sprachen: Sonic 3.6 wird als Cartesias schnellstes und natürlichstes Sprachsynthesemodell beschrieben und unterstützt 44 Sprachen nativ.
  • Latenz: Laut Cartesia liefert Sonic eine Modelllatenz unter 90 ms, und dank Streaming kann die Wiedergabe beginnen, bevor die vollständige Antwort generiert ist.
  • Ausdrucksstarker Vortrag: Standardmäßig erfasst Sonic den emotionalen Subtext eines Skripts und passt seinen Vortrag an; nonverbale Laute wie Lachen lassen sich direkt ins Skript schreiben.
  • Aussprachesteuerung: Eigene Aussprachewörterbücher legen fest, wie Eigennamen und Fachbegriffe gesprochen werden.
  • Versionsfixierung: Die Modell-ID sonic-3.6 verweist immer auf den neuesten stabilen Snapshot, ein datierter Snapshot ändert sich nach der Veröffentlichung nicht mehr, und sonic-preview ist ein Betamodell, das nicht für den Produktivbetrieb gedacht ist.

Spracherkennung mit Ink

  • Integrierte Sprecherwechsel-Erkennung: Ink 2 braucht keinen separaten Sprachaktivitätsdetektor, weil es Wechselereignisse (Start, Update, vorzeitiges Ende, Fortsetzung und Ende) ausgibt, die einem Agenten sagen, wann er zuhören und wann er antworten soll.
  • Strukturierte Daten: Laut Cartesia hat Ink die niedrigste Wortfehlerrate aller Streaming-Spracherkennungsmodelle und verarbeitet Telefonnummern, Datumsangaben, E-Mail-Adressen, Währungen und UUIDs nativ.

Stimmklonen

Cartesia bietet KI-Stimmklonen in zwei Stufen an. Ein Sofort-Klon entsteht ab 10 Sekunden Audio, Sonic 3.6 und neuer können bis zu 60 Sekunden nutzen, um einen Akzent zu erhalten, und hochgeladene Dateien sind auf 16 MB begrenzt. Ein Pro-Stimmklon trainiert das Modell mit mindestens 30 Minuten Audio einer einzelnen Person nach, und das Training dauert bis zu 3 Stunden. Jeder Pro-Klon wird jeweils nur auf eine Sprache trainiert, daher braucht eine mehrsprachige Markenstimme für jede Sprache einen separat aufgenommenen Datensatz.

Verwaltete Agenten

Verwaltete Agenten verbinden Ink-2, ein vom Kunden gewähltes LLM und Sonic-3.6 zu einem Echtzeit-Sprachagenten, der Sprecherwechsel, Unterbrechungen, Audio-Streaming und Tool-Aufrufe übernimmt. Agenten können drei Arten von Tools nutzen: integrierte System-Tools wie das Beenden eines Anrufs, Webhook-Tools, die Anfragen an den Server des Kunden senden, und Client-Tools, die im verbundenen Browser, in der mobilen App oder auf dem Server laufen. Die LLM-Integration betreibt Cartesia selbst, sodass kein separates Konto und kein API-Schlüssel bei einem Modellanbieter nötig sind. Ein integriertes Evaluierungs-Framework ergänzt Live-Tests, Systemmetriken und eigene Anrufanalysen.

Anleitung

Einen Sofort-Stimmklon erstellen und nutzen

  1. Wählen Sie eine Person, deren Stimme Ihnen gehört oder die Sie mit ausdrücklicher Erlaubnis klonen dürfen.
  2. Nehmen Sie eine einzelne Person in einem ruhigen Raum ohne Musik, Hall oder Hintergrundgeräusche auf, in der Sprache und dem Stil, die der Klon verwenden soll; die Stimmung des Clips überträgt sich auf die Stimme eines Sofort-Klons.
  3. Öffnen Sie das Sofort-Stimmklonen im Playground, nehmen Sie den Clip auf oder laden Sie ihn hoch und wählen Sie die gesprochene Sprache, oder rufen Sie die Klon-API auf, wenn das Klonen Teil einer Anwendung ist.
  4. Verwenden Sie die Stimmen-ID des Klons in Sprachsynthese-Anfragen, egal ob die Stimme im Playground oder über die API erstellt wurde.

Einen Pro-Stimmklon über die API trainieren

Über die API entsteht ein Pro-Stimmklon in vier Schritten: einen Datensatz anlegen, Audiodateien in ihn hochladen, aus diesem Datensatz ein Fine-Tuning erstellen und dann die Stimmen auflisten, die das Fine-Tuning erzeugt hat.

Anwendungsfälle und Beispiele für Cartesia

Cartesias Beispiele drehen sich um Telefonagenten und geklonte Stimmen für Medien.

  • Kundensupport: Ein Agent authentifiziert Anrufer, ruft Live-Kontodaten ab und klärt Abrechnungsfragen, Bestellstatus und Kontoprobleme ohne Wartezeiten oder Weiterleitungen.
  • Personalgewinnung: Ein Agent ruft Bewerber sofort an, prüft sie vorab und überträgt noch vor Gesprächsende eine Eignungszusammenfassung in das Bewerbermanagementsystem.
  • Betrugserkennung: Agenten führen bei verdächtigen Transaktionen ausgehende Verifizierungsanrufe in Echtzeit durch und übernehmen die verstärkte Authentifizierung.
  • Spiele: Studios können Figurendialoge aus dem Klon eines Synchronsprechers erstellen und neue Zeilen direkt aus Text sprechen lassen, wenn sich die Geschichte ändert.
  • Synchronisation: Eine eigene Stimme liest übersetzte Skripte in unterstützten Sprachen, wobei Aussprache und Timing geprüft werden, bevor das Audio ins Video kommt.

Zur Größenordnung verweist Cartesia auf Bolna, das nach Cartesias Angaben auf seiner latenzarmen Infrastruktur täglich mehr als 500.000 Sprachanrufe in indischen Sprachen abwickelt; das ist eine vom Anbieter veröffentlichte Kundengeschichte und kein unabhängiges Audit.

Für wen ist es

Cartesia passt zu Teams, die Sprache in ihre eigene Software einbauen, nicht zu Leuten, die eine fertige Verbraucher-App suchen.

  • Junge Unternehmen: Ein Förderprogramm nimmt Startups in jeder Phase auf und prüft Studierende und einmalige Projekte im Einzelfall. Aufgenommene Startups erhalten 12 Monate Scale mit monatlich 8 Millionen gemeinsam nutzbaren Sonic- und Ink-Credits plus $299 pro Monat an Credits für verwaltete Agenten. Im Gegenzug stellen die Teilnehmer ihr Logo bereit und erlauben Cartesia, ihren Namen und ihr Logo im Marketing zu verwenden.
  • Regulierte, volumenstarke und öffentliche Käufer: Cartesia verweist Teams an den Vertrieb, wenn sie mehr als 50 Millionen Credits verbrauchen, lokale, VPC- oder OEM-Bereitstellung brauchen, ein BAA oder eine Option ohne Datenaufbewahrung benötigen oder für Behörden einkaufen.

Weniger geeignet ist es für Teams, die Streaming-Transkription außerhalb der fünf Ink-Sprachen brauchen, für alle, die Stimmklonen im Free-Tarif erwarten, und für Käufer, die erstattungsfähige Abonnements benötigen.

Plattformen

  • Browser-Playground: Jedes Modell lässt sich im Browser testen, wo auch API-Schlüssel erstellt werden.
  • API-Endpunkte: Die Text-to-Speech-API von Sonic wird über drei Endpunkte bereitgestellt: /tts/bytes, /tts/sse und /tts/websocket.
  • SDKs: Offizielle SDKs decken die TTS-, STT- und Stimmen-APIs in JavaScript/TypeScript und Python ab.
  • Coding-Agenten: Cartesia MCP funktioniert in Cursor, Claude Code und anderen MCP-Clients, um Stimmen aufzulisten, TTS und STT auszuführen und Aussprachewörterbücher ohne eigene Skripte zu verwalten.
  • Agenten-Frameworks: Eine LiveKit-Integration bietet Echtzeit-Räume und Agenten über das Cartesia-Plugin oder LiveKit Inference. Pipecat liefert offizielle Cartesia-TTS- und STT-Dienste für Sprach- und multimodale Agenten.
  • Telefonie: Agenten verbinden sich mit von Cartesia bereitgestellten Nummern, aus Twilio importierten Nummern oder über einen SIP-Anbieter gerouteten Nummern.
  • Bereitstellung: Cloud-Verkehr läuft über regionale API-Endpunkte zur Verarbeitung in der Region, und die Modelle können auch im Rechenzentrum eines Kunden oder auf eigener Hardware laufen. Mit Enterprise-Verträgen lässt sich Sonic-3.6 lokal (auch an vom Netz isolierten Standorten), in einer Kunden-VPC auf AWS, GCP oder Azure bereitstellen oder per OEM-Lizenz einbetten.
  • Marktplatz: Cartesia verkauft über AWS Marketplace außerdem ein einzelnes Abonnement, das Sonic, Ink und Sprachagenten abdeckt.

Preise

Cartesia rechnet Sprachmodelle in Credits und Agentenanrufe in Dollar ab, und jeder Tarif enthält unbegrenzt viele Workspace-Plätze. Monatstarife, erfasst am 6. Oktober 2026:

TarifPreis pro MonatCredits pro MonatVorausbezahlte Agenten-DollarWas der Tarif hinzufügt
Free$020.000$1Zugang zu Sprachsynthese und Spracherkennung
Pro$5100.000$5Lizenz zur kommerziellen Nutzung und Sofort-Stimmklonen
Startup$491.250.000$49Alles aus Pro plus Pro-Stimmklonen
Scale$2998.000.000$299Priorisierter Support und hohe Parallelitätslimits
EnterpriseIndividuellIndividuellIndividuellMengenpreise, individuelle Parallelität, DPAs und BAAs, SSO

In Free, Pro, Startup und Scale entsprechen die Sonic-3.6-Kontingente etwa 27, 133, 1.667 und 10.667 Minuten pro Monat bei 2, 3, 5 und 15 parallelen Sprachsynthese-Anfragen. Die Ink-2-Kontingente ergeben rund 1 Std. 51 Min., 9 Std. 16 Min., 115 Std. 44 Min. und 740 Std. 44 Min. Transkription bei 8, 12, 20 und 60 parallelen Anfragen.

  • Abrechnung der Sprachsynthese: Eine Minute Sonic-Audio verbraucht 750–800 Credits, weil 1 Credit 1 Zeichen entspricht.
  • Abrechnung der Spracherkennung: Ink-2 kostet 3 Credits pro Sekunde Audio. Die Sätze hängen vom Modell und davon ab, ob Batch- oder Echtzeit-Endpunkte genutzt werden, und Stille wird auch dann berechnet, wenn kein Transkript zurückkommt.
  • Sprachagenten: Anrufe kosten $0.06 pro Minute, plus $0.014 pro Minute bei einer von Cartesia bereitgestellten Telefonnummer. Die vorausbezahlten Agenten-Dollar reichen vor Kosten für verwaltete Telefonnummern für etwa 17 Minuten in Free, 1 Stunde 23 Minuten in Pro, 13 Stunden 37 Minuten in Startup und 83 Stunden 3 Minuten in Scale.
  • Mehrverbrauch: Zahlende Nutzer können Mehrverbrauch zu $65 pro 1 Million Credits in Pro, $45 in Startup und $38 in Scale aktivieren; ist er deaktiviert, werden neue Anfragen blockiert, sobald die Credits aufgebraucht sind.
  • Übertrag: Nicht genutzte Credits werden übertragen, bis zum 2-Fachen des monatlichen Tarifkontingents.
  • Plätze für Pro-Stimmklone: Das Training eines Pro-Klons ist kostenlos, seine Sprachausgabe kostet 1 Credit pro Zeichen; Startup enthält 2 Plätze, Scale 4, Free und Pro keine.
  • Verlängerung und Kündigung: Abonnements verlängern sich monatlich ab dem Kaufdatum, und nach einer Kündigung oder einem Downgrade mitten im Zeitraum behält das Konto seine Stufe bis zum Ende des Zeitraums.
  • Erstattungen: Sofern die Bedingungen nichts anderes vorsehen, sind Abonnementzahlungen nicht erstattungsfähig, und teilweise genutzte Zeiträume werden nicht gutgeschrieben.

Alternativen zu Cartesia für Sprachsynthese und Transkription

Laut Cartesias Website stehen die Modelle des Unternehmens auf der Bestenliste einer externen Sprach-Arena und einer Spracherkennungs-Bestenliste auf Platz 1. Die Sprachsynthese-Bestenliste dieser unabhängigen Arena für Anbieterstimmen, die auf Blindhör-Abstimmungen beruht und am 6. Oktober 2026 erfasst wurde, führte Eleven v4 Turbo (Elo 1334), Eleven v4 (1321) und Qwen-Audio-3.1-TTS-Plus (1292) vor Sonic 3.6 (1278), mit Gemini 3.8 Flash TTS (1275) knapp dahinter. Die beiden Aussagen stimmten an diesem Tag nicht überein, und dieser Vergleich deckt nur die Ansicht der Arena mit Anbieterstimmen ab.

Bei der Transkription behauptet Cartesia, Ink-2 übertreffe Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro und ElevenLabs Scribe-2-realtime bei Telefonleitungsaufnahmen, Sprache mit Akzent, verrauschtem Audio und Telefonkonferenzen zu Geschäftszahlen. Der Benchmark stammt vom Anbieter selbst, benennt aber die Streaming-Modelle, die Cartesia als direkte Konkurrenten betrachtet.

Einschränkungen

  • Widersprüchliche Angaben zum Klonzugang: Die Seite zum Stimmklonen sagt, Klonen erfordere einen kostenpflichtigen Tarif, mit Sofort-Stimmklonen ab Pro und Pro-Stimmklonen ab Startup. Die Sonic-FAQ beschreibt die Free-Stufe dagegen als für Evaluierung und private Nutzung gedacht, inklusive Sofort-Stimmklonen. Dieselbe FAQ nennt für professionelles Stimmklonen 15–30 Minuten Referenzaudio, während die Klon-Dokumentation 30 Minuten als Minimum festlegt.
  • Feste Geschwindigkeit und Lautstärke bei Pro-Klonen: Ein Pro-Stimmklon lernt Tempo und Lautheit aus seinem Datensatz, daher wirken Geschwindigkeits- und Lautstärkeregler in der Anfrage nicht auf ihn.
  • Fünf Transkriptionssprachen: Ink-2 unterstützt Englisch, Spanisch, Französisch, Hindi und Japanisch, weit weniger als die 44 von Sonic.
  • Unklare LLM-Kosten für Agenten: Die LLM-Dokumentation für Agenten nennt kostenlose LLM-Nutzung bis zum 1. Oktober 2026, ein Datum vor dieser Erfassung. Die Preisseite führt die LLM-Nutzung während Anrufen für in der Oberfläche erstellte Agenten weiterhin als zeitlich begrenzt kostenlos. Token-Preise pro Modell, Anbieter und durchschnittliche Latenz liefert der Modell-Endpunkt für Agenten.
  • Bereitgestellte Nummern nur in den USA: Cartesia stellt nur US-Telefonnummern bereit; Nummern in anderen Ländern kommen über Twilio oder einen SIP-Anbieter.
  • Anruf-Compliance bleibt beim Kunden: Kunden sind allein dafür verantwortlich, dass jeder Anruf, jede Textnachricht und jede vorab aufgezeichnete Nachricht dem geltenden Recht entspricht, einschließlich des Telephone Consumer Protection Act und der Regeln zu Sperrlisten für Werbeanrufe.
  • Schutzmaßnahmen beim Klonen, damals und heute: Ein unabhängiges IT-Medium stellte im Dezember 2024 kaum erkennbare Schutzmaßnahmen beim Stimmklon-Werkzeug von Sonic fest, das nur ein Häkchen zur Zustimmung zu den Nutzungsbedingungen verlangte; Cartesia gab damals an, automatische und manuelle Prüfungen zu haben und an Stimmverifizierung und Wasserzeichen zu arbeiten. Heute erklärt Cartesia, dass alle Stimmklone eine verifizierte Einwilligung der sprechenden Person erfordern und das Klonen von Personen des öffentlichen Lebens oder anderer Personen ohne Einwilligung verboten ist. Keine der am 6. Oktober 2026 erfassten Seiten zum Klonen beschreibt, wie diese Einwilligung geprüft wird.
  • Dünne Bewertungsbasis: Ein Eintrag auf einem Cloud-Marktplatz zeigte bei der Erfassung am 6. Oktober 2026 einen Wert von 4,3 von 5 aus 41 Bewertungen, alle importiert von einer externen Bewertungsseite für Unternehmenssoftware, ohne eine einzige auf dem Marktplatz selbst abgegebene Bewertung.

Datenschutz, Datennutzung und Stimmrechte

  • Training mit Kundeninhalten: Sofern nicht anders vereinbart, kann Cartesia Eingaben, Ausgaben und Nutzerinteraktionen verwenden, um seine Modelle zu trainieren und zu verbessern. Über ein Online-Formular lassen sich bestimmte Kategorien eigener Inhalte ausschließen, doch dieser Widerspruch gilt nur für die Zukunft und macht frühere Nutzung nicht rückgängig.
  • Keine Datenaufbewahrung: Die Option ohne Datenaufbewahrung steht nur Enterprise-Kunden für die TTS- und STT-APIs zur Verfügung und schließt Stimmklonen, Pro-Stimmklonen und Stimmerstellung aus.
  • Hinweispflichten für Apps: Eine auf Cartesia aufgebaute App muss Endnutzern mitteilen, dass sie mit einer KI und nicht mit einem Menschen sprechen und dass ihre Gespräche aufgezeichnet werden und an Cartesia und dessen externe LLM-Anbieter weitergegeben werden können.
  • Kommerzielle Nutzung: Ausgaben dürfen nicht kommerziell genutzt werden, sofern die Abonnementstufe dies nicht ausdrücklich erlaubt; in der Tariftabelle beginnt die Lizenz zur kommerziellen Nutzung bei Pro.
  • Regeln zu Stimmen und Identitätsanmaßung: Die Richtlinie zur akzeptablen Nutzung verbietet, sich als irgendeine Person, auch Prominente, oder als irgendein Unternehmen auszugeben, und erlaubt nur die eigene Stimme oder die Stimmen anderer mit deren ausdrücklicher Einwilligung. Die Bedingungen untersagen zudem, ohne ausdrückliche Erlaubnis die Stimme einer verstorbenen Person oder eines politischen Kandidaten zu veröffentlichen.
  • Minderjährige und Politik: Ausgaben dürfen sich nicht auf Personen unter 18 Jahren beziehen oder diese darstellen. Die Richtlinie schließt außerdem legitime politische Werbung, Wahlkampf, Lobbyarbeit und Spendensammlung aus.

FAQ

Q1. Kann ich Cartesia ohne Konto ausprobieren?

Ja, teilweise. Der KI-Stimmverzerrer lässt sich ohne Registrierung kostenlos testen; kostenlose Umwandlungen haben ein Tageslimit, und Uploads müssen WAV- oder MP3-Dateien unter 15 MB sein.

Q2. Verbrauchen fehlgeschlagene API-Anfragen Credits?

Nein. Nur erfolgreiche Anfragen verbrauchen Credits, Fehler werden nicht berechnet.

Q3. Kann eine geklonte Stimme andere Sprachen sprechen?

Ja, mit einem zusätzlichen Schritt. Jeder Sofort-Klon entsteht aus einer Sprache, daher wird der Klon zuerst in seiner Ausgangssprache erstellt, und weitere Sprachen kommen über die API zum Hinzufügen von Stimmakzenten dazu. Jeder hinzugefügte Stimmakzent kostet 225 Credits.

Q4. Welche Audioformate liefert Sonic?

Der Bytes-Endpunkt kann Rohaudio, WAV oder MP3 liefern, die SSE- und WebSocket-Endpunkte dagegen nur Rohaudio. Unterstützt werden Abtastraten von 8.000 bis 48.000 Hz.

Q5. Ist Cartesia SOC-2- oder HIPAA-konform?

Cartesia gibt an, dass seine Compliance SOC 2 Type II, HIPAA-Eignung mit BAAs für Kunden aus dem Gesundheitswesen und DSGVO-Konformität umfasst, wobei Unternehmenskunden bei berechtigten Diensten eine Option ohne Datenaufbewahrung nutzen können.

Kennen Sie ein ähnliches Tool?
Wenn Sie andere großartige KI-Tools kennen, können Sie sie uns gerne einreichen