
Typecast ist eine KI-Sprachplattform des koreanischen Unternehmens Neosapience, die Text mit über 700 lizenzierten Sprecherstimmen in ausdrucksstarke Sprache verwandelt und dazu kontextbasierte Emotionsanalyse, Stimmklonen sowie eine mehrsprachige Sprachsynthese-Schnittstelle für Kreative, Entwickler und Unternehmen bietet.
Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Typecast ist eine KI-Plattform, die geschriebenen Text in Sprache mit steuerbarer emotionaler Färbung umwandelt. Das Unterscheidungsmerkmal ist weder die reine Stimmenzahl noch der Preis, sondern die Ausdruckskraft: Das Unternehmen bezeichnet sich als „der ausdrucksstärkste KI-Sprachgenerator der Welt" und beschreibt das Produkt als „den KI-Sprachgenerator, der natürlich und voller Emotion klingt — für Kreative, Entwickler und Unternehmen". In der Praxis bedeutet das drei miteinander verbundene Produkte unter einem Abonnement — einen im Browser laufenden Sprach-Editor, ein System zum Klonen von Stimmen und eine Schnittstelle zur Sprachsynthese — ergänzt um einen Video-Editor und eine sprechende Avatar-Funktion.
Betreiberin ist Neosapience, Inc., ein südkoreanisches Unternehmen. Das wiegt weit schwerer als eine Fußnote, und zwar aus zwei Gründen. Erstens bestimmt es den rechtlichen Rahmen: Die Nutzungsbedingungen halten fest, dass sie „eine Vereinbarung zwischen Ihnen und Neosapience, Inc. bilden" und dass sie „nach den Gesetzen der Republik Korea geregelt und ausgelegt werden", wobei Streitigkeiten der koreanischen Zivilprozessordnung unterliegen. Zweitens erklärt es den sprachlichen Schwerpunkt des Produkts: Koreanisch, Englisch, Japanisch und Chinesisch sind hier Sprachen erster Ordnung, was nicht auf jeden westlichen Wettbewerber zutrifft. Die koreanische Website legt die betreibende Einheit vollständig offen, wie es die dortige Regulierung des elektronischen Handels verlangt: 네오사피엔스 주식회사, Gewerbeanmeldenummer 883-86-00767, Vertreter Taesu Kim, mit eingetragener Anschrift im Bezirk Samseong-dong in Gangnam-gu, Seoul. Dieselbe Person ist in der Datenschutzerklärung als Datenschutzbeauftragter benannt.
Was die Typecast Stimme tatsächlich von einer gewöhnlichen Vorlesesoftware trennt, ist die Emotionsschicht. Neben den üblichen Reglern für Tempo und Tonhöhe bietet die Plattform das, was sie Smart Emotion nennt: ein System, das den umgebenden Text liest, um daraus abzuleiten, wie eine Zeile gesprochen werden soll, ohne dass Sie jeden Satz von Hand kennzeichnen müssten. Das Unternehmen beschreibt seine Stimmbibliothek als „exklusive Stimmen echter Sprecherinnen und Sprecher", und die Nutzungsrichtlinie legt die dahinterstehende Lizenzkonstruktion so deutlich offen, wie es in dieser Kategorie selten vorkommt. Weil Stimmlizenzen und Einwilligung häufig darüber entscheiden, ob ein KI-Sprachwerkzeug tragfähig für ein Geschäft ist, behandelt diese Seite beides als zentrale Frage und nicht als Nachbemerkung.
Die Hauptfähigkeit ist Sprachsynthese mit einstellbarer emotionaler Wiedergabe. Die Website wirbt mit „über 700 KI-Stimmen mit einstellbarer Emotion, Geschwindigkeit und Dynamik", und die Vorführungen auf der Seite zeigen die verfügbaren Gefühlszustände unmittelbar: Freude, Trauer, Wut, Flüstern und tiefe Tonlage erscheinen als wählbare Modi, angewandt auf dieselbe Textzeile. Die Stimmen sind nach Funktion geordnet, darunter Ansager, Erzähler, Podcast, Nachrichtensprecher, Roboter und Charakterstimmen, ergänzt um Filter nach Alter und Geschlecht. Der wichtige Vorbehalt lautet, dass es sich nicht um von Grund auf zusammengesetzte synthetische Gebilde handelt: Das Unternehmen beschreibt sie als „exklusive Stimmen echter Sprecherinnen und Sprecher", was den später erörterten Lizenzbedingungen erst ihr Gewicht gibt.
Smart Emotion ist die Funktion, mit der das Unternehmen auftritt, und sie weicht tatsächlich von der schlagwortbasierten Emotionssteuerung ab. Statt jeden Satz mit einer Stimmung zu versehen, analysiert das System den Text um eine Zeile herum, um zu entscheiden, wie sie gesprochen werden soll. Die eigene Beschreibung der zugrunde liegenden Forschung lautet, die Technik „analysiert Skripte Zeile für Zeile, um automatisch einen kontextgerechten Tonfall zu erzeugen". Die Schnittstelle legt das unmittelbar offen: Eine Anfrage kann den vorhergehenden und den folgenden Satz zusammen mit der zu synthetisierenden Zeile tragen, sodass ein Satz wie „Es wird alles gut" anders klingt, je nachdem, ob er auf eine gute oder eine schlechte Nachricht folgt. Für erzählende Arbeit ist das eine substanzielle Entwurfsentscheidung, denn dieselben Worte wiegen unterschiedlich, je nachdem, was ihnen vorausgeht.
Die Plattform bietet das Klonen von Stimmen in zwei Qualitätsstufen. Instant Cloning erzeugt aus einer kurzen Audioprobe eine eigene Stimme und steht ab der ersten kostenpflichtigen Stufe zur Verfügung; Professional Cloning als originalgetreuerer Weg erscheint ab der mittleren Stufe. Die Klon-Plätze sind gezählt und nicht unbegrenzt: einer auf der Einstiegs- und der mittleren Stufe, zwei auf der beliebtesten Stufe und zehn auf der Geschäftsstufe. Das Unternehmen gibt an, eine geklonte Stimme könne anschließend „mehrsprachig sprechen", das heißt eine in einer Sprache aufgenommene Stimme lässt sich nutzen, um Sprache in anderen zu erzeugen — der praktische Reiz für Kreative, die über Märkte hinweg veröffentlichen.
Das Entwicklerprodukt ist keine dünne Hülle um den Web-Editor. Die Dokumentation beschreibt eine Schnittstelle, die über das Modell ssfm-v30 Sprache in 37 Sprachen bereitstellt und Zugriff auf mehr als 500 Stimmen gewährt, mit vier klar getrennten Erzeugungsarten: die Standardsynthese, die vollständige WAV- oder MP3-Dateien liefert; die Streaming-Synthese, die Audio abspielt, sobald Teilstücke eintreffen, gedacht für Sprachagenten und Anwendungen mit geringer Verzögerung; die Synthese mit Zeitmarken, die Ausrichtungsdaten auf Wort- oder Zeichenebene zurückgibt, für Untertitel, Karaoke-Hervorhebung und Lippensynchronität; und das programmgesteuerte Instant Cloning. Die offiziellen Beispiele des Entwicklungspakets decken Python und JavaScript als die verbreitetsten Sprachen ab, dazu C# und Java sowie Kotlin und Rust. Die Dokumentation veröffentlicht zudem eine Datei llms.txt, die ausdrücklich für KI-Programmieragenten gedacht ist.
Über das Audio hinaus enthält das Abonnement einen Video-Editor, dessen Exportqualität nach Stufe gestaffelt ist: 720p in der kostenlosen Stufe, 1080p in der Einstiegsstufe und 4K ab der mittleren Stufe, wobei der Export ohne Wasserzeichen jede kostenpflichtige Stufe voraussetzt. Eine gesonderte Funktion für sprechende Avatare erzeugt eine im Bild sprechende Person und rechnet nach Anzahl der Erzeugungen statt nach Dauer ab: bis zu sechs in der Einstiegsstufe, bis zu vierzig in der Geschäftsstufe und keine in der kostenlosen Stufe. Zu beachten ist, dass für Avatare eine strengere Altersgrenze gilt als für den Rest der Plattform, wie unten ausgeführt.
Typecast veröffentlicht mobile Anwendungen für iOS und Android, die Sprachaufnahmen direkt vom Telefon erzeugen und Projekte zwischen Geräten abgleichen. Die iOS-Fassung ist auf die Gesellschaft Neosapience eingetragen, kostenlos ladbar, verlangt iOS 16.4 oder neuer, trägt eine Alterseinstufung von 12+ und wurde im August 2026 aktualisiert — eine aktiv gepflegte Fassung und keine liegen gelassene Begleitanwendung.
Das Unternehmen veröffentlicht eine Modellgenealogie, statt seine Synthese als Blackbox zu behandeln: ein erstes Modell für Sprachsynthese auf Basis tiefen Lernens im Jahr 2018, das Modell CATS mit verbesserter Aussprache und Natürlichkeit 2021, SSFM 1.0 im Jahr 2024 mit einer neuen, auf großen Datensätzen trainierten Architektur, SSFM 2.0 im Jahr 2025 mit Mehrsprachigkeit und erweiterten Steuerungen sowie SSFM 3.0 im selben Jahr mit kontextsensitiver Emotionserzeugung. Beim Vergleich mit neueren Anbietern verdient diese Linie Beachtung, wobei es sich um Angaben des Unternehmens handelt, die nicht unabhängig geprüft sind.
Am besten passt Inhalt, bei dem flache Wiedergabe scheitern würde: Hörspiel, Animation, Spieldialoge, belletristische Hörbücher und erzählerisch getragenes Video. Ein Erfahrungsbericht auf der Website, von einem Filmregisseur, fasst den beabsichtigten Arbeitsablauf: verschiedene Stimmen ausprobieren, das Timing anpassen und mit Emotion spielen, bis eine Szene trägt — beschrieben als „Casting, Regie und Produktion in einem". Erst die Verbindung eines großen Katalogs an Charakterstimmen mit zeilenweiser Emotionssteuerung macht diese Kategorie wirklich brauchbar statt nur eben machbar.
Für Kreative, die denselben Inhalt über mehrere Märkte hinweg veröffentlichen, ist die Verbindung von Klonen und Mehrsprachigkeit der eigentliche Reiz: eine Stimme einmal aufnehmen und sie dann andere Sprachen sprechen lassen. Mit 37 über die Schnittstelle verfügbaren Sprachen und der ausdrücklichen Nennung von Koreanisch, Englisch, Japanisch, Chinesisch, Spanisch und Vietnamesisch in der Dokumentation ist die Abdeckung wirklich breit — und bemerkenswert stark bei ostasiatischen Sprachen, wo manche westlichen Wettbewerber schwächer sind.
Streaming-Synthese existiert genau für Fälle, in denen das Warten auf die vollständige Berechnung nicht hinnehmbar ist. Das Unternehmen erklärt, seine Richtung entwickle sich „von einfacher Spracherzeugung hin zu echter dialogfähiger KI, die in Echtzeit zuhört, denkt und spricht", und die Unternehmensstufe nennt dialogfähige Agenten in Echtzeit ausdrücklich. Für Entwickler, die Assistenten oder interaktive Sprachprodukte bauen, ist die einschlägige Fläche der Streaming-Endpunkt samt Wiedergabe mit geringer Verzögerung, nicht der Web-Editor.
Die Synthese mit Zeitmarken gibt Ausrichtungsdaten auf Wort- oder Zeichenebene zurück, wodurch die Ausgabe zu etwas wird, das eine Produktionskette unmittelbar verarbeiten kann, statt zu einer bloßen Audiodatei. Genau das macht automatische Untertitelung, Karaoke-artige Hervorhebung und lippensynchrone Animation praktikabel, ohne einen gesonderten Schritt zur erzwungenen Ausrichtung.
Das Unternehmen beschreibt eine Nutzerschaft aus Rundfunk, Telekommunikation, Onlinehandel und Bildung, und die Stufenstruktur spiegelt institutionelle Nutzung: Die Geschäftsstufe ergänzt Teammitglieder, zehn Klon-Plätze und den Zukauf von Guthaben. Ein lizenzrechtliches Detail wiegt hier schwer und wird leicht übersehen: Die Nutzungsrichtlinie bestimmt, dass „einzelne Niederlassungen oder Gesellschaften jeweils ein eigenes Abonnement halten müssen, um die Einhaltung sicherzustellen", sodass ein einzelner Zugang einen ganzen Konzern rechtlich nicht abdecken kann.
Weil Erzeugung und Wiedergabe auf jeder Stufe einschließlich der kostenlosen unbegrenzt sind und Guthaben nur beim Herunterladen verbraucht wird, ermöglicht Typecast einen Ablauf, den die meisten Wettbewerber nicht bieten: ein ganzes Skript mit vielen Stimmen und emotionalen Lesarten kostenlos durchspielen und nur die Aufnahmen bezahlen, die man behält. Bewusst eingesetzt, ist es damit ebenso ein Werkzeug für Besetzung und Vorvisualisierung wie für die Produktion.
Verstehen Sie zuerst das Guthabenmodell, denn es prägt alles Weitere. Die Preisseite hält fest, dass „Spracherzeugung und Wiedergabe auf jeder Stufe kostenlos" sind und dass „Guthaben verbraucht wird, wenn Sie Audio herunterladen". Beim Ausprobieren im Editor wird nichts abgezogen. Erzeugen Sie dieselbe Zeile mit einem Dutzend Stimmen, testen Sie jeden Emotionsmodus, passen Sie das Tempo an — nichts davon verbraucht Guthaben, solange Sie nicht exportieren. Die meisten, denen die kostenlose Stufe knausrig erscheint, haben schlicht nicht verinnerlicht, dass die Grenze beim Herunterladen liegt und nicht beim Ausprobieren.
Die Stufen bilden keine schlichte Qualitätsleiter; jede schaltet eine bestimmte Steuerung frei. Die kostenlose Stufe gewährt 3.000 lebenslange Guthabenpunkte (etwa fünf Minuten), beschränkt Sie aber auf Teststimmen, 16 kHz und drei Projekte. Die Einstiegsstufe zu 5 Dollar monatlich öffnet alle Stimmen, 44,1 kHz, einen Platz für Instant Cloning und eine kommerzielle Lizenz. Die nächste Stufe zu 19 Dollar ergänzt die Geschwindigkeitssteuerung und Professional Cloning. Auf der Stufe zu 29 Dollar sitzen die Emotionssteuerungen samt Smart Emotion, eigener Emotion, Betonung und Tonhöhe — wenn also die Ausdruckskraft Ihr Beweggrund ist, liegt Ihr Einstiegspreis bei 29 und nicht bei 5 Dollar. Die Geschäftsstufe zu 69 Dollar ergänzt zehn Klon-Plätze, Teammitglieder und Guthabenzukauf. Jahreszahlung spart zehn Prozent.
Wenn Ihre Stufe diese Funktion enthält, geben Sie ihr Zusammenhang mit. Da das System die Wiedergabe aus dem umgebenden Text erschließt, wirft das Zerlegen einer Szene in einzelne Ein-Zeilen-Anfragen genau das Signal weg, von dem es lebt. Über die Schnittstelle ist das ausdrücklich vorgesehen — liefern Sie den vorhergehenden und den folgenden Satz —, doch dasselbe gilt im Editor: Halten Sie erzählende Passagen zusammen, damit das Modell den Bogen liest und nicht jede Zeile für sich allein behandelt.
Diesen Schritt überspringen viele und bereuen es später. Die kommerzielle Lizenzierung ist über die Stufen hinweg nicht einheitlich. In der kostenlosen Stufe führt die Preistabelle die kommerzielle Lizenz als „Namensnennung erforderlich", und die Beschreibung hält fest, dass „für alle in der kostenlosen Stufe heruntergeladenen Inhalte eine Namensnennung erforderlich ist". Ab der Einstiegsstufe wird die Namensnennung „optional". Wer monetarisierte Inhalte verbreitet, sollte vor der Verbreitung klären, unter welcher Stufe die Downloads erfolgt sind, nicht danach.
Die Aufbewahrungsregel ist das folgenreichste betriebliche Detail dieser Seite. Ergebnisse verbleiben ein Jahr ab Erstellung auf den Servern von Typecast und werden danach „ohne weitere Ankündigung automatisch von unseren Servern gelöscht". Die Bedingungen halten fest, dass „Sie dafür verantwortlich sind, alle Ergebnisse, die Sie behalten möchten, vor Ablauf der Aufbewahrungsfrist herunterzuladen und zu speichern", und dass das Unternehmen „keine Verpflichtung hat, gelöschte Ergebnisse wiederherzustellen". Entscheidend: Diese Regel „gilt gleichermaßen für alle Nutzer, unabhängig davon, ob sie einen kostenpflichtigen oder kostenlosen Plan haben". Behandeln Sie die Plattform als Erzeugungsdienst, nicht als Ihr Archiv.
Die Nutzungsrichtlinie zieht eine Grenze, die viele erst nach der Kündigung bemerken: „Erzeugtes Audio darf ausschließlich während Ihres Abonnementzeitraums für persönliche oder kommerzielle Zwecke heruntergeladen und verwendet werden. Nach Ablauf dürfen Sie zuvor heruntergeladenes Audio weiterhin nutzen, jedoch sind keine neuen Änderungen oder Downloads möglich, sofern Ihr Abonnement nicht verlängert wird." Bereits heruntergeladenes Audio bleibt nutzbar, doch die Möglichkeit, erneut herunterzuladen oder Neues abzuleiten, endet mit dem Abonnement.
Für die programmgesteuerte Nutzung besorgen Sie sich einen Schlüssel und wählen den Modus, der zur Last passt: Standardsynthese für fertige Dateien, Streaming für interaktive Verzögerungsempfindlichkeit, Zeitmarken, wenn Ausrichtungsdaten nötig sind. Das offizielle Entwicklungspaket deckt sechs Sprachen ab: Python und JavaScript, dazu C# und Java sowie Kotlin und Rust. Beachten Sie, dass die Nutzungsrichtlinie gesonderte Vereinbarungen für Schnittstellendienste, die Erstellung eigener Stimmen und die Einbindung in automatisierte Systeme verlangt; ein Schnittstelleneinsatz ist also kein bloß größeres Verbraucherabonnement.
Richten Sie Ihre Arbeitsgewohnheiten am Guthabenmodell aus. Da die Wiedergabe nichts kostet, erledigen Sie Vergleich, Regie und Überarbeitung vollständig im Editor und exportieren nur die endgültigen Aufnahmen. Eine grobe Umrechnung hilft: 30.000 Guthabenpunkte entsprechen etwa 35 Minuten Audio, 75.000 etwa 90 Minuten und 200.000 etwa 250 Minuten. Guthaben misst also die Länge des fertigen Ergebnisses, nicht den Aufwand auf dem Weg dorthin.
Weil jede Stufe eine andere Steuerung verschließt, ist der günstigste ausreichende Plan oft nicht der günstigste Plan. Die Geschwindigkeitssteuerung erscheint erst bei 19 Dollar, die Emotionssteuerungen einschließlich Smart Emotion erst bei 29. Wer bei 5 Dollar abschließt und die beworbene Ausdruckskraft erwartet, wird enttäuscht — nicht weil die Funktion fehlte, sondern weil sie zwei Stufen höher liegt.
Die Preisseite enthält einen beachtenswerten Hinweis: „Preise im App Store und im Google Play Store können aufgrund der Preisrichtlinien des jeweiligen Stores vom oben angegebenen Betrag abweichen", und „über die mobile App (iOS/Android) gekaufte Abonnements können nicht im Web geändert werden. Bitte verwalten Sie Ihren Plan über den jeweiligen App-Store." Ein Abschluss auf dem Mobilgerät bindet die Verwaltung an diesen Store.
Die Erstattungsklauseln sind streng und unmittelbar an die Nutzung geknüpft. Bei Monatsplänen gilt: „Eine vollständige Erstattung ist nur möglich, wenn keine Guthabennutzung, keine Erstellung eines Premium-Klons und keine ausstehenden Aufgaben vorliegen, innerhalb von 7 Tagen nach dem Abrechnungsdatum." Jahrespläne folgen denselben Bedingungen binnen sieben Tagen nach Zahlung; danach wird die Erstattung um die genutzten Monate und eine Bearbeitungsgebühr gekürzt. Faktisch beendet der erste Download oder der erste Klon den Weg zur sauberen Erstattung. Nutzer in der Europäischen Union haben zusätzlich ein gesetzliches Widerrufsrecht von vierzehn Tagen, das die Bedingungen jedoch als verwirkt bezeichnen, sobald die Leistung teilweise erbracht wurde.
Die Nutzungsrichtlinie untersagt ausdrücklich „die unbefugte Nutzung der Identität, Stimme oder des Abbilds einer Person für nicht satirische, böswillige oder kommerzielle Zwecke ohne deren Einwilligung" sowie die unbefugte Nachahmung politischer Persönlichkeiten. Über die plattformeigenen Regeln hinaus verlangen die Bedingungen die Zusicherung, dass Sie über „alle Rechte, Lizenzen, Einwilligungen, Erlaubnisse und/oder Befugnisse" für hochgeladene Inhalte verfügen. Die rechtliche Verantwortung für die Einwilligung zum Klonen liegt bei Ihnen, nicht bei der Plattform.
Politische Werbung ist untersagt, „sofern keine ausdrückliche schriftliche Erlaubnis erteilt wurde"; Wahldesinformation sowie die Nachahmung politischer Persönlichkeiten oder ihrer Angehörigen sind vollständig verboten. Inhalte für Erwachsene und die Verwendung von KI-Stimmen im Zusammenhang mit Pornografie oder Erwachsenendiensten sind ebenfalls untersagt. Berührt Ihre Arbeit diese Bereiche, holen Sie vorab eine schriftliche Freigabe ein, statt die Einschränkung nach der Veröffentlichung zu entdecken.
Da „einzelne Niederlassungen oder Gesellschaften jeweils ein eigenes Abonnement halten müssen", kann eine Agentur mit mehreren Mandanten oder eine Gruppe mit mehreren Rechtsträgern die Nutzung nicht regelkonform auf einem Zugang bündeln. Klären Sie die Lizenzstruktur beim Einkauf und nicht erst bei einer Prüfung.
Typecast passt zu Kreativen, deren Inhalt nicht nur von Verständlichkeit, sondern von emotionaler Wiedergabe lebt — Hörfiktion, Animation, Charakterarbeit, erzählendes Video —, weil genau dort die Investition des Produkts liegt. Es passt zu Teams, die in Ostasien und im Westen zugleich veröffentlichen, da Koreanisch, Japanisch und Chinesisch hier zum Kern gehören. Es passt zu Entwicklern, die Sprachagenten oder Untertitelketten bauen, dank Streaming- und Zeitmarken-Endpunkten und eines Pakets für sechs Sprachen. Es passt zu allen, die vor dem Bezahlen ausgiebig testen wollen, da Erzeugung und Wiedergabe unbegrenzt und kostenlos sind. Und es passt zu Nutzern, die eine klare Auskunft über Stimmlizenzen wollen, weil die Haltung zur Einwilligung der Sprecher veröffentlicht und nicht bloß angedeutet ist.
Ungeeignet für alle, die die Plattform als Langzeitspeicher brauchen: Die automatische Löschung nach einem Jahr gilt unabhängig von der Stufe. Ungeeignet für Organisationen, die mit einer Lizenz mehrere Rechtsträger abdecken wollen, wegen der Pflicht zu getrennten Abonnements. Ungeeignet für Erwachsenen- oder politische Inhalte, beide sind eingeschränkt. Ungeeignet für Nutzer unter 13 Jahren überall und unter 17 Jahren speziell für den sprechenden Avatar. Ungeeignet für Käufer, die vor einer Entscheidung einen großen Bestand unabhängiger Bewertungen brauchen, da der Fußabdruck externer Bewertungen im Verhältnis zur behaupteten Nutzerzahl dünn ist. Und möglicherweise ungeeignet für alle, denen koreanisches Recht und ein Verzicht auf Sammelklagen zu weit gehen, wie in den Einschränkungen dargelegt.
Für die meisten Interessenten ist die eigentliche Frage enger als „ist Typecast gut". Sie lautet, ob die Emotionssteuerung den Aufpreis der Stufe wert ist. Genügt eine klare, sachliche Erzählstimme, gibt es reichlich günstigere Möglichkeiten, und die Einstiegsstufe wirkt gegenüber dem Wettbewerb sogar eher teuer. Ist die Darbietung jedoch das Produkt — trägt der Unterschied zwischen Flüstern und Rufen Ihren Inhalt —, dann ist die Stufe zu 29 Dollar der ehrliche Vergleichspunkt, und Smart Emotion ist eine tatsächlich unterscheidbare Fähigkeit und keine umbenannte Tonhöhensteuerung.
Typecast läuft überwiegend im Browser: Sprach-Editor, Video-Editor und Klon-Oberfläche sind allesamt webbasiert, eine Desktop-Anwendung gibt es nicht. Mobile Anwendungen existieren für iOS und Android und sind darauf ausgerichtet, unterwegs Sprachaufnahmen zu erzeugen und Projekte geräteübergreifend abzugleichen. Die iOS-Anwendung ist auf die Gesellschaft Neosapience eingetragen, kostenlos ladbar, verlangt iOS 16.4 oder neuer, trägt eine Einstufung von 12+, ist den Kategorien Foto und Video sowie Unterhaltung zugeordnet und unterstützt Englisch und Koreanisch. Die jüngste Fassung stammt aus August 2026, was auf aktive Pflege hindeutet.
Für Entwickler ist die Fläche der Plattform die Sprachsynthese-API und kein installierter Client, mit einem offiziellen Paket für sechs Sprachen — Python und JavaScript, C# und Java, Kotlin und Rust — dazu ein Kommandozeilenwerkzeug und eine Dokumentation, die für die Verarbeitung durch KI-Programmieragenten ausgelegt ist. Der Webauftritt selbst ist zweisprachig, mit getrennten englischen und koreanischen Seiten, wobei die koreanische Seite die vollständige gesetzliche Offenlegung trägt, die die koreanische Regulierung des elektronischen Handels verlangt.
Ein Vorbehalt verdient Nachdruck: Da über die mobilen Stores gekaufte Abonnements nicht im Web verwaltet werden können, bestimmt die Plattform des Abschlusses, wo Sie später kündigen oder wechseln müssen.
Typecast rechnet im Monatsabonnement ab, mit zehn Prozent Nachlass bei Jahreszahlung, und die Struktur beruht auf Download-Guthaben statt auf Erzeugungszeit. Jede Stufe einschließlich der kostenlosen bietet unbegrenzte Spracherzeugung und Wiedergabe; Guthaben wird nur beim Herunterladen verbraucht.
Die kostenlose Stufe kostet nichts und liefert 3.000 lebenslange Download-Guthabenpunkte, entsprechend etwa fünf Minuten Audio. Sie beschränkt Downloads auf Teststimmen, begrenzt Audio auf 16 kHz, erlaubt drei Projekte, bietet 720p-Videoexport mit 1 GB Speicher, bewahrt den Downloadverlauf sieben Tage und verlangt Namensnennung für alle heruntergeladenen Inhalte. Klon-Plätze und Avatar-Erzeugungen sind nicht enthalten.
Die Stufe Basic zu 5 Dollar monatlich oder 54 Dollar jährlich liefert 30.000 Guthabenpunkte monatlich (etwa 35 Minuten), öffnet alle KI-Stimmen, hebt das Audio auf 44,1 kHz, ergänzt einen Platz für Instant Cloning, ermöglicht 1080p-Videoexport ohne Wasserzeichen mit 5 GB Speicher und macht die Namensnennung unter kommerzieller Lizenz optional.
Die Stufe Plus zu 19 Dollar monatlich oder 204 Dollar jährlich liefert 40.000 Guthabenpunkte (etwa 50 Minuten), ergänzt Geschwindigkeitssteuerung und Professional Cloning und hebt den Videoexport auf 4K bei 30 GB Speicher.
Die Stufe Pro zu 29 Dollar monatlich oder 312 Dollar jährlich beherbergt die charakteristische Fähigkeit der Plattform. Sie liefert 75.000 Guthabenpunkte (etwa 90 Minuten) und ergänzt die Emotionssteuerungen samt Ein-Klick-Anpassung von Smart Emotion, eigener Emotion, Betonung und Tonhöhe sowie einen zweiten Klon-Platz und 50 GB Speicher.
Die Stufe Business zu 69 Dollar monatlich oder 744 Dollar jährlich liefert 200.000 Guthabenpunkte (etwa 250 Minuten), erlaubt den Zukauf weiteren Guthabens und ergänzt zehn Klon-Plätze, Teammitglieder und 100 GB Speicher. Darüber steht eine Unternehmensstufe auf Anfrage mit eigener Schnittstelle und Sicherheitspaket, dialogfähigen Agenten in Echtzeit und einem festen Ansprechpartner.
Zwei praktische Hinweise begleiten die Tabelle. Preise in den mobilen Stores können von den Webangaben abweichen, und mobile Abonnements müssen über den ursprünglichen Store verwaltet werden. Erstattungen sind bedingt: Eine vollständige Erstattung setzt keine Guthabennutzung, keine Erstellung eines Premium-Klons und keine ausstehenden Aufgaben binnen sieben Tagen nach Abrechnung voraus; Jahrespläne jenseits dieses Fensters werden abzüglich der genutzten Monate und einer Bearbeitungsgebühr erstattet.
ElevenLabs ist die am häufigsten herangezogene Alternative und der stärkste Wettbewerber bei reiner Stimmqualität und Breite des Ökosystems. Der ehrliche Unterschied liegt in der Gewichtung: Typecast investiert in kontextbasierte emotionale Wiedergabe und in eine ausdrücklich dokumentierte Lizenzposition gegenüber Sprechern, während ElevenLabs über Modellgüte, Größe und ein breiteres Werkzeugumfeld konkurriert. Vergleichen Sie entlang der Achse, die Ihnen tatsächlich wichtig ist, statt entlang eines allgemeinen Rufs.
Murf und WellSaid Labs zielen auf Unternehmens- und Onlinelern-Vertonung, wo Beständigkeit und Aussprachesteuerung wichtiger wiegen als dramatische Bandbreite. Für Produkterklärungen, Schulungsmodule und interne Kommunikation sind sie häufig die wirtschaftlichere Wahl, und die emotionale Feinheit, für die Typecast Geld verlangt, bleibt dort weitgehend ungenutzt.
Play.ht und Speechify besetzen das Ende von Menge und Preis und sprechen Verlage an, die große Textbestände in Audio überführen. Ihr Vorteil ist die Wirtschaftlichkeit des Durchsatzes; das Gegenargument von Typecast ist die zeilenweise Regie, deren Wert allerdings gering bleibt, wenn die Aufgabe schlicht Massenumwandlung heißt.
Die großen Cloudanbieter — Google, Amazon und Microsoft — bieten tief in die Infrastruktur eingebettete Sprachsynthese und unternehmenstaugliche Beschaffungswege. Sie sind die Voreinstellung, wenn hochvolumige Synthese in einen bestehenden Cloud-Bestand eingebettet werden soll. Was sie in der Regel nicht bieten, ist ein kuratierter Katalog echter Sprecherstimmen mit veröffentlichten Einwilligungszusagen — und genau das ist der Unterschied von Typecast.
Für koreanische, japanische und chinesische Inhalte ist die regionale Herkunft des Produkts ein echter Vorteil, den zu prüfen sich lohnt. Statt einen Vergleich für bare Münze zu nehmen, erzeugen Sie dasselbe Skript in der Zielsprache auf zwei Plattformen und hören Sie hin: Bei ostasiatischen Sprachen läuft der Abstand häufig entgegen der allgemeinen englischsprachigen Rangfolge.
Die folgenreichste Einschränkung ist keine Funktionslücke, sondern eine Aufbewahrungsregel. Über den Dienst erzeugte Ergebnisse werden ein Jahr ab Erstellung aufbewahrt und danach „ohne weitere Ankündigung automatisch von unseren Servern gelöscht". Die Bedingungen machen drei Punkte ausdrücklich: Sie sind dafür verantwortlich, herunterzuladen, was Sie behalten wollen; das Unternehmen hat keine Pflicht, Gelöschtes wiederherzustellen; und die Regelung „gilt gleichermaßen für alle Nutzer, unabhängig von kostenpflichtigem oder kostenlosem Plan". Ein erneuter Download früherer Ergebnisse ist nur möglich, solange sie auf den Servern liegen und ein aktives Abonnement besteht.
Bereits heruntergeladenes Audio bleibt nach der Kündigung nutzbar, doch die Nutzungsrichtlinie bestimmt, dass die kommerzielle Nutzung „ausschließlich während Ihres Abonnementzeitraums" zulässig ist und nach Ablauf „keine neuen Änderungen oder Downloads möglich sind, sofern das Abonnement nicht verlängert wird". Zusammen mit der Aufbewahrungsregel kann ein ausgelaufenes Abonnement noch nicht exportierte Arbeit dauerhaft stranden lassen.
Ergebnisse der kostenlosen Stufe sind nicht bedingungslos verwendbar: Für alles dort Heruntergeladene ist Namensnennung erforderlich, Downloads beschränken sich auf Teststimmen und die Qualität ist auf 16 kHz gedeckelt. Die kostenlose Stufe ist eine echte Testumgebung, kein kostenloses Produktionswerkzeug.
Die Vermarktung führt mit Ausdruckskraft, doch grundlegende Emotionssteuerungen, Smart Emotion, eigene Emotion, Betonung und Tonhöhe erscheinen erst ab der Stufe Pro, während die Geschwindigkeitssteuerung mindestens die Stufe zu 19 Dollar erfordert. Wer von den Emotionsvorführungen angezogen bei 5 Dollar abschließt, erhält gerade jene Fähigkeit nicht, die ihn angezogen hat.
Zwar bestätigen die Bedingungen, dass „Sie Ihre Eigentumsrechte an Ihren Inhalten behalten und das Ergebnis besitzen", doch mit dem Hochladen räumen Sie Neosapience „eine nicht ausschließliche, unwiderrufliche, weltweite, vollständig bezahlte und lizenzgebührenfreie Lizenz ein, Ihre Inhalte zu speichern, zu vervielfältigen, zu verändern, zu übertragen, anzuzeigen, zu veröffentlichen und zu verbreiten, um die Dienste zu betreiben, zu verbessern, zu bewerben und bereitzustellen". Lesen Sie diesen Umfang genau, bevor Sie heikle Stimmproben hochladen: Er schließt Werbung ein und ist unwiderruflich.
Streitigkeiten unterliegen den Gesetzen der Republik Korea und der koreanischen Zivilprozessordnung. Die Bedingungen ergänzen, dass jede Streitigkeit „EINZELN BEIZULEGEN IST, OHNE RÜCKGRIFF AUF IRGENDEINE FORM DER SAMMELKLAGE", und dass jeder Anspruch „INNERHALB EINES (1) JAHRES NACH ENTSTEHEN DES ANSPRUCHS GELTEND GEMACHT WERDEN MUSS". Für gewerbliche Nutzer außerhalb Koreas sind das wesentliche Bedingungen und keine Formeln.
Da eine vollständige Erstattung keine Guthabennutzung, keine Erstellung eines Premium-Klons und keine ausstehenden Aufgaben voraussetzt, beendet bereits ein einziger Download oder ein einziger Premium-Klon diesen Weg. Weil Erzeugung und Wiedergabe ohnehin kostenlos sind, lässt sich das umgehen — allerdings nur, wenn Sie vor dem Herunterladen prüfen.
Die Anforderung, dass „einzelne Niederlassungen oder Gesellschaften jeweils ein eigenes Abonnement halten müssen", begrenzt den Einsatz bei Agenturen und Konzernen; zusätzlich sind gesonderte Vereinbarungen für Schnittstellendienste, eigene Stimmerstellung und die Einbindung in automatisierte Systeme erforderlich.
Nutzer müssen mindestens 13 Jahre alt sein, beziehungsweise älter, wo örtliches Recht dies verlangt, und die Funktion des sprechenden Avatars ist auf Personen ab 17 Jahren beschränkt. Verbotene Inhalte reichen von sexuellem Material über Gewalt und Hassrede, politische Werbung und Wahldesinformation, Betrug und Identitätsnachahmung bis zu Verstößen gegen den Kinderschutz sowie gegen Urheber- oder Persönlichkeitsrechte. Das Unternehmen behält sich vor, erzeugte Inhalte „aus beliebigem Grund (oder ohne Grund)" zu entfernen und den Zugang ohne vorherige Ankündigung zu beenden.
Dies ist eine Belegkücke und keine Kritik am Produkt. Das Trustpilot-Profil der Domain war zum Prüfzeitpunkt nicht beansprucht und trug nur eine einzige Bewertung mit dem Wert 3,2 — eine Stichprobe, die für jede Qualitätsaussage viel zu klein ist, wobei Trustpilot selbst vermerkt, das Unternehmen habe „seine Kunden nicht eingeladen, sodass die Bewertungen möglicherweise nicht repräsentativ sind". Die iOS-Anwendung wies einen Durchschnitt von 3,33 aus lediglich drei Bewertungen auf, ebenfalls unterhalb jeder aussagekräftigen Schwelle. Versuche, Bewertungen bei G2 und Capterra zu prüfen, wurden auf allen verfügbaren Wegen blockiert; die dazu in Sekundärquellen kursierenden Zahlen werden hier daher nicht wiedergegeben. Wer Typecast bewertet, sollte es unmittelbar testen statt sich auf aggregierte Werte zu verlassen.
Über 700 Stimmen, die auf der Vermarktungsseite genannten mehr als 35 Sprachen (gegenüber 37 in der Dokumentation) und die in der Presse berichteten Nutzerzahlen stammen sämtlich vom Unternehmen. Beachten Sie, dass sich die Nutzerzahl in dessen eigener Kommunikation deutlich bewegt hat: Die Berichterstattung zur Series B von 2022 nannte „mehr als eine Million Nutzer", jene zur Vorbörsenrunde vom Dezember 2025 „mehr als zwei Millionen registrierte Nutzer weltweit". Registrierte Nutzer sind nicht aktive Nutzer, und keine der beiden Zahlen wurde unabhängig überprüft.
Als Hinweis auf Stabilität und nicht als Empfehlung: Das Unternehmen schloss im Februar 2022 eine von BRV Capital Management angeführte Series B über 21,5 Millionen Dollar ab, womit sich die Gesamtfinanzierung zu diesem Zeitpunkt auf rund 26,7 Millionen belief, und im Dezember 2025 eine Vorbörsenrunde über 11,5 Millionen Dollar unter Beteiligung von HB Investment und K2 Investment Partners. Gegründet wurde es 2017 von ehemaligen Qualcomm-Ingenieuren. Eine Vorbörsenrunde signalisiert die Absicht eines Börsengangs, der in der Regel mehr Offenlegung mit sich bringt, aber auch strategische Veränderungen; garantiert ist beides nicht.
Es gibt eine wirklich brauchbare kostenlose Stufe, doch ihre Grenze liegt an einer bestimmten Stelle. Spracherzeugung und Wiedergabe sind auf jeder Stufe einschließlich der kostenlosen unbegrenzt — Sie können endlos ohne Kosten experimentieren. Begrenzt ist das Herunterladen: Die kostenlose Stufe bietet 3.000 lebenslange Guthabenpunkte, rund fünf Minuten Audio, und zwar lebenslang statt monatlich. Kostenlose Downloads beschränken sich auf Teststimmen, sind auf 16 kHz gedeckelt, auf drei Projekte und 720p-Video mit 1 GB Speicher begrenzt und verlangen Namensnennung für alle heruntergeladenen Inhalte. Es ist eine Prüfstufe, keine kostenlose Produktionsstufe.
Dies ist der klarste Bereich der Plattformrichtlinie und ein echtes Unterscheidungsmerkmal. Die Nutzungsrichtlinie hält fest, dass „Sprecherinnen und Sprecher das Eigentum an ihren Stimmmodellen behalten" und dass „die unbefugte Vervielfältigung, Verbreitung oder Veränderung einer Stimme ohne Erlaubnis streng untersagt ist". Zur Einwilligung heißt es, das Unternehmen stelle sicher, dass „jede Sprecherin und jeder Sprecher, deren Stimmmodell auf der Plattform verfügbar ist, den Anwendungsfällen für die eigene Stimme ausdrücklich zugestimmt hat". Ferner darf erzeugtes Audio „nicht so verändert werden, dass es die Sprecher falsch darstellt, und nicht für Inhalte verwendet werden, die sie nicht gebilligt haben", wobei Missbrauch zur Entfernung und möglichen rechtlichen Schritten führt. Das Unternehmen bewirbt diese Stimmen als „exklusive Stimmen echter Sprecherinnen und Sprecher". Hinweis: Dies sind veröffentlichte Zusagen des Unternehmens; die tatsächlichen Verträge mit einzelnen Sprechern sind nicht öffentlich, und in keiner geprüften Quelle werden Vergütungsbedingungen offengelegt.
Ja, unter Bedingungen, die von Stufe und Abonnementstatus abhängen. Ab der Stufe Basic ist eine kommerzielle Lizenz enthalten, die Namensnennung ist optional; im kostenlosen Plan ist sie für alle heruntergeladenen Inhalte erforderlich. Die Nutzungsrichtlinie gewährt „ein nicht ausschließliches, nicht übertragbares Recht, die über unsere Dienste erzeugten Audioinhalte für persönliche oder kommerzielle Zwecke zu nutzen", knüpft dies aber an die Zeit: Die Nutzung ist „ausschließlich während Ihres Abonnementzeitraums" zulässig, danach dürfen Sie bereits Heruntergeladenes weiter nutzen, während neue Downloads oder Änderungen nicht möglich sind. Einzelne Niederlassungen oder Gesellschaften müssen jeweils ein eigenes Abonnement halten.
Es wird gelöscht. Ergebnisse verbleiben ein Jahr ab Erstellung auf den Servern und werden danach „ohne weitere Ankündigung automatisch von unseren Servern gelöscht". Das gilt für zahlende und kostenlose Nutzer gleichermaßen. Die Löschung betrifft nur die serverseitigen Kopien — bereits heruntergeladene Dateien bleiben Ihre —, doch die Bedingungen halten klar fest, dass Sie für die Sicherung des Gewünschten verantwortlich sind und das Unternehmen keine Pflicht zur Wiederherstellung hat. Ein erneuter Download ist nur möglich, solange das Ergebnis noch vorgehalten wird und Ihr Abonnement aktiv ist.
Die Pläne reichen von kostenlos bis 69 Dollar monatlich, mit zehn Prozent Nachlass bei Jahreszahlung: Basic 5 Dollar (30.000 Guthabenpunkte, alle Stimmen, ein Platz für Instant Cloning, kommerzielle Lizenz), Plus 19 Dollar (40.000 Punkte, Geschwindigkeitssteuerung, Professional Cloning, 4K-Video), Pro 29 Dollar (75.000 Punkte, Emotionssteuerungen samt Smart Emotion, Betonung und Tonhöhe, zwei Klon-Plätze), Business 69 Dollar (200.000 Punkte, zehn Klon-Plätze, Teammitglieder, Guthabenzukauf), dazu eine Unternehmensstufe auf Anfrage. Welche Stufe Sie brauchen, hängt von der gewünschten Steuerung ab: Emotionssteuerungen beginnen bei 29 Dollar und die Geschwindigkeitssteuerung bei 19, sodass die beworbene Ausdruckskraft eine Funktion der Pro-Stufe ist.
Smart Emotion erschließt die Wiedergabe aus dem Zusammenhang, statt eine Kennzeichnung jeder Zeile zu verlangen. Das System liest den umgebenden Text — über die Schnittstelle übergeben Sie die vorhergehende und die folgende Zeile ausdrücklich — und erzeugt eine dem Zusammenhang angemessene Lesart, sodass identische Worte je nach Umgebung anders klingen. Das Unternehmen beschreibt den Ansatz als zeilenweise Analyse des Skripts zur Erzeugung eines kontextgerechten Tonfalls. Herkömmliche zeilenweise Emotionsmarkierungen bleiben als eigene Emotion verfügbar, zusammen mit Betonung und Tonhöhe, ab der Stufe Pro.
Die Vermarktungsseite wirbt mit über 700 KI-Stimmen und mehr als 35 Sprachen; die Dokumentation nennt 37 Sprachen über das Modell ssfm-v30 und mehr als 500 programmgesteuert verfügbare Stimmen. Die Abweichung erklärt sich am ehesten daraus, dass Webkatalog und Schnittstellenkatalog nicht identisch sind; prüfen Sie daher die Verfügbarkeit Ihrer Sprache und Stimme über die Stufe und Oberfläche, die Sie einsetzen wollen. Ausdrücklich genannt sind in der Dokumentation Koreanisch, Englisch, Japanisch, Chinesisch, Spanisch und Vietnamesisch.
Beides ja, ab den kostenpflichtigen Stufen. Instant Cloning erzeugt eine Stimme aus einer kurzen Probe und steht ab Basic mit einem Platz bereit; das originalgetreuere Professional Cloning erscheint ab Plus. Die Zahl der Plätze steigt auf zwei bei Pro und zehn bei Business. Das Unternehmen gibt an, eine geklonte Stimme könne mehrere Sprachen sprechen, was der wesentliche praktische Grund ist, zu klonen statt aus dem Katalog zu wählen. Sie müssen die Rechte an jeder geklonten Stimme halten: Die Bedingungen verlangen die Zusicherung, über alle nötigen Rechte, Lizenzen und Einwilligungen zu verfügen, und das Klonen fremder Stimmen ohne Erlaubnis ist untersagt.
Typecast wird von Neosapience, Inc. betrieben, einem südkoreanischen Unternehmen, das 2017 von ehemaligen Qualcomm-Ingenieuren gegründet wurde. Die koreanische Website weist die Einheit als 네오사피엔스 주식회사 aus, mit der Gewerbeanmeldenummer 883-86-00767, dem Vertreter Taesu Kim und einer Anschrift in Gangnam-gu, Seoul; dieselbe Person ist als Datenschutzbeauftragter benannt. Die Bedingungen unterliegen den Gesetzen der Republik Korea, Streitigkeiten der koreanischen Zivilprozessordnung, und enthalten einen Verzicht auf Sammelklagen sowie eine einjährige Frist zur Geltendmachung. Die Datenschutzerklärung nennt die Einhaltung des koreanischen Datenschutzrechts neben den Regimen der Europäischen Union und des Vereinigten Königreichs, dem kalifornischen Datenschutzrecht und den US-Regeln zum Onlinedatenschutz von Kindern.
Ja, und mehrere reichen weiter, als Nutzer erwarten. Sexuelle Inhalte und Inhalte für Erwachsene sind untersagt, einschließlich der Nutzung von KI-Stimmen in Erwachsenendiensten. Politische Werbung ist ohne ausdrückliche schriftliche Erlaubnis untersagt, ebenso Wahldesinformation und die Nachahmung politischer Persönlichkeiten oder ihrer Angehörigen. Betrug, Täuschung, unbefugte Nachahmung einer beliebigen Person, Hassrede, Belästigung sowie Verstöße gegen Urheber- oder Persönlichkeitsrechte sind allesamt verboten. Nutzer müssen mindestens 13 Jahre alt sein, und die Funktion des sprechenden Avatars verlangt ein Alter von mindestens 17 Jahren. Das Unternehmen behält sich vor, erzeugte Inhalte nach eigenem Ermessen zu prüfen und zu entfernen sowie Konten ohne vorherige Ankündigung zu schließen.