
Typecast est une plateforme vocale IA de la société coréenne Neosapience qui transforme un texte en parole expressive grâce à plus de 700 modèles de voix sous licence de comédiens, une analyse émotionnelle contextuelle, le clonage vocal et une API de synthèse multilingue destinée aux créateurs, développeurs et entreprises.
Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Typecast est une plateforme d'intelligence artificielle qui convertit un texte écrit en parole dont la charge émotionnelle est réglable. Son argument distinctif n'est ni le nombre brut de voix ni le prix, mais l'expressivité : l'entreprise se présente comme « le générateur de voix IA le plus expressif au monde » et décrit le produit comme « le générateur de voix IA au rendu naturel et plein d'émotion — pour les créateurs, les développeurs et les entreprises ». Concrètement, cela recouvre trois produits liés sous un même abonnement — un éditeur vocal accessible depuis le navigateur, un système de clonage vocal et une interface de synthèse vocale — auxquels s'ajoutent un éditeur vidéo et une fonction d'avatar parlant.
L'exploitant est Neosapience, Inc., une société sud-coréenne. Ce point pèse bien plus qu'une note de bas de page, pour deux raisons. D'abord, il détermine le cadre juridique : les conditions d'utilisation énoncent que celles-ci « forment un accord entre vous et Neosapience, Inc. » et qu'elles sont « régies et interprétées conformément aux lois de la République de Corée », les litiges relevant de la procédure civile coréenne. Ensuite, il explique le centre de gravité linguistique du produit : le coréen, l'anglais, le japonais et le chinois y sont des langues de premier rang, ce qui n'est pas le cas chez tous les concurrents occidentaux. Le site en coréen divulgue intégralement l'entité exploitante conformément à la réglementation locale du commerce électronique : 네오사피엔스 주식회사, numéro d'enregistrement d'entreprise 883-86-00767, représentant Taesu Kim, avec une adresse dans le quartier de Samseong-dong à Gangnam-gu, à Séoul. La même personne figure comme responsable de la protection des données dans la politique de confidentialité.
Ce qui sépare réellement la voix IA Typecast d'un moteur de synthèse ordinaire, c'est la couche émotionnelle. Outre les réglages habituels de vitesse et de hauteur, la plateforme propose ce qu'elle nomme Smart Emotion : un système qui lit le texte environnant pour déduire comment une réplique doit être livrée, sans exiger que vous étiquetiez chaque phrase à la main. L'entreprise décrit sa bibliothèque comme « des voix exclusives issues de véritables comédiens de doublage », et sa politique d'utilisation explicite le montage contractuel derrière cette formule avec une clarté rare dans cette catégorie. Parce que la licence des voix et le consentement sont les questions qui déterminent le plus souvent si un outil vocal peut sans risque soutenir une activité commerciale, cette page les traite comme centrales et non comme une remarque finale.
La capacité phare est la synthèse vocale avec réglage de l'intensité émotionnelle. Le site annonce « plus de 700 voix IA avec émotion, vitesse et dynamique réglables », et les démonstrations affichées exposent les états émotionnels disponibles : joie, tristesse, colère, chuchotement et registre grave apparaissent comme des modes applicables à une même réplique. Les voix sont organisées par fonction — annonceur, narrateur, podcast, présentateur de journal, robot et voix de personnage — avec des filtres d'âge et de genre. La réserve importante est que ces voix ne sont pas des constructions synthétiques assemblées de toutes pièces : l'entreprise les décrit comme « des voix exclusives issues de véritables comédiens de doublage », ce qui donne tout son poids aux conditions de licence évoquées plus loin.
Smart Emotion est la fonction que l'entreprise met en avant, et elle s'écarte réellement du contrôle émotionnel par étiquettes. Plutôt que d'assigner une humeur à chaque phrase, le système analyse le texte qui entoure une réplique pour décider comment la dire. La description que l'entreprise donne de ses travaux sous-jacents est que la technologie « analyse les scripts ligne par ligne pour générer automatiquement un ton adapté au contexte ». L'interface expose ce mécanisme directement : une requête peut transporter la phrase précédente et la suivante en même temps que la réplique à synthétiser, de sorte qu'une phrase comme « tout va bien se passer » est livrée différemment selon qu'elle suit une bonne ou une mauvaise nouvelle. Pour le travail narratif, c'est un choix de conception substantiel, puisque les mêmes mots ne pèsent pas pareil selon ce qui les précède.
La plateforme propose le clonage vocal à deux niveaux de qualité. Le clonage instantané crée une voix personnalisée à partir d'un court échantillon audio et devient accessible dès le premier palier payant ; le clonage professionnel, plus fidèle, apparaît à partir du palier intermédiaire. Les emplacements de clonage sont comptés et non illimités : un sur les paliers d'entrée et intermédiaire, deux sur le palier le plus populaire, dix sur le palier entreprise. L'entreprise indique qu'une voix clonée peut ensuite « parler plusieurs langues », c'est-à-dire qu'une voix captée dans une langue peut servir à générer de la parole dans d'autres — l'attrait concret pour les créateurs qui publient sur plusieurs marchés.
Le produit destiné aux développeurs n'est pas une simple enveloppe autour de l'éditeur web. La documentation décrit une interface fournissant la parole en 37 langues via le modèle ssfm-v30 et l'accès à plus de 500 voix, avec quatre modes de génération distincts : la synthèse standard produisant des fichiers WAV ou MP3 complets ; la synthèse en continu qui lit l'audio au fur et à mesure de l'arrivée des fragments, pensée pour les agents vocaux et les applications interactives à faible latence ; la synthèse horodatée qui renvoie des données d'alignement au niveau du mot ou du caractère, pour les sous-titres, la mise en évidence de type karaoké et la synchronisation labiale ; et le clonage instantané exposé par programmation. Les exemples officiels du kit de développement couvrent Python et JavaScript, les deux langages les plus répandus, ainsi que C# et Java, puis Kotlin et Rust. La documentation publie en outre un fichier llms.txt explicitement destiné aux agents de codage.
Au-delà de l'audio, l'abonnement inclut un éditeur vidéo dont la qualité d'export est échelonnée : 720p au palier gratuit, 1080p à l'entrée, 4K à partir du palier intermédiaire, l'export sans filigrane étant réservé à tout palier payant. Une fonction distincte d'avatar parlant génère un présentateur à l'écran, comptée en nombre de générations plutôt qu'en durée : jusqu'à six générations au palier d'entrée et jusqu'à quarante au palier entreprise, aucune au palier gratuit. À noter que les avatars sont soumis à une limite d'âge plus stricte que le reste de la plateforme, comme indiqué plus bas.
Typecast publie des applications mobiles pour iOS et Android qui génèrent des voix off directement depuis un téléphone et synchronisent les projets entre appareils. La version iOS est enregistrée au nom de la société Neosapience, se télécharge gratuitement, exige iOS 16.4 ou une version ultérieure, porte une classification 12+ et a été mise à jour en août 2026 : une application activement entretenue plutôt qu'un compagnon laissé à l'abandon.
L'entreprise publie une généalogie de modèles plutôt que de traiter son moteur comme une boîte noire : un premier modèle de synthèse par apprentissage profond en 2018, le modèle CATS améliorant prononciation et naturel en 2021, SSFM 1.0 en 2024 introduisant une nouvelle architecture entraînée sur de vastes jeux de données, SSFM 2.0 en 2025 ajoutant le multilingue et des contrôles avancés, et SSFM 3.0 la même année apportant la génération émotionnelle sensible au contexte. Cette généalogie mérite d'entrer dans la comparaison face aux nouveaux venus, étant entendu qu'il s'agit d'affirmations de l'entreprise, non auditées de façon indépendante.
Le meilleur ajustement concerne les contenus qu'une lecture plate ferait échouer : fiction audio, animation, dialogues de jeu, livres audio romanesques et vidéo portée par un récit. Un témoignage publié sur le site, signé d'un réalisateur, résume le flux de travail visé — essayer différentes voix, ajuster le rythme et jouer sur l'émotion jusqu'à ce qu'une scène prenne vie, ce qu'il décrit comme « faire le casting, la mise en scène et la production en même temps ». C'est l'association d'un vaste catalogue de voix de personnages et d'un contrôle émotionnel réplique par réplique qui rend cette catégorie réellement exploitable.
Pour qui publie le même contenu sur plusieurs marchés, la combinaison clonage plus multilingue constitue l'attrait de fond : capter une voix une fois, puis lui faire dire d'autres langues. Avec 37 langues disponibles via l'interface et le coréen, l'anglais, le japonais, le chinois, l'espagnol et le vietnamien nommés explicitement dans la documentation, la couverture est réellement large — et notablement solide sur les langues d'Asie orientale, où certains concurrents occidentaux le sont moins.
La synthèse en continu existe précisément pour les cas où attendre la fin du calcul est inacceptable. L'entreprise déclare évoluer « d'une simple génération vocale vers une véritable IA conversationnelle qui écoute, réfléchit et parle en temps réel », et le palier entreprise mentionne explicitement les agents conversationnels en temps réel. Pour un développeur construisant un assistant ou un produit vocal interactif, la surface pertinente est le point d'accès en continu associé à une lecture à faible latence, non l'éditeur web.
La synthèse horodatée renvoie des données d'alignement au mot ou au caractère, ce qui transforme la sortie en objet directement exploitable par une chaîne de production plutôt qu'en simple fichier audio. C'est ce qui rend praticables le sous-titrage automatique, la mise en évidence façon karaoké et l'animation synchronisée sur les lèvres sans passer par une étape d'alignement forcé.
L'entreprise décrit une base d'utilisateurs couvrant l'audiovisuel, les télécommunications, le commerce en ligne et l'éducation, et la structure des paliers reflète cet usage institutionnel : le palier entreprise ajoute des membres d'équipe, dix emplacements de clonage et l'achat de crédits supplémentaires. Un détail de licence considérable et facile à manquer s'applique ici : la politique d'utilisation dispose que « des filiales ou sociétés distinctes doivent chacune disposer de leur propre abonnement afin d'assurer la conformité », de sorte qu'un seul siège ne peut couvrir légalement tout un groupe.
Parce que la génération et l'écoute sont illimitées sur tous les paliers, y compris gratuit, et que les crédits ne sont consommés qu'au téléchargement, Typecast permet un flux de travail que la plupart des concurrents n'offrent pas : auditionner un script entier avec de nombreuses voix et lectures émotionnelles sans rien dépenser, puis payer seulement les prises retenues. Utilisé délibérément, l'outil devient autant un instrument de casting et de prévisualisation qu'un outil de production.
Construisez vos habitudes autour du modèle de crédits. Puisque l'écoute ne coûte rien, faites toute la comparaison, la direction d'acteurs et les révisions dans l'éditeur, et n'exportez que les prises finales. Un ordre de grandeur aide : 30 000 crédits correspondent à environ 35 minutes d'audio, 75 000 à environ 90 minutes et 200 000 à environ 250 minutes. Les crédits mesurent donc la longueur du produit fini, non l'effort dépensé pour y parvenir.
Puisque chaque palier verrouille un contrôle différent, le plan suffisant le moins cher n'est souvent pas le plan le moins cher. Le contrôle de la vitesse n'apparaît qu'à 19 dollars ; les contrôles émotionnels, Smart Emotion compris, seulement à 29. Qui s'abonne à 5 dollars en espérant l'expressivité mise en avant sera déçu — non parce que la fonction n'existe pas, mais parce qu'elle se trouve deux paliers plus haut.
La page de tarifs comporte un avertissement à prendre au sérieux : « Les prix sur l'App Store et le Google Play Store peuvent différer du montant indiqué ci-dessus, selon les politiques tarifaires de chaque boutique », et « les abonnements achetés via l'application mobile (iOS/Android) ne peuvent pas être modifiés sur le web. Veuillez gérer votre offre via la boutique concernée. » S'abonner depuis le mobile enferme la gestion de l'offre dans cette boutique.
Les conditions sont strictes et liées directement à l'usage. Pour les offres mensuelles, « un remboursement intégral n'est possible que s'il n'existe aucun historique d'utilisation de crédits, aucun historique de création de clonage Premium et aucune tâche en attente, dans les 7 jours suivant la date de facturation ». Les offres annuelles suivent les mêmes conditions dans les sept jours du paiement, après quoi le remboursement déduit les mois consommés et des frais de traitement. Autrement dit, le premier téléchargement ou le premier clone met fin au remboursement intégral. Les utilisateurs de l'Union européenne disposent en outre d'un droit de rétractation légal de quatorze jours, que les conditions présentent comme abandonné dès lors que le service a été partiellement exécuté.
La politique d'utilisation interdit expressément « l'utilisation non autorisée de l'identité, de la voix ou de l'image d'une personne à des fins non satiriques, malveillantes ou commerciales sans son consentement », ainsi que l'usurpation d'identité de personnalités politiques. Au-delà des règles internes, les conditions exigent que vous garantissiez détenir « tous les droits, licences, consentements, permissions et/ou pouvoirs » sur ce que vous envoyez. La responsabilité juridique du consentement au clonage vous incombe, pas à la plateforme.
La publicité politique est interdite « sauf autorisation écrite expresse », et la désinformation électorale comme l'usurpation d'identité de responsables politiques ou de leurs proches sont prohibées. Les contenus pour adultes, ainsi que l'usage de voix IA en lien avec la pornographie ou des services pour adultes, sont interdits. Si votre travail touche à ces domaines, demandez une autorisation écrite en amont plutôt que de découvrir la restriction après publication.
Puisque « des filiales ou sociétés distinctes doivent chacune disposer de leur propre abonnement », une agence servant plusieurs entités clientes ou un groupe comptant plusieurs filiales juridiques ne peut consolider son usage sur un seul siège. Réglez la question de la structure de licence à l'achat plutôt qu'au moment d'un audit.
Typecast convient aux créateurs dont le contenu dépend de la charge émotionnelle et pas seulement de l'intelligibilité : fiction audio, animation, travail de personnage, vidéo narrative — puisque c'est précisément là que l'investissement du produit se situe. Il convient aux équipes qui publient à la fois en Asie orientale et en Occident, le coréen, le japonais et le chinois y étant centraux plutôt qu'accessoires. Il convient aux développeurs qui construisent des agents vocaux ou des chaînes de sous-titrage, grâce aux points d'accès en continu et horodatés et au kit couvrant six langages. Il convient à quiconque veut essayer abondamment avant de payer, la génération et l'écoute étant illimitées et gratuites. Et il convient à ceux qui veulent une réponse claire sur la licence des voix, la position sur le consentement des comédiens étant publiée plutôt que sous-entendue.
Il ne convient pas à qui attend de la plateforme un stockage durable : la suppression automatique au bout d'un an s'applique quel que soit le palier. Il ne convient pas aux organisations souhaitant qu'une licence unique couvre plusieurs entités juridiques, du fait de l'exigence d'abonnements distincts. Il ne convient pas aux contenus pour adultes ni politiques, tous deux restreints. Il ne convient pas aux moins de 13 ans où que ce soit, ni aux moins de 17 ans pour l'avatar parlant. Il ne convient pas aux acheteurs qui exigent un corpus d'avis indépendants étoffé avant de s'engager, l'empreinte d'évaluation tierce étant mince au regard de la base d'utilisateurs revendiquée. Et il peut ne pas convenir à qui n'accepte pas le droit coréen ni la renonciation à l'action collective, points détaillés plus loin.
Pour la plupart des utilisateurs potentiels, la vraie question est plus étroite que « Typecast est-il bon ». Elle est de savoir si le contrôle émotionnel vaut le surcoût du palier. Si une narration claire et neutre suffit, les options moins chères abondent et le palier d'entrée peut même sembler cher face à la concurrence. Mais si l'interprétation est le produit — si l'écart entre un murmure et un cri porte votre contenu — alors le palier à 29 dollars est le point de comparaison honnête, et Smart Emotion est une capacité réellement différenciante et non un contrôle de hauteur rebaptisé.
Typecast fonctionne principalement dans le navigateur : l'éditeur vocal, l'éditeur vidéo et l'interface de clonage sont tous web, sans application de bureau. Des applications mobiles existent pour iOS et Android, destinées à générer des voix off en déplacement avec synchronisation des projets. L'application iOS, enregistrée au nom de la société Neosapience, est téléchargeable gratuitement, requiert iOS 16.4 ou une version ultérieure, porte une classification 12+, figure dans les catégories Photo et vidéo ainsi que Divertissement, et prend en charge l'anglais et le coréen. Sa version la plus récente date d'août 2026, signe d'un entretien actif.
Pour les développeurs, la surface de la plateforme est l'API de synthèse vocale plutôt qu'un client installé, avec un kit officiel couvrant six langages — Python et JavaScript, C# et Java, Kotlin et Rust — ainsi qu'un outil en ligne de commande et une documentation conçue pour être lue par des agents de codage. Le site lui-même est bilingue, avec des versions anglaise et coréenne distinctes, la version coréenne portant la divulgation légale complète exigée par la réglementation coréenne.
Une réserve mérite d'être soulignée : puisque les abonnements souscrits via les boutiques mobiles ne peuvent être gérés sur le web, la plateforme par laquelle vous vous abonnez détermine où vous devrez ensuite résilier ou changer d'offre.
Typecast facture par abonnement mensuel avec dix pour cent de remise en engagement annuel, et la structure repose sur des crédits de téléchargement plutôt que sur un temps de génération. Tous les paliers, gratuit compris, offrent une génération et une écoute illimitées ; les crédits ne sont consommés qu'au téléchargement.
Le palier gratuit ne coûte rien et fournit 3 000 crédits de téléchargement à vie, soit environ cinq minutes d'audio. Il limite les téléchargements aux voix d'essai, plafonne l'audio à 16 kHz, autorise trois projets, propose un export vidéo en 720p avec 1 Go de stockage, conserve l'historique des téléchargements sept jours et exige l'attribution pour tout contenu téléchargé. Il n'inclut ni emplacement de clonage ni génération d'avatar.
Le palier Basic à 5 dollars par mois, ou 54 dollars par an, fournit 30 000 crédits mensuels (environ 35 minutes), ouvre toutes les voix IA, porte l'audio à 44,1 kHz, ajoute un emplacement de clonage instantané, permet l'export vidéo 1080p sans filigrane avec 5 Go de stockage, et rend l'attribution facultative sous licence commerciale.
Le palier Plus à 19 dollars par mois, ou 204 dollars par an, fournit 40 000 crédits (environ 50 minutes), ajoute le contrôle de la vitesse et le clonage professionnel, et porte l'export à la 4K avec 30 Go de stockage.
Le palier Pro à 29 dollars par mois, ou 312 dollars par an, abrite la capacité emblématique de la plateforme. Il fournit 75 000 crédits (environ 90 minutes) et ajoute les contrôles émotionnels, dont l'ajustement en un clic de Smart Emotion, l'émotion personnalisée, l'intonation et la hauteur, ainsi qu'un deuxième emplacement de clonage et 50 Go de stockage.
Le palier Business à 69 dollars par mois, ou 744 dollars par an, fournit 200 000 crédits (environ 250 minutes), permet l'achat de crédits supplémentaires et ajoute dix emplacements de clonage, des membres d'équipe et 100 Go de stockage. Au-dessus se trouve un palier Entreprise sur devis, couvrant une interface dédiée et un ensemble de sécurité, des agents conversationnels en temps réel et un gestionnaire de compte attitré.
Deux remarques pratiques accompagnent le tableau. Les prix des boutiques mobiles peuvent différer des chiffres du web, et les abonnements mobiles doivent être gérés via la boutique d'origine. Les remboursements sont conditionnels : un remboursement intégral suppose aucune utilisation de crédits, aucune création de clonage Premium et aucune tâche en attente dans les sept jours suivant la facturation, les offres annuelles au-delà de ce délai étant remboursées déduction faite des mois consommés et de frais de traitement.
ElevenLabs est l'alternative la plus fréquemment comparée et le concurrent le plus solide sur le réalisme brut des voix et l'étendue de l'écosystème. La distinction honnête tient à l'accent mis : l'investissement de Typecast se concentre sur l'interprétation émotionnelle déduite du contexte et sur une position de licence explicitement documentée envers les comédiens, tandis qu'ElevenLabs se bat sur la qualité du modèle, l'échelle et l'outillage périphérique. Comparez sur l'axe qui vous importe réellement plutôt que sur une réputation générale.
Murf et WellSaid Labs visent la narration d'entreprise et la formation en ligne, où la constance et le contrôle de la prononciation comptent davantage que l'amplitude dramatique. Pour des présentations produit, des modules de formation et de la communication interne, ces solutions s'avèrent souvent plus économiques, et la finesse émotionnelle facturée par Typecast y reste largement inutilisée.
Play.ht et Speechify occupent l'extrémité volume et prix, séduisant les éditeurs convertissant de vastes corpus en audio. Leur avantage tient à l'économie du débit ; l'argument de Typecast est la direction réplique par réplique, dont la valeur reste limitée quand la tâche se réduit à une conversion en masse.
Les grands fournisseurs de nuage — Google, Amazon et Microsoft — proposent une synthèse profondément intégrée à l'infrastructure et des circuits d'achat adaptés aux entreprises. Ils constituent le choix par défaut lorsqu'il s'agit d'intégrer une synthèse à haut débit dans un environnement déjà en place. Ce qu'ils n'offrent généralement pas, c'est un catalogue sélectionné de voix de comédiens réels assorti d'engagements publics sur le consentement, ce qui est précisément la différence de Typecast.
Pour les contenus en coréen, japonais et chinois, l'origine régionale du produit constitue un avantage réel qu'il vaut la peine de vérifier directement. Plutôt que d'accepter une comparaison telle quelle, générez le même script dans la langue visée sur deux plateformes et écoutez : pour les langues d'Asie orientale, l'écart s'inverse fréquemment par rapport au classement de réputation anglophone.
La limite la plus lourde n'est pas une absence de fonction mais une règle de conservation. Les productions générées via le service sont conservées un an à compter de leur création, après quoi elles sont « automatiquement supprimées de nos serveurs sans autre préavis ». Les conditions explicitent trois points : il vous revient de télécharger ce que vous voulez garder ; l'entreprise n'a aucune obligation de récupérer les éléments supprimés ; et la politique « s'applique de la même façon à tous les utilisateurs, qu'ils soient sur un plan payant ou gratuit ». Retélécharger une production antérieure n'est possible que tant qu'elle demeure sur les serveurs et que vous disposez d'un abonnement actif.
L'audio déjà téléchargé reste utilisable après résiliation, mais la politique d'utilisation dispose que l'usage commercial n'est permis « que pendant votre période d'abonnement » et qu'après expiration « aucune nouvelle modification ni aucun nouveau téléchargement ne peuvent être effectués sans prolongation ». Combinée à la règle de conservation, une interruption d'abonnement peut immobiliser définitivement un travail non encore exporté.
Les productions du palier gratuit ne sont pas librement utilisables : l'attribution est requise pour tout ce qui y est téléchargé, les téléchargements se limitent aux voix d'essai et la qualité plafonne à 16 kHz. Le palier gratuit est un véritable environnement d'évaluation, pas un outil de production gratuit.
Le discours commercial met l'expressivité en avant, mais les contrôles émotionnels de base, Smart Emotion, l'émotion personnalisée, l'intonation et la hauteur n'apparaissent qu'à partir du palier Pro, le contrôle de la vitesse exigeant au minimum le palier à 19 dollars. L'acheteur séduit par les démonstrations émotionnelles et abonné à 5 dollars n'obtiendra pas la capacité qui l'a attiré.
Si les conditions confirment que « vous conservez vos droits de propriété sur votre contenu et possédez la production », l'envoi de contenu accorde à Neosapience « une licence non exclusive, irrévocable, mondiale, entièrement payée et exempte de redevances pour stocker, reproduire, modifier, transmettre, afficher, publier et distribuer votre contenu afin d'exploiter, améliorer, promouvoir et fournir les services ». Lisez attentivement cette portée avant d'envoyer des échantillons vocaux sensibles : elle inclut la promotion et elle est irrévocable.
Les litiges relèvent des lois de la République de Corée et de la procédure civile coréenne. Les conditions ajoutent que tout litige « SERA RÉSOLU INDIVIDUELLEMENT, SANS RECOURS À AUCUNE FORME D'ACTION COLLECTIVE », et que toute action « DOIT ÊTRE ENGAGÉE DANS UN DÉLAI D'UN (1) AN À COMPTER DE LA NAISSANCE DU DROIT D'AGIR ». Pour un utilisateur professionnel non coréen, ce sont des clauses substantielles et non des formules d'usage.
Puisqu'un remboursement intégral suppose aucune utilisation de crédits, aucune création de clonage Premium et aucune tâche en attente, télécharger un seul fichier ou créer un clone met fin à cette voie. La génération et l'écoute étant gratuites, la difficulté est évitable — à condition d'évaluer avant de télécharger.
L'exigence selon laquelle « des filiales ou sociétés distinctes doivent chacune disposer de leur propre abonnement » limite le déploiement pour les agences et les groupes, et des accords distincts sont en outre requis pour les services d'interface, la création de voix sur mesure et l'intégration dans des systèmes automatisés.
Les utilisateurs doivent avoir au moins 13 ans, ou davantage si la loi locale l'exige, et la fonction d'avatar parlant est réservée aux 17 ans et plus. Les contenus interdits couvrent le matériel sexuel, la violence et les discours haineux, la publicité politique et la désinformation électorale, la fraude et l'usurpation d'identité, les atteintes à la sécurité des mineurs, ainsi que les atteintes à la propriété intellectuelle ou à la vie privée. L'entreprise se réserve le droit de retirer les contenus générés « pour quelque raison que ce soit (ou sans raison) » et de mettre fin à l'accès sans préavis.
Il s'agit d'une lacune probatoire et non d'une critique du produit. La fiche Trustpilot du domaine était non revendiquée et ne comportait qu'un seul avis, avec une note de 3,2, lors de la vérification — un échantillon bien trop faible pour fonder une conclusion de qualité, Trustpilot signalant elle-même que l'entreprise « n'a pas invité ses clients, de sorte que les avis peuvent ne pas être représentatifs ». L'application iOS affichait une moyenne de 3,33 sur trois notes seulement, également en deçà de tout seuil significatif. Les tentatives de vérification sur G2 et Capterra ont été bloquées sur l'ensemble des canaux disponibles ; les chiffres circulant à ce sujet dans des sources secondaires ne sont donc pas repris ici. Qui évalue Typecast devrait le tester directement plutôt que se fier à des scores agrégés.
Les 700 voix et plus, les 35 langues et plus annoncées sur le site commercial (contre 37 dans la documentation) et les nombres d'utilisateurs relayés par la presse émanent tous de l'entreprise. Notez que ce dernier chiffre a beaucoup varié dans sa propre communication : la couverture de la levée de série B en 2022 évoquait « plus d'un million d'utilisateurs », tandis que celle du tour pré-introduction de décembre 2025 fait état de « plus de deux millions d'utilisateurs enregistrés dans le monde ». Utilisateurs enregistrés n'équivaut pas à utilisateurs actifs, et aucun des deux chiffres n'a été vérifié indépendamment.
À titre d'indication sur la stabilité et non d'approbation : l'entreprise a levé 21,5 millions de dollars en série B en février 2022, menée par BRV Capital Management, portant le total à environ 26,7 millions à cette date, puis 11,5 millions de dollars lors d'un tour pré-introduction annoncé en décembre 2025 avec la participation de HB Investment et de K2 Investment Partners. Elle a été fondée en 2017 par d'anciens ingénieurs de Qualcomm. Un tour pré-introduction signale une intention d'entrée en bourse, laquelle s'accompagne généralement de davantage de publicité d'informations mais aussi de possibles inflexions stratégiques ; ni l'une ni l'autre ne sont garanties.
Il existe un palier gratuit réellement utilisable, mais sa limite se situe à un endroit précis. La génération et l'écoute sont illimitées sur tous les paliers, gratuit compris : vous pouvez expérimenter sans fin sans rien dépenser. Ce qui est limité, c'est le téléchargement : le palier gratuit offre 3 000 crédits à vie, environ cinq minutes d'audio, et ces crédits sont à vie et non mensuels. Les téléchargements gratuits se limitent aux voix d'essai, plafonnent à 16 kHz, se restreignent à trois projets et à une vidéo 720p avec 1 Go de stockage, et exigent l'attribution sur tout contenu téléchargé. C'est un palier d'évaluation, pas un palier de production gratuit.
C'est le point le plus clair de la politique de la plateforme et un véritable facteur de différenciation. La politique d'utilisation énonce que « les comédiens de doublage conservent la propriété de leurs modèles vocaux » et que « la reproduction, la distribution ou l'altération non autorisées d'une voix sans permission sont strictement interdites ». Sur le consentement, elle précise que l'entreprise s'assure que « chaque comédien dont le modèle vocal est disponible sur la plateforme a explicitement accepté les cas d'usage de sa voix ». Elle dispose en outre que l'audio généré « ne peut être altéré de manière à donner une image trompeuse du comédien ni utilisé pour des contenus qu'il n'a pas approuvés », tout abus exposant à un retrait et à d'éventuelles poursuites. L'entreprise commercialise ces voix comme « des voix exclusives issues de véritables comédiens de doublage ». À noter : ce sont là des engagements publics de l'entreprise ; les contrats effectifs avec chaque comédien ne sont pas publics et aucune source consultée ne divulgue les modalités de rémunération.
Oui, sous des conditions qui varient selon le palier et l'état de l'abonnement. Une licence commerciale est incluse à partir du palier Basic, avec attribution facultative ; sur le plan gratuit, l'attribution est requise pour tout contenu téléchargé. La politique accorde « un droit non exclusif et non transférable d'utiliser le contenu audio généré par nos services à des fins personnelles ou commerciales », mais l'assortit d'une condition de temps : l'usage n'est permis « que pendant votre période d'abonnement », après quoi vous conservez l'audio déjà téléchargé sans pouvoir effectuer de nouveaux téléchargements ni de modifications. Des filiales ou sociétés distinctes doivent chacune détenir leur propre abonnement.
Il est supprimé. Les productions sont conservées un an sur les serveurs à compter de leur création puis « automatiquement supprimées de nos serveurs sans autre préavis ». Cela vaut identiquement pour les utilisateurs payants et gratuits. La suppression ne concerne que les copies côté serveur — les fichiers déjà téléchargés restent les vôtres — mais les conditions énoncent clairement qu'il vous appartient de sauvegarder ce que vous souhaitez garder et que l'entreprise n'a aucune obligation de restaurer quoi que ce soit. Retélécharger n'est possible que tant que la production est conservée et que votre abonnement est actif.
Les offres vont de la gratuité à 69 dollars par mois, avec dix pour cent de remise en annuel : Basic 5 dollars (30 000 crédits, toutes les voix, un emplacement de clonage instantané, licence commerciale), Plus 19 dollars (40 000 crédits, contrôle de la vitesse, clonage professionnel, vidéo 4K), Pro 29 dollars (75 000 crédits, contrôles émotionnels dont Smart Emotion, intonation et hauteur, deux emplacements de clonage), Business 69 dollars (200 000 crédits, dix emplacements, membres d'équipe, achat de crédits), plus une offre Entreprise sur devis. Le palier nécessaire dépend du contrôle recherché : les contrôles émotionnels commencent à 29 dollars et celui de la vitesse à 19, si bien que l'expressivité mise en avant relève du palier Pro.
Smart Emotion déduit l'interprétation du contexte au lieu d'exiger un étiquetage phrase par phrase. Le système lit le texte environnant — via l'interface, vous transmettez explicitement les répliques précédente et suivante — et produit une lecture adaptée à ce contexte, si bien que des mots identiques sont dits différemment selon ce qui les entoure. L'entreprise décrit l'approche sous-jacente comme une analyse du script ligne par ligne pour produire un ton adapté au contexte. Les étiquettes émotionnelles classiques restent disponibles sous forme d'émotion personnalisée, aux côtés de l'intonation et de la hauteur, à partir du palier Pro.
Le site commercial annonce plus de 700 voix IA et plus de 35 langues ; la documentation fait état de 37 langues via le modèle ssfm-v30 et de plus de 500 voix accessibles par programmation. L'écart s'explique le mieux par le fait que le catalogue web et le catalogue de l'interface ne sont pas identiques : vérifiez donc la disponibilité de la langue et de la voix voulues depuis le palier et l'interface que vous comptez utiliser. Les langues nommées explicitement dans la documentation comprennent le coréen, l'anglais, le japonais, le chinois, l'espagnol et le vietnamien.
Oui aux deux, à partir des paliers payants. Le clonage instantané crée une voix depuis un court échantillon et s'ouvre dès Basic avec un emplacement ; le clonage professionnel, plus fidèle, apparaît à partir de Plus. Le nombre d'emplacements passe à deux sur Pro et à dix sur Business. L'entreprise indique qu'une voix clonée peut parler plusieurs langues, ce qui constitue la principale raison pratique de cloner plutôt que de piocher dans le catalogue. Vous devez détenir les droits sur toute voix clonée : les conditions exigent que vous garantissiez disposer de l'ensemble des droits, licences et consentements nécessaires, et cloner la voix d'autrui sans permission est interdit.
Typecast est exploité par Neosapience, Inc., société sud-coréenne fondée en 2017 par d'anciens ingénieurs de Qualcomm. Le site coréen divulgue l'entité sous la dénomination 네오사피엔스 주식회사, numéro d'enregistrement 883-86-00767, représentant Taesu Kim, avec une adresse à Gangnam-gu, Séoul ; la même personne est désignée responsable de la protection des données. Les conditions relèvent des lois de la République de Corée, les litiges de la procédure civile coréenne, et comportent une renonciation à l'action collective ainsi qu'une prescription d'un an. La politique de confidentialité affirme se conformer à la loi coréenne sur la protection des données personnelles ainsi qu'aux régimes européen et britannique, à la législation californienne sur la vie privée et aux règles américaines relatives à la vie privée des enfants.
Il y en a, et plusieurs sont plus larges qu'attendu. Les contenus sexuels et pour adultes sont interdits, y compris l'usage de voix IA dans des services pour adultes. La publicité politique est interdite sauf autorisation écrite expresse, tout comme la désinformation électorale et l'usurpation d'identité de responsables politiques ou de leurs proches. La fraude, la tromperie, l'usurpation d'identité non autorisée de toute personne, les discours haineux, le harcèlement et les atteintes à la propriété intellectuelle ou à la vie privée sont tous prohibés. Les utilisateurs doivent avoir au moins 13 ans, et la fonction d'avatar parlant exige 17 ans révolus. L'entreprise se réserve le droit d'examiner et de retirer les contenus générés à sa seule discrétion et de résilier des comptes sans préavis.
Comment utiliser Typecast
Étape 1 : auditionner librement avant toute dépense
Comprenez d'abord le modèle de crédits, car il conditionne tout le reste. La page de tarifs indique que « la génération et la lecture des voix sont gratuites sur tous les paliers » et que « les crédits sont utilisés lorsque vous téléchargez l'audio ». Rien n'est consommé pendant vos essais dans l'éditeur. Générez la même réplique avec une douzaine de voix, essayez chaque mode émotionnel, ajustez le rythme : rien de tout cela n'entame vos crédits avant l'export. La plupart des utilisateurs qui jugent le palier gratuit chiche n'ont simplement pas intégré que la limite porte sur les téléchargements et non sur les essais.
Étape 2 : choisir un palier selon le contrôle dont vous avez réellement besoin
Les paliers ne forment pas une simple échelle de qualité ; chacun déverrouille un contrôle particulier. Le palier gratuit offre 3 000 crédits de téléchargement à vie (environ cinq minutes) mais vous limite aux voix d'essai, à un audio en 16 kHz et à trois projets. Le palier d'entrée à 5 dollars par mois ouvre toutes les voix, l'audio en 44,1 kHz, un emplacement de clonage instantané et une licence commerciale. Le palier suivant à 19 dollars ajoute le contrôle de la vitesse et le clonage professionnel. Le palier à 29 dollars est celui où résident les contrôles émotionnels, dont Smart Emotion, l'émotion personnalisée, l'intonation et la hauteur : si l'expressivité est ce qui vous amène ici, votre prix d'entrée est de 29 dollars et non de 5. Le palier entreprise à 69 dollars ajoute dix emplacements de clonage, des membres d'équipe et l'achat de crédits. L'engagement annuel fait économiser dix pour cent.
Étape 3 : écrire dans le sens de Smart Emotion plutôt que contre lui
Si votre palier inclut cette fonction, donnez-lui du contexte. Puisque le système déduit l'interprétation du texte environnant, découper une scène en requêtes d'une seule ligne revient à jeter le signal même dont il se sert. Par l'interface, la chose est explicite — fournissez la phrase précédente et la suivante — mais le principe vaut aussi dans l'éditeur : gardez les passages narratifs entiers pour que le modèle lise l'arc plutôt que de traiter chaque réplique en orpheline.
Étape 4 : vérifier le niveau de licence avant toute publication commerciale
C'est l'étape que l'on saute et que l'on regrette. La licence commerciale n'est pas uniforme selon les paliers. Au palier gratuit, le tableau tarifaire mentionne la licence commerciale comme « attribution requise », et la description du plan précise que « l'attribution est requise pour tout contenu téléchargé sur le plan gratuit ». À partir du palier d'entrée, l'attribution devient « facultative ». Si vous diffusez un contenu monétisé, vérifiez sous quel palier vos téléchargements ont été effectués avant la diffusion, et non après.
Étape 5 : télécharger et archiver tout ce que vous comptez garder
La règle de conservation est le détail opérationnel le plus lourd de conséquences de cette page. Les productions restent sur les serveurs de Typecast pendant un an à compter de leur création, après quoi elles sont « automatiquement supprimées de nos serveurs sans autre préavis ». Les conditions précisent qu'« il vous appartient de télécharger et de sauvegarder toute production que vous souhaitez conserver avant l'expiration de la période de conservation » et que l'entreprise n'a « aucune obligation de récupérer ou de restaurer » ce qui a été supprimé. Point décisif : cette règle « s'applique de la même façon à tous les utilisateurs, qu'ils soient sur un plan payant ou gratuit ». Traitez la plateforme comme un service de génération, pas comme votre archive.
Étape 6 : conserver un abonnement pour garder les droits de production
La politique d'utilisation pose une limite qui surprend après une résiliation : « L'audio généré peut être téléchargé et utilisé à des fins personnelles ou commerciales uniquement pendant votre période d'abonnement. Après expiration, vous pouvez continuer à utiliser l'audio précédemment téléchargé, mais aucune nouvelle modification ni aucun nouveau téléchargement ne peuvent être effectués sans prolongation de votre abonnement. » L'audio déjà téléchargé reste utilisable, mais la faculté de retélécharger ou de produire de nouveaux dérivés s'arrête avec l'abonnement.
Étape 7 : passer à l'interface quand l'éditeur ne suit plus
Pour un usage programmatique, obtenez une clé d'accès et choisissez le mode adapté à la charge : synthèse standard pour des fichiers finis, diffusion en continu pour une latence interactive, synthèse horodatée lorsqu'il faut des données d'alignement. Le kit officiel couvre six langages : Python et JavaScript, mais aussi C# et Java, ainsi que Kotlin et Rust. Notez que la politique d'utilisation exige des accords distincts pour les services d'interface, la création de voix sur mesure et l'intégration dans des systèmes automatisés : un déploiement par interface n'est pas un simple abonnement grand public agrandi.