
Voice.ai est une plateforme vocale éditée par la société américaine Voice AI, Inc. qui réunit un changeur de voix temps réel accéléré par GPU, une synthèse vocale dans plus de quinze langues, le clonage instantané de voix et des agents vocaux téléphoniques, le tout facturé sur un même pool de crédits et accessible via une API documentée.
Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Voice.ai est une plateforme de technologie vocale exploitée par Voice AI, Inc., une société américaine dont les marques déposées Voice.ai® et Voice Universe® figurent au pied de chaque page du site. Le produit a démarré sous une forme bien plus étroite qu'aujourd'hui : une application de bureau qui permettait aux joueurs et aux streameurs de remplacer le timbre de leur propre voix, en direct, pendant qu'ils parlaient sur Discord ou dans un salon vocal de jeu. Ce modificateur de voix temps réel d'origine existe toujours, et il reste la raison pour laquelle la plupart des gens arrivent sur ce domaine. Mais la plateforme vend désormais quatre choses distinctes depuis le même compte, et déterminer laquelle des quatre correspond réellement à votre besoin est la question la plus utile à trancher avant de s'inscrire.
Ces quatre lignes de produits sont un modificateur de voix temps réel, un moteur de synthèse vocale, le clonage instantané de voix et des agents vocaux téléphoniques. Le titre de la page d'accueil en juxtapose deux, en se présentant à la fois comme changeur de voix gratuit et comme plateforme d'agents vocaux, ce qui constitue un assemblage inhabituel puisque ces deux publics n'ont presque rien en commun. D'un côté, un adolescent qui veut ressembler à un personnage de dessin animé sur un serveur Minecraft. De l'autre, un responsable des opérations qui veut que les appels commerciaux de trois heures du matin trouvent quelqu'un au bout du fil. Voice.ai sert les deux depuis une seule base de code et un seul solde de crédits, et cette double identité explique beaucoup de choses dans la manière dont le produit se ressent à l'usage.
Le positionnement technique que revendique l'entreprise est plus étroit et plus intéressant qu'un simple « nous pouvons copier n'importe quelle voix ». Le fondateur et directeur général Heath Ahrens l'a formulé ainsi auprès de TechCrunch : la proposition de valeur centrale de son intelligence artificielle de voix à voix n'est pas de reproduire parfaitement une personne donnée, mais de conserver les éléments fondamentaux de la parole d'un utilisateur, à savoir son émotion, son rythme et ses accentuations, tout en remplaçant la sonorité de la voix, afin de créer en temps réel un résultat entièrement nouveau. C'est une manière délibérée de se distinguer des sociétés de conversion vocale dont tout l'argumentaire repose sur la fidélité à un locuteur cible précis. Voice.ai optimise le naturel de la transformation et son fonctionnement en direct, pas l'indiscernabilité médico-légale du clone.
Le parcours du fondateur éclaire la lecture de ces affirmations. Ahrens a fondé iSpeech en 2007, que la page de présentation décrit comme la première plateforme de synthèse vocale en nuage, et a lancé DriveSafe.ly en 2009, première application à lire les messages texte à voix haute. Il avait également créé Haystack, une société de reconnaissance faciale. Il s'agit d'un fondateur qui livre des interfaces vocales depuis près de deux décennies, ce qui fait apparaître le virage récent vers les interfaces de programmation et les agents vocaux d'entreprise moins comme une réorientation que comme un retour à son terrain d'origine.
Deux chiffres donnent une idée de l'échelle, mais tous deux sont datés. Lorsque TechCrunch a couvert la première levée de fonds externe en juin 2023, Voice.ai comptait plus de 480 000 utilisateurs et une bibliothèque de plus de 50 000 filtres vocaux, et avait grandi par le bouche-à-oreille sur la base de trois millions de dollars d'autofinancement, avec une communauté Discord de plus de 120 000 personnes. Mucker Capital et M13 menaient alors un tour de six millions de dollars, et M13 présente toujours l'entreprise comme un investissement d'amorçage. La fiche actuelle de l'App Store décrit quant à elle une bibliothèque communautaire de plus de 20 000 voix créées par les utilisateurs. Ces chiffres comptent des objets différents à des moments différents et ne doivent pas être raboutés en une seule courbe.
Ce qui distingue vraiment Voice.ai d'un éditeur classique de synthèse vocale, c'est que sa bibliothèque de voix ne lui appartient en grande partie pas. Voice Universe est une bibliothèque communautaire dans laquelle les utilisateurs déposent les voix qu'ils ont créées et où d'autres viennent puiser. Le dépôt de ce nom comme marque indique à quel point cette brique est centrale dans l'identité de l'entreprise. On est plus proche d'une place de marché ou d'une communauté de mods que d'un catalogue de timbres soigneusement organisé, et cela produit à la fois le principal avantage de la plateforme et son problème le plus délicat.
L'avantage tient à l'ampleur et à la vitesse. Un catalogue construit par des dizaines de milliers de contributeurs croît plus vite et couvre davantage de niches que n'importe quel studio d'enregistrement interne. Les difficultés portent sur la variabilité de la qualité et sur la provenance. Comme chacun peut contribuer, la qualité est inégale : un évaluateur indépendant a observé que la qualité audio était constamment hachée et que bon nombre des timbres présentés comme des voix de jeunes filles d'animation semblaient n'être qu'un simple ajustement de hauteur tonale. Et comme les dépôts émanent des utilisateurs, la question de savoir qui a consenti à chaque voix incombe au déposant plutôt qu'à la plateforme, ce qui explique précisément pourquoi les conditions d'utilisation consacrent tant de place à ce sujet.
Le modificateur de voix temps réel est le produit d'origine et reste celui dont les exigences sont les plus fortes. Sur l'application de bureau, il fonctionne sous le nom de Live Mode : le traitement de la parole s'effectue localement sur la carte graphique de la machine, puis l'audio transformé est acheminé vers les autres applications par ce qu'Ahrens a décrit comme un câble audio virtuel. Cette architecture de traitement local explique une latence suffisamment faible pour soutenir une conversation, et elle explique aussi que l'exigence matérielle soit réelle et non symbolique.
La foire aux questions officielle fait preuve sur ce point d'une franchise peu commune. Elle comporte une entrée dédiée intitulée « Quel est le GPU minimum pour pouvoir utiliser Live Mode ? » ainsi qu'une entrée distincte consacrée au message d'avertissement signalant que votre carte graphique ne prend pas en charge Live Mode. Un éditeur ne rédige pas un message d'erreur documenté pour un cas de défaillance matérielle si un nombre significatif d'utilisateurs ne le rencontrait pas. Une évaluation indépendante rapporte que les machines équipées d'une carte graphique d'un niveau inférieur à la Nvidia GTX 980 ou à l'AMD RX 580 subissent des saccades et des coupures, et cite un utilisateur ayant constaté que l'application consommait quatre-vingt-sept pour cent de sa carte graphique. Il faut considérer Live Mode comme une fonction assortie d'un plancher matériel, et non comme une capacité universelle.
Le moteur de synthèse vocale est la brique qui a reçu le plus d'efforts de développement récemment, et c'est la principale unité de compte du modèle tarifaire. Le site annonce la prise en charge de plus de 15 langues et les nomme : anglais américain, français, hindi, ukrainien, japonais, coréen, suédois, espagnol latino-américain, portugais brésilien, chinois, néerlandais, turc, allemand et italien. L'objectif affiché est de localiser un timbre donné vers n'importe quel accent ou n'importe quelle langue, ce qui signifie que l'identité vocale et la langue sont traitées comme deux axes séparables.
Les paliers payants restituent des nécessités pratiques que le palier gratuit retient. Le gratuit plafonne chaque conversion à 500 caractères, soit à peu près un court paragraphe ; Starter porte ce plafond à 5 000 caractères et, surtout, débloque la possibilité même de télécharger les fichiers générés. Il existe par ailleurs un point d'entrée plus léger appelé TTS Lite, signalé comme nouveau dans la navigation, ainsi qu'un studio de synthèse vocale inclus à partir du palier Starter.
Le clonage vocal est commercialisé sous forme de quota par palier plutôt que comme une capacité illimitée, ce qui permet de lire très directement le volume d'usage que l'entreprise anticipe pour chaque type de client. Le palier gratuit indique explicitement l'absence de clones vocaux instantanés. Starter en inclut cinq, Launch dix, Core cinquante, Scale deux cents et Business deux mille deux cents. Cette échelle de quotas est l'un des signaux les plus clairs sur le public visé par chaque palier.
Un détail mérite d'être signalé, car les propres pages de l'entreprise se contredisent. La page d'accueil affirme qu'avec seulement 10 secondes d'audio, le clonage reproduit les voix avec un réalisme saisissant, tandis que la page dédiée au clonage indique que le clonage s'effectue en seulement 15 secondes. Les deux sont des déclarations officielles publiées simultanément, aucune ne renvoie à l'autre et aucune explication n'est fournie sur cet écart. Mieux vaut planifier sur la valeur la plus longue et traiter la plus courte comme un plancher commercial plutôt que comme une spécification technique.
La ligne des agents vocaux est la plus récente et celle qui porte aujourd'hui le plus de poids commercial : elle occupe la première place de la navigation, assortie d'une mention de nouveauté. L'argument est que des agents prennent en charge les appels entrants et sortants afin que l'entreprise cesse d'en manquer, la société décrivant des agents qui automatisent les appels, répondent aux questions, planifient des rendez-vous et pilotent les conversations de bout en bout. Parmi les cibles d'intégration nommées figurent Salesforce, HubSpot, Zendesk et Slack.
Ce qui rend cette ligne crédible en tant que produit et non comme simple page de présentation, c'est qu'elle est facturée selon des unités propres à la téléphonie. Les formules se différencient par le nombre d'appels simultanés et par le nombre de numéros de téléphone attribués : Starter offre deux appels simultanés et un numéro, Launch quatre et trois, Core huit et dix, Scale seize et vingt, et Business trente appels simultanés et cinquante numéros. Ce sont les contraintes d'une véritable plateforme d'appels, pas celles d'une démonstration.
Au-delà des quatre lignes principales, le site héberge neuf utilitaires audio gratuits accessibles depuis le navigateur : synthèse vocale, modificateur de voix en ligne, amélioration audio, suppression de voix, suppression d'écho, séparation de pistes par intelligence artificielle, détection de tonalité et de tempo, suppression de réverbération et convertisseur de formats. Ils fonctionnent davantage comme un canal d'acquisition que comme une ligne d'activité, et ils sont décomptés sur les mêmes crédits : le palier gratuit les limite à cinq minutes par conversion, une durée qui monte progressivement jusqu'à cent quatre-vingts minutes.
L'interface de programmation constitue une véritable ligne de produit et non une promesse, et la preuve tient aux détails plutôt qu'aux affirmations. La page développeurs expose trois interfaces, pour la synthèse vocale, les agents vocaux et le clonage, adossées à un point de terminaison réel situé à dev.voice.ai/api/v1/tts/speech, avec un identifiant de modèle nommé voiceai-tts-v1-latest dans un exemple Python exécutable. Des trousses de développement Python et TypeScript accompagnent des exemples REST, la couverture porte sur le web ainsi que sur iOS et Android, et une compatibilité est annoncée avec LiveKit ainsi qu'avec Pipecat, deux cadres logiciels ouverts que les ingénieurs de la voix en temps réel utilisent réellement.
La plateforme annonce un temps de réponse inférieur à 150 millisecondes pour les interactions conversationnelles. Ce chiffre est communiqué par l'éditeur sans conditions de test ni référence externe, il doit donc être considéré comme un objectif de conception plutôt que comme une mesure vérifiée. Le déploiement est proposé sous quatre formes : interface hébergée en nuage, installation sur site, nuage privé dans le réseau virtuel du client et option locale à faible latence. L'interface prend également en charge des flux d'agents compatibles avec le protocole MCP, l'intégration de la génération augmentée par récupération pour l'accès dynamique aux connaissances, l'appel d'outils, ainsi que des rappels HTTP déclenchés à l'achèvement de la génération audio, lors des réponses d'agent, aux mises à jour d'état de conversation et lors des notifications d'erreur et de reprise.
Un prérequis passe facilement inaperçu et coûte cher lorsqu'il est découvert tardivement. Les conditions d'utilisation précisent que tout usage professionnel, d'entreprise, par interface de programmation ou autrement commercial exige un accord distinct avec Voice.ai. Obtenir une clé d'accès depuis le parcours en libre-service ne signifie pas être contractuellement autorisé à publier un produit qui s'appuie dessus.
Jeu vidéo, streaming et vtubing. C'est le cœur historique de la plateforme et toujours son public réel le plus large. TechCrunch a décrit une adoption par les joueurs, les créateurs de contenu et les vtubeurs sur TikTok, Zoom, Discord, Minecraft, GTA5, Fortnite, Valorant, League of Legends, Among Us, Skype et WhatsApp. La foire aux questions officielle le confirme avec des guides de dépannage propres à chaque application pour Discord, Skype, WhatsApp, Zoom, PUBG, Fortnite, Google Meet, League of Legends, World of Warcraft, Among Us, Minecraft, TeamSpeak, Telegram et Viber. Si votre usage figure sur cette liste, quelqu'un a déjà documenté les modes de défaillance à votre place.
Traitement des appels entrants et sortants. La ligne des agents vocaux vise les entreprises qui perdent des prospects faute de décrocher. Les paliers d'appels simultanés et de numéros permettent de dimensionner honnêtement : un commerce mono-site en phase de test tient largement dans les deux appels simultanés de Starter, tandis qu'une exploitation nécessitant cinquante numéros relève du palier Business.
Voix off et narration. La page de clonage nomme les balados, les jeux vidéo et la voix off professionnelle, et décrit la possibilité de produire des milliers d'heures de contenu vocal sans prononcer un mot. Le véritable déclencheur se situe au palier Starter, où apparaissent pour la première fois le téléchargement des fichiers et une licence commerciale : sans téléchargement, le palier gratuit ne peut alimenter aucune chaîne de production réelle.
Localisation multilingue. Puisque l'identité vocale et la langue sont traitées comme séparables, un même timbre peut être localisé vers un autre accent ou une autre langue parmi les quatorze langues nommées. Pour un créateur qui maintient une même identité de chaîne sur plusieurs marchés, c'est bien plus utile que de choisir une voix de catalogue différente par langue.
Accessibilité et expression de soi. La page consacrée à l'éthique nomme explicitement deux groupes. Elle décrit l'outil comme permettant aux personnes transgenres d'obtenir la voix qu'elles souhaitent sans rééducation vocale ni intervention médicale, et indique que le produit constitue une amélioration potentielle par rapport à la synthèse vocale classique pour les personnes atteintes d'un handicap ou d'une maladie telle qu'un cancer de la gorge, une sclérose latérale amyotrophique ou la maladie de Parkinson. TechCrunch a confirmé de manière indépendante le premier de ces publics, aux côtés des utilisateurs soucieux de confidentialité et de ceux qui explorent de nouvelles personnalités en ligne.
Masquage vocal pour préserver sa vie privée. Un usage distinct du divertissement : participer à des discussions vocales sans exposer sa véritable voix. L'orientation retenue par l'entreprise, qui conserve l'émotion et le rythme tout en remplaçant le timbre, convient mieux à cet objectif qu'un filtre mécanique.
Enregistrez des sources propres pour le clonage. La qualité du clone est bornée par le matériau source. Une pièce silencieuse, une distance constante au microphone et des phrases naturelles plutôt que des listes de mots produisent des modèles nettement meilleurs qu'un court extrait capté sur fond de bruit.
Fournissez davantage d'audio que le minimum annoncé. Puisque les deux chiffres donnés par le site lui-même divergent entre dix et quinze secondes, traitez-les comme des planchers. Un échantillon plus long et plus varié offre au modèle une couverture phonétique plus complète.
Décidez délibérément de publier ou non un clone de votre propre voix. Le dépôt rend une voix disponible dans une bibliothèque où d'autres viennent puiser. La recommandation centrale de Comparitech en matière de sécurité est de ne pas déposer de modèle entraîné sur sa propre voix, au motif qu'il pourrait être détourné par d'autres dans des escroqueries vocales, tout en précisant qu'il s'agit d'une propriété générale des plateformes de clonage et non d'une spécificité de ce produit. Vérifiez les réglages de visibilité de votre compte avant de supposer qu'un clone reste privé.
Vérifiez le réglage d'entraînement du métamodèle. Les conditions indiquent qu'en utilisant les services, vous consentez à ce que l'entreprise utilise votre matériel à des fins d'entraînement du métamodèle et de calcul, et que tous les utilisateurs peuvent désactiver cette fonction à tout moment. Elles ne précisent pas si le réglage est actif ou inactif par défaut : vérifiez-le vous-même plutôt que de le supposer.
Prévoyez une marge graphique si vous jouez et transformez simultanément. Live Mode se dispute la même carte graphique que le jeu. Sur une carte tout juste suffisante, le résultat combine une perte de fluidité dans le jeu et des artefacts dans la transformation.
Vérifiez avant de vous abonner, pas après. Plusieurs évaluateurs indépendants critiquent la même chose : des tarifs invisibles tant que l'installation n'est pas faite. Comme la page tarifaire est publique et détaillée, lisez-la dans un navigateur avant d'installer quoi que ce soit.
Conservez les preuves de consentement pour les voix de tiers. Si vous clonez la voix d'autrui, les conditions exigent une autorisation légale explicite de cette personne, et la clause d'indemnisation fait peser sur vous les conséquences d'une erreur. Conserver une permission écrite constitue la forme pratique de cette exigence.
Ne construisez pas un produit vocal concurrent à partir des résultats. Les conditions interdisent explicitement d'utiliser les sorties pour entraîner, développer ou améliorer des modèles vocaux, pour créer de nouvelles voix synthétiques ou des produits dérivés, ou pour soutenir un produit concurrent.
Les joueurs, streameurs et vtubeurs dotés d'un matériel suffisant constituent le public le mieux adapté au volet temps réel. Si vous disposez d'une carte graphique de jeu de milieu de gamme ou mieux et que vous passez du temps sur Discord ou en vocal multijoueur, vous êtes sur le terrain de prédilection du produit, et la bibliothèque communautaire y est la plus fournie.
Les créateurs produisant de la voix off à volume modéré sont bien servis à partir du palier Starter, où apparaissent le téléchargement et la licence commerciale. Les quatorze langues nommées rendent l'outil viable pour les créateurs qui publient sur plusieurs marchés.
Les petites entreprises qui perdent des appels entrants sont la cible de la ligne des agents vocaux. Les paliers bas mettent un véritable pilote à portée : un numéro et deux appels simultanés pour cinq dollars par mois constituent une manière réaliste de vérifier si le traitement automatisé des appels convient à une activité donnée avant tout engagement.
Les développeurs qui construisent des fonctions vocales temps réel obtiennent une interface documentée avec des trousses nommées et une compatibilité de cadres logiciels, sous réserve de conclure l'accord commercial distinct exigé par les conditions.
Les personnes ayant besoin d'une autre voix pour des raisons d'identité ou d'accessibilité sont explicitement mentionnées sur la page d'éthique, et TechCrunch a identifié indépendamment ce public comme une catégorie en croissance.
À qui il faut conseiller autre chose : toute personne sur circuit graphique intégré ou ordinateur portable ancien qui souhaite une transformation en temps réel, puisqu'aucune formule ne compense le plancher matériel ; toute personne ayant besoin d'une certitude contractuelle sur la propriété des résultats et l'absence de contrefaçon, puisque les conditions excluent précisément cela ; et toute personne ne pouvant tolérer une politique stricte de non-remboursement.
L'application de bureau est le client le plus complet et le seul endroit où fonctionne la transformation en temps réel de Live Mode ; elle est distribuée depuis le programme d'installation hébergé par le site. Ses capacités sont bornées par la carte graphique de la machine autant que par le palier d'abonnement.
La plateforme web couvre la synthèse vocale, la console des agents vocaux et les neuf outils audio en ligne, et fonctionne sans exigence matérielle locale puisque le traitement s'effectue côté serveur. C'est le bon point d'entrée pour évaluer l'outil.
Sur mobile, l'application iOS est publiée par Voice AI Inc. et, d'après les données de l'interface officielle d'Apple, affiche une note de 4,0 sur 189 évaluations, une classification de contenu à partir de 12 ans, un téléchargement gratuit, une exigence d'iOS 18.0 ou version ultérieure, une première publication en mai 2023 et une version 2.0.5 datée de juillet 2026. Un écart de capacité important est documenté dans la foire aux questions de l'entreprise elle-même, qui comporte des entrées demandant si l'application mobile permet la modification de voix en temps réel et pourquoi elle n'en dispose pas encore : mobile et bureau ne sont donc pas équivalents. La couverture de TechCrunch en 2023 décrivait des applications pour Mac, PC, Android et iOS ; les options de téléchargement actuelles du site présentent un programme d'installation Windows et le lien vers l'App Store, et la situation sur Android n'a pas pu être confirmée par des sources officielles au moment de la rédaction : vérifiez donc directement sur le site.
Pour l'accès programmatique, l'interface couvre le web ainsi qu'iOS et Android, avec un déploiement possible en nuage hébergé, sur site, en nuage privé dans votre propre réseau virtuel ou en local à faible latence.
Les tarifs sont publics sur la page dédiée du site et s'organisent en sept paliers décomptés selon une dotation mensuelle de crédits, la facturation annuelle étant présentée comme offrant deux mois gratuits.
| Palier | Prix mensuel | Crédits/mois | Clones instantanés | Appels simultanés | Numéros |
|---|---|---|---|---|---|
| Free | 0 $ | 5k | Aucun | — | — |
| Starter | 5 $ | 15k | 5 | 2 | 1 |
| Launch | 24 $ (premier mois 12 $) | 200k | 10 | 4 | 3 |
| Core | 99 $ | 1M | 50 | 8 | 10 |
| Scale | 330 $ | 4M | 200 | 16 | 20 |
| Business | 880 $ | 22M | 2 200 | 30 | 50 |
| Enterprise | Sur devis | Sur devis | — | — | — |
Le système de crédits est la partie qu'il vaut vraiment la peine de bien comprendre, car les crédits forment une unité partagée dépensée à des taux différents selon les fonctions. Au palier Core, le même million de crédits achète soit 1 000 minutes de synthèse vocale, soit 1 000 minutes d'appels d'agent vocal, soit 15 000 minutes de traitement par les outils audio. La synthèse vocale et les minutes d'agent sont tarifées de façon équivalente entre elles, tandis que le traitement par les outils audio revient environ quinze fois moins cher à la minute. Au palier gratuit, la dotation est très serrée en pratique : 5 000 crédits achètent soit cinq minutes de synthèse vocale, soit trois utilisations des outils audio.
D'autres limites liées aux paliers façonnent l'expérience autant que le nombre de crédits. Le nombre de caractères par conversion passe de 500 sur le gratuit à 5 000 à partir de Starter. La durée par conversion des outils audio monte de cinq minutes sur le gratuit à dix, vingt, soixante puis jusqu'à cent quatre-vingts minutes. Les générations simultanées de synthèse vocale passent de trois sur Starter à quinze sur Scale et Business. Le palier Enterprise ajoute des conditions sur mesure autour des accords de traitement des données et des niveaux de service, des accords spécifiques pour les clients soumis à la réglementation HIPAA, une authentification unique personnalisée, des limites de simultanéité relevées et un support prioritaire.
Deux points relatifs au paiement méritent d'être soulignés avant de souscrire. Les conditions précisent que, sauf mention contraire à l'achat ou obligation légale, tous les paiements sont non remboursables, qu'il s'agisse d'abonnements, de facturation à l'usage ou d'achats ponctuels, avec des exceptions discrétionnaires que l'entreprise n'est pas tenue d'accorder. Et plusieurs évaluateurs indépendants signalent que les prix n'apparaissent qu'après installation, ce que la page tarifaire publique rend inutile d'accepter : lisez-la d'abord.
ElevenLabs constitue la référence en matière de fidélité du clonage et de synthèse vocale expressive, et la couverture de TechCrunch plaçait Voice.ai dans la même grande catégorie tout en relevant la réputation d'ElevenLabs pour un clonage d'une qualité presque inquiétante. Si votre besoin porte sur une narration synthétique de la plus haute qualité sans transformation en direct, c'est le choix le plus direct.
Respeecher occupe l'extrémité professionnelle de la conversion de voix à voix, avec des références en production cinématographique et télévisuelle. C'est la comparaison pertinente lorsqu'il s'agit de restituer un locuteur cible précis à un niveau de diffusion plutôt que de transformer une voix en direct.
Voicemod est le concurrent le plus direct sur le versant du jeu en temps réel, et l'encadré des consultations associées de Trustpilot rapproche les deux produits, en affichant Voicemod à 1,7 sur 5 pour 456 avis face au 2,0 sur 233 avis de Voice.ai. Les deux notes sont basses et les deux fiches présentent les réserves d'échantillonnage évoquées plus bas.
Murf et Acapela ont été cités par TechCrunch parmi les acteurs établis de la simulation vocale, et se situent plus près de la production de voix off classique que de la transformation en direct.
Les plateformes d'agents vocaux spécialisées constituent la comparaison pertinente pour le seul volet téléphonique. Si l'automatisation des appels est le seul besoin et que la modification de voix est hors sujet, évaluez le palier agents de Voice.ai face à des plateformes conversationnelles dédiées sur la simultanéité, les fonctions de téléphonie et la documentation de conformité, plutôt que sur la taille de la bibliothèque de voix.
La transformation en temps réel comporte un plancher matériel. Live Mode dépend du traitement local par la carte graphique. L'entreprise documente à la fois une exigence minimale et un avertissement dédié pour les cartes non prises en charge, et les tests indépendants signalent des saccades en dessous d'un niveau approximatif de GTX 980 ou RX 580, un utilisateur ayant rapporté une occupation de 87 % de sa carte graphique. Aucun palier d'abonnement ne lève cette contrainte.
Le mobile n'égale pas le bureau. La foire aux questions officielle demande et explique elle-même pourquoi l'application mobile ne dispose pas encore de la modification de voix en temps réel. Quiconque vise cet usage sur téléphone devrait vérifier l'état actuel avant de payer.
Deux chiffres officiels sur la durée de clonage se contredisent. Dix secondes sur la page d'accueil, quinze sur la page de clonage, publiés en parallèle et sans mise en cohérence.
Les notes communautaires sont basses et l'échantillonnage n'est pas neutre. Trustpilot affiche 2,0 sur 5 pour 233 avis, avec une distribution nettement bimodale : 82 % d'une étoile, 14 % de cinq étoiles et presque rien entre les deux. La fiche est revendiquée depuis août 2023, l'entreprise invite activement ses clients à donner leur avis et elle a répondu à 100 % des avis négatifs. Un échantillon constitué par sollicitation diffère systématiquement d'un échantillon spontané : cette note doit donc se lire aux côtés des autres canaux et non à leur place. La note de l'App Store, à 4,0 sur 189 évaluations, est nettement plus favorable sur un échantillon comparable, et le résumé par Trustpilot de 59 avis récents porte sur les abonnements automatiques, les prélèvements de renouvellement inattendus et l'absence de réponse du support plutôt que sur la qualité audio elle-même.
Les plaintes relatives à la facturation concordent entre sources indépendantes. Comparitech pointe des tarifs cachés jusqu'après l'installation et une procédure de remboursement stricte et laborieuse exigeant une inscription séparée. Onerep signale des prix et des limites d'essai peu clairs ainsi que des utilisateurs prélevés après résiliation. Les conditions confirment le principe de non-remboursement.
Le produit est décrit comme toujours en phase bêta. L'évaluation d'Onerep de janvier 2026 indique que Voice.ai demeure en bêta en 2026, ce qu'elle avance comme explication des anomalies rencontrées par les utilisateurs.
Les droits commerciaux sont énoncés de façon incohérente. La page tarifaire mentionne une licence commerciale à partir de Starter, tandis que les conditions indiquent à deux reprises que les services sont fournis pour un usage personnel et non commercial et que tout usage professionnel, d'entreprise ou par interface de programmation requiert un accord distinct. Le site n'explique pas comment ces énoncés s'articulent. Quiconque prévoit un déploiement commercial devrait obtenir cette position par écrit.
Aucune garantie sur les résultats ni sur les voix. Les conditions indiquent que l'entreprise ne garantit ni l'absence de contrefaçon, ni l'autorisation pour l'usage envisagé, ni l'adéquation à un objectif particulier, et que toutes les voix sont produites par les utilisateurs sans engagement de responsabilité de sa part. La clause d'indemnisation fait peser sur l'utilisateur les réclamations de tiers.
Vos données alimentent l'entraînement des modèles. Les contenus déposés accordent une licence perpétuelle, irrévocable, mondiale, exempte de redevances et pouvant faire l'objet de sous-licences, qui couvre explicitement l'entraînement et l'amélioration des modèles de l'entreprise ainsi que le développement de nouveaux produits. L'entreprise s'engage à ne pas commercialiser votre voix de façon autonome sans permission explicite, mais cet engagement est bien plus étroit qu'une promesse de ne pas l'utiliser pour l'entraînement.
La contribution de puissance de calcul fait partie des conditions. L'utilisation des services emporte consentement à ce que votre matériel serve à l'entraînement du métamodèle, désactivable à tout moment mais sans valeur par défaut annoncée.
La documentation sur la confidentialité manque de précision. Onerep signale l'absence de méthode de chiffrement annoncée, l'absence de durée de conservation indiquée et l'absence d'option de suppression hors de Californie. Comparitech relève que le service ne respecte pas le signal Do Not Track. Le verdict global de Comparitech reste néanmoins que le produit est sûr moyennant des précautions, aucune fuite de données ni action en justice n'ayant été identifiée.
Les affirmations de conformité ne sont pas étayées. Le site annonce une conformité totale au règlement général sur la protection des données ainsi qu'aux référentiels SOC 2 et HIPAA et à toutes les grandes réglementations d'entreprise, sans publier de rapports d'audit ni d'identifiants de certification. Les acheteurs professionnels devraient réclamer la documentation sous-jacente.
Âge et juridiction. L'utilisation requiert d'avoir au moins 18 ans. Le droit applicable est celui du Delaware, avec compétence exclusive des tribunaux de cet État, ce qui constitue un élément matériel pour les utilisateurs hors des États-Unis.
Il existe bien un palier réellement gratuit, mais il est étroit. Il fournit 5 000 crédits mensuels, soit environ cinq minutes de synthèse vocale ou trois utilisations des outils audio ; il plafonne les conversions à 500 caractères ; il n'inclut aucun clone vocal instantané ; et il n'autorise pas le téléchargement des fichiers générés. Les paliers payants débutent à cinq dollars par mois. Plusieurs évaluateurs indépendants ont critiqué l'écart entre la communication autour d'un changeur de voix gratuit et l'ampleur de ce qui se trouve derrière le mur payant : considérez donc le gratuit comme un mécanisme d'évaluation plutôt que comme une formule de travail.
Le point est réellement ambigu et mérite d'être tranché par écrit avant de s'en remettre à lui. La page tarifaire mentionne une licence commerciale incluse à partir du palier Starter. Les conditions d'utilisation indiquent quant à elles, à deux endroits distincts, que les services sont fournis pour un usage personnel et non commercial et que tout usage professionnel, d'entreprise ou par interface de programmation exige un accord distinct avec l'entreprise. Le site ne réconcilie pas ces énoncés. Les conditions excluent en outre toute garantie que les résultats soient exempts de contrefaçon ou autorisés pour l'usage envisagé.
Oui. Les conditions n'autorisent le dépôt ou la génération de contenu audio que dans trois cas : vous utilisez votre propre voix, vous disposez d'une autorisation légale explicite de la personne dont la voix est utilisée, ou votre usage est clairement permis par le droit applicable, par exemple la parodie ou la satire. Utiliser le logiciel pour usurper l'identité de personnes réelles, vivantes ou décédées, dans l'intention de tromper, de frauder ou d'induire en erreur est interdit et peut entraîner une résiliation immédiate, des poursuites et une coopération avec les autorités. Notez la tension avec la description de l'App Store, qui met en avant la possibilité de ressembler à n'importe qui, des célébrités aux personnages de fiction : ce sont les conditions, et non le texte de la boutique, qui font foi.
Non, et beaucoup se font surprendre. Les conditions comportent une clause intitulée « No License to Voices » qui indique qu'aucun droit n'est accordé sur les voix, modèles vocaux, clones ou identités vocales disponibles via les services, y compris les voix déposées par d'autres utilisateurs, et que la disponibilité publique d'une voix ne confère aucune permission de l'utiliser, de la reproduire, de la distribuer ou de la commercialiser. Être visible dans Voice Universe ne constitue pas une licence.
Une carte graphique dédiée, et raisonnablement performante. Live Mode traite l'audio localement sur la carte graphique, et la foire aux questions officielle documente à la fois une exigence minimale et un avertissement explicite pour les cartes non prises en charge. Des tests indépendants rapportent qu'un matériel situé approximativement sous le niveau de la Nvidia GTX 980 ou de l'AMD RX 580 produit une sortie hachée et saccadée, un utilisateur ayant fait état d'une occupation de 87 % de sa carte graphique. Les fonctions côté serveur, à savoir la synthèse vocale, les outils audio et les agents vocaux, n'imposent aucune contrainte de ce type.
Le site annonce plus de 15 langues et nomme l'anglais américain, le français, l'hindi, l'ukrainien, le japonais, le coréen, le suédois, l'espagnol latino-américain, le portugais brésilien, le chinois, le néerlandais, le turc, l'allemand et l'italien, avec la capacité annoncée de localiser un timbre donné vers un autre accent ou une autre langue.
L'entreprise répond directement à ces deux accusations sur sa page consacrée à la sécurité, en indiquant que l'application est régulièrement soumise à des éditeurs antivirus dont McAfee, Google et Avast, avec publication des résultats VirusTotal, et que sa fonction de calcul distribué n'a rien à voir avec les cryptomonnaies ni le minage, la puissance contribuée servant uniquement à construire des voix, entraîner des modèles et traiter la voix des utilisateurs aux appareils moins puissants. Deux évaluations indépendantes concordent largement : Comparitech a conclu que le produit est sûr moyennant des précautions, sans fuite de données ni action en justice identifiée, et Onerep a conclu qu'il ne s'agit ni d'un virus, ni d'un mineur, et que son usage n'est pas illégal. Toutes deux soulèvent cependant des réserves distinctes sur la transparence tarifaire et la documentation de confidentialité, et la principale recommandation de sécurité de Comparitech est d'éviter de déposer un modèle entraîné sur sa propre voix.
Les contenus déposés accordent à l'entreprise une licence perpétuelle, irrévocable, mondiale, exempte de redevances, pouvant faire l'objet de sous-licences et non exclusive, couvrant l'exploitation du service, l'entraînement et l'amélioration de ses modèles, ainsi que le développement de nouvelles fonctions et de nouveaux produits. L'entreprise déclare qu'elle ne commercialisera pas votre voix de façon autonome sans permission explicite. Par ailleurs, l'usage du service emporte consentement à ce que votre matériel serve à l'entraînement du métamodèle, fonction désactivable à tout moment. Des évaluateurs indépendants relèvent que la politique de confidentialité ne précise ni les méthodes de chiffrement ni les durées de conservation, et que le droit à la suppression n'est offert qu'aux résidents de Californie.
Par défaut, non. Les conditions indiquent que, sauf mention contraire à l'achat ou obligation légale, tous les paiements sont non remboursables, y compris les abonnements, la facturation à l'usage et les achats ponctuels, les exceptions relevant de la seule discrétion de l'entreprise sans obligation de sa part. Des évaluateurs indépendants décrivent une procédure de remboursement stricte exigeant une inscription séparée, et les plaintes liées aux abonnements et aux renouvellements constituent le thème le plus fréquent du résumé des avis récents sur Trustpilot.
Principalement par ce qu'il optimise. Ahrens a explicitement formulé la différence : la proposition centrale n'est pas de reproduire parfaitement une personne donnée, mais de conserver l'émotion, le rythme et les accentuations du locuteur tout en remplaçant le timbre, en temps réel. ElevenLabs et Respeecher sont construits autour de la fidélité à une voix cible pour du contenu produit. Voice.ai est construit autour de la transformation en direct, d'une bibliothèque de voix alimentée par la communauté et, désormais, d'agents téléphoniques. Si vous avez besoin de restituer un locuteur précis à un niveau de diffusion, les spécialistes conviennent mieux ; si vous devez sonner différemment en direct dans un jeu ou un appel, c'est ici le terrain de prédilection de ce produit.
Comment utiliser Voice.ai