Toolso.AI
Toolso.AI
OutilsCatégoriesTendancesNouveautésTarifsBlog
Toolso.AI
Toolso.AI

💌Abonnez-vous à AI Tools Weekly

Sélection hebdomadaire des derniers et meilleurs outils IA et tendances, livrés dans votre boîte mail S'abonner

Toolso.AI
Toolso.AI

Découvrez les meilleurs outils IA pour booster votre productivité

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Catégories populaires

  • Écriture IA
  • Image IA
  • Vidéo IA
  • Codage IA
  • Plus de catégories

Explorer

  • Derniers outils
  • Outils populaires
  • Plus d'outils
  • Soumettre un outil
  • Tarifs

À propos

  • À propos de nous
  • Contact
  • Blog
  • Journal des modifications

Légal

  • Politique des cookies
  • Politique de confidentialité
  • Conditions d'utilisation
  • Politique de remboursement
© 2026 Toolso.AI Tous droits réservés
Offre limitéeOffre limitéeMise en avantExamen sous 24 h · Sans backlink · 30 jours en vedette$29.90puis $59.90Passe à $59.90 après le 31 oct.Fin dans--:--:--Soumettre
  1. Accueil
  2. Tous les outils
  3. Outils IA
  4. Fish Audio
Aperçu de l’interface de Fish AudioVisiter le site web
Logo de Fish Audio

Fish Audio

Fish Audio est une plateforme de synthèse vocale et de clonage de voix construite autour d'un contrôle des émotions au niveau du mot. Elle clone une voix à partir d'un échantillon de dix secondes, diffuse en flux sous 300 ms et publie les poids du modèle S2 — sous une licence toutefois limitée à la recherche et aux usages non commerciaux. Exploitée par Hanabi AI Inc.

Outils IAGénération AudioOutil Audio#Synthèse vocale#Open source#Multilingue
Essayer gratuitement
Favoris
Visites
Vues
Tarif
Gratuit
Publié le
25 août 2026
Domaine
fish.audio
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Informations produit Fish Audio

Essayer gratuitement
Informations sur l'outil
Favoris
Visites
Vues
Tarif
Gratuit
Publié le
25 août 2026
Domaine
fish.audio
Note des utilisateurs

Vous avez utilisé cet outil ? Notez-le

Noter cet outil

Outils en vedette

Outils associés

Essayer gratuitement

Qu'est-ce que Fish Audio ?

Fish Audio est une plateforme d'IA vocale bâtie sur une conviction centrale : bien prononcer les mots et bien dire une phrase sont deux problèmes distincts, et la plupart des systèmes de synthèse vocale n'ont jamais résolu que le premier. La page d'accueil range les capacités en trois axes — la synthèse vocale, le clonage de voix et la reconnaissance vocale — les trois s'appuyant sur une famille de modèles nommée S2.

Ce qui définit vraiment ce produit, c'est le contrôle de l'expression au niveau du mot. Le système ne débite pas votre texte de façon uniforme : il accepte des balises en langage naturel insérées dans le texte, et ce sont elles qui dictent la manière dont un passage doit être dit. La démonstration en page d'accueil expose l'ensemble des balises d'émotion, qui couvrent la colère, la tristesse, la gêne, l'insistance, le chuchotement, la douceur, le souffle et l'excitation, avec un jeu distinct de balises spéciales pour le rire, le petit rire, le raclement de gorge, les sanglots, le soupir, l'essoufflement, ainsi que les pauses brèves et longues. La description technique donnée par le dépôt de code du projet est plus précise que le discours commercial : elle évoque un contrôle fin de la prosodie et de l'émotion au niveau infralexical à l'aide de balises en langage naturel, avec prise en charge native du multilocuteur et de la génération de dialogues à plusieurs tours.

L'éditeur n'est pas anonyme, mais son identité mérite d'être démêlée. Le pied de page du site indique que les droits appartiennent à Hanabi AI Inc. Le fichier de licence open source, lui, exige une mention de paternité désignant une autre entité, dont le texte original porte le nom 39 AI, INC. Cet article consigne les deux noms sans les fusionner, car le site n'explique pas la relation entre eux.

Le financement et l'échelle proviennent de l'annonce faite par l'entreprise elle-même. Fish Audio a levé 52 millions de dollars en amorçage à son premier anniversaire. Le tour a été mené conjointement par deux institutions : la première se nomme Coreline Ventures, la seconde Capital Today. Parmi les autres participants figurent notamment 359 Capital et Play Time, ainsi que HF0 et 645 Ventures. Le même texte rapporte le passage d'une équipe de trois à vingt-deux personnes, un revenu récurrent annuel passé de zéro à 21 millions de dollars, plus de 8 millions de créateurs et développeurs sur la plateforme, et plus de 2 millions de modèles vocaux dans la bibliothèque communautaire. Ces indicateurs sont tous déclarés par l'entreprise et n'ont fait l'objet d'aucun audit indépendant ; ils doivent donc se lire comme des affirmations de sa part et non comme des mesures vérifiées. Le texte nomme également les dirigeants : la directrice générale Rissa Cao, qui fait état de plusieurs années d'IA vocale chez Amazon et Meta, et le directeur scientifique Shijia Liao, ancien ingénieur de recherche chez NVIDIA, qui a commencé par entraîner les modèles dans sa chambre sur une seule carte graphique 4090.

Les deux questions à trancher avant de s'en servir

Deux aspects de ce produit méritent un examen plus sévère qu'une liste de fonctionnalités, et cet article les traite en détail plutôt qu'en passant. Le premier : ce que la plateforme exige réellement en matière de consentement lorsque vous clonez la voix de quelqu'un. Le second : ce que recouvre ici le terme « open source », car la licence n'appartient pas à la catégorie permissive que ce mot laisse habituellement entendre. Aucune de ces réponses n'est une raison d'écarter le produit, mais toutes deux changent la façon dont il convient de l'utiliser.

Fonctionnalités principales

Le clonage de voix à partir de dix secondes

L'argumentaire sur le clonage est précis et, fait rare dans cette catégorie, s'appuie sur des chiffres plutôt que sur des adjectifs. La page produit indique que dix secondes d'audio de référence suffisent, que la latence de diffusion en flux est inférieure à 300 millisecondes de bout en bout, et que le clonage fonctionne sans exemple préalable dans treize langues. Autrement dit : vous clonez une fois, et la même voix parle les autres langues prises en charge, sans réentraînement ni seconde séance d'enregistrement.

C'est cette dernière propriété qui transforme le plus les méthodes de travail. Le doublage traditionnel suppose soit un comédien bilingue, soit une voix différente par langue, si bien qu'un même contenu semble incarné par une autre personne sur chaque marché. Le clonage translingue sans exemple préalable signifie qu'une identité vocale enregistrée une fois peut traverser tout un catalogue.

Une synthèse vocale que l'on peut diriger

C'est du côté de la synthèse que le système de balises d'émotion prend tout son sens. Plutôt que de choisir dans une liste figée de « styles », vous annotez le texte lui-même, et les balises agissent à l'endroit exact où elles apparaissent. C'est pourquoi la notion de niveau infralexical compte : accentuer un mot précis à l'intérieur d'une phrase est une capacité différente de celle qui consiste à fixer une humeur pour la phrase entière, et c'est là que se joue l'écart entre une lecture qui sonne comme une lecture et une lecture qui sonne comme une interprétation.

La reconnaissance vocale et l'étendue de la gamme

La plateforme est bien plus large qu'un simple point d'accès de synthèse. Le menu des produits recense huit outils distincts : synthèse vocale, reconnaissance vocale, clonage de voix, transformation de voix, Story Studio, séparation des voix, traduction audio et génération d'effets sonores. Le volet reconnaissance est présenté comme intégrant à la transcription le multilocuteur, des balises d'émotion et une description en langage naturel : ce que l'on obtient est donc une transcription structurée plutôt qu'un simple bloc de texte.

La bibliothèque vocale communautaire

La plateforme héberge une vaste bibliothèque de voix déposées par les utilisateurs — plus de 2 000 000 selon son propre décompte — présentée comme adaptée à la narration créative, à la publicité et aux livres audio. C'est un véritable avantage en matière d'étendue. C'est aussi la partie du produit la plus étroitement liée aux questions de consentement abordées plus loin, car une bibliothèque de cette taille est remplie par les utilisateurs et non constituée pièce à pièce par l'entreprise.

Des poids de modèle publiés et l'auto-hébergement

Les poids du modèle open source S2 sont publiés, et le site met en avant l'auto-hébergement au même rang que l'API hébergée. Au regard des indicateurs communautaires, le dépôt n'est pas anecdotique : au moment de la consultation, il affichait 32 400 étoiles, 2 800 bifurcations, 101 contributeurs et 14 versions publiées, et se présente comme un projet de synthèse vocale open source de tout premier plan. Ce que cette licence autorise réellement fait l'objet d'une section dédiée plus bas, et la réponse est nettement plus étroite que ce que le terme laisse supposer.

Cas d'usage

Livres audio et narration de longue haleine. L'entreprise le formule ainsi : cinq secondes, c'est facile ; cinq minutes, c'est l'épreuve de vérité. La synthèse vocale est convenable à l'échelle de la phrase depuis une décennie, mais elle se fissure dès que la durée s'allonge. La narration longue est précisément le terrain où les balises d'émotion et la maîtrise du rythme font la différence, car une lecture plate devient insupportable bien avant le deuxième chapitre.

Voix off vidéo au rythme de la production. Transformer un script en narration accordée à l'image sans réserver de studio est l'usage le plus courant de ce type d'outil. Pouvoir changer de ton et ajouter de l'émotion sans réenregistrer est ce qui rend l'itération bon marché.

Voix de personnages pour le jeu et l'animation. La plateforme vise explicitement ce terrain, et l'adéquation est réelle : les médias interactifs réclament de nombreuses voix distinctes, souvent plus qu'un projet ne peut se permettre d'incarner par des comédiens, et il faut tout régénérer dès qu'un dialogue change.

Agents conversationnels et assistance client. Ici, une latence de diffusion inférieure à 300 millisecondes n'est pas un indicateur de vitrine. Un agent vocal qui marque un temps d'arrêt perceptible avant chaque réponse paraît défectueux, quelle que soit la beauté de la voix : la latence relève donc de l'exigence fonctionnelle et non du confort.

Localisation multilingue à partir d'un seul enregistrement. Le clonage translingue permet d'enregistrer une fois et de conserver la même identité vocale dans les langues prises en charge. C'est utile pour les créateurs dont l'audience s'étend sur plusieurs régions, mais mieux vaut lire d'abord la section consacrée au nombre de langues.

Déploiement auto-hébergé pour des raisons de latence ou de données. Les poids étant publiés, les équipes soumises à des exigences strictes de localisation des données, ou disposant de leur propre infrastructure d'inférence, peuvent exécuter le modèle elles-mêmes plutôt que d'envoyer de l'audio à un tiers. Reste que la licence détermine si votre usage précis est permis, ce qui est tout l'enjeu de la section correspondante.

Comment utiliser Fish Audio

Étape 1 — Essayez la démonstration avant de créer un compte. La page d'accueil comporte un champ de synthèse fonctionnel, prérempli d'un texte illustrant le système de balises, avec une limite de 30 000 caractères et les palettes de balises visibles d'emblée. C'est le moyen le plus rapide de juger si ce contrôle expressif tient ses promesses pour votre usage.

Étape 2 — Créez un compte gratuit. L'offre gratuite n'exige pas de carte bancaire et fournit 8 000 crédits mensuels, jusqu'à sept minutes de génération, 500 caractères maximum par génération et trois emplacements de voix publics.

Étape 3 — Choisissez entre la bibliothèque existante et le clonage. Pour bien des travaux, la bibliothèque est la voie la plus rapide et contourne entièrement la question du consentement. Le clonage s'impose lorsque vous avez besoin d'une identité vocale précise — idéalement la vôtre, ou une voix pour laquelle vous disposez d'une autorisation documentée.

Étape 4 — Enregistrez ou sélectionnez dix secondes de référence propres. Dix secondes constituent le plancher annoncé. La qualité de la référence compte davantage que sa durée : plus la source est nette, meilleur est le clone, et la page produit reconnaît qu'un échantillon plus long peut aider pour les voix très expressives.

Étape 5 — Écrivez le texte avec des balises, pas seulement des mots. C'est l'étape que les nouveaux utilisateurs exploitent le moins. Placer l'insistance sur le mot qui porte réellement le sens de la phrase, ou une pause longue là où un humain reprendrait son souffle, voilà ce qui sépare un rendu qui sonne artificiel d'un rendu qui sonne interprété.

Étape 6 — Vérifiez vos droits commerciaux avant de publier. Ce n'est pas une formalité facultative. Comme détaillé plus bas, le statut commercial de l'offre gratuite est énoncé de façon contradictoire selon les pages, et se tromper revient à publier du contenu monétisé sans en détenir les droits.

Étape 7 — Passez à l'API quand le volume le justifie. La documentation développeur et la référence de l'API sont hébergées sur un sous-domaine dédié, et les offres payantes donnent accès à une API facturée à l'usage.

Conseils et bonnes pratiques

Balisez peu et à bon escient. Les balises d'émotion sont un outil de direction d'acteur, pas un ornement. En baliser chaque proposition produit une interprétation instable ; n'en marquer que les deux ou trois moments qui portent réellement le poids émotionnel d'un passage donne au contraire une impression d'intention.

Investissez dans l'enregistrement de référence plutôt que dans les régénérations. Un clone hérite de l'acoustique de sa source. Dix secondes captées au micro correct dans une pièce silencieuse valent mieux qu'une minute d'audio téléphonique bruité, et aucune régénération ne rattrape une référence défectueuse au départ.

Raisonnez en crédits, pas en minutes. La conversion publiée est d'environ 600 à 625 crédits par minute générée. Rapporté aux 8 000 crédits mensuels de l'offre gratuite, cela correspond quasiment aux sept minutes annoncées. Connaître ce rapport transforme la comparaison des offres en calcul plutôt qu'en supposition.

N'oubliez pas que les crédits ne se reportent pas. Les quotas mensuels sont réinitialisés au début de chaque cycle de facturation et les minutes inutilisées ne passent pas au mois suivant : une offre dimensionnée pour votre mois de pointe est donc du gaspillage les mois creux.

Testez votre langue avant de vous engager. Comme exposé plus bas, la prise en charge linguistique est énoncée de quatre manières différentes sur les pages du site, et le dépôt ouvert comporte des signalements de bogues actifs sur certaines écritures. Générer un échantillon représentatif dans votre langue cible coûte quelques crédits et tranche définitivement la question.

Utilisez des emplacements privés pour tout contenu sensible. Les conditions de licence sur les dépôts publics sont sensiblement plus larges que sur les privés, et le contenu public peut rester disponible après suppression du compte. Le choix de l'emplacement relève des droits, pas du rangement.

À qui s'adresse Fish Audio ?

Aux créateurs qui produisent en volume. Vidéastes, podcasteurs et concepteurs de cours qui narrent régulièrement obtiennent le retour le plus net, car l'économie réalisée croît avec le volume produit.

Aux studios de jeu et d'animation aux distributions étoffées. Les projets nécessitant une large distribution, ou dont les dialogues changent souvent, en profitent davantage que ceux au script réduit et figé.

Aux développeurs qui construisent des agents vocaux. La combinaison d'une API documentée, d'une diffusion sous 300 millisecondes et de poids publiés couvre aussi bien le choix hébergé que le choix auto-hébergé.

Aux équipes de localisation. Le clonage translingue répond à un problème réel et coûteux du contenu multimarché.

Aux chercheurs et aux amateurs. Les poids publiés sont réellement exploitables pour la recherche et les travaux non commerciaux : c'est exactement le cas que la licence a été rédigée pour permettre.

À qui il faut se méfier. Quiconque envisage un déploiement auto-hébergé commercial doit lire d'abord la section consacrée à la licence, car la réponse par défaut y est négative. Quiconque doit obtenir de son fournisseur des engagements explicites sur le traitement des données biométriques devra prêter attention à ce que la politique de confidentialité dit — et plus encore à ce qu'elle ne dit pas. Enfin, quiconque compte cloner une voix qui n'est pas la sienne a davantage besoin de la section sur le consentement que d'une liste de fonctionnalités.

Plateformes

Fish Audio est avant tout une application web, utilisable depuis n'importe quel navigateur récent sans installation. L'accès développeur passe par une interface REST documentée et des kits de développement, la documentation et la référence de l'API étant hébergées sur un sous-domaine dédié.

Des applications mobiles existent : les conditions d'utilisation comportent une section dédiée qui reconnaît que leur disponibilité dépend de boutiques tierces, cite nommément l'App Store d'Apple et la boutique d'applications Android, et impose de respecter également les conditions propres à ces boutiques.

L'auto-hébergement constitue une troisième voie officiellement promue. La page produit présente les options telles quelles : déployer soi-même le modèle, appeler le point d'accès en flux sous 300 millisecondes, ou intégrer les voix à vos agents et applications. Lesquelles de ces options vous sont ouvertes dépend de la licence.

Les options de déploiement en entreprise sont présentées à part et comprennent le déploiement sur site, l'absence de conservation des données et la conformité SOC2, avec une tarification personnalisée selon le volume et facturée annuellement.

Une dernière note d'accès : le fichier robots.txt du site ouvre l'accès complet aux robots de Google, Apple et Bing, tout en interdisant aux robots génériques les chemins d'authentification et de synthèse vocale.

Tarifs et formules

Les tarifs ont été vérifiés directement sur la page des offres. À noter : deux promotions se cumulaient au moment de la consultation — trois mois offerts sur l'abonnement annuel et une remise anniversaire de 50 %. Les montants mensuels équivalents ci-dessous reflètent donc ces promotions, et les tarifs de référence sont indiqués à côté.

Offre gratuite. 0 dollar, sans carte bancaire. Comprend 8 000 crédits mensuels, jusqu'à sept minutes de génération, 500 caractères maximum par génération, trois emplacements de voix publics, une vitesse de génération standard et le clonage de voix amélioré.

Plus. 5,5 dollars par mois en équivalent, facturés 66 dollars à l'année, contre un tarif mensuel de référence de 15 dollars. Comprend 250 000 crédits mensuels, jusqu'à 200 minutes, 15 000 caractères maximum par génération, un nombre illimité d'emplacements publics plus 10 privés, la génération prioritaire, l'accès à Voice Design et un emplacement de voix professionnel.

Pro. 37,5 dollars par mois en équivalent, facturés 450 dollars à l'année, contre 100 dollars de référence. Comprend 2 000 000 de crédits mensuels, jusqu'à 1 620 minutes, trois sièges d'équipe, 30 000 caractères maximum par génération, des emplacements illimités, cinq emplacements professionnels et une garantie de remboursement de sept jours.

Max. 749 dollars par mois en équivalent, facturés 8 988 dollars à l'année, contre 999 dollars de référence. Comprend 25 000 000 de crédits mensuels, jusqu'à 6 250 minutes, dix sièges d'équipe et quinze emplacements professionnels.

Entreprise. Tarification personnalisée selon le volume, facturée annuellement, destinée aux organisations soumises à des exigences de conformité, avec facturation à l'usage assortie de contrôles au niveau de l'organisation, absence de conservation des données, déploiement sur site et conformité SOC2.

Le fonctionnement des crédits

La conversion publiée est d'environ 600 à 625 crédits par minute générée. Les quotas mensuels sont réinitialisés au début de chaque cycle de facturation et les minutes inutilisées ne sont pas reportées.

La contradiction sur les droits commerciaux

Ce point mérite d'être signalé sans détour, car il détermine directement si vous pouvez publier ce que vous générez — et le site se contredit à l'intérieur d'une même page.

La liste des fonctionnalités de l'offre gratuite, sur la page des tarifs, comporte la mention « usage commercial ». La foire aux questions située plus bas sur cette même page affirme l'inverse : les abonnés payants peuvent utiliser à des fins commerciales les voix vérifiées qui leur appartiennent, tandis que les utilisateurs de l'offre gratuite ne peuvent employer le contenu généré que pour des projets personnels et non commerciaux. La foire aux questions de la page d'accueil rejoint cette lecture restrictive et se montre plus explicite encore : l'offre gratuite est réservée à un usage personnel, et il faut passer à une offre payante pour monétiser ou exploiter commercialement les voix et obtenir des droits commerciaux complets.

Deux sources officielles affirment donc que le gratuit est réservé à l'usage personnel, tandis qu'une liste de fonctionnalités officielle dit le contraire. Cet article rapporte les deux lectures sans les concilier, car les concilier reviendrait à deviner. La prudence commande de retenir la lecture restrictive et de confirmer auprès de l'éditeur avant toute monétisation d'un contenu produit sur l'offre gratuite : le risque d'erreur pèse entièrement sur celui qui publie.

Alternatives

Le point de comparaison le plus cité dans cette catégorie est ElevenLabs, et Fish Audio participe directement à cette comparaison : le site comporte une section dédiée aux comparatifs, et son propre plan de site inclut une page consacrée à l'alternative à ce concurrent. Se placer explicitement face à cet acteur établi est un choix délibéré, et les utilisateurs potentiels garderont à l'esprit qu'une page comparative publiée par un éditeur au sujet de son concurrent relève du matériel promotionnel et non d'une évaluation indépendante.

Les affirmations de l'entreprise dans ce domaine sont autodéclarées et doivent être lues comme telles : son annonce de financement indique que S2.1 Pro a été préféré par 66 % des auditeurs à des modèles concurrents de premier plan lors de tests d'écoute à l'aveugle. Aucune méthodologie, taille d'échantillon ni composition du panel n'accompagne ce chiffre dans l'annonce, qui ne peut donc pas être vérifié de façon indépendante à partir de cette seule source.

Le véritable axe alternatif n'est cependant pas un autre fournisseur hébergé, mais le choix entre construire et acheter qu'ouvrent les poids publiés. Pour la recherche et les usages non commerciaux, exécuter le modèle soi-même est une option réelle que la plupart des concurrents n'offrent pas. Pour un usage commercial, cette option requiert une licence distincte, et la comparaison se ramène alors à une évaluation classique de service hébergé.

Limites et points de vigilance

Le consentement au clonage vocal : ce que la plateforme exige réellement

C'est la question la plus importante, et la réponse honnête est la suivante : la responsabilité incombe presque entièrement à l'utilisateur, et la plateforme n'effectue aucune vérification préalable.

L'énoncé le plus clair figure dans la foire aux questions de la page de clonage et mérite d'être cité fidèlement : il vous revient de confirmer que vous détenez les droits, les consentements et les informations exigés pour toute voix que vous clonez, et de respecter la législation applicable, y compris celle relative au nom, à l'image et aux contenus générés par IA dans votre région. La même réponse expose la posture d'application : la plateforme ne valide pas au préalable les usages individuels et peut supprimer les contenus ou les comptes qui contreviennent à ses conditions ou à la loi. Le mécanisme est donc un retrait a posteriori, et non un filtre en amont du clonage.

Ce qui frappe, c'est l'absence de toute exigence de consentement dans les documents juridiquement contraignants. La section des conditions d'utilisation consacrée aux autorisations et restrictions énumère dix-sept interdictions, de (a) à (q), dont aucune ne vise spécifiquement le consentement au clonage vocal. La plus proche est la clause générale (a), qui interdit de fournir quoi que ce soit portant atteinte aux droits de propriété intellectuelle ou à tout autre droit d'autrui. La garantie relative aux contributions des utilisateurs est tout aussi générale : elle interdit les contributions portant atteinte aux droits d'auteur ou autres droits de tiers, tels que la marque ou la vie privée. Ni l'une ni l'autre n'impose l'obligation précise de détenir un consentement documenté pour une voix clonée.

Il existe également une tension entre le discours sur le consentement et l'argumentaire commercial figurant sur la même page. Le texte d'accroche de la page de clonage invite précisément à l'usage contre lequel la mention de consentement met en garde : faire narrer votre application de rencontres par un chef d'État en exercice, lancer votre pire idée avec la voix d'un milliardaire de la tech, ou monter une émission entièrement composée d'invités fictifs. La foire aux questions de la même page renforce cette attente en précisant que la plupart des extraits de personnalités publiques, des morceaux d'émissions ou des enregistrements de qualité téléphonique fonctionnent dès le premier essai. Mettre en avant le clonage de personnalités identifiables tout en plaçant à côté une mention invitant à recueillir leur consentement constitue une incohérence bien réelle, et le lecteur doit soupeser les deux faces.

Les conditions imposent une obligation connexe : ne pas diffuser de contenu de manière trompeuse, ce qui inclut le fait de présenter un contenu comme entièrement produit par un humain. La plateforme encourage à signaler spontanément le recours à l'IA, mais formule cela comme une incitation et non comme une obligation. Un canal de signalement des abus figure en pied de page.

La conclusion pratique est nette. Si vous clonez votre propre voix, rien de tout cela ne vous contraint. Si vous clonez celle d'autrui, la plateforme ne vous en empêchera pas et ne vérifiera rien, mais elle décline dans le même mouvement sa responsabilité et fait peser l'exposition juridique entièrement sur vous — une exposition qui, selon les juridictions, peut être considérable.

Ce que signifie ici « open source » — et ce que cela ne signifie pas

Le site met l'ouverture en avant à répétition : le modèle S2 open source est présenté comme un argument de premier plan, l'auto-hébergement comme une voie prise en charge, et le dépôt se décrit comme un projet de synthèse vocale open source de tout premier plan, fort de 32 400 étoiles. Les poids sont effectivement publiés, et c'est bien réel. Mais la licence n'est pas permissive, et la nuance est déterminante sur le plan commercial.

Le dépôt l'indique sans ambiguïté : ce code et les poids de modèle associés sont publiés sous la FISH AUDIO RESEARCH LICENSE, avec l'avertissement que toute violation donnera lieu à des mesures. Cette licence, mise à jour pour la dernière fois le 7 mars 2026, énonce son intention dès l'introduction : le présent accord vise à permettre gratuitement les usages de recherche et non commerciaux, et tout usage commercial nécessite une licence distincte accordée par Fish Audio.

La section III lève toute ambiguïté : tout usage des matériaux ou de leurs œuvres dérivées à des fins commerciales requiert un accord de licence écrit distinct avec Fish Audio, et le présent accord n'accorde aucun droit commercial. Les licences commerciales se négocient via l'adresse professionnelle mentionnée dans la licence.

La définition de la « finalité commerciale » est assez large pour couvrir la plupart des usages en entreprise : elle englobe la création, la modification ou la distribution de votre produit ou service, y compris via un service hébergé ou une interface de programmation applicative ; les opérations internes de votre entreprise ou organisation ; et tout usage lié à un produit ou service pour lequel vous facturez des frais ou générez des revenus, directement ou indirectement. Un simple usage interne suffit à faire basculer dans cette catégorie : nul besoin de revendre le modèle.

Deux autres écarts avec les licences permissives méritent attention. L'autorisation de recherche est décrite comme non exclusive, mondiale, non transférable, non sous-licenciable, révocable et exempte de redevances — le terme révocable est déterminant et n'a pas d'équivalent dans les licences permissives usuelles. Et la distribution s'accompagne d'obligations de mention : un fichier de notice attribuant les droits à 39 AI, INC., ainsi que l'affichage bien visible de la mention « Built with Fish Audio » sur un site ou une documentation produit associés. La licence interdit par ailleurs d'utiliser ces matériaux ou leurs sorties pour créer ou améliorer un quelconque modèle d'IA générative fondationnel.

Une lacune mérite d'être consignée. La licence intègre par référence une politique d'usage acceptable et fait de son respect une condition de licence — mais ce document est introuvable. Plusieurs chemins possibles renvoient tous une erreur 404, et aucune page de ce type n'apparaît dans le plan de site statique de l'éditeur, qui ne recense que l'accueil, la découverte, le générateur de voix, les clients, l'offre entreprise, la page d'alternative au concurrent, les conditions, la confidentialité et les informations légales pour le Japon. Qu'une condition contraignante renvoie à un document que les utilisateurs ne peuvent pas consulter constitue un problème documentaire qu'il vaut mieux éclaircir auprès de l'éditeur avant de s'appuyer sur cette licence.

En résumé : poids ouverts, oui ; open source au sens permissif, non. La recherche et l'usage amateur sont gratuits et véritablement autorisés. Tout usage commercial — y compris interne à une entreprise — exige un accord payant distinct, quoi que suggère la page commerciale.

Ce que la politique de confidentialité n'aborde pas

Cette politique porte une date d'entrée en vigueur au 28 août 2024. Une vérification du texte intégral n'y a relevé aucune occurrence des mots « voice », « biometric » et « train ». Pour un produit dont la fonction centrale consiste à capter et reproduire des voix humaines, l'absence de toute disposition propre à la voix ou aux données biométriques constitue une lacune de fond ; cela signifie aussi que la politique ne dit rien sur l'utilisation éventuelle des contenus des utilisateurs pour entraîner ou améliorer des modèles. Au vu des éléments disponibles, la formulation honnête est que la politique reste silencieuse sur ces points — et non qu'une protection particulière existe ou n'existe pas.

Les fichiers audio déposés relèvent de la catégorie générique du contenu utilisateur, que la politique définit comme les informations personnelles contenues dans les saisies, les téléversements ou les retours fournis au service. Les tiers listés pour cette catégorie incluent les prestataires de services, les partenaires publicitaires, les partenaires d'analyse et les partenaires commerciaux.

La licence que vous accordez sur vos propres dépôts

Les conditions sont nettement plus précises sur les droits que vous cédez que sur ceux que vous conservez. Les licences accordées à la plateforme sur les contributions des utilisateurs sont exemptes de redevances, perpétuelles, sous-licenciables, irrévocables et mondiales.

La suppression connaît donc des limites. À la fermeture du compte, la plateforme cesse d'afficher vos contributions aux autres utilisateurs, à l'exception explicite des contributions publiques, qui peuvent rester intégralement disponibles ; les conditions reconnaissent en outre qu'il peut se révéler impossible de les effacer complètement de leurs archives.

Les contributions publiques supportent les conditions les plus larges de toutes : elles incluent le droit d'utiliser, d'afficher, d'exécuter et de distribuer la contribution publique à des fins de marketing et de promotion, ainsi qu'une licence accordée à tous les autres utilisateurs pour y accéder et en exercer les droits. C'est la raison concrète pour laquelle le choix entre emplacement privé et public relève des droits. C'est aussi l'arrière-plan utile pour comprendre la bibliothèque communautaire de plus de 2 millions de voix : elle existe précisément parce que les dépôts publics sont assortis de ces conditions.

La prise en charge linguistique est énoncée de quatre façons

Les pages officielles avancent quatre chiffres incompatibles, et cet article les rapporte tous les quatre sans en faire la moyenne. La page de clonage indique un fonctionnement translingue sans exemple préalable dans treize langues. La section consacrée à l'API sur la page d'accueil évoque plus de trente langues. La foire aux questions de la page de synthèse n'en énumère que huit — anglais, japonais, coréen, chinois, français, allemand, arabe et espagnol — et met en avant séparément une prise en charge automatique de huit langues avec accents natifs. L'annonce de financement revendique quant à elle plus de 83 langues avec une prosodie native.

Ces énoncés décrivent peut-être des choses différentes : le clonage par rapport à la synthèse, ou une prise en charge complète par rapport à une prise en charge au mieux. Mais le site n'explique pas la distinction : vérifiez donc votre langue par l'expérience plutôt que de vous fier à un chiffre isolé.

Les remontées de la communauté confortent cette prudence. Le dépôt ouvert comporte des tickets actifs signalant que la saisie en gurmukhi pour le pendjabi gère mal les marques de gémination et de nasalisation, ainsi qu'une demande d'amélioration connexe visant la prononciation du pendjabi par une translittération latine tenant compte des diacritiques ou une conversion graphème-phonème. Au moment de la consultation, le dépôt affichait 7 tickets ouverts pour 684 clos — un ratio de maintenance sain, mais aussi le signe d'une qualité inégale selon les langues.

Autres points de vigilance

Aucun contrôle de contenu avant publication. L'avertissement juridique du dépôt l'énonce ainsi : nous déclinons toute responsabilité quant à un usage illicite de ce code ; référez-vous à la législation locale, notamment en matière de droit d'auteur numérique. Combiné à l'absence de validation préalable, la responsabilité est systématiquement reportée vers l'aval.

Rétro-ingénierie et modèles concurrents interdits. Les conditions proscrivent toute tentative d'obtenir le code source, les composants sous-jacents des modèles ou les algorithmes, et interdisent séparément d'utiliser les sorties du service pour développer des modèles concurrents.

Conditions d'âge. Les utilisateurs doivent avoir au moins 13 ans, les mineurs de moins de 18 ans doivent obtenir l'accord de leurs parents, et la plateforme déclare ne pas collecter sciemment d'informations identifiantes auprès d'enfants de moins de 16 ans.

Les métadonnées d'annuaire vieillissent vite. La catégorie enregistrée pour cette fiche était « mode », avec des étiquettes incluant « mode » et « modèles » — manifestement erronées pour un produit de synthèse vocale — et sa description mentionnait plus de 1 000 voix là où le site en revendique désormais plus de 2 000 000. Les produits qui évoluent vite distancent leurs fiches d'annuaire : vérifiez les chiffres actuels sur le site.

FAQ

Q1. Fish Audio est-il gratuit ?

Il existe une véritable offre gratuite sans carte bancaire, qui fournit 8 000 crédits mensuels, jusqu'à sept minutes de génération, une limite de 500 caractères par génération et trois emplacements de voix publics. Savoir si vous pouvez en exploiter commercialement le résultat reste réellement flou d'après le site : la liste des fonctionnalités de l'offre gratuite mentionne l'usage commercial, tandis que la foire aux questions de cette même page et celle de la page d'accueil indiquent toutes deux que le résultat de l'offre gratuite est réservé à un usage personnel et non commercial. Retenez la lecture restrictive et confirmez auprès de l'éditeur avant toute monétisation.

Q2. Faut-il une autorisation pour cloner la voix de quelqu'un ?

La plateforme place cette responsabilité entièrement sur vous et n'effectue aucune vérification préalable. Sa foire aux questions sur le clonage indique qu'il vous revient de confirmer que vous détenez les droits, consentements et informations exigés pour toute voix clonée, et de respecter la législation relative au nom, à l'image et aux contenus générés par IA dans votre région. Elle précise également ne pas valider au préalable les usages individuels et pouvoir supprimer contenus ou comptes après coup. À noter : les conditions d'utilisation contraignantes ne comportent aucune clause exigeant spécifiquement un consentement au clonage vocal — seulement des interdictions générales de porter atteinte aux droits d'autrui — alors que l'argumentaire de la même page produit suggère activement de cloner des personnalités publiques. Juridiquement, l'exposition est la vôtre.

Q3. Le modèle est-il vraiment open source ?

Les poids sont bel et bien publiés, mais la licence n'est pas permissive. Le code et les poids sont diffusés sous la licence de recherche Fish Audio, qui indique dans son introduction viser à autoriser gratuitement la recherche et les usages non commerciaux, tout usage commercial requérant une licence distincte. Sa section III n'accorde aucun droit commercial. Gratuit pour la recherche, l'étude et l'usage amateur ; accord payant distinct pour tout le reste.

Q4. Puis-je l'auto-héberger pour mon entreprise ?

Pas sous la licence publique. La définition de la finalité commerciale y inclut explicitement la création, la modification ou la distribution de votre produit ou service, y compris via un service hébergé ou une interface de programmation, les opérations internes de votre organisation, et tout usage lié à un produit ou service générant des revenus directement ou indirectement. Le seul usage interne en entreprise suffit à la déclencher. Un accord écrit distinct est nécessaire, obtenu via l'adresse professionnelle indiquée dans la licence. Notez également que l'autorisation de recherche est révocable, contrairement aux licences permissives usuelles.

Q5. Quelle quantité d'audio faut-il pour cloner une voix, et quelle est la qualité ?

Le minimum annoncé est de dix secondes de parole propre, la page produit précisant qu'un échantillon plus long peut aider pour les voix très expressives. La qualité de la référence prime sur sa durée : un échantillon court et net vaut mieux qu'un enregistrement long et bruité. La plateforme indique en outre que le clonage est translingue sans exemple préalable dans treize langues, un seul enregistrement se prolongeant donc dans les autres langues prises en charge sans réentraînement.

Q6. Combien de langues sont réellement prises en charge ?

Le site donne quatre réponses différentes, et cet article n'en choisira pas une à votre place. La page de clonage annonce treize langues en clonage translingue ; la page d'accueil, plus de trente ; la foire aux questions de la page de synthèse énumère huit langues et met en avant une prise en charge automatique de huit langues avec accents natifs ; l'annonce de financement revendique plus de 83. Ces chiffres décrivent probablement des capacités distinctes, mais le site ne précise pas lesquelles. Produisez un échantillon test dans votre langue cible avant de vous engager : le dépôt ouvert comporte des signalements actifs sur certaines écritures, dont le traitement des marques de gémination et de nasalisation en gurmukhi pour le pendjabi.

Q7. Combien cela coûte-t-il au-delà de l'offre gratuite ?

Quatre offres payantes étaient répertoriées au moment de la consultation, avec des promotions cumulées. Plus revient à 5,5 dollars par mois facturés 66 dollars à l'année contre 15 dollars de référence, avec 250 000 crédits mensuels. Pro s'établit à 37,5 dollars par mois facturés 450 dollars à l'année contre 100 dollars de référence, avec 2 000 000 de crédits et trois sièges d'équipe. Max atteint 749 dollars par mois facturés 8 988 dollars à l'année contre 999 dollars de référence, avec 25 000 000 de crédits et dix sièges. L'offre Entreprise est personnalisée et facturée annuellement. Environ 600 à 625 crédits correspondent à une minute de génération, et les crédits inutilisés ne sont pas reportés.

Q8. Ma voix déposée sert-elle à entraîner leurs modèles ?

La politique de confidentialité ne le dit pas. Une vérification du texte intégral n'y a relevé aucune occurrence de « train », « voice » ni « biometric », pour un document entré en vigueur le 28 août 2024. Il n'existe donc aucun engagement public dans un sens ou dans l'autre sur ce point, et il serait erroné d'affirmer une protection que le document ne contient pas. Les fichiers audio déposés relèvent de la catégorie générique du contenu utilisateur, dont les destinataires listés incluent prestataires de services, partenaires publicitaires, d'analyse et commerciaux. Si ce point compte pour votre conformité, interrogez directement l'éditeur — et notez que l'offre entreprise met en avant l'absence de conservation des données comme une caractéristique distincte.

Q9. Que deviennent mes voix si je supprime mon compte ?

La suppression est partielle et non complète. Les conditions indiquent qu'à la fermeture du compte, la plateforme cesse d'afficher vos contributions aux autres utilisateurs, mais excluent explicitement les contributions publiques, qui peuvent rester intégralement disponibles, et reconnaissent qu'un effacement complet de leurs archives peut être impossible. Les licences accordées étant perpétuelles, sous-licenciables et irrévocables, et les contributions publiques conférant en plus des droits de promotion ainsi qu'un accès à tous les autres utilisateurs, choisir un emplacement privé plutôt que public constitue une décision de fond et non une préférence de classement.

Q10. Qui se trouve derrière Fish Audio et où en est l'entreprise ?

Le pied de page mentionne Hanabi AI Inc., tandis que la licence open source exige une mention au nom de 39 AI, INC. Les deux noms sont consignés ici, le site n'expliquant pas la relation entre eux. L'entreprise a annoncé 52 millions de dollars en amorçage à son premier anniversaire ; l'un des chefs de file de ce tour se nomme Coreline Ventures, l'autre institution meneuse étant Capital Today. Sa propre annonce fait état d'une équipe de vingt-deux personnes, de 21 millions de dollars de revenu récurrent annuel, de plus de 8 millions d'utilisateurs et de plus de 2 millions de modèles vocaux communautaires, et nomme la directrice générale Rissa Cao ainsi que le directeur scientifique Shijia Liao. Ces chiffres sont autodéclarés et n'ont pas fait l'objet d'un audit indépendant.

Connaissez-vous un outil similaire ?
Si vous connaissez d'autres excellents outils IA, n'hésitez pas à nous les soumettre