Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Herramientas de IA
  4. Fish Audio
Vista previa de la interfaz de Fish AudioVisitar sitio web
Logotipo de Fish Audio

Fish Audio

Fish Audio es una plataforma de síntesis de voz y clonación de voz construida en torno al control de la emoción palabra por palabra. Clona una voz a partir de una muestra de diez segundos, transmite con menos de 300 milisegundos de latencia y publica los pesos del modelo S2, aunque bajo una licencia limitada a la investigación y a usos no comerciales. La opera Hanabi AI Inc.

Herramientas de IAGeneración de AudioHerramienta de Audio#Texto a voz#Código abierto#Multilingüe
Probar gratis
Guardados
Visitas
Vistas
Precio
Gratis
Publicado
25 ago 2026
Dominio
fish.audio
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Fish Audio

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Gratis
Publicado
25 ago 2026
Dominio
fish.audio
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Fish Audio?

Fish Audio es una plataforma de inteligencia artificial de voz levantada sobre una convicción central: pronunciar bien las palabras y decir bien una frase son dos problemas distintos, y la mayoría de los sistemas de síntesis de voz solo ha resuelto siempre el primero. La página de inicio ordena las capacidades en tres ejes —síntesis de voz, clonación de voz y reconocimiento de voz—, y los tres se apoyan en una familia de modelos llamada S2.

Lo que de verdad define este producto es el control de la expresión hasta el nivel de la palabra. El sistema no recita el guion de forma uniforme: acepta etiquetas en lenguaje natural incrustadas en el propio texto, y son esas etiquetas las que dictan cómo se pronuncia cada pasaje. La zona de demostración de la página de inicio deja a la vista el conjunto completo de etiquetas de emoción, que abarca enfado, tristeza, azoramiento, énfasis, susurro, suavidad, voz aireada y entusiasmo, junto a un grupo aparte de etiquetas especiales para la risa, la risita, el carraspeo, el sollozo, el suspiro, el jadeo y las pausas breves y largas. La descripción técnica del repositorio de código del propio proyecto es más precisa que el texto comercial: habla de un control fino de la prosodia y la emoción por debajo del nivel de palabra mediante etiquetas en lenguaje natural, con soporte nativo para varios hablantes y para diálogos de varios turnos.

La empresa que lo opera no es anónima, aunque conviene desenredar los nombres. El pie de página del sitio indica que los derechos corresponden a Hanabi AI Inc. El archivo de licencia de código abierto, en cambio, exige una atribución que señala a otra entidad, cuyo texto original la nombra 39 AI, INC. Este artículo deja constancia de ambos nombres sin fundirlos, porque el sitio no explica la relación entre ellos.

La financiación y la escala proceden del anuncio de la propia compañía. Fish Audio levantó 52 millones de dólares en una ronda semilla al cumplir su primer año. La ronda la lideraron de forma conjunta dos instituciones: la primera se llama Coreline Ventures y la segunda Capital Today. Entre los demás participantes figuran, entre otros, 359 Capital y Play Time, además de HF0 y 645 Ventures. El mismo texto informa del crecimiento del equipo de tres a veintidós personas, de unos ingresos recurrentes anuales que pasaron de cero a 21 millones de dólares, de más de 8 millones de creadores y desarrolladores en la plataforma y de más de 2 millones de modelos de voz en la biblioteca comunitaria. Todos estos indicadores de negocio los declara la propia empresa y no han pasado por una auditoría independiente, de modo que deben leerse como afirmaciones suyas y no como magnitudes verificadas. El texto también nombra a la dirección: la directora general Rissa Cao, que menciona varios años de inteligencia artificial de voz en Amazon y Meta, y el director científico Shijia Liao, antiguo ingeniero de investigación en NVIDIA, que empezó entrenando los modelos en su habitación con una sola tarjeta gráfica 4090.

Las dos preguntas que conviene resolver antes de usarlo

Hay dos aspectos de este producto que merecen un examen más severo que el que ofrece una lista de funciones, y este artículo los aborda en detalle en lugar de mencionarlos de pasada. El primero: qué exige realmente la plataforma en materia de consentimiento cuando clonas la voz de alguien. El segundo: qué significa aquí «código abierto», porque la licencia no pertenece a la clase permisiva que ese término suele dar a entender. Ninguna de las dos respuestas es motivo para descartar el producto, pero ambas cambian el modo en que conviene utilizarlo.

Funciones principales

Clonación de voz a partir de diez segundos

El argumento sobre la clonación es concreto y, algo poco habitual en esta categoría, se apoya en cifras y no en adjetivos. La página del producto indica que bastan diez segundos de audio de referencia, que la latencia de transmisión es inferior a 300 milisegundos de extremo a extremo y que la clonación funciona sin ejemplos previos en trece idiomas. Es decir: clonas una vez y esa misma voz habla los demás idiomas admitidos, sin reentrenamiento ni una segunda sesión de grabación.

Es esta última propiedad la que más transforma los flujos de trabajo. El doblaje tradicional exige o bien un intérprete bilingüe, o bien una voz distinta por idioma, con el resultado de que un mismo contenido suena a otra persona en cada mercado. La clonación translingüe sin ejemplos previos significa que una identidad vocal grabada una sola vez puede recorrer un catálogo entero.

Una síntesis de voz que se puede dirigir

Es en el lado de la síntesis donde el sistema de etiquetas de emoción despliega su utilidad. En lugar de elegir dentro de una lista cerrada de «estilos», anotas el propio texto, y las etiquetas actúan exactamente donde aparecen. Por eso importa la mención al nivel inferior a la palabra: acentuar una palabra concreta dentro de una frase es una capacidad distinta de fijar un estado de ánimo para toda la frase, y ahí se juega la diferencia entre una lectura que suena a lectura y una que suena a interpretación.

Reconocimiento de voz y el resto de la gama

La plataforma abarca mucho más que un punto de acceso de síntesis. El menú de productos recoge ocho herramientas independientes: síntesis de voz, reconocimiento de voz, clonación de voz, cambio de voz, Story Studio, separación de voces, traducción de audio y generación de efectos sonoros. Del lado del reconocimiento se anuncia que la transcripción incorpora varios hablantes, etiquetas de emoción y una descripción en lenguaje natural; lo que se obtiene, por tanto, es una transcripción estructurada y no un simple bloque de texto.

La biblioteca de voces de la comunidad

La plataforma aloja una vasta biblioteca de voces subidas por los usuarios —más de 2.000.000 según su propio recuento— presentada como adecuada para la narración creativa, la publicidad y los audiolibros. En amplitud es una ventaja real. Al mismo tiempo, es la parte del producto más entrelazada con las cuestiones de consentimiento que se tratan más abajo, porque una biblioteca de ese tamaño la llenan los usuarios y no la compone la empresa pieza a pieza.

Pesos del modelo publicados y autoalojamiento

Los pesos del modelo de código abierto S2 están publicados, y el sitio promociona el autoalojamiento en pie de igualdad con la interfaz alojada. Medido con indicadores de la comunidad, el repositorio no es menor: en el momento de la consulta mostraba 32.400 estrellas, 2.800 bifurcaciones, 101 personas contribuyentes y 14 versiones publicadas, y se describe a sí mismo como un proyecto de síntesis de voz de código abierto de primer nivel. Lo que esa licencia permite realmente se trata en una sección propia más abajo, y la respuesta resulta bastante más estrecha de lo que el término suele insinuar.

Casos de uso

Audiolibros y narración de larga duración. La propia empresa lo formula así: cinco segundos es fácil, cinco minutos es la prueba. La síntesis de voz lleva una década siendo aceptable a escala de frase, pero las grietas asoman en cuanto se alarga. La narración extensa es precisamente el terreno donde las etiquetas de emoción y el control del ritmo demuestran su valor, porque una lectura plana se vuelve insoportable mucho antes del segundo capítulo.

Locución de vídeo al ritmo de producción. Convertir un guion en una narración ajustada a la imagen sin reservar estudio es el uso más frecuente de este tipo de herramientas. Poder cambiar de tono y añadir emoción sin volver a grabar es lo que abarata la iteración.

Voces de personaje para videojuegos y animación. La plataforma apunta explícitamente a este terreno y el encaje es real: los medios interactivos requieren muchas voces distintas, a menudo más de las que un proyecto puede costear con intérpretes reales, y hay que regenerarlo todo cada vez que cambia un diálogo.

Agentes conversacionales y atención al cliente. Aquí una latencia de transmisión inferior a 300 milisegundos no es una cifra de escaparate. Un agente de voz que se detiene de forma perceptible antes de cada respuesta parece averiado por muy bien que suene la voz, así que la latencia es un requisito funcional y no un extra agradable.

Localización multilingüe a partir de una sola grabación. La clonación translingüe sin ejemplos permite grabar una vez y conservar la misma identidad vocal en los idiomas admitidos. Resulta útil para creadores cuya audiencia se reparte entre regiones, aunque conviene leer antes la sección sobre el número de idiomas.

Despliegue autoalojado por motivos de latencia o de datos. Como los pesos están publicados, los equipos con requisitos estrictos sobre dónde residen los datos, o con infraestructura propia de inferencia, pueden ejecutar el modelo por su cuenta en lugar de enviar audio a un tercero. Ahora bien, si tu uso concreto está permitido lo decide la licencia, y en eso consiste la sección correspondiente.

Cómo usar Fish Audio

Paso 1: prueba la demostración antes de registrarte. La página de inicio incluye un campo de síntesis funcional, precargado con un texto que muestra el sistema de etiquetas, con un límite de 30.000 caracteres y las paletas de etiquetas a la vista. Es la forma más rápida de juzgar si ese control expresivo funciona para tu caso.

Paso 2: crea una cuenta gratuita. El plan gratuito no exige tarjeta y ofrece 8.000 créditos mensuales, hasta siete minutos de generación, un máximo de 500 caracteres por generación y tres espacios de voz públicos.

Paso 3: decide primero entre la biblioteca existente y la clonación propia. Para muchos trabajos, la biblioteca ya disponible es el camino más rápido y esquiva por completo la cuestión del consentimiento. La clonación es para cuando necesitas de verdad una identidad vocal concreta: idealmente la tuya, o una para la que dispongas de un permiso documentado.

Paso 4: graba o selecciona diez segundos de referencia limpios. Diez segundos es el mínimo declarado. La calidad de la referencia pesa más que su duración: cuanto más limpia sea la fuente, mejor será el clon, y la página del producto admite que una muestra más larga puede ayudar con voces muy expresivas.

Paso 5: escribe el guion con etiquetas, no solo con palabras. Es el paso que menos aprovechan quienes empiezan. Colocar el énfasis sobre la palabra que realmente sostiene el sentido de la frase, o una pausa larga donde una persona tomaría aire, es lo que separa un resultado que suena a máquina de otro que suena interpretado.

Paso 6: comprueba tus derechos comerciales antes de publicar. No es un trámite prescindible. Como se detalla más abajo, el estatus comercial del plan gratuito aparece descrito de forma contradictoria en el sitio, y equivocarse implica publicar contenido monetizado sin tener los derechos.

Paso 7: pasa a la interfaz cuando el volumen lo justifique. La documentación para desarrolladores y la referencia de la interfaz se alojan en un subdominio propio, y los planes de pago dan acceso facturado por uso.

Consejos y buenas prácticas

Etiqueta poco y con criterio. Las etiquetas de emoción son una herramienta de dirección, no un adorno. Etiquetar cada oración produce una interpretación inestable; marcar solo los dos o tres momentos que de verdad sostienen el peso emocional de un pasaje, en cambio, suena deliberado.

Invierte en la grabación de referencia y no en repetir generaciones. Un clon hereda la acústica de su fuente. Diez segundos captados con un micrófono decente en una habitación silenciosa superan a un minuto de audio telefónico con ruido, y ninguna regeneración rescata una referencia defectuosa de origen.

Presupuesta en créditos, no en minutos. La conversión publicada es de unos 600 a 625 créditos por minuto generado. Frente a los 8.000 créditos mensuales del plan gratuito, sale casi exactamente los siete minutos que anuncia. Conocer la conversión convierte la comparación de planes en un cálculo y no en una suposición.

Recuerda que los créditos no se acumulan. Las cuotas mensuales se reinician al comenzar cada ciclo de facturación y los minutos no consumidos no pasan al mes siguiente, de modo que un plan dimensionado para tu mes punta se desperdicia en los meses tranquilos.

Prueba tu idioma antes de comprometerte. Como se detalla más abajo, la compatibilidad lingüística aparece expresada de cuatro maneras distintas en las propias páginas del sitio, y el repositorio abierto contiene informes de fallos activos sobre determinadas escrituras. Generar una muestra representativa en tu idioma de destino cuesta unos pocos créditos y zanja la cuestión.

Usa espacios privados para todo lo sensible. Las condiciones de licencia sobre los envíos públicos son bastante más amplias que sobre los privados, y el contenido público puede seguir disponible tras eliminar la cuenta. Elegir el tipo de espacio es una decisión sobre derechos y no una preferencia de archivo.

¿Para quién es Fish Audio?

Para creadores que producen en volumen. Quienes hacen vídeo, pódcast o cursos y narran con regularidad obtienen el retorno más claro, porque el ahorro crece con la cantidad producida.

Para estudios de videojuegos y animación con muchos personajes. Los proyectos que necesitan un reparto amplio, o cuyos diálogos cambian a menudo, se benefician más que aquellos con un guion pequeño y fijo.

Para quienes desarrollan agentes de voz. La combinación de una interfaz documentada, transmisión por debajo de 300 milisegundos y pesos publicados cubre tanto la opción alojada como la autoalojada.

Para equipos de localización. La clonación translingüe responde a un problema real y costoso del contenido para varios mercados.

Para investigadores y aficionados. Los pesos publicados son realmente utilizables en investigación y trabajos no comerciales: exactamente el supuesto que la licencia se redactó para permitir.

Quién debe andarse con cuidado. Quien planee un despliegue autoalojado con fines comerciales debe leer antes la sección sobre la licencia, porque allí la respuesta por defecto es negativa. Quien necesite compromisos explícitos del proveedor sobre el tratamiento de datos biométricos debería fijarse en lo que dice la política de privacidad y, más aún, en lo que no dice. Y quien pretenda clonar una voz que no es suya necesita más la sección sobre consentimiento que cualquier lista de funciones.

Plataformas

Fish Audio es ante todo una aplicación web, utilizable desde cualquier navegador reciente sin instalar nada. La vía para desarrolladores es una interfaz documentada de estilo REST junto con kits de desarrollo; la documentación y la referencia se alojan en un subdominio propio.

Existen aplicaciones móviles: las condiciones del servicio incluyen un apartado específico que reconoce que su disponibilidad depende de tiendas de terceros, nombra expresamente la App Store de Apple y el mercado de aplicaciones de Android, y exige cumplir también las condiciones propias de esas tiendas.

El autoalojamiento es una tercera vía promovida oficialmente. La página del producto expone las opciones sin rodeos: desplegar el modelo por tu cuenta, llamar al punto de acceso de transmisión por debajo de 300 milisegundos, o llevar las voces a tus agentes y aplicaciones. Cuáles de esas opciones tienes abiertas lo determina la licencia.

Las opciones de despliegue empresarial se presentan aparte e incluyen la instalación en infraestructura propia, la ausencia de conservación de datos y el cumplimiento de SOC2, con precios personalizados según volumen y facturación anual.

Una última nota sobre acceso: el archivo robots.txt del sitio abre el acceso completo a los rastreadores de Google, Apple y Bing, mientras impide a los rastreadores generales las rutas de autenticación y de síntesis de voz.

Precios y planes

Los precios se comprobaron directamente en la página de planes. Conviene señalar que en el momento de la consulta se solapaban dos promociones: tres meses gratis con el pago anual y un descuento de aniversario del 50 %. Los importes mensuales equivalentes que siguen reflejan por tanto esas promociones, y junto a ellos se indica el precio de referencia.

Plan gratuito. 0 dólares, sin tarjeta. Incluye 8.000 créditos mensuales, hasta siete minutos de generación, un máximo de 500 caracteres por generación, tres espacios de voz públicos, velocidad de generación estándar y clonación de voz mejorada.

Plus. 5,5 dólares al mes en equivalente, facturados 66 dólares al año, frente a un precio mensual de referencia de 15 dólares. Incluye 250.000 créditos mensuales, hasta 200 minutos, un máximo de 15.000 caracteres por generación, espacios públicos ilimitados más 10 privados, generación prioritaria, acceso a Voice Design y un espacio de voz profesional.

Pro. 37,5 dólares al mes en equivalente, facturados 450 dólares al año, frente a 100 dólares de referencia. Incluye 2.000.000 de créditos mensuales, hasta 1.620 minutos, tres puestos de equipo, un máximo de 30.000 caracteres por generación, espacios ilimitados, cinco espacios profesionales y una garantía de devolución de siete días.

Max. 749 dólares al mes en equivalente, facturados 8.988 dólares al año, frente a 999 dólares de referencia. Incluye 25.000.000 de créditos mensuales, hasta 6.250 minutos, diez puestos de equipo y quince espacios profesionales.

Empresa. Precio personalizado según volumen con facturación anual, dirigido a organizaciones con requisitos de cumplimiento, con facturación por uso y controles a nivel de organización, ausencia de conservación de datos, instalación en infraestructura propia y cumplimiento de SOC2.

Cómo funciona el sistema de créditos

La conversión publicada es de unos 600 a 625 créditos por minuto generado. Las cuotas mensuales se reinician al comenzar cada ciclo de facturación y los minutos no consumidos no se trasladan.

La contradicción sobre los derechos comerciales

Este punto conviene señalarlo sin rodeos, porque determina directamente si puedes publicar lo que generas, y el sitio se contradice dentro de una misma página.

La lista de funciones del plan gratuito, en la página de precios, incluye el epígrafe «uso comercial». Las preguntas frecuentes situadas más abajo en esa misma página afirman lo contrario: quienes tienen suscripción de pago pueden emplear con fines comerciales las voces verificadas de su propiedad, mientras que quienes usan el plan gratuito solo pueden destinar el contenido generado a proyectos personales y no comerciales. Las preguntas frecuentes de la página de inicio coinciden con esta lectura restrictiva y son aún más explícitas: el plan gratuito es solo para uso personal, y para monetizar o explotar comercialmente las voces hay que pasar a un plan de pago y obtener así derechos comerciales completos.

Es decir, dos fuentes oficiales afirman que lo gratuito se limita al uso personal, mientras que una lista oficial de funciones dice lo contrario. Este artículo recoge ambas lecturas sin conciliarlas, porque conciliarlas equivaldría a adivinar. Lo prudente es tomar la lectura restrictiva como la vigente y confirmarlo con el proveedor antes de monetizar cualquier resultado obtenido en el plan gratuito: el coste de equivocarse recae íntegramente sobre quien publica.

Alternativas

El punto de comparación más citado en esta categoría es ElevenLabs, y Fish Audio participa directamente en esa comparación: el sitio mantiene una sección específica de comparativas y su propio mapa del sitio incluye una página que se plantea como alternativa a ese competidor. Situarse de forma explícita frente a ese actor consolidado es una decisión deliberada, y conviene que quien evalúe el producto tenga presente que una página comparativa publicada por un proveedor sobre su competidor es material promocional y no una evaluación independiente.

Las afirmaciones de la empresa en este terreno son autodeclaradas y deben leerse como tales: su anuncio de financiación sostiene que S2.1 Pro fue preferido por el 66 % de los oyentes frente a modelos competidores destacados en pruebas de escucha a ciegas. El anuncio no acompaña esa cifra de metodología, tamaño de muestra ni composición del panel, de modo que no puede verificarse de forma independiente a partir de esa sola fuente.

Con todo, el verdadero eje alternativo no es otro proveedor alojado, sino la elección entre construir y comprar que abren los pesos publicados. Para investigación y trabajos no comerciales, ejecutar el modelo por cuenta propia es una opción real que la mayoría de los competidores no ofrece. Para trabajos comerciales, esa opción requiere una licencia aparte, y la comparación vuelve entonces a ser una evaluación corriente de servicio alojado.

Limitaciones y consideraciones

El consentimiento en la clonación de voz: qué exige realmente la plataforma

Esta es la pregunta más importante, y la respuesta honesta es la siguiente: la responsabilidad recae casi por completo en quien usa la herramienta, y la plataforma no realiza ninguna comprobación previa.

La formulación más clara está en las preguntas frecuentes de la página de clonación y merece recogerse con fidelidad: corresponde a la persona usuaria confirmar que dispone de los derechos, consentimientos y comunicaciones exigidos para cualquier voz que clone, y cumplir la legislación aplicable, incluida la relativa al nombre, la imagen y los contenidos generados por inteligencia artificial en su región. La misma respuesta describe el enfoque de aplicación: la plataforma no autoriza de antemano casos de uso concretos y puede retirar contenidos o cuentas que infrinjan sus condiciones o la ley. El mecanismo es, por tanto, una retirada posterior y no un filtro previo a la clonación.

Llama la atención que en los documentos jurídicamente vinculantes no exista requisito alguno de consentimiento. El apartado de las condiciones dedicado a permisos y restricciones enumera diecisiete prohibiciones, de la (a) a la (q), y ninguna aborda específicamente el consentimiento para clonar una voz. La más próxima es la cláusula general (a), que prohíbe aportar cualquier cosa que vulnere derechos de propiedad intelectual o cualesquiera otros derechos de terceros. La garantía sobre las aportaciones de los usuarios es igual de genérica: prohíbe aportaciones que vulneren derechos de autor u otros derechos de terceros, como marcas o intimidad. Ninguna impone la obligación concreta de conservar un consentimiento documentado para una voz clonada.

Existe además una tensión entre el lenguaje sobre el consentimiento y el texto comercial de esa misma página. El titular de la página de clonación invita justo al uso contra el que advierte esa cláusula: hacer que un jefe de Estado en ejercicio narre tu aplicación de citas, presentar tu peor idea con la voz de un multimillonario de la tecnología o montar un programa compuesto solo por invitados ficticios. Las preguntas frecuentes de la misma página refuerzan esa expectativa al señalar que la mayoría de los fragmentos de personajes públicos, los cortes de programas o las grabaciones de calidad telefónica funcionan al primer intento. Exhibir la clonación de figuras públicas reconocibles en el lugar más visible y colocar al lado una advertencia para que se obtenga su consentimiento es una incoherencia real, y quien lea debería sopesar ambas caras.

Las condiciones sí imponen una obligación relacionada: no difundir contenido de forma engañosa, lo que incluye presentarlo como enteramente producido por personas. La plataforma anima a revelar por iniciativa propia que se ha recurrido a la inteligencia artificial, pero lo formula como recomendación y no como obligación. En el pie de página hay un canal para denunciar abusos.

La conclusión práctica es nítida. Si clonas tu propia voz, nada de esto te limita. Si clonas la de otra persona, la plataforma no te lo impedirá ni lo comprobará, pero al mismo tiempo declina su responsabilidad y traslada la exposición jurídica íntegramente a tu lado, una exposición que, según la jurisdicción, puede ser considerable.

Qué significa aquí «código abierto» y qué no

El sitio insiste una y otra vez en la apertura: presenta el modelo S2 de código abierto como un rasgo de titular, el autoalojamiento como una vía admitida, y el repositorio se describe como un proyecto de síntesis de voz de código abierto de primer nivel respaldado por 32.400 estrellas. Los pesos están efectivamente publicados, y eso es cierto. Pero la licencia no es permisiva, y la diferencia resulta decisiva en el plano comercial.

El repositorio lo dice sin ambages: este código y los pesos de modelo asociados se publican bajo la FISH AUDIO RESEARCH LICENSE, con la advertencia de que se actuará ante cualquier infracción. Esa licencia, actualizada por última vez el 7 de marzo de 2026, expone su propósito ya en la introducción: el acuerdo pretende permitir de forma gratuita los usos de investigación y no comerciales de los materiales, y cualquier uso comercial requiere una licencia aparte otorgada por Fish Audio.

El apartado III despeja toda ambigüedad: cualquier uso de los materiales o de obras derivadas con una finalidad comercial exige un acuerdo de licencia escrito e independiente con Fish Audio, y el presente acuerdo no otorga derecho comercial alguno. Las licencias comerciales se gestionan a través de la dirección profesional que figura en la propia licencia.

La definición de «finalidad comercial» es lo bastante amplia como para abarcar la mayoría de los usos empresariales: comprende crear, modificar o distribuir tu producto o servicio, incluso mediante un servicio alojado o una interfaz de programación; las operaciones internas de tu empresa u organización; y cualquier uso vinculado a un producto o servicio por el que cobres o generes ingresos, de forma directa o indirecta. Basta con el uso interno dentro de una empresa: no hace falta revender el modelo.

Otras dos diferencias respecto de las licencias permisivas merecen atención. La autorización de investigación se describe como no exclusiva, mundial, intransferible, no sublicenciable, revocable y libre de regalías; revocable es la palabra determinante y no tiene equivalente en las condiciones permisivas habituales. Y la distribución conlleva obligaciones de atribución: un archivo de aviso que atribuye los derechos a 39 AI, INC., además de mostrar de forma destacada la leyenda «Built with Fish Audio» en un sitio web asociado o en la documentación del producto. La licencia prohíbe asimismo emplear los materiales o sus salidas para crear o mejorar cualquier modelo fundacional de inteligencia artificial generativa.

Conviene dejar constancia de una laguna. La licencia incorpora por referencia una política de uso aceptable y convierte su cumplimiento en condición de la licencia, pero ese documento no ha podido localizarse. Varias rutas candidatas devuelven todas un error 404, y ninguna página de ese tipo aparece en el mapa del sitio estático del proveedor, que solo recoge la página de inicio, la de descubrimiento, la del generador de voz, la de clientes, la de empresa, la de alternativa al competidor, las condiciones, la privacidad y la información legal para Japón. Que una condición vinculante remita a un documento que quienes la usan no pueden consultar es un problema de documentación conveniente aclarar con el proveedor antes de apoyarse en esta licencia.

En resumen: pesos abiertos, sí; código abierto en sentido permisivo, no. La investigación y el uso aficionado son gratuitos y están realmente permitidos. Cualquier uso comercial, incluido el interno de una empresa, exige un acuerdo de pago aparte, insinúe lo que insinúe la página comercial.

Lo que la política de privacidad no aborda

La política de privacidad lleva fecha de entrada en vigor de 28 de agosto de 2024. Una revisión del texto completo no halló en él ninguna aparición de las palabras «voice», «biometric» ni «train». Para un producto cuya función central consiste en captar y reproducir voces humanas, la ausencia de cualquier disposición específica sobre la voz o los datos biométricos constituye una laguna de fondo; significa también que la política no dice nada sobre si el contenido de las personas usuarias se emplea para entrenar o mejorar modelos. A la vista de las pruebas disponibles, la formulación honesta es que la política guarda silencio sobre estos puntos, y no que exista o deje de existir una protección concreta.

El audio subido queda encuadrado en la categoría genérica de contenido de usuario, que la política define como la información personal incluida en las entradas, los archivos subidos o los comentarios que se facilitan al servicio. Entre los terceros enumerados para esa categoría figuran proveedores de servicios, socios publicitarios, socios de analítica y socios comerciales.

La licencia que concedes sobre tus propias subidas

Las condiciones son bastante más precisas sobre los derechos que cedes que sobre los que conservas. Las licencias concedidas a la plataforma sobre las aportaciones de los usuarios son libres de regalías, perpetuas, sublicenciables, irrevocables y de alcance mundial.

La eliminación tiene, en consecuencia, límites. Al cerrar la cuenta, la plataforma deja de mostrar tus aportaciones a otras personas usuarias, con la excepción expresa de las aportaciones públicas, que pueden seguir plenamente disponibles; además, las condiciones reconocen que puede resultar imposible borrarlas por completo de sus registros.

Las aportaciones públicas soportan las condiciones más amplias de todas: incluyen el derecho a usar, mostrar, ejecutar y distribuir la aportación pública con fines de marketing y promoción, así como una licencia a todas las demás personas usuarias para acceder a ella y ejercer derechos sobre ella. Esa es la razón concreta por la que elegir entre espacio privado y público es una decisión sobre derechos. También es el trasfondo útil para entender la biblioteca comunitaria de más de 2 millones de voces: existe precisamente porque las subidas públicas llevan aparejadas estas condiciones.

La compatibilidad lingüística se expresa de cuatro maneras

Las páginas oficiales ofrecen cuatro cifras incompatibles entre sí, y este artículo las recoge todas sin promediarlas. La página de clonación habla de funcionamiento translingüe sin ejemplos previos en trece idiomas. La sección sobre la interfaz de la página de inicio menciona más de treinta idiomas. Las preguntas frecuentes de la página de síntesis solo enumeran ocho —inglés, japonés, coreano, chino, francés, alemán, árabe y español— y anuncian por separado compatibilidad automática con ocho idiomas con acento nativo. El anuncio de financiación reivindica más de 83 idiomas con cadencia nativa.

Es posible que estas afirmaciones describan cosas distintas: clonación frente a síntesis, o compatibilidad plena frente a compatibilidad en la medida de lo posible. Pero el sitio no explica la distinción, así que comprueba tu idioma de forma empírica en lugar de fiarte de una cifra aislada.

Los informes de la comunidad respaldan esa cautela. El repositorio abierto contiene incidencias activas que señalan que la entrada en gurmukhi para el panyabí gestiona mal los signos de geminación y nasalización, junto a una petición relacionada para mejorar la pronunciación del panyabí mediante una transliteración latina sensible a los diacríticos o una conversión de grafemas a fonemas. En el momento de la consulta, el repositorio mostraba 7 incidencias abiertas frente a 684 cerradas: una proporción de mantenimiento saludable, pero también un indicio de calidad desigual según el idioma.

Otras consideraciones

No hay revisión de contenido antes de publicar. El propio aviso legal del repositorio lo expresa así: no se asume responsabilidad alguna por un uso ilícito del código, y conviene remitirse a la legislación local, entre otras la relativa a los derechos de autor en el entorno digital. Sumado a la ausencia de autorización previa, la responsabilidad se desplaza de forma sistemática aguas abajo.

Ingeniería inversa y modelos competidores están prohibidos. Las condiciones prohíben intentar obtener el código fuente, los componentes subyacentes de los modelos o los algoritmos, y prohíben aparte utilizar las salidas del servicio para desarrollar modelos que compitan con él.

Requisitos de edad. Hay que tener al menos 13 años, los menores de 18 necesitan permiso parental, y la plataforma declara que no recopila a sabiendas información identificativa de menores de 16 años.

Los datos de directorio envejecen deprisa. La categoría almacenada para esta ficha era «moda», con etiquetas que incluían «moda» y «plantillas» —claramente erróneas para un producto de síntesis de voz—, y su descripción mencionaba más de 1.000 voces cuando el sitio reivindica ya más de 2.000.000. Los productos que avanzan rápido dejan atrás sus fichas de directorio: comprueba las cifras actuales en el sitio.

Preguntas frecuentes (FAQ)

Q1. ¿Fish Audio es gratuito?

Existe un plan gratuito real que no exige tarjeta y ofrece 8.000 créditos mensuales, hasta siete minutos de generación, un límite de 500 caracteres por generación y tres espacios de voz públicos. Si puedes explotar comercialmente ese resultado es algo que el sitio deja verdaderamente confuso: la lista de funciones del plan gratuito menciona el uso comercial, mientras que las preguntas frecuentes de esa misma página y las de la página de inicio afirman ambas que el resultado del plan gratuito se limita a un uso personal y no comercial. Adopta la lectura restrictiva y confírmalo con el proveedor antes de monetizar nada.

Q2. ¿Necesito permiso para clonar la voz de otra persona?

La plataforma coloca esa responsabilidad enteramente en ti y no realiza comprobación previa. Sus preguntas frecuentes sobre clonación indican que te corresponde confirmar que dispones de los derechos, consentimientos y comunicaciones exigidos para cualquier voz que clones, y cumplir la normativa sobre nombre, imagen y contenidos generados por inteligencia artificial de tu región. Añade que no autoriza de antemano casos de uso concretos y que puede retirar contenidos o cuentas con posterioridad. Ten en cuenta que las condiciones vinculantes no contienen ninguna cláusula que exija específicamente el consentimiento para clonar una voz —solo prohibiciones genéricas de vulnerar derechos ajenos— mientras que el texto comercial de esa misma página del producto sugiere activamente clonar a figuras públicas. Jurídicamente, la exposición es tuya.

Q3. ¿El modelo es realmente de código abierto?

Los pesos están efectivamente publicados, pero la licencia no es permisiva. Tanto el código como los pesos se difunden bajo la licencia de investigación de Fish Audio, que en su introducción señala que pretende permitir gratuitamente la investigación y los usos no comerciales, mientras que cualquier uso comercial requiere una licencia aparte. Su apartado III no concede derecho comercial alguno. Gratis para investigación, estudio y uso aficionado; acuerdo de pago independiente para todo lo demás.

Q4. ¿Puedo autoalojarlo para mi empresa?

Bajo la licencia pública, no. Su definición de finalidad comercial incluye expresamente crear, modificar o distribuir tu producto o servicio, incluso mediante un servicio alojado o una interfaz, las operaciones internas de tu organización y cualquier uso vinculado a un producto o servicio que genere ingresos directa o indirectamente. Basta el uso interno en una empresa para activarla. Se requiere un acuerdo escrito aparte, que puede gestionarse a través de la dirección profesional indicada en la licencia. Ten en cuenta además que la autorización de investigación es revocable, a diferencia de las licencias permisivas habituales.

Q5. ¿Cuánto audio hace falta para clonar una voz y qué calidad tiene?

El mínimo declarado son diez segundos de habla limpia, y la página del producto señala que una muestra más larga puede ayudar con voces muy expresivas. La calidad de la referencia importa más que su duración: una muestra corta y limpia supera a una grabación larga con ruido. La plataforma indica además que la clonación es translingüe sin ejemplos previos en trece idiomas, de modo que una sola grabación se extiende a los demás idiomas admitidos sin reentrenamiento.

Q6. ¿Cuántos idiomas admite en realidad?

El sitio da cuatro respuestas distintas, y este artículo no elegirá una por ti. La página de clonación habla de trece idiomas para la clonación translingüe; la de inicio, de más de treinta; las preguntas frecuentes de la página de síntesis enumeran ocho idiomas y anuncian compatibilidad automática con ocho idiomas con acento nativo; y el anuncio de financiación reivindica más de 83. Probablemente describan capacidades distintas, pero el sitio no aclara cuál es cuál. Genera una muestra de prueba en tu idioma de destino antes de comprometerte: el repositorio abierto contiene informes de fallos activos sobre determinadas escrituras, incluido el tratamiento de los signos de geminación y nasalización en gurmukhi para el panyabí.

Q7. ¿Cuánto cuesta más allá del plan gratuito?

En el momento de la consulta había cuatro planes de pago, con promociones solapadas. Plus sale a 5,5 dólares al mes facturados 66 dólares anuales frente a 15 dólares de referencia, con 250.000 créditos mensuales. Pro sale a 37,5 dólares al mes facturados 450 dólares anuales frente a 100 dólares de referencia, con 2.000.000 de créditos y tres puestos de equipo. Max sale a 749 dólares al mes facturados 8.988 dólares anuales frente a 999 dólares de referencia, con 25.000.000 de créditos y diez puestos. El plan Empresa es personalizado y se factura anualmente. Unos 600 a 625 créditos equivalen a un minuto de generación, y los créditos no consumidos no se trasladan.

Q8. ¿Se usa mi voz subida para entrenar sus modelos?

La política de privacidad no lo dice. Una revisión del texto completo no encontró «train», «voice» ni «biometric» en ningún punto; el documento entró en vigor el 28 de agosto de 2024. No existe, por tanto, compromiso público alguno en un sentido ni en otro sobre este punto, y sería incorrecto afirmar una protección que el documento no contiene. El audio subido queda encuadrado en la categoría genérica de contenido de usuario, entre cuyos destinatarios enumerados figuran proveedores de servicios y socios publicitarios, de analítica y comerciales. Si esto pesa en tu cumplimiento normativo, pregunta directamente al proveedor y ten en cuenta que el plan de empresa destaca la ausencia de conservación de datos como una característica diferenciada.

Q9. ¿Qué ocurre con mis voces si elimino la cuenta?

La eliminación es parcial y no completa. Las condiciones indican que al cerrar la cuenta la plataforma deja de mostrar tus aportaciones a otras personas usuarias, pero excluyen expresamente las aportaciones públicas, que pueden seguir plenamente disponibles, y reconocen que un borrado completo de sus registros puede resultar imposible. Dado que las licencias concedidas son perpetuas, sublicenciables e irrevocables, y que las aportaciones públicas otorgan además derechos promocionales y acceso a todas las demás personas usuarias, elegir un espacio privado en lugar de público es una decisión de fondo y no una preferencia de archivo.

Q10. ¿Quién está detrás de Fish Audio y en qué punto está la empresa?

El pie de página nombra a Hanabi AI Inc., mientras que la licencia de código abierto exige atribución a 39 AI, INC. Ambos nombres quedan aquí consignados, y el sitio no explica la relación entre ellos. La compañía anunció 52 millones de dólares en una ronda semilla al cumplir su primer año; una de las instituciones que la lideraron se llama Coreline Ventures y la otra institución líder es Capital Today. Su propio anuncio menciona un equipo de veintidós personas, 21 millones de dólares de ingresos recurrentes anuales, más de 8 millones de usuarios en la plataforma y más de 2 millones de modelos de voz comunitarios, y nombra a la directora general Rissa Cao y al director científico Shijia Liao. Estas cifras de negocio son autodeclaradas y no han pasado por una auditoría independiente.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas