Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Herramientas de IA
  4. Typecast
Vista previa de la interfaz de TypecastVisitar sitio web
Logotipo de Typecast

Typecast

Typecast es una plataforma de voz con IA de la empresa coreana Neosapience que convierte texto en habla expresiva mediante más de 700 modelos de voz licenciados de actores de doblaje, análisis emocional según el contexto, clonación de voz y una interfaz de síntesis multilingüe pensada para creadores, desarrolladores y empresas.

Herramientas de IAGeneración de VozGeneración de Audio#Texto a voz#Multilingüe#Clonación de voz
Probar gratis
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
25 ago 2026
Dominio
typecast.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Typecast

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
25 ago 2026
Dominio
typecast.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Typecast?

Typecast es una plataforma de inteligencia artificial que convierte texto escrito en habla con una carga emocional regulable. Su argumento distintivo no es el número bruto de voces ni el precio, sino la expresividad: la empresa se presenta como «el generador de voz con IA más expresivo del mundo» y describe el producto como «el generador de voz con IA que suena natural y lleno de emoción — para creadores, desarrolladores y empresas». En la práctica esto abarca tres productos enlazados bajo una misma suscripción — un editor de voz que funciona en el navegador, un sistema de clonación de voz y una interfaz de síntesis de habla — a los que se suman un editor de vídeo y una función de avatar parlante.

La operadora es Neosapience, Inc., una empresa surcoreana. Este dato pesa mucho más que una nota al pie, por dos motivos. Primero, determina el marco jurídico: las condiciones de uso establecen que «constituyen un acuerdo entre usted y Neosapience, Inc.» y que «se rigen e interpretan conforme a las leyes de la República de Corea», quedando los litigios bajo el procedimiento civil coreano. Segundo, explica el centro de gravedad lingüístico del producto: el coreano, el inglés, el japonés y el chino son aquí idiomas de primer orden, algo que no ocurre con todos los competidores occidentales. El sitio en coreano divulga íntegramente la entidad operadora, tal como exige la normativa local de comercio electrónico: 네오사피엔스 주식회사, número de registro mercantil 883-86-00767, representante Taesu Kim, con domicilio inscrito en la zona de Samseong-dong del distrito de Gangnam-gu, en Seúl. La misma persona figura como responsable de protección de datos en la política de privacidad.

Lo que realmente separa a la voz Typecast de un sintetizador de voz corriente es la capa emocional. Además de los controles habituales de velocidad y tono, la plataforma ofrece lo que denomina Smart Emotion: un sistema que lee el texto circundante para deducir cómo debe pronunciarse una línea, sin exigir que etiquete cada frase a mano. La empresa describe su biblioteca como «voces exclusivas de actores de doblaje reales», y su política de uso detalla el armazón contractual que hay detrás de esa frase con una claridad poco común en esta categoría. Dado que la licencia de las voces y el consentimiento suelen decidir si una herramienta de voz con IA puede sostener con seguridad un negocio, esta página los trata como cuestiones centrales y no como una observación final.

Funciones principales

Síntesis de voz emocional y una amplia biblioteca procedente de actores

La capacidad principal es la síntesis de voz con intensidad emocional regulable. El sitio anuncia «más de 700 voces con IA con emoción, velocidad y dinámica ajustables», y las demostraciones mostradas exponen los estados emocionales disponibles: alegría, tristeza, enfado, susurro y registro grave aparecen como modos aplicables a una misma línea. Las voces se organizan por función —locutor, narrador, pódcast, presentador de noticias, robot y voces de personaje— con filtros por edad y sexo. La salvedad importante es que no se trata de construcciones sintéticas armadas desde cero: la empresa las describe como «voces exclusivas de actores de doblaje reales», lo que dota de peso a las condiciones de licencia tratadas más adelante.

Smart Emotion: una interpretación deducida del contexto

Smart Emotion es la función con la que la empresa se presenta, y supone un apartamiento real del control emocional por etiquetas. En lugar de marcar cada frase con un estado de ánimo, el sistema analiza el texto que rodea a una línea para decidir cómo decirla. La descripción que la propia empresa da de su investigación de base es que la tecnología «analiza los guiones línea por línea para generar automáticamente un tono acorde al contexto». La interfaz expone este mecanismo de forma directa: una petición puede transportar la frase anterior y la siguiente junto a la línea que se sintetiza, de modo que una frase como «todo va a salir bien» se pronuncia de manera distinta según venga después de una buena o de una mala noticia. Para el trabajo narrativo es una decisión de diseño sustancial, ya que las mismas palabras pesan de forma diferente según lo que las preceda.

Clonación de voz en dos niveles

La plataforma ofrece clonación de voz en dos niveles de calidad. La clonación instantánea crea una voz propia a partir de una muestra breve de audio y queda disponible desde el primer nivel de pago; la clonación profesional, de mayor fidelidad, aparece a partir del nivel intermedio. Las plazas de clonación están contadas y no son ilimitadas: una en los niveles de entrada e intermedio, dos en el nivel más popular y diez en el nivel empresarial. La empresa indica que una voz clonada puede después «hablar en varios idiomas», es decir, una voz captada en un idioma sirve para generar habla en otros, que es el atractivo concreto para quienes publican en varios mercados.

Una interfaz de síntesis con transmisión continua y marcas de tiempo

El producto para desarrolladores no es una envoltura fina alrededor del editor web. La documentación describe una interfaz que proporciona habla en 37 idiomas mediante el modelo ssfm-v30 y acceso a más de 500 voces, con cuatro modos de generación diferenciados: la síntesis estándar, que produce archivos WAV o MP3 completos; la síntesis en continuo, que reproduce el audio conforme llegan los fragmentos y está pensada para agentes de voz y aplicaciones interactivas de baja latencia; la síntesis con marcas de tiempo, que devuelve datos de alineación por palabra o por carácter para subtítulos, resaltado tipo karaoke y sincronización labial; y la clonación instantánea expuesta por programación. Los ejemplos oficiales del kit de desarrollo cubren Python y JavaScript, los dos lenguajes más extendidos, además de C# y Java, y luego Kotlin y Rust. La documentación publica asimismo un archivo llms.txt destinado explícitamente a los agentes de programación.

Un editor de vídeo y avatares parlantes

Más allá del audio, la suscripción incluye un editor de vídeo cuya calidad de exportación está escalonada: 720p en el nivel gratuito, 1080p en el de entrada y 4K a partir del intermedio, quedando la exportación sin marca de agua reservada a cualquier nivel de pago. Una función aparte de avatar parlante genera un presentador en pantalla y se mide por número de generaciones en lugar de por duración: hasta seis en el nivel de entrada y hasta cuarenta en el empresarial, ninguna en el gratuito. Conviene señalar que los avatares están sujetos a un límite de edad más estricto que el resto de la plataforma, según se detalla más abajo.

Aplicaciones móviles con sincronización entre dispositivos

Typecast publica aplicaciones móviles para iOS y Android que generan locuciones directamente desde el teléfono y sincronizan los proyectos entre dispositivos. La versión de iOS está inscrita a nombre de la sociedad Neosapience, se descarga gratis, exige iOS 16.4 o posterior, lleva una clasificación 12+ y se actualizó en agosto de 2026: una aplicación mantenida activamente y no un acompañante abandonado.

Nueve años de investigación en voz detrás del modelo

La empresa publica una genealogía de modelos en lugar de tratar su motor como una caja negra: un primer modelo de síntesis basado en aprendizaje profundo en 2018, el modelo CATS que mejoró pronunciación y naturalidad en 2021, SSFM 1.0 en 2024 con una nueva arquitectura entrenada sobre grandes conjuntos de datos, SSFM 2.0 en 2025 añadiendo multilingüismo y controles avanzados, y SSFM 3.0 ese mismo año aportando generación emocional sensible al contexto. Al compararlo con recién llegados, esa trayectoria merece considerarse, entendiendo que son afirmaciones de la empresa y no han sido auditadas de forma independiente.

Casos de uso

Trabajo narrativo y de personaje donde el registro emocional es lo que importa

El mejor encaje son los contenidos que una lectura plana arruinaría: ficción sonora, animación, diálogos de videojuego, audiolibros de narrativa y vídeo sostenido por un relato. Un testimonio publicado en el sitio, firmado por un director de cine, resume el flujo de trabajo previsto: probar distintas voces, ajustar los tiempos y jugar con la emoción hasta que una escena cobre vida, algo que describe como «hacer el reparto, la dirección y la producción a la vez». Es la unión de un amplio catálogo de voces de personaje con un control emocional línea a línea lo que vuelve esta categoría realmente utilizable y no meramente posible.

Publicar en varios idiomas a partir de una sola voz grabada

Para quien publica el mismo contenido en varios mercados, la combinación de clonación y multilingüismo es el atractivo de fondo: captar una voz una vez y luego hacerle decir otros idiomas. Con 37 idiomas disponibles a través de la interfaz y el coreano, el inglés, el japonés, el chino, el español y el vietnamita nombrados explícitamente en la documentación, la cobertura es realmente amplia y notablemente sólida en las lenguas de Asia oriental, donde algunos competidores occidentales flaquean.

Agentes de voz y aplicaciones en tiempo real

La síntesis en continuo existe precisamente para los casos en que esperar al cálculo completo resulta inaceptable. La empresa declara que evoluciona «de la simple generación de voz hacia una verdadera IA conversacional que escucha, piensa y habla en tiempo real», y el nivel empresarial menciona expresamente agentes conversacionales en tiempo real. Para quien construye un asistente o un producto de voz interactivo, la superficie pertinente es el punto de acceso en continuo junto con la reproducción de baja latencia, no el editor web.

Subtitulado, doblaje y cadenas de sincronización labial

La síntesis con marcas de tiempo devuelve datos de alineación por palabra o carácter, lo que convierte la salida en algo que una cadena de producción puede consumir directamente en vez de en un simple archivo de audio. Eso es lo que hace practicables el subtitulado automático, el resaltado tipo karaoke y la animación sincronizada con los labios sin un paso adicional de alineación forzada.

Formación en línea, narración corporativa y contenidos de producto

La empresa describe una base de usuarios que abarca radiodifusión, telecomunicaciones, comercio electrónico y educación, y la estructura de niveles refleja ese uso institucional: el nivel empresarial añade miembros de equipo, diez plazas de clonación y compra de créditos adicionales. Aquí opera un detalle de licencia de gran alcance y fácil de pasar por alto: la política de uso establece que «las sucursales o empresas distintas deben contar cada una con su propia suscripción para garantizar el cumplimiento», de modo que una sola plaza no puede cubrir legalmente a todo un grupo empresarial.

Iterar rápido antes de comprometer una grabación humana

Como la generación y la reproducción son ilimitadas en todos los niveles, incluido el gratuito, y los créditos solo se consumen al descargar, Typecast permite un flujo de trabajo del que carecen la mayoría de los competidores: recorrer un guion entero con muchas voces y lecturas emocionales sin coste alguno y pagar solo por las tomas que se conservan. Usado con intención, resulta tanto una herramienta de reparto y previsualización como de producción.

Cómo usar Typecast

Paso 1: escuchar sin límite antes de gastar nada

Comprenda primero el modelo de créditos, porque condiciona todo lo demás. La página de precios indica que «la generación y la reproducción de voz son gratuitas en todos los niveles» y que «los créditos se utilizan al descargar el audio». Nada se consume mientras experimenta en el editor. Genere la misma línea con una docena de voces, pruebe cada modo emocional, ajuste el ritmo: nada de eso gasta créditos hasta que exporta. La mayoría de quienes juzgan tacaño el nivel gratuito simplemente no han interiorizado que el límite está en las descargas y no en las pruebas.

Paso 2: elegir nivel según el control que realmente necesita

Los niveles no forman una simple escalera de calidad; cada uno desbloquea un control concreto. El nivel gratuito otorga 3.000 créditos de descarga de por vida (unos cinco minutos), pero le limita a voces de prueba, audio a 16 kHz y tres proyectos. El nivel de entrada, a 5 dólares al mes, abre todas las voces, el audio a 44,1 kHz, una plaza de clonación instantánea y una licencia comercial. El siguiente nivel, a 19 dólares, añade el control de velocidad y la clonación profesional. En el nivel de 29 dólares residen los controles emocionales, entre ellos Smart Emotion, la emoción personalizada, la entonación y el tono: si la expresividad es lo que le trae aquí, su precio de entrada es de 29 dólares y no de 5. El nivel empresarial, a 69 dólares, añade diez plazas de clonación, miembros de equipo y compra de créditos. La facturación anual ahorra un diez por ciento.

Paso 3: escribir a favor de Smart Emotion y no en contra

Si su nivel incluye esta función, dele contexto. Puesto que el sistema deduce la interpretación del texto circundante, trocear una escena en peticiones de una sola línea equivale a tirar la señal misma de la que se sirve. En la interfaz esto es explícito —se entregan la línea anterior y la siguiente—, pero el principio vale igual en el editor: mantenga íntegros los pasajes narrativos para que el modelo lea el arco en lugar de tratar cada línea como huérfana.

Paso 4: comprobar el nivel de licencia antes de publicar comercialmente

Este es el paso que se omite y luego se lamenta. La licencia comercial no es uniforme entre niveles. En el plan gratuito la tabla marca la licencia comercial como «atribución obligatoria», y la descripción del plan precisa que «se requiere atribución para todo el contenido descargado en el plan gratuito». A partir del nivel de entrada, la atribución pasa a ser «opcional». Si distribuye contenido monetizado, verifique bajo qué nivel se hicieron las descargas antes de distribuir, no después.

Paso 5: descargar y archivar todo lo que piense conservar

La regla de conservación es el detalle operativo de mayor calado de esta página. Las producciones permanecen en los servidores de Typecast un año desde su creación, tras lo cual se «eliminan automáticamente de nuestros servidores sin más aviso». Las condiciones señalan que «usted es responsable de descargar y guardar cualquier producción que desee conservar antes de que expire el periodo de conservación» y que la empresa no tiene «obligación alguna de recuperar ni restaurar» lo eliminado. Punto decisivo: esta regla «se aplica por igual a todos los usuarios, con independencia de que estén en un plan de pago o gratuito». Trate la plataforma como un servicio de generación y no como su archivo.

Paso 6: mantener la suscripción si necesita derechos de producción continuados

La política de uso traza una línea que sorprende tras una cancelación: «El audio generado puede descargarse y utilizarse con fines personales o comerciales únicamente durante su periodo de suscripción. Tras el vencimiento, podrá seguir usando el audio descargado previamente, pero no podrán realizarse nuevas modificaciones ni descargas salvo que se prorrogue la suscripción». El audio ya descargado sigue siendo utilizable, pero la capacidad de volver a descargar o derivar contenido nuevo se detiene con la suscripción.

Paso 7: pasar a la interfaz cuando el editor deje de bastar

Para un uso programático, obtenga una clave de acceso y elija el modo acorde a la carga: síntesis estándar para archivos terminados, transmisión continua para latencia interactiva, síntesis con marcas de tiempo cuando hagan falta datos de alineación. El kit oficial cubre seis lenguajes: Python y JavaScript, además de C# y Java, junto con Kotlin y Rust. Tenga en cuenta que la política de uso exige acuerdos separados para los servicios de interfaz, la creación de voces a medida y la integración en sistemas automatizados: un despliegue por interfaz no es una suscripción de consumo simplemente agrandada.

Consejos y buenas prácticas

Tratar la generación como gratuita y las descargas como el presupuesto real

Construya sus hábitos alrededor del modelo de créditos. Como escuchar no cuesta nada, haga toda la comparación, la dirección y las revisiones dentro del editor y exporte solo las tomas finales. Una equivalencia aproximada ayuda a hacerse a la idea: 30.000 créditos corresponden a unos 35 minutos de audio, 75.000 a unos 90 minutos y 200.000 a unos 250 minutos. Los créditos miden, pues, la duración del resultado terminado y no el esfuerzo invertido en alcanzarlo.

Comprar el nivel que contiene la función que más necesita

Como cada nivel cierra un control distinto, el plan suficiente más barato rara vez es el plan más barato. El control de velocidad no aparece hasta los 19 dólares; los controles emocionales, incluido Smart Emotion, solo a partir de los 29. Quien se suscriba por 5 dólares esperando la expresividad que se anuncia quedará decepcionado, no porque la función no exista, sino porque se encuentra dos niveles más arriba.

Fijarse en qué tienda contrata

La página de precios contiene un aviso que conviene atender: «Los precios en App Store y Google Play pueden diferir del importe indicado arriba, según las políticas de precios de cada tienda», y «las suscripciones adquiridas a través de la aplicación móvil (iOS/Android) no pueden modificarse en la web. Gestione su plan a través de la tienda correspondiente». Contratar desde el móvil ata la gestión del plan a esa tienda.

Entender las condiciones de reembolso antes de la primera descarga

Las condiciones de reembolso son estrictas y se vinculan directamente al uso. En los planes mensuales, «solo procede un reembolso íntegro si no existe historial de uso de créditos, ni historial de creación de clonación Premium, ni tareas pendientes, dentro de los 7 días siguientes a la fecha de facturación». Los planes anuales siguen las mismas condiciones dentro de los siete días del pago, y a partir de ahí el reembolso descuenta los meses consumidos más una comisión de tramitación. En la práctica, la primera descarga o el primer clon cierran la vía del reembolso limpio. Los usuarios de la Unión Europea disponen además de un derecho legal de desistimiento de catorce días, que las condiciones consideran renunciado en cuanto el servicio se ha ejecutado parcialmente.

No clonar nunca una voz sobre la que no se tienen derechos

La política de uso prohíbe expresamente «el uso no autorizado de la identidad, la voz o la imagen de una persona con fines no satíricos, maliciosos o comerciales sin su consentimiento», así como la suplantación no autorizada de figuras políticas. Más allá de las reglas internas, las condiciones exigen que garantice poseer «todos los derechos, licencias, consentimientos, permisos y/o facultades» sobre lo que sube. La responsabilidad jurídica del consentimiento para clonar es suya, no de la plataforma.

Dejar fuera el contenido político y regulado salvo autorización

La publicidad política está prohibida «salvo que se conceda autorización expresa por escrito», y la desinformación electoral y la suplantación de figuras políticas o de sus familiares están vetadas por completo. El contenido para adultos, así como el uso de voces con IA en relación con la pornografía o servicios para adultos, está prohibido. Si su trabajo roza estos terrenos, solicite una autorización escrita de antemano en lugar de descubrir la restricción tras publicar.

Planificar la estructura del equipo antes de crecer

Dado que «las sucursales o empresas distintas deben contar cada una con su propia suscripción», una agencia que atiende a varias entidades cliente o un grupo con varias filiales jurídicas no puede consolidar el uso en una sola plaza. Resuelva la estructura de licencias en la compra y no en una auditoría.

¿Para quién es Typecast?

Buena opción para

Typecast encaja con creadores cuyo contenido depende de la carga emocional y no solo de la inteligibilidad —ficción sonora, animación, trabajo de personaje, vídeo narrativo—, porque ahí es exactamente donde el producto ha invertido. Encaja con equipos que publican a la vez en Asia oriental y en Occidente, ya que el coreano, el japonés y el chino son aquí centrales y no accesorios. Encaja con desarrolladores que construyen agentes de voz o cadenas de subtitulado, gracias a los puntos de acceso en continuo y con marcas de tiempo y al kit para seis lenguajes. Encaja con cualquiera que quiera probar a fondo antes de pagar, al ser la generación y la reproducción ilimitadas y gratuitas. Y encaja con quienes desean una respuesta clara sobre la licencia de las voces, dado que la postura sobre el consentimiento de los actores está publicada y no meramente insinuada.

Mala opción para

No encaja con quien necesite la plataforma como almacenamiento duradero: el borrado automático al año se aplica sea cual sea el nivel. No encaja con organizaciones que pretendan cubrir varias entidades jurídicas con una sola licencia, por la exigencia de suscripciones separadas. No encaja con contenido para adultos ni político, ambos restringidos. No encaja con menores de 13 años en ningún territorio, ni con menores de 17 para el avatar parlante. No encaja con compradores que exijan un cuerpo amplio de reseñas independientes antes de decidir, ya que la huella de valoración externa es escasa frente a la base de usuarios declarada. Y puede no encajar con quien no acepte el derecho coreano ni la renuncia a la acción colectiva, tratados en las limitaciones.

La decisión que de verdad importa

Para la mayoría de posibles usuarios la pregunta real es más estrecha que «¿es bueno Typecast?». Es si el control emocional compensa el sobreprecio del nivel. Si basta una narración clara y neutra, abundan las opciones más baratas y el nivel de entrada incluso puede parecer caro frente a la competencia. Pero si la interpretación es el producto —si la diferencia entre un susurro y un grito sostiene su contenido—, entonces el nivel de 29 dólares es el punto honesto de comparación, y Smart Emotion resulta una capacidad realmente diferenciada y no un control de tono rebautizado.

Plataformas

Typecast funciona sobre todo en el navegador: el editor de voz, el editor de vídeo y la interfaz de clonación son todos web, sin aplicación de escritorio. Existen aplicaciones móviles para iOS y Android, orientadas a generar locuciones sobre la marcha con sincronización de proyectos entre dispositivos. La aplicación de iOS, inscrita a nombre de la sociedad Neosapience, se descarga gratis, exige iOS 16.4 o posterior, lleva clasificación 12+, figura en las categorías de Foto y vídeo y Entretenimiento, y admite inglés y coreano como idiomas de interfaz. Su versión más reciente data de agosto de 2026, señal de mantenimiento activo.

Para los desarrolladores, la superficie de la plataforma es la interfaz de síntesis de voz y no un cliente instalado, con un kit oficial para seis lenguajes —Python y JavaScript, C# y Java, Kotlin y Rust—, además de una herramienta de línea de comandos y documentación pensada para que la consuman agentes de programación. El propio sitio es bilingüe, con versiones separadas en inglés y coreano, y la coreana incluye la divulgación legal completa que exige la normativa coreana de comercio electrónico.

Una salvedad de plataforma merece énfasis: puesto que las suscripciones adquiridas en las tiendas móviles no pueden gestionarse en la web, la plataforma por la que contrate determina dónde deberá después cancelar o cambiar de plan.

Precios y planes

Typecast cobra mediante suscripción mensual con un diez por ciento de descuento en facturación anual, y la estructura se apoya en créditos de descarga y no en tiempo de generación. Todos los niveles, incluido el gratuito, ofrecen generación y reproducción ilimitadas; los créditos solo se consumen al descargar audio.

El nivel gratuito no cuesta nada y proporciona 3.000 créditos de descarga de por vida, equivalentes a unos cinco minutos de audio. Limita las descargas a voces de prueba, topa el audio en 16 kHz, permite tres proyectos, ofrece exportación de vídeo en 720p con 1 GB de almacenamiento, conserva el historial de descargas siete días y exige atribución en todo el contenido descargado. No incluye plazas de clonación ni generaciones de avatar.

El nivel Basic, a 5 dólares mensuales o 54 dólares anuales, proporciona 30.000 créditos mensuales (unos 35 minutos), abre todas las voces con IA, eleva el audio a 44,1 kHz, añade una plaza de clonación instantánea, permite exportación de vídeo en 1080p sin marca de agua con 5 GB de almacenamiento y hace opcional la atribución bajo licencia comercial.

El nivel Plus, a 19 dólares mensuales o 204 dólares anuales, proporciona 40.000 créditos (unos 50 minutos), añade el control de velocidad y la clonación profesional, y eleva la exportación a 4K con 30 GB de almacenamiento.

El nivel Pro, a 29 dólares mensuales o 312 dólares anuales, alberga la capacidad emblemática de la plataforma. Proporciona 75.000 créditos (unos 90 minutos) y añade los controles emocionales, incluido el ajuste en un clic de Smart Emotion, la emoción personalizada, la entonación y el tono, además de una segunda plaza de clonación y 50 GB de almacenamiento.

El nivel Business, a 69 dólares mensuales o 744 dólares anuales, proporciona 200.000 créditos (unos 250 minutos), permite comprar créditos adicionales y añade diez plazas de clonación, miembros de equipo y 100 GB de almacenamiento. Por encima se sitúa un nivel Empresarial presupuestado a consulta, que cubre una interfaz dedicada y un paquete de seguridad, agentes conversacionales en tiempo real y un gestor de cuenta asignado.

Dos notas prácticas acompañan a la tabla. Los precios de las tiendas móviles pueden diferir de las cifras de la web, y las suscripciones móviles deben gestionarse a través de la tienda de origen. Los reembolsos están condicionados: un reembolso íntegro exige que no haya uso de créditos, ni creación de clonación Premium, ni tareas pendientes dentro de los siete días siguientes a la facturación, mientras que los planes anuales pasados ese plazo se reembolsan descontando los meses consumidos y una comisión de tramitación.

Alternativas

ElevenLabs es la alternativa más comparada y el competidor más fuerte en realismo puro de la voz y amplitud del ecosistema. La distinción honesta está en el acento: la inversión de Typecast se concentra en la interpretación emocional deducida del contexto y en una postura de licencia hacia los actores explícitamente documentada, mientras que ElevenLabs compite por calidad del modelo, escala y un utillaje periférico más ancho. Compare por el eje que de verdad le importa y no por la reputación general.

Murf y WellSaid Labs apuntan a la narración corporativa y de formación en línea, donde la constancia y el control de la pronunciación pesan más que el registro dramático. Para explicaciones de producto, módulos de formación y comunicación interna suelen resultar más económicos, y la finura emocional por la que Typecast cobra queda allí en gran medida sin usar.

Play.ht y Speechify ocupan el extremo de volumen y precio, atrayendo a editoriales que convierten grandes corpus de texto en audio. Su ventaja es la economía del rendimiento; el contraargumento de Typecast es la dirección línea a línea, cuyo valor es escaso cuando la tarea se reduce a una conversión masiva.

Los grandes proveedores de nube —Google, Amazon y Microsoft— ofrecen síntesis profundamente integrada en la infraestructura y vías de compra pensadas para empresas. Son la opción por defecto cuando se trata de incrustar síntesis de alto volumen en un entorno de nube ya existente. Lo que por lo general no ofrecen es un catálogo seleccionado de voces de actores reales acompañado de compromisos públicos sobre el consentimiento, que es precisamente la diferencia de Typecast.

Para contenidos en coreano, japonés y chino, el origen regional del producto constituye una ventaja real que conviene verificar directamente. En lugar de aceptar una comparación tal cual, genere el mismo guion en el idioma de destino en dos plataformas y escuche: en las lenguas de Asia oriental la brecha se invierte con frecuencia respecto al escalafón de reputación anglosajón.

Limitaciones y consideraciones

Las producciones se eliminan al año, en cualquier nivel

La limitación de mayor calado no es una carencia de funciones, sino una regla de conservación. Las producciones generadas a través del servicio se conservan un año desde su creación y luego se «eliminan automáticamente de nuestros servidores sin más aviso». Las condiciones explicitan tres puntos: le corresponde a usted descargar lo que quiera conservar; la empresa no tiene obligación de recuperar lo eliminado; y la política «se aplica por igual a todos los usuarios, con independencia de que estén en un plan de pago o gratuito». Volver a descargar producciones anteriores solo es posible mientras sigan en los servidores y mientras mantenga una suscripción activa.

Los derechos comerciales están ligados a una suscripción activa

El audio ya descargado sigue siendo utilizable tras la cancelación, pero la política de uso establece que el uso comercial se permite «únicamente durante su periodo de suscripción» y que tras el vencimiento «no podrán realizarse nuevas modificaciones ni descargas salvo prórroga». Combinado con la regla de conservación, dejar caducar una suscripción puede varar de forma permanente un trabajo aún no exportado.

El nivel gratuito exige atribución y restringe las voces

Las producciones del nivel gratuito no son de uso incondicional: se exige atribución para todo lo descargado allí, las descargas se limitan a voces de prueba y la calidad topa en 16 kHz. El nivel gratuito es un auténtico entorno de evaluación, no una herramienta de producción gratuita.

Los controles emocionales, argumento estrella, quedan más allá del nivel de 29 dólares

El discurso comercial abre con la expresividad, pero los controles emocionales básicos, Smart Emotion, la emoción personalizada, la entonación y el tono solo aparecen a partir del nivel Pro, mientras que el control de velocidad exige como mínimo el nivel de 19 dólares. El comprador atraído por las demostraciones emocionales que se suscriba por 5 dólares no obtendrá justamente la capacidad que lo atrajo.

Usted concede una licencia amplia e irrevocable sobre lo que sube

Aunque las condiciones confirman que «usted conserva sus derechos de propiedad sobre su contenido y posee la producción», subir contenido concede a Neosapience «una licencia no exclusiva, irrevocable, mundial, totalmente pagada y libre de regalías para almacenar, reproducir, modificar, transmitir, mostrar, publicar y distribuir su contenido con el fin de operar, mejorar, promocionar y prestar los servicios». Lea con atención ese alcance antes de subir muestras de voz sensibles: incluye la promoción y es irrevocable.

Derecho coreano, renuncia a la acción colectiva y plazo de un año

Los litigios se rigen por las leyes de la República de Corea y por el procedimiento civil coreano. Las condiciones añaden que cualquier disputa «SE RESOLVERÁ INDIVIDUALMENTE, SIN RECURRIR A NINGUNA FORMA DE ACCIÓN COLECTIVA», y que toda causa de acción «DEBERÁ INICIARSE DENTRO DE UN (1) AÑO DESDE QUE SURJA». Para un usuario profesional no coreano estas son cláusulas sustanciales y no fórmulas de estilo.

El reembolso se pierde de hecho con el primer uso

Puesto que un reembolso íntegro exige que no haya uso de créditos, ni creación de clonación Premium, ni tareas pendientes, descargar un solo archivo o crear un clon premium cierra esa vía. Como la generación y la reproducción son gratuitas de todos modos, el escollo es evitable, pero solo si evalúa antes de descargar.

Una suscripción no puede cubrir varias entidades

La exigencia de que «las sucursales o empresas distintas cuenten cada una con su propia suscripción» limita el despliegue en agencias y grupos empresariales, y además se requieren acuerdos separados para los servicios de interfaz, la creación de voces a medida y la integración en sistemas automatizados.

Las restricciones de edad y de contenido son amplias

Los usuarios deben tener al menos 13 años, o más donde la ley local lo exija, y la función de avatar parlante se limita a mayores de 17. El contenido prohibido abarca material sexual, violencia y discurso de odio, publicidad política y desinformación electoral, fraude y suplantación, vulneraciones de la seguridad infantil y violaciones de propiedad intelectual o de la intimidad. La empresa se reserva el derecho de retirar contenido generado «por cualquier motivo (o sin motivo)» y de terminar el acceso sin aviso previo.

Las pruebas de reseñas independientes son escasas frente a la base declarada

Se trata de una laguna probatoria y no de una crítica al producto. El perfil de Trustpilot del dominio estaba sin reclamar y contenía una sola reseña con una puntuación de 3,2 en el momento de la comprobación: una muestra demasiado pequeña para sostener conclusión alguna sobre calidad, señalando la propia Trustpilot que la empresa «no ha invitado a sus clientes, por lo que las reseñas pueden no ser representativas». La aplicación de iOS mostraba una media de 3,33 a partir de solo tres valoraciones, también por debajo de cualquier umbral significativo. Los intentos de verificar puntuaciones en G2 y Capterra fueron bloqueados por todos los canales disponibles, de modo que las cifras que circulan al respecto en fuentes secundarias no se reproducen aquí. Quien evalúe Typecast debería probarlo directamente en lugar de fiarse de puntuaciones agregadas.

Las cifras declaradas por la empresa no están auditadas

Las más de 700 voces, los más de 35 idiomas anunciados en la página comercial (frente a 37 en la documentación) y las cifras de usuarios recogidas por la prensa proceden todas de la propia empresa. Repare en cuánto se ha movido ese número de usuarios en su propia comunicación: la cobertura de la ronda de serie B de 2022 hablaba de «más de un millón de usuarios», mientras que la de la ronda previa a la salida a bolsa de diciembre de 2025 cita «más de dos millones de usuarios registrados en el mundo». Usuarios registrados no equivale a usuarios activos, y ninguna de las dos cifras ha sido verificada de forma independiente.

Financiación y trayectoria de la empresa

Como referencia sobre estabilidad y no como aval: la empresa cerró una ronda de serie B de 21,5 millones de dólares en febrero de 2022 liderada por BRV Capital Management, elevando el total captado hasta entonces a unos 26,7 millones, y una ronda previa a la salida a bolsa de 11,5 millones de dólares anunciada en diciembre de 2025 con participación de HB Investment y K2 Investment Partners. Fue fundada en 2017 por antiguos ingenieros de Qualcomm. Una ronda previa a la salida a bolsa señala intención de cotizar, lo que suele traer más divulgación pero también cambios estratégicos; ninguna de las dos cosas está garantizada.

FAQ

Q1. ¿Typecast es gratuito y qué permite realmente el plan gratuito?

Existe un nivel gratuito genuinamente utilizable, pero su límite se sitúa en un punto concreto. La generación y la reproducción de voz son ilimitadas en todos los niveles, incluido el gratuito: puede experimentar sin fin sin gastar nada. Lo limitado es la descarga: el nivel gratuito ofrece 3.000 créditos de por vida, unos cinco minutos de audio, y son de por vida y no mensuales. Las descargas gratuitas se limitan a voces de prueba, topan en 16 kHz, se ciñen a tres proyectos y vídeo 720p con 1 GB de almacenamiento, y exigen atribución en todo lo descargado. Es un nivel de evaluación, no un nivel de producción gratuito.

Q2. ¿De quién son estas voces y consintieron los actores?

Es la parte más clara de la política de la plataforma y un factor de diferenciación real. La política de uso señala que «los actores de doblaje conservan la propiedad de sus modelos de voz» y que «queda estrictamente prohibida la réplica, distribución o alteración no autorizadas de una voz sin permiso». Sobre el consentimiento precisa que la empresa se asegura de que «todo actor de doblaje cuyo modelo de voz esté disponible en la plataforma haya aceptado explícitamente los casos de uso de su voz». Añade que el audio generado «no podrá alterarse de modo que tergiverse al actor ni emplearse en contenidos que no haya aprobado», quedando el abuso sujeto a retirada y a posibles acciones legales. La empresa comercializa estas voces como «voces exclusivas de actores de doblaje reales». Conviene precisar: se trata de compromisos publicados por la empresa; los contratos concretos con cada actor no son públicos y ninguna fuente consultada divulga las condiciones de remuneración.

Q3. ¿Puedo usar comercialmente las producciones de Typecast?

Sí, con condiciones que varían según el nivel y el estado de la suscripción. Desde el nivel Basic se incluye licencia comercial con atribución opcional; en el plan gratuito la atribución es obligatoria para todo lo descargado. La política concede «un derecho no exclusivo e intransferible a usar el contenido de audio generado a través de nuestros servicios con fines personales o comerciales», pero lo ata al tiempo: el uso se permite «únicamente durante su periodo de suscripción», tras el cual conserva el audio ya descargado sin poder realizar nuevas descargas ni modificaciones. Las sucursales o empresas distintas deben contar cada una con su propia suscripción.

Q4. ¿Qué ocurre con mi audio generado con el paso del tiempo?

Se elimina. Las producciones se conservan un año en los servidores desde su creación y después se «eliminan automáticamente de nuestros servidores sin más aviso». Esto rige por igual para usuarios de pago y gratuitos. La eliminación afecta solo a las copias del lado del servidor —los archivos ya descargados siguen siendo suyos—, pero las condiciones señalan con claridad que le corresponde guardar lo que desee conservar y que la empresa no tiene obligación de restaurar nada. Volver a descargar solo es posible mientras la producción siga conservada y su suscripción esté activa.

Q5. ¿Cuánto cuesta Typecast y qué nivel necesito de verdad?

Los planes van de gratuito a 69 dólares al mes, con un diez por ciento de descuento anual: Basic 5 dólares (30.000 créditos, todas las voces, una plaza de clonación instantánea, licencia comercial), Plus 19 dólares (40.000 créditos, control de velocidad, clonación profesional, vídeo 4K), Pro 29 dólares (75.000 créditos, controles emocionales incluido Smart Emotion, entonación y tono, dos plazas de clonación), Business 69 dólares (200.000 créditos, diez plazas, miembros de equipo, compra de créditos), más un nivel Empresarial a consulta. El nivel que necesita depende del control que busque: los controles emocionales arrancan en 29 dólares y el de velocidad en 19, de modo que la expresividad con la que se promociona el producto es una función del nivel Pro.

Q6. ¿Qué es Smart Emotion y en qué se diferencia de elegir un estado de ánimo?

Smart Emotion deduce la interpretación del contexto en lugar de exigir que etiquete cada línea. El sistema lee el texto circundante —en la interfaz se entregan explícitamente la línea anterior y la siguiente— y genera una lectura acorde a ese contexto, de modo que palabras idénticas suenan distintas según lo que las rodee. La empresa describe el planteamiento de base como un análisis del guion línea por línea para producir un tono acorde al contexto. Las etiquetas emocionales clásicas siguen disponibles como emoción personalizada, junto con la entonación y el tono, a partir del nivel Pro.

Q7. ¿Qué idiomas se admiten y cuántas voces hay?

El sitio comercial anuncia más de 700 voces con IA y más de 35 idiomas; la documentación de la interfaz indica 37 idiomas mediante el modelo ssfm-v30 y más de 500 voces accesibles por programación. La diferencia se explica mejor porque el catálogo web y el de la interfaz no son idénticos, así que verifique la disponibilidad del idioma y la voz que necesita desde el nivel y la interfaz que piense usar. Los idiomas nombrados de forma explícita en la documentación incluyen coreano, inglés, japonés, chino, español y vietnamita.

Q8. ¿Puedo clonar mi propia voz y hablará el clon otros idiomas?

Sí a ambas, desde los niveles de pago. La clonación instantánea crea una voz a partir de una muestra breve y se abre desde Basic con una plaza; la clonación profesional, de mayor fidelidad, aparece desde Plus. El número de plazas sube a dos en Pro y a diez en Business. La empresa indica que una voz clonada puede hablar varios idiomas, que es la principal razón práctica para clonar en vez de escoger del catálogo. Debe poseer los derechos sobre cualquier voz que clone: las condiciones exigen que garantice contar con todos los derechos, licencias y consentimientos necesarios, y clonar la voz de otra persona sin permiso está prohibido.

Q9. ¿Quién opera Typecast y bajo qué derecho?

Typecast lo opera Neosapience, Inc., empresa surcoreana fundada en 2017 por antiguos ingenieros de Qualcomm. El sitio en coreano divulga la entidad como 네오사피엔스 주식회사, con número de registro 883-86-00767, representante Taesu Kim y domicilio en Gangnam-gu, Seúl; esa misma persona figura como responsable de protección de datos. Las condiciones se rigen por las leyes de la República de Corea, los litigios por el procedimiento civil coreano, e incluyen una renuncia a la acción colectiva y un plazo de un año para reclamar. La política de privacidad afirma cumplir la ley coreana de protección de datos personales junto con los regímenes de la Unión Europea y el Reino Unido, la legislación californiana sobre privacidad y las normas estadounidenses sobre privacidad infantil en línea.

Q10. ¿Qué restricciones de contenido debo conocer antes de construir sobre ello?

Sí, y varias son más amplias de lo que se espera. El contenido sexual y para adultos está prohibido, incluido el uso de voces con IA en servicios para adultos. La publicidad política queda prohibida salvo autorización expresa por escrito, así como la desinformación electoral y la suplantación de figuras políticas o de sus familiares. El fraude, el engaño, la suplantación no autorizada de cualquier persona, el discurso de odio, el acoso y las vulneraciones de propiedad intelectual o de la intimidad están todos vetados. Los usuarios deben tener al menos 13 años, y la función de avatar parlante exige 17 cumplidos. La empresa se reserva el derecho de revisar y retirar contenido generado a su exclusivo criterio y de cerrar cuentas sin aviso previo.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas