
A Typecast é uma plataforma de voz com IA da empresa coreana Neosapience que converte texto em fala expressiva por meio de mais de 700 modelos de voz licenciados de dubladores, análise emocional conforme o contexto, clonagem de voz e uma interface de síntese multilíngue voltada a criadores, desenvolvedores e empresas.
Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
A Typecast é uma plataforma de inteligência artificial que converte texto escrito em fala com carga emocional regulável. Seu argumento distintivo não é o número bruto de vozes nem o preço, mas a expressividade: a empresa se apresenta como «o gerador de voz com IA mais expressivo do mundo» e descreve o produto como «o gerador de voz com IA que soa natural e cheio de emoção — para criadores, desenvolvedores e empresas». Na prática, isso abrange três produtos ligados sob uma mesma assinatura — um editor de voz que funciona no navegador, um sistema de clonagem de voz e uma interface de síntese de fala — aos quais se somam um editor de vídeo e uma função de avatar falante.
A operadora é a Neosapience, Inc., uma empresa sul-coreana. Esse dado pesa muito mais do que uma nota de rodapé, por dois motivos. Primeiro, determina o enquadramento jurídico: os termos de uso estabelecem que «formam um acordo entre você e a Neosapience, Inc.» e que são «regidos e interpretados conforme as leis da República da Coreia», ficando os litígios sob o processo civil coreano. Segundo, explica o centro de gravidade linguístico do produto: coreano, inglês, japonês e chinês são aqui idiomas de primeira ordem, o que não vale para todos os concorrentes ocidentais. O site em coreano divulga integralmente a entidade operadora, como exige a regulamentação local do comércio eletrônico: 네오사피엔스 주식회사, número de registro empresarial 883-86-00767, representante Taesu Kim, com endereço inscrito na área de Samseong-dong, no distrito de Gangnam-gu, em Seul. A mesma pessoa consta como responsável pela proteção de dados na política de privacidade.
O que de fato separa a voz Typecast de um sintetizador de fala comum é a camada emocional. Além dos controles habituais de velocidade e altura, a plataforma oferece o que chama de Smart Emotion: um sistema que lê o texto ao redor para deduzir como uma fala deve ser dita, sem exigir que você marque cada frase à mão. A empresa descreve sua biblioteca como «vozes exclusivas de dubladores reais», e sua política de uso detalha o arranjo contratual por trás dessa frase com uma clareza incomum nesta categoria. Como o licenciamento das vozes e o consentimento costumam decidir se uma ferramenta de voz com IA pode sustentar um negócio com segurança, esta página trata ambos como questões centrais e não como observação final.
A capacidade principal é a síntese de voz emocional, isto é, fala com entrega emocional ajustável. O site anuncia «mais de 700 vozes com IA com emoção, velocidade e dinâmica ajustáveis», e as demonstrações exibidas expõem os estados emocionais disponíveis: alegria, tristeza, raiva, sussurro e registro grave aparecem como modos aplicáveis a uma mesma fala. As vozes se organizam por função — locutor, narrador, podcast, apresentador de notícias, robô e vozes de personagem — com filtros por idade e sexo. A ressalva importante é que não se trata de construções sintéticas montadas do zero: a empresa as descreve como «vozes exclusivas de dubladores reais», o que dá peso às condições de licença tratadas adiante.
O Smart Emotion é a função com que a empresa se apresenta, e representa um afastamento real do controle emocional por etiquetas. Em vez de marcar cada frase com um estado de ânimo, o sistema analisa o texto que cerca uma fala para decidir como dizê-la. A descrição que a própria empresa dá de sua pesquisa de base é que a tecnologia «analisa os roteiros linha a linha para gerar automaticamente um tom adequado ao contexto». A interface expõe esse mecanismo de forma direta: uma requisição pode transportar a frase anterior e a seguinte junto da linha a sintetizar, de modo que uma frase como «vai ficar tudo bem» é dita de maneira diferente conforme venha depois de uma boa ou de uma má notícia. Para o trabalho narrativo é uma decisão de projeto substancial, já que as mesmas palavras pesam de modo diverso conforme o que as precede.
A plataforma oferece clonagem de voz em dois níveis de qualidade. A clonagem instantânea cria uma voz própria a partir de uma amostra curta de áudio e fica disponível já no primeiro nível pago; a clonagem profissional, de maior fidelidade, aparece a partir do nível intermediário. As vagas de clonagem são contadas e não ilimitadas: uma nos níveis de entrada e intermediário, duas no nível mais popular e dez no nível empresarial. A empresa indica que uma voz clonada pode depois «falar em vários idiomas», ou seja, uma voz captada em uma língua serve para gerar fala em outras — o atrativo concreto para quem publica em vários mercados.
O produto voltado a desenvolvedores não é um invólucro fino em torno do editor web. A documentação descreve uma interface que fornece fala em 37 idiomas por meio do modelo ssfm-v30 e acesso a mais de 500 vozes, com quatro modos de geração distintos: a síntese padrão, que produz arquivos WAV ou MP3 completos; a síntese em fluxo, que reproduz o áudio conforme os fragmentos chegam e se destina a agentes de voz e aplicações interativas de baixa latência; a síntese com marcações de tempo, que devolve dados de alinhamento por palavra ou por caractere para legendas, destaque tipo karaokê e sincronia labial; e a clonagem instantânea exposta por programação. Os exemplos oficiais do kit de desenvolvimento cobrem Python e JavaScript, as duas linguagens mais difundidas, além de C# e Java, e ainda Kotlin e Rust. A documentação publica também um arquivo llms.txt destinado explicitamente a agentes de programação.
Para além do áudio, a assinatura inclui um editor de vídeo cuja qualidade de exportação é escalonada: 720p no nível gratuito, 1080p no de entrada e 4K a partir do intermediário, ficando a exportação sem marca d'água reservada a qualquer nível pago. Uma função separada de avatar falante gera um apresentador em tela e é medida por número de gerações em vez de duração: até seis no nível de entrada e até quarenta no empresarial, nenhuma no gratuito. Note-se que os avatares estão sujeitos a um limite de idade mais estrito que o restante da plataforma, conforme detalhado adiante.
A Typecast publica aplicativos móveis para iOS e Android que geram locuções diretamente do telefone e sincronizam projetos entre dispositivos. A versão iOS está registrada em nome da sociedade Neosapience, é baixada gratuitamente, exige iOS 16.4 ou posterior, traz classificação 12+ e foi atualizada em agosto de 2026 — um aplicativo mantido de forma ativa e não um companheiro abandonado.
A empresa publica uma genealogia de modelos em vez de tratar seu motor como caixa-preta: um primeiro modelo de síntese baseado em aprendizado profundo em 2018, o modelo CATS que melhorou pronúncia e naturalidade em 2021, o SSFM 1.0 em 2024 com nova arquitetura treinada sobre grandes conjuntos de dados, o SSFM 2.0 em 2025 acrescentando multilinguismo e controles avançados, e o SSFM 3.0 no mesmo ano trazendo geração emocional sensível ao contexto. Ao comparar com recém-chegados, essa trajetória merece consideração, entendendo-se que são afirmações da empresa e não passaram por auditoria independente.
O melhor encaixe são conteúdos que uma leitura plana arruinaria: ficção sonora, animação, diálogos de jogo, audiolivros de ficção e vídeo sustentado por um enredo. Um depoimento publicado no site, assinado por um diretor de cinema, resume o fluxo de trabalho pretendido: experimentar vozes diferentes, ajustar o tempo e brincar com a emoção até que uma cena ganhe vida, algo que ele descreve como «fazer elenco, direção e produção ao mesmo tempo». É a união de um vasto catálogo de vozes de personagem com controle emocional linha a linha que torna essa categoria realmente utilizável e não apenas possível.
Para quem publica o mesmo conteúdo em vários mercados, a combinação de clonagem e multilinguismo é o atrativo de fundo: captar uma voz uma vez e depois fazê-la dizer outros idiomas. Com 37 idiomas disponíveis pela interface e coreano, inglês, japonês, chinês, espanhol e vietnamita nomeados explicitamente na documentação, a cobertura é de fato ampla e notavelmente sólida nas línguas do Leste Asiático, onde alguns concorrentes ocidentais são mais fracos.
A síntese em fluxo existe precisamente para os casos em que esperar o cálculo completo é inaceitável. A empresa declara evoluir «da simples geração de voz para uma verdadeira IA conversacional que escuta, pensa e fala em tempo real», e o nível empresarial menciona expressamente agentes conversacionais em tempo real. Para quem constrói um assistente ou um produto de voz interativo, a superfície pertinente é o ponto de acesso em fluxo aliado à reprodução de baixa latência, e não o editor web.
A síntese com marcações de tempo devolve dados de alinhamento por palavra ou caractere, o que transforma a saída em algo que uma cadeia de produção consome diretamente em vez de um simples arquivo de áudio. É isso que torna praticáveis a legendagem automática, o destaque tipo karaokê e a animação sincronizada aos lábios sem um passo adicional de alinhamento forçado.
A empresa descreve uma base de usuários que abrange radiodifusão, telecomunicações, comércio eletrônico e educação, e a estrutura de níveis reflete esse uso institucional: o nível empresarial acrescenta membros de equipe, dez vagas de clonagem e compra de créditos adicionais. Aqui opera um detalhe de licença de grande alcance e fácil de ignorar: a política de uso estabelece que «filiais ou empresas distintas devem ter cada uma sua própria assinatura para assegurar a conformidade», de modo que uma única vaga não cobre juridicamente um grupo empresarial inteiro.
Como a geração e a reprodução são ilimitadas em todos os níveis, inclusive o gratuito, e os créditos só se consomem ao baixar, a Typecast permite um fluxo de trabalho que a maioria dos concorrentes não oferece: percorrer um roteiro inteiro com muitas vozes e leituras emocionais sem custo algum e pagar apenas pelas tomadas que se guarda. Usada com intenção, torna-se tanto ferramenta de elenco e pré-visualização quanto de produção.
Entenda primeiro o modelo de créditos, porque ele condiciona todo o resto. A página de preços indica que «a geração e a reprodução de voz são gratuitas em todos os níveis» e que «os créditos são usados quando você baixa o áudio». Nada se consome enquanto você experimenta no editor. Gere a mesma fala com uma dúzia de vozes, teste cada modo emocional, ajuste o ritmo: nada disso gasta créditos até a exportação. A maioria dos que acham o nível gratuito mesquinho simplesmente não interiorizou que o limite está nas descargas e não nas tentativas.
Os níveis não formam uma simples escada de qualidade; cada um libera um controle específico. O nível gratuito concede 3.000 créditos de descarga vitalícios (cerca de cinco minutos), mas limita você a vozes de teste, áudio a 16 kHz e três projetos. O nível de entrada, a 5 dólares mensais, abre todas as vozes, o áudio a 44,1 kHz, uma vaga de clonagem instantânea e uma licença comercial. O nível seguinte, a 19 dólares, acrescenta o controle de velocidade e a clonagem profissional. No nível de 29 dólares residem os controles emocionais, entre eles o Smart Emotion, a emoção personalizada, a entonação e a altura: se a expressividade é o que o traz aqui, seu preço de entrada é de 29 dólares e não de 5. O nível empresarial, a 69 dólares, acrescenta dez vagas de clonagem, membros de equipe e compra de créditos. A cobrança anual poupa dez por cento.
Se o seu nível inclui essa função, dê contexto a ela. Como o sistema deduz a interpretação do texto ao redor, picotar uma cena em requisições de uma única linha equivale a jogar fora o próprio sinal de que ele se serve. Na interface isso é explícito — entregam-se a linha anterior e a seguinte —, mas o princípio vale igualmente no editor: mantenha íntegros os trechos narrativos para que o modelo leia o arco em vez de tratar cada fala como órfã.
Este é o passo que se pula e depois se lamenta. A licença comercial não é uniforme entre os níveis. No plano gratuito a tabela marca a licença comercial como «atribuição obrigatória», e a descrição do plano precisa que «é exigida atribuição para todo conteúdo baixado no plano gratuito». A partir do nível de entrada, a atribuição passa a «opcional». Se você distribui conteúdo monetizado, verifique sob qual nível as descargas foram feitas antes de distribuir, não depois.
A regra de retenção é o detalhe operacional de maior alcance desta página. As produções permanecem nos servidores da Typecast por um ano a contar da criação, findo o qual são «automaticamente excluídas de nossos servidores sem aviso adicional». Os termos assinalam que «você é responsável por baixar e salvar qualquer produção que deseje manter antes de expirar o período de retenção» e que a empresa não tem «obrigação alguma de recuperar ou restaurar» o que foi excluído. Ponto decisivo: essa regra «aplica-se igualmente a todos os usuários, independentemente de estarem em plano pago ou gratuito». Trate a plataforma como serviço de geração e não como seu arquivo.
A política de uso traça uma linha que surpreende após um cancelamento: «O áudio gerado pode ser baixado e usado para fins pessoais ou comerciais somente durante o seu período de assinatura. Após o vencimento, você pode continuar usando o áudio baixado anteriormente, mas nenhuma nova modificação ou descarga pode ser feita salvo se a assinatura for prorrogada». O áudio já baixado segue utilizável, mas a capacidade de baixar de novo ou derivar conteúdo novo cessa com a assinatura.
Para uso programático, obtenha uma chave de acesso e escolha o modo compatível com a carga: síntese padrão para arquivos prontos, transmissão contínua para latência interativa, síntese com marcações de tempo quando forem necessários dados de alinhamento. O kit oficial cobre seis linguagens: Python e JavaScript, além de C# e Java, junto de Kotlin e Rust. Observe que a política de uso exige acordos separados para serviços de interface, criação de vozes sob medida e integração em sistemas automatizados: uma implantação por interface não é uma assinatura de consumo simplesmente ampliada.
Construa seus hábitos em torno do modelo de créditos. Como ouvir não custa nada, faça toda a comparação, a direção e as revisões dentro do editor e exporte apenas as tomadas finais. Uma equivalência aproximada ajuda a formar noção: 30.000 créditos correspondem a cerca de 35 minutos de áudio, 75.000 a cerca de 90 minutos e 200.000 a cerca de 250 minutos. Os créditos medem, portanto, a duração do resultado pronto e não o esforço gasto para chegar até ele.
Como cada nível tranca um controle diferente, o plano suficiente mais barato raramente é o plano mais barato. O controle de velocidade só aparece aos 19 dólares; os controles emocionais, incluído o Smart Emotion, apenas aos 29. Quem assinar por 5 dólares esperando a expressividade anunciada ficará decepcionado — não porque a função inexista, mas porque ela está dois níveis acima.
A página de preços traz um aviso digno de atenção: «Os preços na App Store e na Google Play podem diferir do valor indicado acima, conforme as políticas de preço de cada loja», e «assinaturas adquiridas pelo aplicativo móvel (iOS/Android) não podem ser modificadas na web. Administre seu plano pela loja de aplicativos correspondente». Assinar pelo celular prende a gestão do plano àquela loja.
As condições de reembolso são rigorosas e ligadas diretamente ao uso. Nos planos mensais, «o reembolso integral só é possível se não houver histórico de uso de créditos, nem histórico de criação de clonagem Premium, nem tarefas pendentes, dentro de 7 dias da data de faturamento». Os planos anuais seguem as mesmas condições dentro de sete dias do pagamento, e depois disso o reembolso desconta os meses consumidos mais uma taxa de processamento. Na prática, a primeira descarga ou o primeiro clone encerram o caminho do reembolso limpo. Usuários da União Europeia dispõem ainda de um direito legal de desistência de catorze dias, que os termos consideram renunciado assim que o serviço tenha sido parcialmente executado.
A política de uso proíbe expressamente «o uso não autorizado da identidade, voz ou imagem de uma pessoa para fins não satíricos, maliciosos ou comerciais sem o seu consentimento», bem como a personificação não autorizada de figuras políticas. Além das regras internas, os termos exigem que você garanta deter «todos os direitos, licenças, consentimentos, permissões e/ou poderes» sobre o que envia. A responsabilidade jurídica pelo consentimento para clonar é sua, não da plataforma.
A publicidade política é proibida «salvo se concedida autorização expressa por escrito», e a desinformação eleitoral e a personificação de figuras políticas ou de seus familiares são vedadas por completo. Conteúdo adulto, assim como o uso de vozes com IA em conexão com pornografia ou serviços adultos, é proibido. Se o seu trabalho toca esses terrenos, busque autorização escrita antes em vez de descobrir a restrição após publicar.
Como «filiais ou empresas distintas devem ter cada uma sua própria assinatura», uma agência que atende várias entidades clientes ou um grupo com várias subsidiárias jurídicas não pode consolidar o uso em uma única vaga. Resolva a estrutura de licenciamento na compra e não numa auditoria.
A Typecast combina com criadores cujo conteúdo depende da carga emocional e não apenas da inteligibilidade — ficção sonora, animação, trabalho de personagem, vídeo narrativo —, porque é exatamente aí que o produto investiu. Combina com equipes que publicam simultaneamente no Leste Asiático e no Ocidente, já que coreano, japonês e chinês são aqui centrais e não acessórios. Combina com desenvolvedores que constroem agentes de voz ou cadeias de legendagem, graças aos pontos de acesso em fluxo e com marcações de tempo e ao kit para seis linguagens. Combina com quem quer testar à exaustão antes de pagar, sendo a geração e a reprodução ilimitadas e gratuitas. E combina com quem deseja uma resposta clara sobre a licença das vozes, pois a posição quanto ao consentimento dos dubladores está publicada e não apenas insinuada.
Não combina com quem precise da plataforma como armazenamento duradouro: a exclusão automática em um ano vale seja qual for o nível. Não combina com organizações que pretendam cobrir várias entidades jurídicas com uma única licença, pela exigência de assinaturas separadas. Não combina com conteúdo adulto nem político, ambos restritos. Não combina com menores de 13 anos em qualquer território, nem com menores de 17 para o avatar falante. Não combina com compradores que exijam um corpo amplo de avaliações independentes antes de decidir, já que a pegada de avaliação externa é escassa diante da base de usuários declarada. E pode não combinar com quem não aceite o direito coreano nem a renúncia à ação coletiva, tratados nas limitações.
Para a maioria dos possíveis usuários a pergunta real é mais estreita do que «a Typecast é boa?». É se o controle emocional compensa o acréscimo do nível. Se basta uma narração clara e neutra, abundam opções mais baratas e o nível de entrada pode até parecer caro diante da concorrência. Mas se a interpretação é o produto — se a diferença entre um sussurro e um grito sustenta o seu conteúdo —, então o nível de 29 dólares é o ponto honesto de comparação, e o Smart Emotion revela-se uma capacidade realmente diferenciada e não um controle de altura rebatizado.
A Typecast funciona sobretudo no navegador: o editor de voz, o editor de vídeo e a interface de clonagem são todos web, sem aplicativo de desktop. Existem aplicativos móveis para iOS e Android, voltados a gerar locuções em movimento com sincronização de projetos entre dispositivos. O aplicativo iOS, registrado em nome da sociedade Neosapience, é baixado gratuitamente, exige iOS 16.4 ou posterior, traz classificação 12+, figura nas categorias de Foto e vídeo e Entretenimento, e aceita inglês e coreano como idiomas de interface. Sua versão mais recente é de agosto de 2026, sinal de manutenção ativa.
Para desenvolvedores, a superfície da plataforma é a interface de síntese de voz e não um cliente instalado, com um kit oficial para seis linguagens — Python e JavaScript, C# e Java, Kotlin e Rust —, além de uma ferramenta de linha de comando e documentação pensada para ser consumida por agentes de programação. O próprio site é bilíngue, com versões separadas em inglês e coreano, e a coreana traz a divulgação legal completa exigida pela regulamentação coreana do comércio eletrônico.
Uma ressalva de plataforma merece ênfase: como as assinaturas adquiridas nas lojas móveis não podem ser administradas na web, a plataforma pela qual você assina determina onde precisará depois cancelar ou trocar de plano.
A Typecast cobra por assinatura mensal com dez por cento de desconto na cobrança anual, e a estrutura se apoia em créditos de descarga e não em tempo de geração. Todos os níveis, inclusive o gratuito, oferecem geração e reprodução ilimitadas; os créditos só se consomem ao baixar áudio.
O nível gratuito não custa nada e fornece 3.000 créditos de descarga vitalícios, equivalentes a cerca de cinco minutos de áudio. Limita as descargas a vozes de teste, trava o áudio em 16 kHz, permite três projetos, oferece exportação de vídeo em 720p com 1 GB de armazenamento, guarda o histórico de descargas por sete dias e exige atribuição em todo conteúdo baixado. Não inclui vagas de clonagem nem gerações de avatar.
O nível Basic, a 5 dólares mensais ou 54 dólares anuais, fornece 30.000 créditos por mês (cerca de 35 minutos), abre todas as vozes com IA, eleva o áudio a 44,1 kHz, acrescenta uma vaga de clonagem instantânea, permite exportação de vídeo em 1080p sem marca d'água com 5 GB de armazenamento e torna a atribuição opcional sob licença comercial.
O nível Plus, a 19 dólares mensais ou 204 dólares anuais, fornece 40.000 créditos (cerca de 50 minutos), acrescenta o controle de velocidade e a clonagem profissional, e eleva a exportação a 4K com 30 GB de armazenamento.
O nível Pro, a 29 dólares mensais ou 312 dólares anuais, abriga a capacidade emblemática da plataforma. Fornece 75.000 créditos (cerca de 90 minutos) e acrescenta os controles emocionais, incluído o ajuste em um clique do Smart Emotion, a emoção personalizada, a entonação e a altura, além de uma segunda vaga de clonagem e 50 GB de armazenamento.
O nível Business, a 69 dólares mensais ou 744 dólares anuais, fornece 200.000 créditos (cerca de 250 minutos), permite comprar créditos adicionais e acrescenta dez vagas de clonagem, membros de equipe e 100 GB de armazenamento. Acima dele há um nível Empresarial sob consulta, cobrindo uma interface dedicada e um pacote de segurança, agentes conversacionais em tempo real e um gerente de conta designado.
Duas notas práticas acompanham a tabela. Os preços das lojas móveis podem diferir dos valores da web, e as assinaturas móveis devem ser administradas pela loja de origem. Os reembolsos são condicionados: o reembolso integral pressupõe nenhum uso de créditos, nenhuma criação de clonagem Premium e nenhuma tarefa pendente dentro de sete dias do faturamento, enquanto planos anuais além desse prazo são reembolsados descontando os meses consumidos e uma taxa de processamento.
A ElevenLabs é a alternativa mais comparada e a concorrente mais forte em realismo puro da voz e amplitude do ecossistema. A distinção honesta está na ênfase: o investimento da Typecast se concentra na interpretação emocional deduzida do contexto e numa posição de licenciamento perante os dubladores explicitamente documentada, ao passo que a ElevenLabs compete por qualidade de modelo, escala e um ferramental periférico mais largo. Compare pelo eixo que de fato lhe importa, e não pela reputação geral.
Murf e WellSaid Labs miram a narração corporativa e de ensino a distância, onde a constância e o controle da pronúncia pesam mais que o registro dramático. Para explicações de produto, módulos de treinamento e comunicação interna costumam sair mais econômicos, e a fineza emocional pela qual a Typecast cobra fica ali largamente sem uso.
Play.ht e Speechify ocupam a ponta do volume e do preço, atraindo editoras que convertem grandes acervos de texto em áudio. Sua vantagem é a economia de vazão; o contra-argumento da Typecast é a direção linha a linha, cujo valor, no entanto, é escasso quando a tarefa se resume a conversão em massa.
Os grandes provedores de nuvem — Google, Amazon e Microsoft — oferecem síntese profundamente integrada à infraestrutura e vias de compra próprias para empresas. São a escolha padrão quando se trata de embutir síntese de alto volume num ambiente de nuvem já existente. O que em geral não oferecem é um catálogo selecionado de vozes de dubladores reais acompanhado de compromissos públicos sobre consentimento, e é precisamente essa a diferença da Typecast.
Para conteúdos em coreano, japonês e chinês, a origem regional do produto constitui uma vantagem real que vale verificar diretamente. Em vez de aceitar qualquer comparação pelo que ela diz, gere o mesmo roteiro no idioma-alvo em duas plataformas e ouça: nas línguas do Leste Asiático a diferença frequentemente se inverte em relação ao ranking de reputação do mundo anglófono.
A limitação de maior alcance não é uma lacuna de recursos, mas uma regra de retenção. As produções geradas pelo serviço são mantidas por um ano a contar da criação e depois «automaticamente excluídas de nossos servidores sem aviso adicional». Os termos explicitam três pontos: cabe a você baixar o que quiser guardar; a empresa não tem obrigação de recuperar o excluído; e a política «aplica-se igualmente a todos os usuários, independentemente de plano pago ou gratuito». Baixar de novo produções anteriores só é possível enquanto permanecerem nos servidores e enquanto você mantiver uma assinatura ativa.
O áudio já baixado permanece utilizável após o cancelamento, mas a política de uso estabelece que o uso comercial é permitido «somente durante o seu período de assinatura» e que após o vencimento «nenhuma nova modificação ou descarga pode ser feita salvo prorrogação». Combinado com a regra de retenção, deixar a assinatura caducar pode encalhar em definitivo um trabalho ainda não exportado.
As produções do nível gratuito não são de uso incondicional: exige-se atribuição para tudo o que ali se baixa, as descargas limitam-se a vozes de teste e a qualidade trava em 16 kHz. O nível gratuito é um autêntico ambiente de avaliação, não uma ferramenta gratuita de produção.
O discurso comercial abre com a expressividade, mas os controles emocionais básicos, o Smart Emotion, a emoção personalizada, a entonação e a altura só aparecem a partir do nível Pro, enquanto o controle de velocidade exige no mínimo o nível de 19 dólares. O comprador atraído pelas demonstrações emocionais que assinar por 5 dólares não receberá justamente a capacidade que o atraiu.
Embora os termos confirmem que «você conserva seus direitos de propriedade sobre o seu conteúdo e possui a produção», enviar conteúdo concede à Neosapience «uma licença não exclusiva, irrevogável, mundial, integralmente paga e isenta de royalties para armazenar, reproduzir, modificar, transmitir, exibir, publicar e distribuir o seu conteúdo a fim de operar, aprimorar, promover e prestar os serviços». Leia com atenção esse alcance antes de enviar amostras de voz sensíveis: ele inclui a promoção e é irrevogável.
Os litígios regem-se pelas leis da República da Coreia e pelo processo civil coreano. Os termos acrescentam que qualquer disputa «SERÁ RESOLVIDA INDIVIDUALMENTE, SEM RECURSO A QUALQUER FORMA DE AÇÃO COLETIVA», e que toda causa de pedir «DEVERÁ SER PROPOSTA DENTRO DE UM (1) ANO APÓS O SEU SURGIMENTO». Para um usuário empresarial fora da Coreia, essas são cláusulas substanciais e não fórmulas de estilo.
Como o reembolso integral exige nenhum uso de créditos, nenhuma criação de clonagem Premium e nenhuma tarefa pendente, baixar um único arquivo ou criar um clone premium encerra esse caminho. Como a geração e a reprodução são gratuitas de qualquer modo, o percalço é evitável — mas apenas se você avaliar antes de baixar.
A exigência de que «filiais ou empresas distintas tenham cada uma sua própria assinatura» limita a implantação em agências e grupos empresariais, e além disso são necessários acordos separados para serviços de interface, criação de vozes sob medida e integração em sistemas automatizados.
Os usuários devem ter ao menos 13 anos, ou mais onde a lei local exigir, e a função de avatar falante limita-se a maiores de 17. O conteúdo proibido abrange material sexual, violência e discurso de ódio, publicidade política e desinformação eleitoral, fraude e personificação, violações da segurança infantil e ofensas à propriedade intelectual ou à privacidade. A empresa reserva-se o direito de remover conteúdo gerado «por qualquer motivo (ou sem motivo)» e de encerrar o acesso sem aviso prévio.
Trata-se de uma lacuna probatória e não de uma crítica ao produto. O perfil do domínio no Trustpilot estava não reivindicado e continha uma única avaliação com nota 3,2 no momento da verificação — amostra pequena demais para sustentar qualquer conclusão de qualidade, observando o próprio Trustpilot que a empresa «não convidou seus clientes, de modo que as avaliações podem não ser representativas». O aplicativo iOS exibia média de 3,33 a partir de apenas três avaliações, também abaixo de qualquer limiar significativo. As tentativas de verificar notas no G2 e no Capterra foram bloqueadas em todos os canais disponíveis, de modo que os números que circulam a respeito em fontes secundárias não são aqui reproduzidos. Quem avaliar a Typecast deve testá-la diretamente em vez de confiar em pontuações agregadas.
As mais de 700 vozes, os mais de 35 idiomas anunciados na página comercial (contra 37 na documentação) e os números de usuários noticiados pela imprensa provêm todos da própria empresa. Repare em quanto esse número de usuários se moveu na própria comunicação dela: a cobertura da rodada série B de 2022 falava em «mais de um milhão de usuários», enquanto a da rodada anterior à abertura de capital, em dezembro de 2025, cita «mais de dois milhões de usuários registrados no mundo». Usuários registrados não equivalem a usuários ativos, e nenhum dos dois números foi verificado de forma independente.
Como referência de estabilidade e não como aval: a empresa fechou uma rodada série B de 21,5 milhões de dólares em fevereiro de 2022 liderada pela BRV Capital Management, elevando o total captado até então a cerca de 26,7 milhões, e uma rodada anterior à abertura de capital de 11,5 milhões de dólares anunciada em dezembro de 2025 com participação de HB Investment e K2 Investment Partners. Foi fundada em 2017 por antigos engenheiros da Qualcomm. Uma rodada anterior à abertura sinaliza intenção de listar-se em bolsa, o que costuma trazer mais divulgação mas também mudanças estratégicas; nenhuma das duas coisas é garantida.
Existe um nível gratuito genuinamente utilizável, mas seu limite fica num ponto específico. A geração e a reprodução de voz são ilimitadas em todos os níveis, inclusive o gratuito: você pode experimentar sem fim sem gastar nada. O que é limitado é a descarga: o nível gratuito oferece 3.000 créditos vitalícios, cerca de cinco minutos de áudio, e são vitalícios e não mensais. As descargas gratuitas limitam-se a vozes de teste, travam em 16 kHz, restringem-se a três projetos e vídeo 720p com 1 GB de armazenamento, e exigem atribuição em tudo o que for baixado. É um nível de avaliação, não um nível de produção gratuito.
Esta é a parte mais clara da política da plataforma e um fator de diferenciação real. A política de uso assinala que «os dubladores conservam a propriedade de seus modelos de voz» e que «a réplica, distribuição ou alteração não autorizadas de uma voz sem permissão são estritamente proibidas». Sobre o consentimento, precisa que a empresa assegura que «todo dublador cujo modelo de voz esteja disponível na plataforma tenha concordado explicitamente com os casos de uso de sua voz». Acrescenta que o áudio gerado «não poderá ser alterado de modo a deturpar o dublador nem empregado em conteúdos que ele não tenha aprovado», ficando o abuso sujeito a remoção e a possíveis medidas legais. A empresa comercializa essas vozes como «vozes exclusivas de dubladores reais». Cabe precisar: trata-se de compromissos publicados pela empresa; os contratos concretos com cada dublador não são públicos e nenhuma fonte consultada divulga as condições de remuneração.
Sim, com condições que variam conforme o nível e o estado da assinatura. A partir do nível Basic a licença comercial está incluída com atribuição opcional; no plano gratuito a atribuição é obrigatória para tudo o que for baixado. A política concede «um direito não exclusivo e intransferível de usar o conteúdo de áudio gerado por meio de nossos serviços para fins pessoais ou comerciais», mas o prende ao tempo: o uso é permitido «somente durante o seu período de assinatura», após o qual você conserva o áudio já baixado sem poder realizar novas descargas ou modificações. Filiais ou empresas distintas devem ter cada uma sua própria assinatura.
Ele é excluído. As produções são mantidas por um ano nos servidores a contar da criação e depois «automaticamente excluídas de nossos servidores sem aviso adicional». Isso vale igualmente para usuários pagos e gratuitos. A exclusão atinge apenas as cópias do lado do servidor — os arquivos já baixados continuam sendo seus —, mas os termos assinalam com clareza que cabe a você salvar o que deseja guardar e que a empresa não tem obrigação de restaurar coisa alguma. Baixar de novo só é possível enquanto a produção ainda estiver retida e a sua assinatura estiver ativa.
Os planos vão de gratuito a 69 dólares mensais, com dez por cento de desconto no anual: Basic 5 dólares (30.000 créditos, todas as vozes, uma vaga de clonagem instantânea, licença comercial), Plus 19 dólares (40.000 créditos, controle de velocidade, clonagem profissional, vídeo 4K), Pro 29 dólares (75.000 créditos, controles emocionais incluído o Smart Emotion, entonação e altura, duas vagas de clonagem), Business 69 dólares (200.000 créditos, dez vagas, membros de equipe, compra de créditos), mais um nível Empresarial sob consulta. O nível de que você precisa depende do controle procurado: os controles emocionais começam em 29 dólares e o de velocidade em 19, de modo que a expressividade com que o produto é promovido é uma função do nível Pro.
O Smart Emotion deduz a interpretação do contexto em vez de exigir que você etiquete cada fala. O sistema lê o texto ao redor — na interface entregam-se explicitamente a fala anterior e a seguinte — e gera uma leitura adequada a esse contexto, de modo que palavras idênticas soam diferentes conforme o que as cerca. A empresa descreve a abordagem de base como uma análise do roteiro linha a linha para produzir um tom adequado ao contexto. As etiquetas emocionais clássicas seguem disponíveis como emoção personalizada, ao lado da entonação e da altura, a partir do nível Pro.
O site comercial anuncia mais de 700 vozes com IA e mais de 35 idiomas; a documentação da interface indica 37 idiomas por meio do modelo ssfm-v30 e mais de 500 vozes acessíveis por programação. A diferença explica-se melhor pelo fato de o catálogo web e o da interface não serem idênticos, portanto verifique a disponibilidade do idioma e da voz de que precisa a partir do nível e da interface que pretende usar. Os idiomas nomeados explicitamente na documentação incluem coreano, inglês, japonês, chinês, espanhol e vietnamita.
Sim para ambos, a partir dos níveis pagos. A clonagem instantânea cria uma voz a partir de uma amostra curta e abre-se já no Basic com uma vaga; a clonagem profissional, de maior fidelidade, aparece a partir do Plus. O número de vagas sobe para duas no Pro e dez no Business. A empresa indica que uma voz clonada pode falar vários idiomas, o que constitui a principal razão prática para clonar em vez de escolher do catálogo. Você precisa deter os direitos sobre qualquer voz que clone: os termos exigem que garanta contar com todos os direitos, licenças e consentimentos necessários, e clonar a voz de outra pessoa sem permissão é proibido.
A Typecast é operada pela Neosapience, Inc., empresa sul-coreana fundada em 2017 por antigos engenheiros da Qualcomm. O site em coreano divulga a entidade como 네오사피엔스 주식회사, com número de registro 883-86-00767, representante Taesu Kim e endereço em Gangnam-gu, Seul; essa mesma pessoa consta como responsável pela proteção de dados. Os termos regem-se pelas leis da República da Coreia, os litígios pelo processo civil coreano, e incluem renúncia à ação coletiva e prazo de um ano para reclamar. A política de privacidade afirma cumprir a lei coreana de proteção de dados pessoais juntamente com os regimes da União Europeia e do Reino Unido, a legislação californiana de privacidade e as regras norte-americanas sobre privacidade infantil on-line.
Sim, e várias são mais amplas do que se espera. Conteúdo sexual e adulto é proibido, incluído o uso de vozes com IA em serviços adultos. A publicidade política é proibida salvo autorização expressa por escrito, assim como a desinformação eleitoral e a personificação de figuras políticas ou de seus familiares. Fraude, engano, personificação não autorizada de qualquer pessoa, discurso de ódio, assédio e violações de propriedade intelectual ou de privacidade estão todos vedados. Os usuários devem ter ao menos 13 anos, e a função de avatar falante exige 17 completos. A empresa reserva-se o direito de revisar e remover conteúdo gerado a seu exclusivo critério e de encerrar contas sem aviso prévio.