Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Ferramentas de IA
  4. Fish Audio
Prévia da interface do Fish AudioVisitar Website
Logotipo do Fish Audio

Fish Audio

O Fish Audio é uma plataforma de síntese de voz e clonagem de voz construída em torno do controle da emoção palavra a palavra. Ele clona uma voz a partir de uma amostra de dez segundos, transmite com menos de 300 milissegundos de latência e publica os pesos do modelo S2, ainda que sob uma licença limitada à pesquisa e a usos não comerciais. É operado pela Hanabi AI Inc.

Ferramentas de IAGeração de ÁudioFerramenta de Áudio#Texto para fala#Código aberto#Multilíngue
Experimentar Grátis
Salvos
Visitas
Visualizações
Preço
Grátis
Publicado
25 de ago. de 2026
Domínio
fish.audio
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Fish Audio

Experimentar Grátis
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Grátis
Publicado
25 de ago. de 2026
Domínio
fish.audio
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Experimentar Grátis

O que é o Fish Audio?

O Fish Audio é uma plataforma de inteligência artificial de voz erguida sobre uma convicção central: pronunciar bem as palavras e dizer bem uma frase são dois problemas distintos, e a maioria dos sistemas de síntese de voz só resolveu sempre o primeiro. A página inicial organiza as capacidades em três eixos — síntese de voz, clonagem de voz e reconhecimento de voz — e os três se apoiam numa família de modelos chamada S2.

O que de fato define este produto é o controle da expressão até o nível da palavra. O sistema não recita o roteiro de forma uniforme: ele aceita etiquetas em linguagem natural embutidas no próprio texto, e são essas etiquetas que ditam como cada trecho é dito. A área de demonstração da página inicial deixa à vista o conjunto completo de etiquetas de emoção, que abrange raiva, tristeza, constrangimento, ênfase, sussurro, suavidade, voz soprada e entusiasmo, ao lado de um grupo à parte de etiquetas especiais para riso, risinho, pigarro, soluço, suspiro, ofego e pausas curtas e longas. A descrição técnica do repositório de código do próprio projeto é mais precisa que o texto comercial: fala de um controle fino da prosódia e da emoção abaixo do nível da palavra por meio de etiquetas em linguagem natural, com suporte nativo a vários falantes e a diálogos de várias trocas.

A empresa que o opera não é anônima, embora convenha desembaraçar os nomes. O rodapé do site indica que os direitos pertencem à Hanabi AI Inc. Já o arquivo de licença de código aberto exige uma atribuição que aponta para outra entidade, cujo texto original a nomeia 39 AI, INC. Este artigo registra ambos os nomes sem fundi-los, porque o site não explica a relação entre eles.

O financiamento e a escala vêm do anúncio da própria companhia. O Fish Audio levantou 52 milhões de dólares numa rodada semente ao completar seu primeiro ano. A rodada foi liderada em conjunto por duas instituições: a primeira se chama Coreline Ventures e a segunda, Capital Today. Entre os demais participantes figuram, entre outros, 359 Capital e Play Time, além de HF0 e 645 Ventures. O mesmo texto relata o crescimento da equipe de três para vinte e duas pessoas, uma receita recorrente anual que passou de zero a 21 milhões de dólares, mais de 8 milhões de criadores e desenvolvedores na plataforma e mais de 2 milhões de modelos de voz na biblioteca da comunidade. Todos esses indicadores de negócio são declarados pela própria empresa e não passaram por auditoria independente, de modo que devem ser lidos como afirmações dela e não como grandezas verificadas. O texto também nomeia a direção: a diretora-executiva Rissa Cao, que menciona vários anos de inteligência artificial de voz na Amazon e na Meta, e o diretor científico Shijia Liao, ex-engenheiro de pesquisa da NVIDIA, que começou treinando os modelos no próprio quarto com uma única placa de vídeo 4090.

As duas perguntas que vale resolver antes de usar

Há dois aspectos deste produto que merecem um exame mais rigoroso do que uma lista de recursos oferece, e este artigo trata ambos em detalhe em vez de mencioná-los de passagem. O primeiro: o que a plataforma realmente exige em matéria de consentimento quando você clona a voz de alguém. O segundo: o que significa aqui «código aberto», porque a licença não pertence à classe permissiva que esse termo costuma sugerir. Nenhuma das respostas é motivo para descartar o produto, mas ambas mudam o modo como convém utilizá-lo.

Funcionalidades principais

Clonagem de voz a partir de dez segundos

O argumento sobre a clonagem é concreto e, algo incomum nesta categoria, apoia-se em números e não em adjetivos. A página do produto indica que bastam dez segundos de áudio de referência, que a latência de transmissão é inferior a 300 milissegundos de ponta a ponta e que a clonagem funciona sem exemplos prévios em treze idiomas. Ou seja: você clona uma vez e essa mesma voz fala os demais idiomas suportados, sem retreinamento nem uma segunda sessão de gravação.

É essa última propriedade que mais transforma os fluxos de trabalho. A dublagem tradicional exige ou um intérprete bilíngue ou uma voz diferente por idioma, com o resultado de que um mesmo conteúdo soa como outra pessoa em cada mercado. A clonagem translíngue sem exemplos prévios significa que uma identidade vocal gravada uma única vez pode percorrer um catálogo inteiro.

Uma síntese de voz que se pode dirigir

É do lado da síntese que o sistema de etiquetas de emoção mostra sua utilidade. Em vez de escolher dentro de uma lista fechada de «estilos», você anota o próprio texto, e as etiquetas agem exatamente onde aparecem. Por isso importa a menção ao nível inferior à palavra: enfatizar uma palavra específica dentro de uma frase é uma capacidade diferente de fixar um clima para a frase inteira, e é aí que se decide a diferença entre uma leitura que soa como leitura e outra que soa como interpretação.

Reconhecimento de voz e o restante da linha

A plataforma abrange muito mais do que um ponto de acesso de síntese. O menu de produtos reúne oito ferramentas independentes: síntese de voz, reconhecimento de voz, clonagem de voz, transformação de voz, Story Studio, separação de vozes, tradução de áudio e geração de efeitos sonoros. Do lado do reconhecimento, anuncia-se que a transcrição incorpora vários falantes, etiquetas de emoção e uma descrição em linguagem natural; o que se obtém, portanto, é uma transcrição estruturada e não um simples bloco de texto.

A biblioteca de vozes da comunidade

A plataforma hospeda uma vasta biblioteca de vozes enviadas por usuários — mais de 2.000.000 segundo sua própria contagem — apresentada como adequada à narrativa criativa, à publicidade e aos audiolivros. Em amplitude, é uma vantagem real. Ao mesmo tempo, é a parte do produto mais entrelaçada com as questões de consentimento tratadas adiante, porque uma biblioteca desse tamanho é preenchida pelos usuários e não montada peça a peça pela empresa.

Pesos de modelo publicados e auto-hospedagem

Os pesos do modelo de código aberto S2 estão publicados, e o site promove a auto-hospedagem em pé de igualdade com a interface hospedada. Medido por indicadores da comunidade, o repositório não é pequeno: no momento da consulta exibia 32.400 estrelas, 2.800 bifurcações, 101 pessoas contribuintes e 14 versões publicadas, e descreve a si mesmo como um projeto de síntese de voz de código aberto de primeira linha. O que essa licença permite de fato é tratado em seção própria adiante, e a resposta acaba sendo bem mais estreita do que o termo costuma insinuar.

Casos de uso

Audiolivros e narração de longa duração. A própria empresa formula assim: cinco segundos é fácil, cinco minutos é a prova. A síntese de voz é aceitável na escala da frase há uma década, mas as rachaduras aparecem assim que a duração aumenta. A narração extensa é justamente o terreno onde as etiquetas de emoção e o controle de ritmo se pagam, porque uma leitura plana se torna insuportável muito antes do segundo capítulo.

Locução de vídeo no ritmo da produção. Transformar um roteiro em narração ajustada à imagem sem reservar estúdio é o uso mais frequente deste tipo de ferramenta. Poder mudar o tom e acrescentar emoção sem regravar é o que barateia a iteração.

Vozes de personagem para jogos e animação. A plataforma mira explicitamente esse terreno e o encaixe é real: as mídias interativas exigem muitas vozes distintas, muitas vezes mais do que um projeto consegue custear com intérpretes reais, e é preciso regerar tudo sempre que um diálogo muda.

Agentes de conversa e atendimento ao cliente. Aqui, uma latência de transmissão inferior a 300 milissegundos não é número de vitrine. Um agente de voz que trava de forma perceptível antes de cada resposta parece quebrado por melhor que soe a voz, de modo que a latência é requisito funcional e não um extra agradável.

Localização multilíngue a partir de uma única gravação. A clonagem translíngue sem exemplos permite gravar uma vez e manter a mesma identidade vocal nos idiomas suportados. É útil para criadores cujo público se espalha por regiões, embora convenha ler antes a seção sobre o número de idiomas.

Implantação auto-hospedada por motivos de latência ou de dados. Como os pesos estão publicados, equipes com exigências rígidas sobre onde os dados residem, ou com infraestrutura própria de inferência, podem executar o modelo por conta própria em vez de enviar áudio a terceiros. Ainda assim, se o seu uso específico é permitido, quem decide é a licença — e é disso que trata a seção correspondente.

Como usar o Fish Audio

Passo 1 — teste a demonstração antes de se cadastrar. A página inicial traz um campo de síntese funcional, já preenchido com um texto que exibe o sistema de etiquetas, com limite de 30.000 caracteres e as paletas de etiquetas à vista. É a forma mais rápida de julgar se esse controle expressivo funciona para o seu caso.

Passo 2 — crie uma conta gratuita. O plano gratuito não exige cartão e oferece 8.000 créditos mensais, até sete minutos de geração, no máximo 500 caracteres por geração e três espaços de voz públicos.

Passo 3 — decida primeiro entre a biblioteca existente e a clonagem própria. Para muitos trabalhos, a biblioteca já disponível é o caminho mais rápido e contorna por completo a questão do consentimento. A clonagem serve para quando você realmente precisa de uma identidade vocal específica: idealmente a sua, ou uma para a qual tenha permissão documentada.

Passo 4 — grave ou selecione dez segundos de referência limpos. Dez segundos é o mínimo declarado. A qualidade da referência pesa mais que a duração: quanto mais limpa a fonte, melhor o clone, e a página do produto admite que uma amostra maior pode ajudar com vozes muito expressivas.

Passo 5 — escreva o roteiro com etiquetas, não só com palavras. É o passo que quem começa menos aproveita. Colocar a ênfase sobre a palavra que de fato sustenta o sentido da frase, ou uma pausa longa onde uma pessoa tomaria fôlego, é o que separa um resultado que soa a máquina de outro que soa interpretado.

Passo 6 — verifique seus direitos comerciais antes de publicar. Não é uma formalidade dispensável. Como se detalha adiante, a condição comercial do plano gratuito aparece descrita de forma contraditória no site, e errar significa publicar conteúdo monetizado sem ter os direitos.

Passo 7 — passe à interface quando o volume justificar. A documentação para desenvolvedores e a referência da interface ficam num subdomínio próprio, e os planos pagos dão acesso cobrado por uso.

Dicas e boas práticas

Etiquete pouco e com critério. As etiquetas de emoção são ferramenta de direção, não enfeite. Etiquetar cada oração produz uma interpretação instável; marcar apenas os dois ou três momentos que realmente sustentam o peso emocional de um trecho, ao contrário, soa deliberado.

Invista na gravação de referência e não em repetir gerações. Um clone herda a acústica de sua fonte. Dez segundos captados com um microfone decente num cômodo silencioso superam um minuto de áudio de telefone com ruído, e nenhuma regeneração resgata uma referência defeituosa de origem.

Faça o orçamento em créditos, não em minutos. A conversão publicada é de cerca de 600 a 625 créditos por minuto gerado. Diante dos 8.000 créditos mensais do plano gratuito, isso dá quase exatamente os sete minutos anunciados. Conhecer a conversão transforma a comparação de planos em cálculo e não em suposição.

Lembre-se de que os créditos não se acumulam. As cotas mensais são reiniciadas no começo de cada ciclo de cobrança e os minutos não usados não passam para o mês seguinte, de modo que um plano dimensionado para o seu mês de pico é desperdício nos meses calmos.

Teste o seu idioma antes de se comprometer. Como se detalha adiante, o suporte a idiomas aparece expresso de quatro maneiras distintas nas próprias páginas do site, e o repositório aberto contém relatos de falhas ativos sobre determinadas escritas. Gerar uma amostra representativa no seu idioma de destino custa alguns créditos e encerra a questão.

Use espaços privados para tudo que for sensível. As condições de licença sobre os envios públicos são bem mais amplas que sobre os privados, e o conteúdo público pode continuar disponível após a exclusão da conta. Escolher o tipo de espaço é uma decisão sobre direitos e não uma preferência de arquivamento.

Para quem é o Fish Audio?

Para criadores que produzem em volume. Quem faz vídeo, podcast ou cursos e narra com regularidade obtém o retorno mais claro, porque a economia cresce com a quantidade produzida.

Para estúdios de jogos e animação com muitos personagens. Projetos que exigem elenco amplo, ou cujos diálogos mudam com frequência, se beneficiam mais do que aqueles com roteiro pequeno e fixo.

Para quem desenvolve agentes de voz. A combinação de interface documentada, transmissão abaixo de 300 milissegundos e pesos publicados cobre tanto a opção hospedada quanto a auto-hospedada.

Para equipes de localização. A clonagem translíngue responde a um problema real e caro do conteúdo destinado a vários mercados.

Para pesquisadores e entusiastas. Os pesos publicados são realmente utilizáveis em pesquisa e em trabalhos não comerciais — exatamente o caso que a licença foi escrita para permitir.

Quem deve ter cautela. Quem planeja uma implantação auto-hospedada com fins comerciais precisa ler antes a seção sobre a licença, porque ali a resposta padrão é negativa. Quem precisa de compromissos explícitos do fornecedor sobre o tratamento de dados biométricos deve observar o que a política de privacidade diz e, mais ainda, o que ela não diz. E quem pretende clonar uma voz que não é sua precisa mais da seção sobre consentimento do que de qualquer lista de recursos.

Plataformas

O Fish Audio é sobretudo um aplicativo web, utilizável em qualquer navegador recente sem instalação. A via para desenvolvedores é uma interface documentada no estilo REST junto de kits de desenvolvimento; a documentação e a referência ficam num subdomínio próprio.

Existem aplicativos móveis: os termos de serviço incluem uma seção específica que reconhece que sua disponibilidade depende de lojas de terceiros, nomeia expressamente a App Store da Apple e o mercado de aplicativos do Android, e exige cumprir também as condições próprias dessas lojas.

A auto-hospedagem é uma terceira via promovida oficialmente. A página do produto expõe as opções sem rodeios: implantar o modelo por conta própria, chamar o ponto de acesso de transmissão abaixo de 300 milissegundos, ou levar as vozes aos seus agentes e aplicativos. Quais dessas opções estão abertas a você é a licença que determina.

As opções de implantação corporativa são apresentadas à parte e incluem a instalação em infraestrutura própria, a ausência de retenção de dados e a conformidade com SOC2, com preços personalizados por volume e cobrança anual.

Uma última nota sobre acesso: o arquivo robots.txt do site abre acesso completo aos rastreadores do Google, da Apple e do Bing, ao mesmo tempo que impede os rastreadores gerais nas rotas de autenticação e de síntese de voz.

Preços e planos

Os preços foram conferidos diretamente na página de planos. Vale registrar que, no momento da consulta, duas promoções se sobrepunham: três meses grátis no pagamento anual e um desconto de aniversário de 50%. Os valores mensais equivalentes abaixo refletem, portanto, essas promoções, e os preços de referência aparecem ao lado.

Plano gratuito. 0 dólar, sem cartão. Inclui 8.000 créditos mensais, até sete minutos de geração, no máximo 500 caracteres por geração, três espaços de voz públicos, velocidade de geração padrão e clonagem de voz aprimorada.

Plus. 5,5 dólares por mês em equivalente, cobrados 66 dólares ao ano, ante um preço mensal de referência de 15 dólares. Inclui 250.000 créditos mensais, até 200 minutos, no máximo 15.000 caracteres por geração, espaços públicos ilimitados mais 10 privados, geração prioritária, acesso ao Voice Design e um espaço de voz profissional.

Pro. 37,5 dólares por mês em equivalente, cobrados 450 dólares ao ano, ante 100 dólares de referência. Inclui 2.000.000 de créditos mensais, até 1.620 minutos, três assentos de equipe, no máximo 30.000 caracteres por geração, espaços ilimitados, cinco espaços profissionais e garantia de reembolso de sete dias.

Max. 749 dólares por mês em equivalente, cobrados 8.988 dólares ao ano, ante 999 dólares de referência. Inclui 25.000.000 de créditos mensais, até 6.250 minutos, dez assentos de equipe e quinze espaços profissionais.

Empresarial. Preço personalizado por volume com cobrança anual, voltado a organizações com exigências de conformidade, com cobrança por uso e controles no nível da organização, ausência de retenção de dados, instalação em infraestrutura própria e conformidade com SOC2.

Como funciona o sistema de créditos

A conversão publicada é de cerca de 600 a 625 créditos por minuto gerado. As cotas mensais são reiniciadas no começo de cada ciclo de cobrança e os minutos não usados não são transferidos.

A contradição sobre os direitos comerciais

Este ponto merece ser apontado sem rodeios, porque determina diretamente se você pode publicar o que gera — e o site se contradiz dentro de uma mesma página.

A lista de recursos do plano gratuito, na página de preços, inclui o item «uso comercial». As perguntas frequentes situadas mais abaixo nessa mesma página afirmam o contrário: quem tem assinatura paga pode empregar com fins comerciais as vozes verificadas de sua propriedade, ao passo que quem usa o plano gratuito só pode destinar o conteúdo gerado a projetos pessoais e não comerciais. As perguntas frequentes da página inicial coincidem com essa leitura restritiva e são ainda mais explícitas: o plano gratuito é apenas para uso pessoal, e para monetizar ou explorar comercialmente as vozes é preciso passar a um plano pago e obter assim direitos comerciais completos.

Ou seja, duas fontes oficiais afirmam que o gratuito se limita ao uso pessoal, enquanto uma lista oficial de recursos diz o oposto. Este artigo registra ambas as leituras sem conciliá-las, porque conciliá-las equivaleria a adivinhar. O prudente é tomar a leitura restritiva como a vigente e confirmar com o fornecedor antes de monetizar qualquer resultado obtido no plano gratuito: o custo de errar recai inteiramente sobre quem publica.

Alternativas

O ponto de comparação mais citado nesta categoria é o ElevenLabs, e o Fish Audio participa dessa comparação diretamente: o site mantém uma seção específica de comparativos e seu próprio mapa do site inclui uma página que se coloca como alternativa a esse concorrente. Posicionar-se de forma explícita diante desse ator consolidado é uma decisão deliberada, e convém que quem avalia o produto tenha em mente que uma página comparativa publicada por um fornecedor sobre seu concorrente é material promocional e não uma avaliação independente.

As afirmações da empresa nesse terreno são autodeclaradas e devem ser lidas como tais: seu anúncio de financiamento sustenta que o S2.1 Pro foi preferido por 66% dos ouvintes em relação a modelos concorrentes de destaque em testes de escuta às cegas. O anúncio não acompanha esse número de metodologia, tamanho de amostra nem composição do painel, de modo que ele não pode ser verificado de forma independente a partir dessa única fonte.

Ainda assim, o verdadeiro eixo alternativo não é outro fornecedor hospedado, e sim a escolha entre construir e comprar que os pesos publicados abrem. Para pesquisa e trabalhos não comerciais, executar o modelo por conta própria é uma opção real que a maioria dos concorrentes não oferece. Para trabalhos comerciais, essa opção exige licença à parte, e a comparação volta então a ser uma avaliação comum de serviço hospedado.

Limitações e considerações

O consentimento na clonagem de voz: o que a plataforma exige de fato

Esta é a pergunta mais importante, e a resposta honesta é a seguinte: a responsabilidade recai quase inteiramente sobre quem usa a ferramenta, e a plataforma não realiza qualquer verificação prévia.

A formulação mais clara está nas perguntas frequentes da página de clonagem e merece registro fiel: cabe a quem usa confirmar que dispõe dos direitos, consentimentos e comunicações exigidos para qualquer voz que clonar, e cumprir a legislação aplicável, inclusive a relativa a nome, imagem e conteúdos gerados por inteligência artificial em sua região. A mesma resposta descreve a postura de aplicação: a plataforma não autoriza de antemão casos de uso específicos e pode remover conteúdos ou contas que infrinjam seus termos ou a lei. O mecanismo é, portanto, uma retirada posterior e não um filtro anterior à clonagem.

Chama atenção que, nos documentos juridicamente vinculantes, não exista exigência alguma de consentimento. A seção dos termos dedicada a permissões e restrições enumera dezessete proibições, da (a) à (q), e nenhuma trata especificamente do consentimento para clonar uma voz. A mais próxima é a cláusula geral (a), que proíbe contribuir com qualquer coisa que viole direitos de propriedade intelectual ou quaisquer outros direitos de terceiros. A garantia sobre as contribuições dos usuários é igualmente genérica: proíbe contribuições que violem direitos autorais ou outros direitos de terceiros, como marca ou privacidade. Nenhuma impõe a obrigação concreta de manter um consentimento documentado para uma voz clonada.

Há ainda uma tensão entre a linguagem sobre consentimento e o texto comercial dessa mesma página. A chamada principal da página de clonagem convida justamente ao uso contra o qual essa cláusula adverte: fazer um chefe de Estado em exercício narrar seu aplicativo de relacionamentos, apresentar sua pior ideia com a voz de um bilionário da tecnologia ou montar um programa composto só por convidados fictícios. As perguntas frequentes da mesma página reforçam essa expectativa ao observar que a maioria dos trechos de figuras públicas, cortes de programas ou gravações de qualidade telefônica funciona já na primeira tentativa. Exibir a clonagem de figuras públicas reconhecíveis no lugar mais visível e colocar ao lado um aviso para que se obtenha o consentimento delas é uma incoerência real, e quem lê deve pesar os dois lados.

Os termos impõem, sim, uma obrigação correlata: não difundir conteúdo de forma enganosa, o que inclui apresentá-lo como inteiramente produzido por pessoas. A plataforma incentiva a revelar por iniciativa própria o recurso à inteligência artificial, mas formula isso como recomendação e não como obrigação. No rodapé há um canal para denunciar abusos.

A conclusão prática é nítida. Se você clona a própria voz, nada disso o limita. Se clona a de outra pessoa, a plataforma não vai impedir nem verificar, mas ao mesmo tempo declina sua responsabilidade e transfere a exposição jurídica integralmente para o seu lado — uma exposição que, conforme a jurisdição, pode ser considerável.

O que «código aberto» significa aqui e o que não significa

O site insiste repetidamente na abertura: apresenta o modelo S2 de código aberto como característica de destaque, a auto-hospedagem como via suportada, e o repositório se descreve como um projeto de síntese de voz de código aberto de primeira linha respaldado por 32.400 estrelas. Os pesos estão de fato publicados, e isso é verdadeiro. Mas a licença não é permissiva, e a diferença é decisiva no plano comercial.

O repositório diz sem rodeios: este código e os pesos de modelo associados são publicados sob a FISH AUDIO RESEARCH LICENSE, com a advertência de que se agirá diante de qualquer infração. Essa licença, atualizada pela última vez em 7 de março de 2026, expõe seu propósito já na introdução: o acordo pretende permitir gratuitamente os usos de pesquisa e não comerciais dos materiais, e qualquer uso comercial exige uma licença à parte concedida pelo Fish Audio.

A seção III elimina toda ambiguidade: qualquer uso dos materiais ou de obras derivadas com finalidade comercial exige um acordo de licença escrito e independente com o Fish Audio, e o presente acordo não concede direito comercial algum. As licenças comerciais são tratadas pelo endereço profissional que consta da própria licença.

A definição de «finalidade comercial» é ampla o bastante para abarcar a maioria dos usos empresariais: compreende criar, modificar ou distribuir seu produto ou serviço, inclusive por meio de um serviço hospedado ou de uma interface de programação; as operações internas da sua empresa ou organização; e qualquer uso vinculado a um produto ou serviço pelo qual você cobre ou gere receita, de forma direta ou indireta. Basta o uso interno dentro de uma empresa: não é preciso revender o modelo.

Outras duas diferenças em relação às licenças permissivas merecem atenção. A autorização de pesquisa é descrita como não exclusiva, mundial, intransferível, não sublicenciável, revogável e isenta de royalties; revogável é a palavra determinante e não tem equivalente nas condições permissivas habituais. E a distribuição traz obrigações de atribuição: um arquivo de aviso atribuindo os direitos a 39 AI, INC., além de exibir de forma destacada a expressão «Built with Fish Audio» num site associado ou na documentação do produto. A licença também proíbe empregar os materiais ou suas saídas para criar ou aprimorar qualquer modelo fundacional de inteligência artificial generativa.

Convém registrar uma lacuna. A licença incorpora por referência uma política de uso aceitável e faz de seu cumprimento uma condição da licença, mas esse documento não pôde ser localizado. Várias rotas candidatas retornam todas erro 404, e nenhuma página desse tipo aparece no mapa do site estático do fornecedor, que traz apenas a página inicial, a de descoberta, a do gerador de voz, a de clientes, a empresarial, a de alternativa ao concorrente, os termos, a privacidade e as informações legais para o Japão. Que uma condição vinculante remeta a um documento que quem a usa não consegue consultar é um problema de documentação que convém esclarecer com o fornecedor antes de se apoiar nesta licença.

Em resumo: pesos abertos, sim; código aberto no sentido permissivo, não. A pesquisa e o uso amador são gratuitos e estão realmente permitidos. Qualquer uso comercial, inclusive o interno de uma empresa, exige um acordo pago à parte, insinue o que insinuar a página comercial.

O que a política de privacidade não aborda

A política de privacidade traz data de vigência de 28 de agosto de 2024. Uma verificação do texto completo não encontrou nele nenhuma ocorrência das palavras «voice», «biometric» nem «train». Para um produto cuja função central consiste em captar e reproduzir vozes humanas, a ausência de qualquer disposição específica sobre voz ou dados biométricos constitui uma lacuna de fundo; significa também que a política nada diz sobre se o conteúdo dos usuários é empregado para treinar ou aprimorar modelos. À luz das evidências disponíveis, a formulação honesta é que a política silencia sobre esses pontos, e não que exista ou deixe de existir alguma proteção específica.

O áudio enviado é enquadrado na categoria genérica de conteúdo de usuário, que a política define como as informações pessoais incluídas nas entradas, nos arquivos enviados ou nos comentários fornecidos ao serviço. Entre os terceiros elencados para essa categoria figuram prestadores de serviços, parceiros de publicidade, parceiros de análise e parceiros comerciais.

A licença que você concede sobre os próprios envios

Os termos são bem mais precisos sobre os direitos que você cede do que sobre os que conserva. As licenças concedidas à plataforma sobre as contribuições dos usuários são isentas de royalties, perpétuas, sublicenciáveis, irrevogáveis e de alcance mundial.

A exclusão tem, por consequência, limites. Ao encerrar a conta, a plataforma deixa de exibir suas contribuições a outras pessoas usuárias, com a exceção expressa das contribuições públicas, que podem continuar plenamente disponíveis; além disso, os termos reconhecem que pode ser impossível apagá-las por completo de seus registros.

As contribuições públicas suportam as condições mais amplas de todas: incluem o direito de usar, exibir, executar e distribuir a contribuição pública com fins de marketing e promoção, além de uma licença a todas as demais pessoas usuárias para acessá-la e exercer direitos sobre ela. Essa é a razão concreta pela qual escolher entre espaço privado e público é uma decisão sobre direitos. É também o pano de fundo útil para entender a biblioteca comunitária de mais de 2 milhões de vozes: ela existe precisamente porque os envios públicos carregam essas condições.

O suporte a idiomas é expresso de quatro maneiras

As páginas oficiais oferecem quatro números incompatíveis entre si, e este artigo registra todos sem tirar média. A página de clonagem fala em funcionamento translíngue sem exemplos prévios em treze idiomas. A seção sobre a interface na página inicial menciona mais de trinta idiomas. As perguntas frequentes da página de síntese enumeram apenas oito — inglês, japonês, coreano, chinês, francês, alemão, árabe e espanhol — e anunciam à parte suporte automático a oito idiomas com sotaque nativo. O anúncio de financiamento reivindica mais de 83 idiomas com cadência nativa.

É possível que essas afirmações descrevam coisas distintas: clonagem contra síntese, ou suporte pleno contra suporte na medida do possível. Mas o site não explica a distinção, então verifique seu idioma na prática em vez de confiar num número isolado.

Os relatos da comunidade reforçam essa cautela. O repositório aberto contém questões ativas apontando que a entrada em gurmukhi para o punjabi trata mal os sinais de geminação e nasalização, junto de um pedido correlato para melhorar a pronúncia do punjabi por meio de transliteração latina sensível a diacríticos ou de conversão de grafemas em fonemas. No momento da consulta, o repositório exibia 7 questões abertas ante 684 fechadas: uma proporção de manutenção saudável, mas também um indício de qualidade desigual conforme o idioma.

Outras considerações

Não há revisão de conteúdo antes da publicação. O próprio aviso legal do repositório coloca assim: não se assume responsabilidade alguma por uso ilícito do código, e convém recorrer à legislação local, entre outras a relativa aos direitos autorais no ambiente digital. Somado à ausência de autorização prévia, a responsabilidade é deslocada de forma sistemática para a ponta seguinte.

Engenharia reversa e modelos concorrentes são proibidos. Os termos proíbem tentar obter o código-fonte, os componentes subjacentes dos modelos ou os algoritmos, e proíbem à parte utilizar as saídas do serviço para desenvolver modelos que concorram com ele.

Requisitos de idade. É preciso ter ao menos 13 anos, menores de 18 precisam de permissão dos responsáveis, e a plataforma declara não coletar deliberadamente informações identificáveis de crianças menores de 16 anos.

Os dados de diretório envelhecem depressa. A categoria armazenada para esta ficha era «moda», com etiquetas que incluíam «moda» e «modelos prontos» — claramente equivocadas para um produto de síntese de voz — e sua descrição mencionava mais de 1.000 vozes quando o site já reivindica mais de 2.000.000. Produtos que avançam rápido deixam para trás suas fichas de diretório: confira os números atuais no site.

Perguntas frequentes (FAQ)

Q1. O Fish Audio é gratuito?

Existe um plano gratuito real que não exige cartão e oferece 8.000 créditos mensais, até sete minutos de geração, um limite de 500 caracteres por geração e três espaços de voz públicos. Se você pode explorar comercialmente esse resultado é algo que o site deixa verdadeiramente confuso: a lista de recursos do plano gratuito menciona uso comercial, enquanto as perguntas frequentes dessa mesma página e as da página inicial afirmam ambas que o resultado do plano gratuito se limita a uso pessoal e não comercial. Adote a leitura restritiva e confirme com o fornecedor antes de monetizar qualquer coisa.

Q2. Preciso de permissão para clonar a voz de outra pessoa?

A plataforma coloca essa responsabilidade inteiramente sobre você e não faz verificação prévia. Suas perguntas frequentes sobre clonagem indicam que cabe a você confirmar que dispõe dos direitos, consentimentos e comunicações exigidos para qualquer voz que clonar, e cumprir as normas sobre nome, imagem e conteúdos gerados por inteligência artificial da sua região. Acrescenta que não autoriza de antemão casos de uso específicos e que pode remover conteúdos ou contas posteriormente. Note que os termos vinculantes não contêm qualquer cláusula que exija especificamente o consentimento para clonar uma voz — apenas proibições genéricas de violar direitos alheios — enquanto o texto comercial dessa mesma página do produto sugere ativamente clonar figuras públicas. Juridicamente, a exposição é sua.

Q3. O modelo é realmente de código aberto?

Os pesos estão de fato publicados, mas a licença não é permissiva. Tanto o código quanto os pesos são difundidos sob a licença de pesquisa do Fish Audio, que em sua introdução assinala pretender permitir gratuitamente a pesquisa e os usos não comerciais, enquanto qualquer uso comercial exige licença à parte. Sua seção III não concede direito comercial algum. Grátis para pesquisa, estudo e uso amador; acordo pago independente para todo o resto.

Q4. Posso auto-hospedar para a minha empresa?

Sob a licença pública, não. Sua definição de finalidade comercial inclui expressamente criar, modificar ou distribuir seu produto ou serviço, inclusive por meio de um serviço hospedado ou de uma interface, as operações internas da sua organização e qualquer uso vinculado a um produto ou serviço que gere receita direta ou indiretamente. Basta o uso interno numa empresa para ativá-la. É preciso um acordo escrito à parte, obtido pelo endereço profissional indicado na licença. Note ainda que a autorização de pesquisa é revogável, diferentemente das licenças permissivas habituais.

Q5. Quanto áudio é preciso para clonar uma voz e qual é a qualidade?

O mínimo declarado são dez segundos de fala limpa, e a página do produto assinala que uma amostra maior pode ajudar com vozes muito expressivas. A qualidade da referência importa mais do que a duração: uma amostra curta e limpa supera uma gravação longa com ruído. A plataforma indica ainda que a clonagem é translíngue sem exemplos prévios em treze idiomas, de modo que uma única gravação se estende aos demais idiomas suportados sem retreinamento.

Q6. Quantos idiomas ele suporta de fato?

O site dá quatro respostas distintas, e este artigo não escolherá uma por você. A página de clonagem fala em treze idiomas para a clonagem translíngue; a inicial, em mais de trinta; as perguntas frequentes da página de síntese enumeram oito idiomas e anunciam suporte automático a oito idiomas com sotaque nativo; e o anúncio de financiamento reivindica mais de 83. Provavelmente descrevem capacidades distintas, mas o site não esclarece qual é qual. Gere uma amostra de teste no seu idioma de destino antes de se comprometer: o repositório aberto contém relatos de falhas ativos sobre determinadas escritas, inclusive o tratamento dos sinais de geminação e nasalização em gurmukhi para o punjabi.

Q7. Quanto custa além do plano gratuito?

No momento da consulta havia quatro planos pagos, com promoções sobrepostas. O Plus sai a 5,5 dólares por mês cobrados 66 dólares anuais ante 15 dólares de referência, com 250.000 créditos mensais. O Pro sai a 37,5 dólares por mês cobrados 450 dólares anuais ante 100 dólares de referência, com 2.000.000 de créditos e três assentos de equipe. O Max sai a 749 dólares por mês cobrados 8.988 dólares anuais ante 999 dólares de referência, com 25.000.000 de créditos e dez assentos. O plano Empresarial é personalizado e cobrado anualmente. Cerca de 600 a 625 créditos equivalem a um minuto de geração, e os créditos não usados não são transferidos.

Q8. Minha voz enviada é usada para treinar os modelos deles?

A política de privacidade não diz. Uma verificação do texto completo não encontrou «train», «voice» nem «biometric» em ponto algum; o documento entrou em vigor em 28 de agosto de 2024. Não existe, portanto, compromisso público algum num sentido ou no outro sobre esse ponto, e seria incorreto afirmar uma proteção que o documento não contém. O áudio enviado é enquadrado na categoria genérica de conteúdo de usuário, entre cujos destinatários elencados figuram prestadores de serviços e parceiros de publicidade, de análise e comerciais. Se isso pesa na sua conformidade, pergunte diretamente ao fornecedor e note que o plano empresarial destaca a ausência de retenção de dados como característica à parte.

Q9. O que acontece com minhas vozes se eu excluir a conta?

A exclusão é parcial e não completa. Os termos indicam que, ao encerrar a conta, a plataforma deixa de exibir suas contribuições a outras pessoas usuárias, mas excluem expressamente as contribuições públicas, que podem continuar plenamente disponíveis, e reconhecem que uma remoção completa de seus registros pode ser impossível. Como as licenças concedidas são perpétuas, sublicenciáveis e irrevogáveis, e as contribuições públicas concedem ainda direitos promocionais e acesso a todas as demais pessoas usuárias, escolher um espaço privado em vez de público é uma decisão de fundo e não uma preferência de arquivamento.

Q10. Quem está por trás do Fish Audio e em que estágio está a empresa?

O rodapé nomeia a Hanabi AI Inc., ao passo que a licença de código aberto exige atribuição a 39 AI, INC. Ambos os nomes ficam aqui registrados, e o site não explica a relação entre eles. A companhia anunciou 52 milhões de dólares numa rodada semente ao completar seu primeiro ano; uma das instituições que a lideraram se chama Coreline Ventures e a outra instituição líder é a Capital Today. Seu próprio anúncio menciona uma equipe de vinte e duas pessoas, 21 milhões de dólares de receita recorrente anual, mais de 8 milhões de usuários na plataforma e mais de 2 milhões de modelos de voz comunitários, e nomeia a diretora-executiva Rissa Cao e o diretor científico Shijia Liao. Esses números de negócio são autodeclarados e não passaram por auditoria independente.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos