
Voice.ai é uma plataforma de voz da empresa norte-americana Voice AI, Inc. que combina um alterador de voz em tempo real acelerado por GPU, síntese de voz em mais de quinze idiomas, clonagem instantânea de voz e agentes de voz telefónicos, tudo cobrado num mesmo conjunto de créditos e acessível por uma API documentada.
Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
O Voice.ai é uma plataforma de tecnologia de voz operada pela Voice AI, Inc., uma empresa norte-americana cujas marcas registadas Voice.ai® e Voice Universe® aparecem no rodapé de todas as páginas do site. O produto nasceu numa forma bem mais estreita do que a actual: uma aplicação de computador que permitia a jogadores e criadores de transmissões substituir o timbre da própria voz, ao vivo, enquanto falavam no Discord ou numa sala de voz de um jogo. Esse alterador de voz em tempo real original continua lá e continua a ser a razão pela qual a maioria das pessoas chega a este domínio. Só que a plataforma vende hoje quatro coisas distintas a partir da mesma conta, e perceber qual das quatro realmente lhe interessa é a questão mais útil a resolver antes de criar uma conta.
As quatro linhas de produto são um alterador de voz em tempo real, um motor de síntese de voz, a clonagem instantânea de voz e agentes de voz telefónicos. O título da página inicial coloca duas delas lado a lado, apresentando-se ao mesmo tempo como alterador de voz gratuito e como plataforma de agentes de voz, uma combinação invulgar porque estes dois públicos quase não têm nada em comum. De um lado, um adolescente que quer soar como uma personagem de desenhos animados num servidor de Minecraft. Do outro, uma responsável de operações que quer que as chamadas comerciais das três da manhã encontrem alguém do outro lado. O Voice.ai serve ambos a partir de uma única base de código e de um único saldo de créditos, e essa identidade dupla explica muito daquilo que se sente ao usar o produto.
A posição técnica que a empresa reivindica é mais estreita e mais interessante do que afirmar que consegue copiar qualquer voz. O fundador e director executivo Heath Ahrens formulou-a assim ao TechCrunch: a proposta de valor central da sua inteligência artificial de voz para voz não está em reproduzir com perfeição uma pessoa específica, mas em preservar os elementos essenciais da fala do utilizador, ou seja, a emoção, o ritmo e a acentuação, substituindo o som da voz para criar em tempo real um resultado inteiramente novo. Trata-se de uma demarcação deliberada face às empresas de conversão vocal cujo argumento assenta inteiramente na fidelidade a um locutor-alvo determinado. O Voice.ai optimiza para que a transformação soe natural e funcione ao vivo, não para que o clone seja indistinguível numa análise forense.
O percurso do fundador ajuda a ler estas afirmações. Ahrens fundou a iSpeech em 2007, que a página institucional descreve como a primeira plataforma de síntese de voz na nuvem, e lançou o DriveSafe.ly em 2009, a primeira aplicação a ler mensagens de texto em voz alta. Antes disso construíra também a Haystack, uma empresa de reconhecimento facial. Estamos perante um fundador que entrega interfaces de fala há quase duas décadas, o que faz com que a viragem recente para interfaces de programação e agentes de voz empresariais pareça menos uma mudança de rumo e mais um regresso ao terreno de origem.
Dois números dão ideia da escala, mas ambos têm data. Quando o TechCrunch noticiou a primeira ronda de financiamento externo em Junho de 2023, o Voice.ai contava com mais de 480 000 utilizadores e uma biblioteca de mais de 50 000 filtros de voz, e crescera exclusivamente pelo passa-palavra sobre uma base de três milhões de dólares de autofinanciamento, com uma comunidade no Discord de mais de 120 000 pessoas. A Mucker Capital e a M13 lideraram então uma ronda de seis milhões de dólares, e a M13 continua a apresentar a empresa como investimento em fase semente. Já a ficha actual da App Store descreve uma biblioteca comunitária de mais de 20 000 vozes criadas por utilizadores. Estes números contam coisas diferentes em momentos diferentes e não devem ser costurados numa única linha de tendência.
O que verdadeiramente distingue o Voice.ai de um fornecedor convencional de síntese de voz é o facto de a sua biblioteca de vozes, em boa medida, não lhe pertencer. O Voice Universe é uma biblioteca comunitária para onde os utilizadores enviam as vozes que criam e de onde outros retiram o que precisam. O registo desse nome como marca mostra quão central é a peça na identidade da empresa. O formato aproxima-se mais de um mercado ou de uma comunidade de modificações do que de um catálogo curado de timbres oficiais, e é daí que nascem simultaneamente a maior vantagem da plataforma e o seu problema mais delicado.
A vantagem está na amplitude e na velocidade. Um catálogo construído por dezenas de milhares de contribuidores cresce mais depressa e cobre mais nichos do que qualquer estúdio de gravação interno conseguiria. As dificuldades prendem-se com a variabilidade de qualidade e com a proveniência. Como qualquer pessoa pode contribuir, a qualidade é desigual: um avaliador independente observou que a qualidade do áudio se entrecortava de forma constante e que muitos dos timbres apresentados como vozes de rapariga de animação pareciam ser apenas um ajuste de altura tonal. E como os envios provêm de utilizadores, a questão de saber quem consentiu cada voz recai sobre quem envia e não sobre a plataforma, o que explica exactamente por que motivo as condições de utilização dedicam tanto espaço a este assunto.
O alterador de voz em tempo real é o produto original e continua a ser o mais exigente. Na aplicação de computador funciona com o nome Live Mode: o processamento da fala ocorre localmente na placa gráfica da máquina e o áudio transformado é depois encaminhado para outras aplicações através daquilo que Ahrens descreveu como um cabo de áudio virtual. Essa arquitectura de processamento local explica uma latência suficientemente baixa para sustentar uma conversa e explica também que a exigência de equipamento seja real e não meramente formal.
As perguntas frequentes oficiais são invulgarmente francas neste ponto. Incluem uma entrada dedicada a perguntar qual a placa gráfica mínima para poder usar o Live Mode e outra entrada separada sobre a mensagem de aviso que indica que a placa gráfica não suporta o Live Mode. Um fornecedor não redige uma mensagem de erro documentada para uma falha de equipamento se um número apreciável de utilizadores não a encontrasse. Uma análise independente relata que máquinas com placas gráficas abaixo da classe Nvidia GTX 980 ou AMD RX 580 sofrem cortes e falhas, e cita um utilizador que verificou que a aplicação consumia oitenta e sete por cento da sua placa gráfica. Convém entender o Live Mode como uma funcionalidade com um patamar mínimo de equipamento e não como uma capacidade universal.
O motor de síntese de voz é a peça que mais desenvolvimento recebeu recentemente e constitui a principal unidade de contagem do modelo de preços. O site declara compatibilidade com mais de 15 idiomas e nomeia-os: inglês norte-americano, francês, hindi, ucraniano, japonês, coreano, sueco, espanhol latino-americano, português do Brasil, chinês, neerlandês, turco, alemão e italiano. O objectivo declarado é localizar um timbre para qualquer sotaque ou idioma, o que significa que a identidade vocal e a língua são tratadas como eixos separáveis.
Os níveis pagos devolvem necessidades práticas que o nível gratuito retém. O gratuito limita cada conversão a 500 caracteres, aproximadamente um parágrafo curto; o Starter eleva esse limite para 5 000 caracteres e, sobretudo, desbloqueia a própria possibilidade de transferir os ficheiros gerados. Existe ainda um ponto de entrada mais leve chamado TTS Lite, assinalado como novidade na navegação, e um estúdio de síntese de voz incluído a partir do nível Starter.
A clonagem de voz é comercializada como uma quota por nível e não como capacidade ilimitada, o que permite ler com grande clareza quanto uso a empresa espera de cada tipo de cliente. O nível gratuito indica explicitamente que não inclui clones de voz instantâneos. O Starter inclui cinco, o Launch dez, o Core cinquenta, o Scale duzentos e o Business dois mil e duzentos. Essa escada de quotas é um dos sinais mais nítidos sobre a quem se destina cada nível.
Um pormenor merece ser assinalado porque as próprias páginas da empresa se contradizem. A página inicial afirma que com apenas 10 segundos de áudio a clonagem reproduz vozes com um realismo impressionante, ao passo que a página dedicada à clonagem indica que clonar demora apenas 15 segundos. Ambas são declarações oficiais publicadas em simultâneo, nenhuma remete para a outra e nenhuma explicação é dada para a diferença. Convém planear pelo valor mais longo e tratar o mais curto como um mínimo de marketing e não como uma especificação técnica.
A linha de agentes de voz é a mais recente e a que hoje carrega maior peso comercial: ocupa o primeiro lugar da navegação e surge assinalada como novidade. A promessa é que os agentes tratem das chamadas recebidas e efectuadas para que uma empresa deixe de as perder; a empresa descreve agentes que automatizam chamadas, respondem a perguntas, marcam encontros e conduzem conversas de ponta a ponta. Entre os destinos de integração nomeados estão o Salesforce, o HubSpot, o Zendesk e o Slack.
O que torna esta linha credível como produto e não como mera página promocional é o facto de ser tarifada em unidades próprias da telefonia. Os planos distinguem-se por chamadas em simultâneo e por número de linhas telefónicas: o Starter oferece duas chamadas simultâneas e um número, o Launch quatro e três, o Core oito e dez, o Scale dezasseis e vinte, e o Business trinta chamadas simultâneas e cinquenta números. São as restrições de uma plataforma de chamadas real e não as de uma demonstração.
Para além das quatro linhas principais, o site aloja nove utilitários de áudio gratuitos para o navegador: síntese de voz, alterador de voz em linha, melhoria de áudio, remoção de voz, remoção de eco, separação de faixas por inteligência artificial, detecção de tonalidade e andamento, remoção de reverberação e conversor de formatos. Funcionam mais como canal de captação do que como linha de negócio e são contabilizados nos mesmos créditos: o nível gratuito limita-os a cinco minutos por conversão, subindo por níveis até aos cento e oitenta minutos.
A interface de programação constitui uma linha de produto real e não uma promessa, e a prova está nos pormenores e não nas afirmações. A página para programadores expõe três interfaces, para síntese de voz, agentes de voz e clonagem, sustentadas por um ponto de acesso real em dev.voice.ai/api/v1/tts/speech e por um identificador de modelo chamado voiceai-tts-v1-latest num exemplo executável em Python. Há kits de desenvolvimento para Python e TypeScript a par de exemplos REST, a cobertura abrange a web além de iOS e Android, e é declarada compatibilidade com o LiveKit e com o Pipecat, dois enquadramentos de código aberto que os engenheiros de voz em tempo real usam de facto.
A plataforma anuncia um tempo de resposta inferior a 150 milissegundos para interacções conversacionais. É um número fornecido pelo próprio fornecedor, publicado sem condições de teste nem medições independentes, pelo que deve ser tomado como objectivo de concepção e não como medição verificada. A implantação é oferecida em quatro formas: interface alojada na nuvem, instalação nas instalações do cliente, nuvem privada dentro da rede virtual do cliente e uma opção local de baixa latência. A interface suporta ainda fluxos de agentes compatíveis com o protocolo MCP, integração de geração aumentada por recuperação para acesso dinâmico ao conhecimento, chamada de ferramentas e avisos por HTTP accionados na conclusão da geração de áudio, nas respostas do agente, em actualizações do estado da conversa e em notificações de erro e nova tentativa.
Há um requisito prévio fácil de ignorar e caro de descobrir tarde. As condições de utilização estabelecem que o uso empresarial, corporativo, através da interface de programação ou comercial de qualquer outro tipo exige um acordo separado com o Voice.ai. Obter uma chave de acesso pelo fluxo de autosserviço não equivale a estar contratualmente autorizado a lançar um produto assente nela.
Jogos, transmissões e vtubing. É o núcleo histórico da plataforma e continua a ser o seu público real mais numeroso. O TechCrunch descreveu a adopção por jogadores, criadores de conteúdo e vtubers no TikTok, Zoom, Discord, Minecraft, GTA5, Fortnite, Valorant, League of Legends, Among Us, Skype e WhatsApp. As perguntas frequentes oficiais sustentam-no com guias de resolução de problemas específicos para Discord, Skype, WhatsApp, Zoom, PUBG, Fortnite, Google Meet, League of Legends, World of Warcraft, Among Us, Minecraft, TeamSpeak, Telegram e Viber. Se o seu caso consta dessa lista, alguém já documentou as falhas possíveis por si.
Tratamento de chamadas recebidas e efectuadas. A linha de agentes de voz visa empresas que perdem oportunidades por não atenderem o telefone. A escala por chamadas simultâneas e números permite dimensionar com honestidade: um negócio de um só espaço em fase de teste cabe folgadamente nas duas chamadas simultâneas do Starter, ao passo que uma operação que precise de cinquenta números se situa no território do Business.
Locução e narração. A página de clonagem menciona podcasts, videojogos e locução profissional, e descreve a possibilidade de gerar milhares de horas de conteúdo de voz sem dizer uma palavra. O verdadeiro facilitador está no nível Starter, onde surgem pela primeira vez a transferência de ficheiros e uma licença comercial: sem transferência, o nível gratuito não consegue alimentar nenhuma cadeia de produção real.
Localização multilingue. Uma vez que a identidade vocal e a língua são tratadas como separáveis, o mesmo timbre pode ser localizado para outro sotaque ou outro idioma entre os catorze idiomas nomeados. Para quem mantém uma mesma personalidade de canal em vários mercados, isso é bastante mais útil do que escolher uma voz de catálogo diferente por idioma.
Acessibilidade e expressão da identidade. A página de ética nomeia dois grupos de forma explícita. Descreve a ferramenta como uma via para que pessoas transgénero obtenham a voz que desejam sem treino vocal nem intervenção médica, e assinala que para pessoas com uma deficiência ou doença como cancro da garganta, esclerose lateral amiotrófica ou doença de Parkinson o produto representa uma melhoria potencial face à síntese de voz convencional. O TechCrunch confirmou de forma independente o primeiro desses públicos, a par de utilizadores preocupados com a privacidade e de quem explora novas identidades em linha.
Ocultação da voz por privacidade. Um caso distinto do entretenimento: participar em conversas de voz sem expor a voz real. A abordagem da empresa, que preserva emoção e ritmo enquanto substitui o timbre, ajusta-se melhor a este objectivo do que um filtro mecânico.
Grave material de origem limpo para os clones. A qualidade do clone está limitada pelo material de partida. Uma sala silenciosa, uma distância constante ao microfone e frases naturais em vez de listas de palavras produzem modelos claramente melhores do que um excerto curto gravado com ruído de fundo.
Forneça mais áudio do que o mínimo indicado. Dado que os dois números do próprio site divergem entre dez e quinze segundos, trate-os como patamares mínimos. Uma amostra mais longa e mais variada dá ao modelo uma cobertura fonética mais completa.
Decida deliberadamente se publica um clone da sua própria voz. Enviá-lo torna essa voz disponível numa biblioteca de onde outros retiram material. A recomendação central de segurança da Comparitech é não enviar um modelo treinado com a voz própria, por poder ser usado por terceiros em burlas por voz, embora o mesmo texto esclareça que se trata de uma propriedade geral das plataformas de clonagem e não de uma particularidade deste produto. Verifique as definições de visibilidade da sua conta antes de assumir que um clone permanece privado.
Verifique a definição de treino do metamodelo. As condições indicam que, ao usar os serviços, consente que a empresa utilize o seu equipamento para treino do metamodelo e para fins de cálculo, e que todos os utilizadores podem desactivar esta função a qualquer momento. Não especificam se vem activada ou desactivada por omissão, por isso confirme por si em vez de supor.
Reserve margem de placa gráfica se jogar e transformar em simultâneo. O Live Mode disputa a mesma placa gráfica que o jogo. Numa placa no limite, o resultado combina perda de fluidez no jogo e artefactos na transformação.
Verifique antes de subscrever, não depois. Vários avaliadores independentes criticam a mesma coisa: preços que só se vêem depois da instalação. Como a página de preços é pública e detalhada, leia-a no navegador antes de instalar seja o que for.
Guarde provas de consentimento para vozes de terceiros. Se clonar a voz de outra pessoa, as condições exigem autorização legal explícita dessa pessoa, e a cláusula de indemnização coloca do seu lado as consequências de um erro. Guardar uma permissão escrita é a forma prática de cumprir esse requisito.
Não construa um produto de voz concorrente a partir dos resultados. As condições proíbem expressamente usar as saídas para treinar, desenvolver ou melhorar modelos de voz, para criar novas vozes sintéticas ou produtos derivados, ou para apoiar um produto concorrente.
Jogadores, criadores de transmissões e vtubers com equipamento adequado constituem o público que melhor encaixa na vertente de tempo real. Se tiver uma placa gráfica de jogo de gama média ou superior e passar tempo no Discord ou em conversas de voz multijogador, está no terreno próprio do produto, e a biblioteca comunitária é aqui que se apresenta mais rica.
Criadores com volume moderado de locução ficam bem servidos a partir do nível Starter, onde surgem a transferência e a licença comercial. Os catorze idiomas nomeados tornam a ferramenta viável para quem publica em vários mercados.
Pequenas empresas que perdem chamadas recebidas são o alvo da linha de agentes de voz. Os níveis mais baixos colocam ao alcance um piloto verdadeiro: um número e duas chamadas simultâneas por cinco dólares mensais é uma forma realista de confirmar se o atendimento automatizado serve a um negócio concreto antes de assumir compromissos.
Programadores que constroem funcionalidades de voz em tempo real obtêm uma interface documentada com kits nomeados e compatibilidade de enquadramentos, desde que fechem o acordo comercial separado exigido pelas condições.
Pessoas que precisam de outra voz por razões de identidade ou acessibilidade são mencionadas de forma explícita na página de ética, e o TechCrunch identificou de forma independente este público como uma categoria em crescimento.
Quem deve procurar noutro lado: quem tenha gráficos integrados ou um portátil antigo e queira transformação em tempo real, porque nenhum plano compensa o patamar mínimo de equipamento; quem precise de certeza contratual sobre a titularidade dos resultados e a ausência de infracção, porque as condições excluem exactamente isso; e quem não possa tolerar uma política estrita de não reembolso.
A aplicação de computador é o cliente mais completo e o único lugar onde funciona a transformação em tempo real do Live Mode; é distribuída a partir do instalador do próprio site. As suas capacidades são limitadas pela placa gráfica da máquina tanto quanto pelo nível de subscrição.
A plataforma web cobre a síntese de voz, a consola de agentes de voz e as nove ferramentas de áudio em linha, e funciona sem requisitos de equipamento local porque o processamento ocorre no servidor. É o ponto de entrada adequado para avaliar a ferramenta.
Em telemóveis, a aplicação para iOS é publicada pela Voice AI Inc. Segundo os dados da interface oficial da Apple, mantém uma classificação de 4,0 em 189 avaliações, uma classificação de conteúdo a partir dos 12 anos, transferência gratuita, exigência de iOS 18.0 ou posterior, primeira publicação em Maio de 2023 e versão 2.0.5 de Julho de 2026. As próprias perguntas frequentes da empresa documentam uma diferença de capacidades relevante: incluem entradas a perguntar se a aplicação móvel serve para alterar a voz em tempo real e por que motivo ainda não dispõe dessa função, pelo que telemóvel e computador não são equivalentes. A cobertura do TechCrunch em 2023 descrevia aplicações para Mac, PC, Android e iOS; as opções de transferência actuais do site mostram um instalador para Windows e a ligação para a App Store, e a situação no Android não pôde ser confirmada por fontes oficiais no momento da redacção, pelo que convém verificar directamente no site.
Para o acesso programático, a interface cobre web, iOS e Android, com implantação possível em nuvem alojada, nas instalações do cliente, em nuvem privada dentro da sua própria rede virtual ou localmente com baixa latência.
Os preços são públicos na página de tarifas do site e organizam-se em sete níveis medidos por uma dotação mensal de créditos, com a facturação anual anunciada como dois meses gratuitos.
| Nível | Preço mensal | Créditos/mês | Clones instantâneos | Chamadas simultâneas | Números |
|---|---|---|---|---|---|
| Free | 0 $ | 5k | Nenhum | — | — |
| Starter | 5 $ | 15k | 5 | 2 | 1 |
| Launch | 24 $ (primeiro mês 12 $) | 200k | 10 | 4 | 3 |
| Core | 99 $ | 1M | 50 | 8 | 10 |
| Scale | 330 $ | 4M | 200 | 16 | 20 |
| Business | 880 $ | 22M | 2 200 | 30 | 50 |
| Enterprise | sob consulta | sob consulta | — | — | — |
O sistema de créditos é a parte que vale mesmo a pena compreender bem, porque os créditos são uma unidade partilhada gasta a taxas diferentes consoante a função. No nível Core, esse mesmo milhão de créditos compra ou 1 000 minutos de síntese de voz, ou 1 000 minutos de chamadas de agente, ou 15 000 minutos de processamento com as ferramentas de áudio. A síntese de voz e os minutos de agente têm preço equivalente entre si, ao passo que o processamento com ferramentas de áudio fica cerca de quinze vezes mais barato por minuto. No nível gratuito a dotação é bastante apertada na prática: 5 000 créditos dão para cinco minutos de síntese de voz ou três utilizações das ferramentas de áudio.
Outros limites ligados ao nível moldam a experiência tanto quanto a quantidade de créditos. Os caracteres por conversão passam de 500 no gratuito para 5 000 a partir do Starter. A duração por conversão das ferramentas de áudio sobe de cinco minutos no gratuito para dez, vinte, sessenta e finalmente cento e oitenta minutos. As gerações simultâneas de síntese de voz aumentam de três no Starter para quinze no Scale e no Business. O nível Enterprise acrescenta condições à medida sobre acordos de tratamento de dados e níveis de serviço, acordos específicos para clientes sujeitos à regulamentação HIPAA, início de sessão único personalizado, limites de simultaneidade elevados e apoio prioritário.
Duas questões sobre pagamento merecem ênfase antes de subscrever. As condições estabelecem que, salvo indicação em contrário no momento da compra ou exigência legal, todos os pagamentos não são reembolsáveis, tanto mensalidades como encargos por utilização e compras pontuais, com excepções discricionárias que a empresa não está obrigada a conceder. Além disso, vários avaliadores independentes assinalam que os preços só aparecem depois da instalação, algo que a página pública de tarifas torna desnecessário aceitar: leia-a antes.
O ElevenLabs é a referência em fidelidade de clonagem e síntese de voz expressiva, e a cobertura do TechCrunch colocava o Voice.ai na mesma categoria ampla, assinalando ao mesmo tempo a reputação do ElevenLabs por uma clonagem inquietantemente boa. Se a sua necessidade é narração sintética da máxima qualidade e não exige transformação ao vivo, essa é a opção mais directa.
O Respeecher ocupa o extremo profissional da conversão de voz para voz, com percurso em produção de cinema e televisão. É a comparação pertinente quando se trata de reproduzir um locutor-alvo específico com qualidade de emissão em vez de transformar uma voz ao vivo.
O Voicemod é o concorrente mais directo na vertente de tempo real para jogos, e a caixa de serviços relacionados do Trustpilot coloca-os lado a lado, mostrando o Voicemod com 1,7 em 5 em 456 avaliações face ao 2,0 em 233 avaliações do Voice.ai. Ambas as notas são baixas e ambas as fichas trazem as reservas de amostragem discutidas mais abaixo.
O Murf e a Acapela foram citados pelo TechCrunch entre os fornecedores estabelecidos de simulação de voz, e situam-se mais perto da produção de locução tradicional do que da transformação ao vivo.
As plataformas especializadas em agentes de voz são a comparação pertinente apenas para a vertente telefónica. Se a única necessidade for automatizar chamadas e a alteração de voz for irrelevante, compare o nível de agentes do Voice.ai com plataformas conversacionais dedicadas pela simultaneidade, pelas funções de telefonia e pela documentação de conformidade, e não pelo tamanho da biblioteca de vozes.
A transformação em tempo real tem um patamar mínimo de equipamento. O Live Mode depende do processamento local na placa gráfica. A empresa documenta tanto um requisito mínimo como um aviso próprio para placas não suportadas, e os testes independentes relatam cortes em equipamento abaixo da classe aproximada de uma GTX 980 ou RX 580, com um utilizador a reportar uma ocupação de 87 % da sua placa gráfica. Nenhum nível de subscrição levanta esta restrição.
O telemóvel não iguala o computador. As perguntas frequentes oficiais colocam e respondem elas próprias por que motivo a aplicação móvel ainda não oferece alteração de voz em tempo real. Quem persiga esse uso no telemóvel deve confirmar o estado actual antes de pagar.
Dois números oficiais sobre a duração da clonagem contradizem-se. Dez segundos na página inicial, quinze na página de clonagem, publicados em paralelo e sem conciliação.
As classificações da comunidade são baixas e a amostragem não é neutra. O Trustpilot mostra 2,0 em 5 em 233 avaliações, com uma distribuição marcadamente bimodal: 82 % de uma estrela, 14 % de cinco estrelas e quase nada pelo meio. A ficha está reclamada desde Agosto de 2023, a empresa convida activamente os clientes a avaliar e respondeu a 100 % das avaliações negativas. Uma amostra formada por convite difere sistematicamente de uma espontânea, pelo que esta nota deve ser lida a par dos outros canais e não em substituição deles. A classificação da App Store, de 4,0 em 189 avaliações, é bastante mais favorável com uma dimensão de amostra comparável, e o resumo do Trustpilot sobre 59 avaliações recentes centra-se em subscrições automáticas, cobranças de renovação inesperadas e ausência de resposta do apoio, mais do que na qualidade do áudio em si.
As queixas sobre facturação coincidem entre fontes independentes. A Comparitech aponta preços ocultos até depois da instalação e um processo de reembolso estrito e trabalhoso que exige registo separado. A Onerep relata preços e limites de experimentação pouco claros, bem como utilizadores cobrados após cancelarem. As próprias condições confirmam que o não reembolso é a regra por omissão.
O produto continua a ser descrito como versão beta. A avaliação da Onerep de Janeiro de 2026 indica que o Voice.ai permanece em beta em 2026, apresentando isso como explicação para as falhas encontradas pelos utilizadores.
Os direitos comerciais são enunciados de forma incoerente. A página de tarifas inclui uma licença comercial a partir do Starter, ao passo que as condições afirmam por duas vezes que os serviços são prestados apenas para uso pessoal e não comercial e que o uso empresarial, corporativo ou através da interface de programação exige um acordo separado. O site não explica como se articulam. Quem planeie uma implantação comercial deve obter a posição por escrito.
Sem garantia sobre resultados nem sobre as vozes. As condições estabelecem que a empresa não garante que qualquer resultado ou activo de voz esteja livre de infracção, autorizado para o uso pretendido ou adequado a um fim concreto, e que todas as vozes são geradas pelos utilizadores, não assumindo a empresa responsabilidade por elas. A cláusula de indemnização coloca as reclamações de terceiros do lado do utilizador.
As suas contribuições treinam os modelos. O material enviado concede uma licença perpétua, irrevogável, mundial, isenta de royalties e sublicenciável que cobre expressamente o treino e o aperfeiçoamento dos modelos da empresa e o desenvolvimento de novos produtos. A empresa compromete-se a não comercializar a sua voz de forma autónoma sem permissão explícita, mas esse compromisso é bem mais estreito do que a promessa de não a usar para treino.
Contribuir com capacidade de cálculo faz parte das condições. A utilização dos serviços traz consigo o consentimento para que o seu equipamento seja usado no treino do metamodelo, desactivável a qualquer momento mas sem valor por omissão declarado.
A documentação sobre privacidade carece de concretização. A Onerep relata que não é especificado método de cifragem, não é indicado prazo de conservação e não é oferecida opção de eliminação fora da Califórnia. A Comparitech observa que o serviço não atende ao sinal Do Not Track. Ainda assim, o veredicto global da Comparitech é que o produto é seguro com precauções, não tendo encontrado fugas de dados nem acções judiciais.
As afirmações de conformidade não vêm sustentadas. O site declara conformidade plena com o Regulamento Geral sobre a Protecção de Dados e com os referenciais SOC 2 e HIPAA, além de toda a regulamentação empresarial relevante, sem publicar relatórios de auditoria nem identificadores de certificação. Os compradores empresariais devem solicitar a documentação subjacente.
Idade e jurisdição. A utilização exige ter pelo menos 18 anos. A lei aplicável é a do Delaware, com jurisdição exclusiva dos seus tribunais, o que é relevante para utilizadores fora dos Estados Unidos.
Existe um nível verdadeiramente gratuito, mas é estreito. Oferece 5 000 créditos mensais, equivalentes a cerca de cinco minutos de síntese de voz ou três utilizações das ferramentas de áudio; limita as conversões a 500 caracteres; não inclui qualquer clone de voz instantâneo; e não permite transferir os ficheiros gerados. Os níveis pagos começam em cinco dólares por mês. Vários avaliadores independentes criticaram a distância entre a promoção como alterador de voz gratuito e o alcance do que fica atrás da barreira de pagamento, pelo que convém tratar o nível gratuito como mecanismo de avaliação e não como plano de trabalho.
Este ponto é genuinamente ambíguo e merece ser esclarecido por escrito antes de nele confiar. A página de tarifas inclui uma licença comercial como prestação a partir do nível Starter. As condições de utilização, por seu lado, afirmam em dois lugares distintos que os serviços são prestados apenas para uso pessoal e não comercial e que o uso empresarial, corporativo ou através da interface de programação exige um acordo separado com a empresa. O site não concilia estas formulações. Acresce que as condições excluem qualquer garantia de que os resultados estejam livres de infracção ou autorizados para o uso pretendido.
Sim. As condições só permitem enviar ou gerar conteúdo de áudio em três situações: usar a sua própria voz, dispor de autorização legal explícita da pessoa cuja voz é usada, ou o seu uso estar claramente permitido pela lei aplicável, por exemplo como paródia ou sátira. Usar o software para se fazer passar por pessoas reais, vivas ou falecidas, com intenção de enganar, defraudar ou induzir em erro é proibido e pode implicar a cessação imediata do acesso, acções judiciais e colaboração com as autoridades. Note-se a tensão com a descrição da App Store, que promove a possibilidade de soar como qualquer pessoa, de celebridades a personagens de ficção: o que vincula são as condições e não o texto da loja.
Não, e é aqui que muita gente tropeça. As condições incluem uma cláusula intitulada «No License to Voices» que estabelece que não é concedido qualquer direito sobre vozes, modelos de voz, clones ou identidades vocais disponíveis através dos serviços, incluindo as vozes enviadas por outros utilizadores, e que o facto de um activo de voz estar publicamente disponível não confere permissão para o usar, reproduzir, distribuir ou comercializar. Estar visível no Voice Universe não equivale a uma licença.
Uma placa gráfica dedicada, e razoavelmente capaz. O Live Mode processa o áudio localmente na placa gráfica, e as perguntas frequentes oficiais documentam tanto um requisito mínimo como um aviso explícito para placas não suportadas. Os testes independentes relatam que equipamento situado aproximadamente abaixo da classe Nvidia GTX 980 ou AMD RX 580 produz uma saída entrecortada, e um utilizador reportou uma ocupação de 87 % da sua placa gráfica. Já as funções do lado do servidor, ou seja, síntese de voz, ferramentas de áudio e agentes de voz, não impõem restrições deste tipo.
O site declara mais de 15 idiomas e nomeia o inglês norte-americano, o francês, o hindi, o ucraniano, o japonês, o coreano, o sueco, o espanhol latino-americano, o português do Brasil, o chinês, o neerlandês, o turco, o alemão e o italiano, com a capacidade declarada de localizar um timbre para outro sotaque ou outro idioma.
A empresa responde directamente a ambas as acusações na sua página de segurança, indicando que a aplicação é enviada com regularidade a fabricantes de antivírus, entre os quais McAfee, Google e Avast, com publicação dos resultados do VirusTotal, e que a sua função de cálculo distribuído não tem qualquer relação com criptomoedas ou mineração, sendo a capacidade cedida usada apenas para construir vozes, treinar modelos e processar a voz de utilizadores com dispositivos menos potentes. Duas avaliações independentes concordam no essencial: a Comparitech concluiu que o produto é seguro com precauções, não tendo encontrado fugas de dados nem acções judiciais, e a Onerep concluiu que não é um vírus, nem um minerador, nem ilegal de usar. Ambas, porém, levantam reservas distintas sobre a transparência da facturação e a documentação de privacidade, e a principal recomendação de segurança da Comparitech é evitar enviar um modelo treinado com a voz própria.
O material enviado concede à empresa uma licença perpétua, irrevogável, mundial, isenta de royalties, sublicenciável e não exclusiva que abrange o funcionamento do serviço, o treino e o aperfeiçoamento dos seus modelos e o desenvolvimento de novas funcionalidades e produtos. A empresa declara que não comercializará a sua voz de forma autónoma sem permissão explícita. Em separado, usar o serviço implica consentir que o seu equipamento seja usado no treino do metamodelo, função desactivável a qualquer momento. Avaliadores independentes observam que a política de privacidade não especifica métodos de cifragem nem prazos de conservação e que o direito de eliminação só é oferecido a residentes na Califórnia.
Por omissão, não. As condições estabelecem que, salvo indicação em contrário no momento da compra ou exigência da lei aplicável, todos os pagamentos não são reembolsáveis, incluindo mensalidades, encargos por utilização e compras pontuais, ficando as excepções ao critério exclusivo da empresa, sem qualquer obrigação da sua parte. Avaliadores independentes descrevem o processo de reembolso como estrito e com registo separado, e as queixas sobre subscrição e renovação constituem o tema mais frequente no resumo de avaliações recentes do Trustpilot.
Sobretudo naquilo que optimiza. Ahrens formulou a diferença de forma explícita: a proposta central não é reproduzir com perfeição uma pessoa específica, mas preservar a emoção, o ritmo e a acentuação de quem fala enquanto se substitui o timbre, e fazê-lo em tempo real. O ElevenLabs e o Respeecher estão construídos em torno da fidelidade a uma voz-alvo para conteúdo acabado. O Voice.ai está construído em torno da transformação ao vivo, de uma biblioteca de vozes alimentada pela comunidade e, agora, de agentes telefónicos. Se precisa de reproduzir um locutor específico com qualidade de emissão, os especialistas encaixam melhor; se precisa de soar diferente ao vivo numa partida ou numa chamada, este é o terreno próprio deste produto.