TTSMaker é um serviço gratuito de texto para voz que roda no navegador: você cola um texto e recebe um arquivo de áudio para ouvir ou baixar. São dois acessos: o conversor aberto em ttsmaker.com, que dispensa conta, e o TTSMaker Pro em pro.ttsmaker.com, com cotas pagas de caracteres, editor de diálogos com várias vozes e API.
É um conversor, não um estúdio. Entra texto, sai MP3 ou WAV; nas páginas verificadas para esta ficha não há linha do tempo de edição nem ponto de entrada para clonagem de voz. O resumo do próprio fornecedor o apresenta como uma ferramenta gratuita de texto para voz que oferece serviços de síntese de fala e suporta vários idiomas, e o FAQ do site descreve a mesma coisa como um gerador de voz com IA.
Duas coisas o separam da maioria dos planos gratuitos dessa categoria. O plano gratuito não é um teste: o fornecedor anuncia uma versão gratuita permanente para os usuários e reserva o direito de ajustar as políticas correspondentes no futuro. E os direitos comerciais vêm com a saída gratuita, não com um upgrade — a licença publicada concede um direito de uso não exclusivo, irrevogável, mundial e perpétuo sobre os arquivos de áudio gerados.
O custo está do outro lado: os arquivos somem em minutos e o nível gratuito traz captchas e anúncios.
O catálogo é anunciado com mais de 600 vozes de IA em mais de 100 idiomas. O detalhe que a maioria das listagens omite: o teto de uma conversão é definido por voz, não por conta. Na lista de vozes convivem entradas marcadas como Limit Per Conversion: 20000 characters ao lado de outras marcadas como Limit Per Conversion: 300 characters, de modo que escolher a voz é escolher quanto texto cabe numa passada.
Dentro da biblioteca há um segundo nível: as vozes sinalizadas como unlimited. Todo plano, inclusive o gratuito, lista mais de 20, e a saída delas não consome a cota semanal de caracteres. Isso, porém, é política e não garantia: o fornecedor reserva o direito de ajustar o número de vozes, a disponibilidade (adicionar ou remover vozes) e a velocidade de síntese.
O áudio é exportado em MP3, OGG, AAC, OPUS ou WAV, e o MP3 tem ajuste padrão e de alta qualidade; em alta qualidade o tamanho do arquivo convertido costuma dobrar. Dois extras são incomuns nessa faixa de preço: o conversor gera um arquivo de legendas com marcação de tempo para o áudio recém-produzido, e dá para colocar música de fundo sob a locução, com até 3 arquivos BGM na versão gratuita que expiram em 6 horas, contra 20 uploads nos planos pagos. Um modo somente de escuta converte apenas os primeiros 50 caracteres para avaliar a voz.
Um editor de diálogos à parte monta conversas a partir de blocos, cada um com idioma e voz próprios, converte o texto de cada bloco em fala e junta todos os blocos em um único arquivo de áudio. O teto gratuito é apertado: até 5 blocos de diálogo, 200 caracteres por bloco e no máximo 5 diálogos gerados por semana. Contas pagas ampliam isso para 300 projetos de diálogo com até 100 blocos cada, e a versão gratuita não inclui função de salvamento para eles.
Marcas de pausa dentro do texto são mais confiáveis do que acrescentar silêncio na edição; elas contam em milissegundos, e a API expõe o mesmo mecanismo como parâmetro na faixa 0-10000 ms, com 0 por padrão.
A API v2 tem duas chamadas principais: uma devolve a lista de vozes com identificadores e tetos de caracteres, e a outra cria um pedido de conversão e devolve, em vez do áudio, uma URL para um arquivo temporário que é apagado depois de 2 horas. Por isso, coloque o download no mesmo job que cria o pedido.
A lista de cenários do fornecedor gira em torno de três tarefas, cada uma esbarrando numa restrição concreta do produto:
Os desenvolvedores acrescentam um quarto padrão: wrappers em Python de terceiros publicados numa plataforma pública de hospedagem de código, e um deles se descreve como uma biblioteca Python para interagir com a API do TTSMaker e converter texto em fala.
Boa escolha se você é:
Má escolha se você é:
Há uma incoerência que importa para quem desenvolve: a mesma página de documentação diz que a URL temporária vale 24 horas e, mais abaixo, que o arquivo é apagado depois de duas horas. Planeje pelo número menor.
A cobrança conta caracteres, não minutos, porque a duração do áudio depende do idioma, da voz e das configurações de velocidade. A faixa que decide qual plano você precisa: 300,000 caracteres rendem cerca de 6.9 horas de áudio em inglês, 4.3 horas em espanhol e mais de 14 horas em chinês por causa das diferenças de idioma. A tabela de planos foi capturada no estado de cobrança anual; a aba de cobrança mensal não chegou a ser renderizada nessa passagem, então abaixo só os valores anuais estão confirmados.
| Plano | Cobrança anual | Cota de caracteres | Máximo por conversão |
|---|---|---|---|
| Free | Gratuito | 20,000 por semana | 500 |
| Lite | $119.88 por ano, economia de $36 | 300,000 por mês | 10,000 |
| Pro Mini | $227.88 por ano, economia de $60 | 600,000 por mês | 20,000 |
| Pro Max | $299.88 por ano, economia de $96 | 1,200,000 por mês | 20,000 |
| Studio | $1296 por ano, economia de $384 | 6,000,000 por mês | 30,000 |
Os níveis também diferem em anúncios e captchas, número de inserções de pausa, vagas de hospedagem e de música de fundo, emissão de faturas e metas de resposta por e-mail que apertam de 72h no Lite para 24h no Studio. O acesso à API começa no Pro Mini, e pacotes extras de caracteres são vendidos à parte aos assinantes.
A comparação mais útil vem de fora do fornecedor. Uma resenha editorial independente de geradores de voz com IA escolheu o TTSMaker como sua opção gratuita, citando o uso comercial permitido mesmo nas vozes gratuitas e mais de 600 vozes em 100 idiomas, das quais 20 podem ser usadas de graça sem limite — e, na mesma entrada, julgou que a interface parece básica diante de ElevenLabs ou Speechify. Ganha em direitos e preço, perde em acabamento.
Três situações pedem outra ferramenta: quando a voz é o entregável e será julgada como interpretação; quando é preciso clonagem de voz, que nenhuma página verificada aqui oferece; e quando um fluxo de trabalho precisa de ativos hospedados duradouros em vez de um link que expira.
Um alerta na hora de comparar: diretórios de ferramentas de IA de terceiros carregam números desatualizados, e um deles ainda mostra mais de 200 vozes de IA, em contradição com a tabela oficial de planos atual.
É a restrição operacional mais importante, e três páginas oficiais dão três números diferentes:
As linhas da tabela de planos combinam com uma diferença por plano — 30 minutos de histórico no gratuito, 24h nos pagos — mas os textos de licença e de privacidade não delimitam assim o alcance, então a divergência continua sem solução. De todo modo o hábito seguro é o mesmo: baixe o áudio e o arquivo de legendas assim que a conversão terminar.
Minutos, não dias. Os números publicados divergem — 30 minutos na licença, 60 minutos na política de privacidade do Pro, 24 horas nos termos — e todos são curtos o bastante para que baixar na hora seja o único hábito seguro. Uma resenha independente alerta o mesmo: o TTSMaker guarda seus arquivos por apenas 30 minutos antes de apagá-los.
Não. O acesso à API exige assinatura Pro ou Studio, uma chave por conta e uma requisição por segundo. Contas Free e Lite não têm suporte de API algum.
O cancelamento é possível a qualquer momento, com acesso até o fim do ciclo de cobrança. Os reembolsos são mais estreitos: em até 30 dias se nenhum caractere foi consumido, em até 7 dias após a cobrança se menos de 500 foram consumidos, sem reembolso parcial e com apenas um reembolso por conta antes de as compras serem bloqueadas.