Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Tecnologia de voz
  4. Deepgram
Prévia da interface do Deepgram
Logotipo do Deepgram

Deepgram

O Deepgram vende APIs de fala para texto, texto para fala e Voice Agent cobradas por minuto ou por 1.000 caracteres, com crédito inicial de $200, endpoints regionais e auto-hospedagem para clientes corporativos elegíveis.

Tecnologia de vozFerramentas de desenvolvimentoDesenvolvimento de IA#Texto para fala#API#Transcrição
Experimentar Grátis
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
6 de out. de 2026
Domínio
deepgram.com
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Deepgram

Experimentar Grátis
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
6 de out. de 2026
Domínio
deepgram.com
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Experimentar Grátis

O que é Deepgram?

O Deepgram é uma plataforma de IA de voz oferecida como APIs para desenvolvedores: fala para texto para áudio ao vivo e gravado, texto para fala, uma Voice Agent API e análises com Audio Intelligence. O Deepgram combina fala para texto, texto para fala e orquestração de LLM em uma única Voice Agent API, o que, segundo a empresa, reduz complexidade, latência e custo.

Em janeiro de 2026, o Deepgram anunciou ter captado US$ 130 milhões em uma rodada Série C liderada pela AVP, com avaliação de US$ 1,3 bilhão. A empresa também informou que mais de 1.300 organizações usam seus produtos e modelos de IA de voz, entre elas a ferramenta de anotações de reuniões Granola, a startup de agentes de voz Vapi e a Twilio.

Principais funcionalidades

A API de fala para texto do Deepgram aceita áudio em streaming para transcrição em tempo real ou arquivos gravados para processamento em lote.

Modelos de fala para texto

  • Flux STT: o Flux STT é um modelo de reconhecimento de fala conversacional para agentes de voz em tempo real, com detecção de turnos e tratamento de interrupções integrados em 10 idiomas. Sua opção multilíngue abrange inglês, espanhol, francês, alemão, hindi, russo, português, japonês, italiano e holandês.
  • Nova-3: o Nova-3 é posicionado para transcrição em produção, com robustez a ruídos e suporte multilíngue em mais de 50 idiomas. A página de preços traz um número menor, dizendo que os modelos Nova suportam mais de 45 idiomas com diarização de locutores, formatação inteligente, indicação de termos-chave e detecção automática de idioma.
  • Nova-2: o Nova-2 continua recomendado para idiomas que o Nova-3 ainda não suporta e para identificar palavras de preenchimento.
  • Modelos ajustados por setor: miram o vocabulário e a estrutura de áreas como saúde, jurídico e finanças.
  • Modelos personalizados: podem ser treinados com conjuntos de dados proprietários ou inéditos para áudios de casos extremos.

Os números de precisão e velocidade são informados pelo próprio fornecedor. O Deepgram diz que o Nova-3 tem taxa de erro por palavra 54,2% menor em streaming e 47,4% menor em processamento em lote do que os concorrentes. Também diz que entrega transcrições em menos de 300 milissegundos. A indicação de termos-chave é descrita como uma melhoria no reconhecimento de palavras críticas, com revocação de palavras-chave até 90% maior.

Texto para fala

  • Flux TTS: o Flux TTS mantém tom, ritmo e registro emocional ao longo de toda a sessão, sem SSML, tags de estilo ou engenharia de prompts. O Deepgram diz que a saída do Flux TTS começa em apenas 80 ms, mesmo sob carga de produção. Quando quem liga interrompe, a API informa o que essa pessoa de fato ouviu.
  • Aura-2: o Aura-2 é o modelo da linha com maior cobertura de idiomas, com vozes em sete idiomas.
  • Aura: o Aura é o modelo TTS de primeira geração do Deepgram e oferece apenas vozes em inglês.

Voice Agent API

A Voice Agent API inclui detecção de interrupções, previsão de turnos, chamada de funções e controle durante a sessão. As equipes podem usar seu próprio provedor de LLM ou TTS e manter a orquestração e o pipeline de streaming do Deepgram.

O Deepgram oferece LLMs gerenciados para os tipos de provedor OpenAI, Anthropic, Google e NVIDIA, então não é preciso endpoint para eles. Modelos do Groq e do Amazon Bedrock precisam do seu próprio endpoint, porque o Deepgram não gerencia esses LLMs. Os modelos gerenciados têm um nível de preço: o claude-sonnet-4-5 aparece como Advanced (Avançado) e o claude-haiku-4-5 como Standard (Padrão), e o nível define a tarifa por minuto.

Audio Intelligence

O Audio Intelligence adiciona às transcrições resumo, detecção de tópicos, reconhecimento de intenção e análise de sentimento. A análise de sentimento marca sentimento positivo, neutro ou negativo no nível da palavra, da frase e da transcrição inteira. Esses recursos rodam em modelos leves e específicos por tarefa, ajustados com dados de conversas, e não em grandes modelos de linguagem genéricos.

Guia

  1. Criar uma conta: crie uma conta gratuita no Deepgram para obter uma chave de API.
  2. Definir o modelo e o idioma: os modelos de fala para texto usam inglês por padrão, a menos que o parâmetro language indique outra coisa. Texto para fala precisa de um modelo em cada solicitação, com o Flux TTS servido em /v2/speak e o Aura-2 e o Aura em /v1/speak.
  3. Sair do treinamento de modelos por solicitação: adicione mip_opt_out=true como parâmetro de consulta em fala para texto e texto para fala, ou defina "mip_opt_out": true na mensagem Settings do Voice Agent. Solicitações excluídas mostram mip_opt_out como true em Usage > Logs no Deepgram Console.
  4. Escolher o LLM do agente: o modelo de LLM do Voice Agent é definido nessa mesma mensagem Settings.

Casos de uso e exemplos do Deepgram

A API de fala para texto do Deepgram é voltada à transcrição em atendimento ao cliente, saúde, mídia e IA conversacional.

  • Centrais de atendimento e análise de fala: a análise de fala converte áudio em texto para analisar conversas e detectar intenção.
  • Transcrição médica: mira termos médicos e palavras-chave especializadas.
  • Mídia e podcasts: a transcrição para mídia abrange podcasts, vídeos e transmissões, com legendas e resumos.
  • Agentes de voz de suporte e de saída: a API de texto para fala do Deepgram é posicionada para agentes de voz de chamadas de saída, com tratamento de interrupções e contexto entre turnos.
  • Pedidos em restaurantes: o Deepgram adquiriu a OfOne, uma startup que criou pedidos por IA de voz para restaurantes de serviço rápido.

Para Quem É

O Deepgram é vendido como APIs e SDKs, então o comprador costuma ser uma equipe que escreve código.

  • Desenvolvedores e equipes de produto: a via de autoatendimento é voltada a desenvolvedores e equipes de produto que querem APIs flexíveis.
  • Plataformas e parceiros: uma via de parceiros mira plataformas que incorporam a IA de voz do Deepgram.
  • Empresas reguladas: modelos personalizados e contratos miram empresas com fluxos de trabalho e necessidades de conformidade próprios.
  • Equipes que planejam auto-hospedar: a auto-hospedagem foi pensada para equipes que já têm recursos de DevOps.

Ele se encaixa menos em narração em idiomas que não o inglês com o Flux TTS ou em projetos que precisam de uma biblioteca de vozes muito grande.

Plataformas

  • API em nuvem: a opção hospedada é um serviço em nuvem multilocatário executado na infraestrutura do Deepgram. Os limites de taxa da API são publicados separadamente para os endpoints da América do Norte, Europa, Austrália e Índia.
  • Dedicado e VPC: a Voice Agent API pode ser implantada de forma totalmente gerenciada, dedicada de locatário único, em uma VPC ou auto-hospedada.
  • Auto-hospedado: a auto-hospedagem está disponível para clientes Premium com requisitos de negócio específicos. Os contêineres auto-hospedados Enterprise rodam na VPC do cliente ou em hardware local e exigem GPUs NVIDIA. O Deepgram pode ser auto-hospedado em infraestrutura de nuvem, em servidores físicos (bare metal) ou por meio de ofertas no marketplace do Amazon SageMaker.
  • SDKs: há SDKs do Deepgram para Java, JavaScript, Python, Go e .NET.
  • Frameworks de agentes de voz: o Deepgram TTS se integra ao LiveKit, ao Pipecat, ao Vapi e a outros frameworks de orquestração de agentes de voz por meio de APIs de streaming.
  • Telefonia: a Voice Agent API suporta áudio de telefonia mu-law de 8 kHz por streaming WebSocket bidirecional. O Deepgram documenta integrações com a Twilio, além de integrações para Genesys Cloud CX e Amazon Connect.
  • Playground: os modelos podem ser testados no Playground, e apps iniciais estão publicados no GitHub.

Preços

Os preços do Deepgram são baseados no uso e divididos por produto e modelo, e não por assento.

Planos e concorrência

O Pay As You Go começa com um crédito gratuito de $200 e depois cobra pelo uso; o Growth começa em $4K+ por ano. O Pay As You Go não tem mínimos nem expiração e não exige cartão de crédito para começar. O Growth permite economizar até 20% com créditos anuais pré-pagos, abatidos do uso real. As condições Enterprise são cotadas pela equipe de vendas.

ServiçoPay As You GoGrowth
Fala para texto (REST / WebSocket / Whisper Cloud)até 50 / 150 / 5até 50 / 225 / 5
Texto para fala (REST + WebSocket)até 45até 60
Voice Agent (WebSocket)até 45até 60
Audio Intelligence (REST)até 10até 10

Tarifas de fala para texto

As tarifas de fala para texto em streaming estão atualmente marcadas como promocionais por tempo limitado, por isso os preços regulares aparecem entre parênteses.

ModeloModoPay As You GoGrowth
Flux inglêsStreaming$0.0065/min (regular $0.0077)$0.0057/min (regular $0.0065)
Flux multilíngueStreaming$0.0078/min$0.0068/min
Nova-3 monolíngueStreaming$0.0048/min (regular $0.0077)$0.0042/min (regular $0.0065)
Nova-3 multilíngueStreaming$0.0058/min (regular $0.0092)$0.0050/min (regular $0.0078)
Nova-3 monolínguePré-gravado$0.0043/min$0.0036/min
Nova-3 multilínguePré-gravado$0.0052/min$0.0043/min
Whisper LargePré-gravado$0.0048/min$0.0048/min

Os complementos são cobrados além da tarifa do modelo:

  • A ocultação de dados sensíveis (Redaction) custa $0.0020/min no Pay As You Go e $0.0017/min no Growth.
  • A indicação de termos-chave (Keyterm Prompting) custa $0.0013/min no Pay As You Go e $0.0012/min no Growth.
  • A formatação inteligente (Smart Formatting) está incluída nos dois planos.

A cobrança é por segundo, então um arquivo de 14 segundos é cobrado exatamente como 14 segundos. O áudio multicanal é cobrado pela duração total processada, então um arquivo estéreo de 10 minutos conta como 20 minutos.

Tarifas de texto para fala

ModeloPay As You GoGrowth
Flux TTS$0.0450 por 1.000 caracteres$0.0405 por 1.000 caracteres
Aura-2$0.030 por 1.000 caracteres$0.027 por 1.000 caracteres
Aura-1$0.0150 por 1.000 caracteres$0.0135 por 1.000 caracteres

Até 31 de dezembro de 2026, os gastos com Flux TTS são igualados com créditos de até $500 no Pay As You Go e no Growth. Um período gratuito de desenvolvimento com o Flux TTS foi até 12 de setembro de 2026, e os preços padrão valem desde 13 de setembro de 2026. O FAQ da página do produto de texto para fala diz que o Deepgram TTS começa em $0.15 por 1.000 caracteres, o que não bate com a tarifa do Aura-1 na tabela acima.

Tarifas de Voice Agent e Audio Intelligence

Nível do Voice AgentPay As You GoGrowth
Padrão$0.075/min$0.068/min
Padrão com seu próprio TTS$0.065/min$0.051/min
Personalizado com seus próprios LLM e TTS$0.050/min$0.041/min
Avançado$0.163/min$0.146/min
Avançado com seu próprio TTS$0.122/min$0.110/min

Os minutos do Voice Agent são calculados pelo tempo de conexão WebSocket. O resumo custa $0.0003 por 1.000 tokens de entrada e $0.0006 por 1.000 tokens de saída no Pay As You Go.

Créditos, excedentes e reembolsos

  • Recarga automática: vem ativada por padrão e recarrega $100 quando o crédito restante chega a $10.
  • Prazo de reembolso: é possível pedir reembolso de créditos não usados comprados nos últimos 30 dias. Fora disso, cancelar não dá direito a reembolso de créditos não usados, exceto conforme a Pricing List (tabela de preços) vigente na época.
  • Expiração: os créditos expiram quando a conta é encerrada ou quando a assinatura é cancelada ou rescindida.
  • Excedentes no Growth: são cobrados pela tarifa do Growth mais um acréscimo, em vez de passar para os preços do Pay As You Go. O FAQ de preços chama isso de taxa de excedente de 10%. Os excedentes são cobrados semanalmente, de forma postecipada, no cartão cadastrado.
  • Transferências: o FAQ de preços diz que créditos comprados podem ser transferidos, mediante solicitação, entre contas da mesma organização. Os Termos de Serviço, por outro lado, afirmam que os créditos não são transferíveis e não têm valor em dinheiro.
  • Startups: startups aceitas no programa para startups podem receber até $100,000 em créditos ao longo de 12 meses.

Alternativas ao Deepgram

A maioria das comparações publicadas nesta categoria vem dos próprios fornecedores.

  • AssemblyAI: a própria comparação do Deepgram com o AssemblyAI diz que os dois fornecedores documentam auto-hospedagem e um caminho para um BAA e trata um teste em condições equivalentes com o seu próprio áudio como fator decisivo.
  • OpenAI Whisper: o Whisper também está disponível dentro do Deepgram como Whisper Large para áudio pré-gravado. Um desenvolvedor de agentes de voz publicou um teste de 13 provedores de fala para texto com 100 chamadas reais de clientes. Nesse teste, o Deepgram Flux teve a menor taxa de erro por palavra, de 15,86%, e o OpenAI Whisper a maior, de 39,78%. O reconhecimento de códigos postais passou de 50% de taxa de erro por palavra em todos os provedores, incluindo o Deepgram. É o teste de uma única equipe com seus próprios dados de chamadas, não um ranking geral.
  • ElevenLabs: o Deepgram posiciona seu TTS para agentes de voz em tempo real e admite que o ElevenLabs oferece uma biblioteca de vozes maior e uma cobertura de idiomas mais ampla, adequadas à criação de conteúdo.
  • Cartesia: o Deepgram descreve a Cartesia como conhecida por síntese rápida, controle expressivo por meio de tags de texto e uma ampla biblioteca de vozes multilíngues.

Limitações

Limites do produto e de uso

  • Idiomas das vozes: o Flux TTS é apenas em inglês; vozes em espanhol, alemão, francês, holandês, italiano e japonês exigem o Aura-2.
  • Whisper na UE: os modelos Whisper não são suportados no endpoint da UE.
  • Concorrência do Whisper: a documentação de limites de taxa da API lista o Whisper Cloud com até 3 solicitações simultâneas de áudio pré-gravado na América do Norte e indisponível em outras regiões, enquanto a página de preços mostra até 5.
  • Projetos: os limites de taxa valem por projeto, e projetos secundários em contas de autoatendimento ficam limitados a um stream simultâneo.
  • Acima do limite: no Pay As You Go, solicitações acima do limite de concorrência podem ser enfileiradas ou rejeitadas.
  • Uploads com falha: os clientes pagam por cada arquivo processado, inclusive uploads com falha causados pelos próprios sistemas.

Regras de uso nos Termos

  • Os Termos proíbem usar os serviços ou os resultados para fins competitivos, incluindo treinamento de modelos, benchmarking e análise competitiva.
  • Os usuários não podem apresentar o áudio gerado como feito por humanos e devem dar os avisos exigidos por lei de que ele é gerado por IA.
  • Os resultados podem não ser únicos, e o Deepgram não declara que os usuários são donos de resultados semelhantes criados para outros clientes.
  • Informações de saúde protegidas não podem ser enviadas a menos que um acordo de associado comercial (BAA) tenha sido assinado.

Uso de dados e privacidade

As solicitações à API participam por padrão do Model Improvement Program (programa de melhoria de modelos), e o Deepgram as retém. Os Termos permitem que o Deepgram use as entradas e saídas dos clientes para melhorar seus serviços, incluindo treinar e testar seus modelos.

  • Exclusão: definir mip_opt_out=true em uma solicitação a exclui da retenção e, em um endpoint regional, a mantém na região, exceto para provedores terceiros de Voice Agent. Solicitações excluídas têm retenção zero de áudio, texto, transcrições e áudio sintetizado depois que a resposta é devolvida. A aplicação obrigatória da exclusão em toda a conta ou em toda a implantação está disponível entrando em contato com o Deepgram.
  • Registros: metadados de solicitações e registros de uso ficam disponíveis para consulta por 90 dias, e o uso resumido é guardado por mais tempo.
  • Residência de dados: uma garantia completa de permanência na região exige tanto um endpoint regional quanto mip_opt_out=true. Solicitações ao endpoint da UE nunca são roteadas para fora da UE e falham em vez de recorrer a uma alternativa se a região estiver indisponível.
  • Propriedade e compartilhamento: o Deepgram não reivindica a propriedade das entradas e saídas dos clientes. O Deepgram diz que não vende dados de clientes, não os usa para perfis de publicidade nem os redistribui sem permissão.
  • Escopo da política: o aviso de privacidade do site não se aplica ao tratamento de dados de clientes.
  • Fluxo de dados na auto-hospedagem: em uma implantação auto-hospedada típica, nenhum áudio, transcrição ou conteúdo que identifique solicitações é enviado ao Deepgram.
  • Certificações: o Deepgram afirma ter certificação SOC 2 Type 1 e Type 2. O Deepgram assina acordos de associado comercial com clientes Enterprise que lidam com ePHI.

FAQ

Q1. Existe uma forma gratuita de testar o Deepgram?

Sim. Novas contas Pay As You Go começam com um crédito de $200 e sem exigência de cartão de crédito; depois disso, o uso é cobrado por minuto, por 1.000 caracteres ou por minuto de conexão do agente.

Q2. O Deepgram usa meu áudio para treinar seus modelos?

Por padrão, sim: as solicitações entram no Model Improvement Program e são retidas. Adicionar mip_opt_out=true a uma solicitação a exclui e interrompe a retenção do seu conteúdo.

Q3. O processamento pode ficar dentro da UE?

O Deepgram oferece um endpoint dedicado da UE cujas solicitações não são roteadas para fora da UE. O processamento totalmente dentro da região também exige optar pela exclusão da melhoria de modelos, e os modelos Whisper não estão disponíveis ali.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos