Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Tecnología de voz
  4. Deepgram
Vista previa de la interfaz de Deepgram
Logotipo de Deepgram

Deepgram

Deepgram vende API de voz a texto, texto a voz y Voice Agent que se facturan por minuto o por cada 1.000 caracteres, con un crédito inicial de $200, endpoints regionales y autoalojamiento para clientes empresariales que cumplan los requisitos.

Tecnología de vozHerramientas de desarrolloDesarrollo de IA#Texto a voz#API#Transcripción
Probar gratis
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
6 oct 2026
Dominio
deepgram.com
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Deepgram

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
6 oct 2026
Dominio
deepgram.com
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Deepgram?

Deepgram es una plataforma de IA de voz ofrecida como API para desarrolladores: voz a texto para audio en directo y grabado, texto a voz, una Voice Agent API y análisis con Audio Intelligence. Deepgram combina voz a texto, texto a voz y orquestación de LLM en una sola Voice Agent API, lo que, según la empresa, reduce la complejidad, la latencia y el coste.

En enero de 2026, Deepgram anunció haber captado 130 millones de dólares en una ronda Serie C liderada por AVP, con una valoración de 1.300 millones de dólares. También informó de que más de 1.300 organizaciones usan sus productos y modelos de IA de voz, entre ellas la herramienta de notas de reuniones Granola, la startup de agentes de voz Vapi y Twilio.

Funciones principales

La API de voz a texto de Deepgram acepta audio en streaming para transcripción en tiempo real o archivos grabados para procesamiento por lotes.

Modelos de voz a texto

  • Flux STT: modelo de reconocimiento de voz conversacional para agentes de voz en tiempo real, con detección de turnos y gestión de interrupciones integradas en 10 idiomas. Su opción multilingüe cubre inglés, español, francés, alemán, hindi, ruso, portugués, japonés, italiano y neerlandés.
  • Nova-3: se presenta como modelo para transcripción en producción, con robustez frente al ruido y soporte multilingüe en más de 50 idiomas. La página de precios da una cifra menor: más de 45 idiomas para los modelos Nova, con diarización de hablantes, formato inteligente, indicación de términos clave y detección automática de idioma.
  • Nova-2: sigue siendo el recomendado para idiomas que Nova-3 aún no admite y para identificar muletillas.
  • Modelos ajustados por sector: se centran en el vocabulario y la estructura de ámbitos como la sanidad, el derecho y las finanzas.
  • Modelos personalizados: pueden entrenarse con conjuntos de datos propios o novedosos para audio de casos límite.

Las cifras de precisión y velocidad las comunica el propio proveedor. Deepgram afirma que Nova-3 tiene una tasa de error por palabra un 54,2 % menor en streaming y un 47,4 % menor en procesamiento por lotes que sus competidores. También afirma entregar transcripciones en menos de 300 milisegundos. Se describe que la indicación de términos clave mejora el reconocimiento de palabras críticas, con una exhaustividad de palabras clave hasta un 90 % mayor.

Texto a voz

  • Flux TTS: mantiene el tono, el ritmo y el registro emocional durante toda una sesión, sin SSML, etiquetas de estilo ni ingeniería de prompts. Deepgram afirma que la salida de Flux TTS empieza en apenas 80 ms, incluso con carga de producción. Cuando quien llama interrumpe, la API informa de lo que esa persona oyó realmente.
  • Aura-2: el modelo de la gama con mayor cobertura de idiomas, con voces en siete idiomas.
  • Aura: modelo TTS de primera generación de Deepgram; solo ofrece voces en inglés.

Voice Agent API

La Voice Agent API incluye detección de interrupciones, predicción de turnos, llamadas a funciones y control a mitad de sesión. Los equipos pueden usar su propio proveedor de LLM o de TTS y conservar la orquestación y la canalización de streaming de Deepgram.

Deepgram ofrece LLM gestionados para los tipos de proveedor OpenAI, Anthropic, Google y NVIDIA, así que con ellos no hace falta endpoint. Los modelos de Groq y Amazon Bedrock necesitan tu propio endpoint, porque Deepgram no gestiona esos LLM. Los modelos gestionados tienen un nivel de precio: claude-sonnet-4-5 figura como Advanced (Avanzado) y claude-haiku-4-5 como Standard (Estándar), y el nivel determina la tarifa por minuto.

Audio Intelligence

Audio Intelligence añade a las transcripciones resumen, detección de temas, reconocimiento de intención y análisis de sentimiento. El análisis de sentimiento etiqueta sentimiento positivo, neutro o negativo por palabra, frase y transcripción completa. Estas funciones se ejecutan en modelos ligeros y específicos por tarea, ajustados con datos conversacionales, no en grandes modelos de lenguaje generales.

Guía

  1. Crear una cuenta: crea una cuenta gratuita de Deepgram para obtener una clave de API.
  2. Configurar el modelo y el idioma: los modelos de voz a texto usan inglés por defecto, salvo que el parámetro language indique otra cosa. El texto a voz necesita un modelo en cada solicitud: Flux TTS se sirve en /v2/speak, y Aura-2 y Aura en /v1/speak.
  3. Excluirse del entrenamiento de modelos por solicitud: añade mip_opt_out=true como parámetro de consulta en voz a texto y texto a voz, o define "mip_opt_out": true en el mensaje Settings de Voice Agent. Las solicitudes excluidas muestran mip_opt_out como true en Usage > Logs de la Deepgram Console.
  4. Elegir el LLM del agente: el modelo LLM del Voice Agent se configura en ese mismo mensaje Settings.

Casos de uso y ejemplos de Deepgram

La API de voz a texto de Deepgram está orientada a la transcripción en atención al cliente, sanidad, medios e IA conversacional.

  • Centros de contacto y analítica de voz: convierte el audio en texto para analizar conversaciones y detectar la intención.
  • Transcripción médica: se centra en términos médicos y palabras clave especializadas.
  • Medios y pódcasts: la transcripción cubre pódcasts, vídeos y emisiones, con subtítulos y resúmenes.
  • Agentes de voz de soporte y salientes: la API de texto a voz de Deepgram se posiciona para agentes de voz salientes, con gestión de interrupciones y contexto entre turnos.
  • Pedidos en restaurantes: Deepgram adquirió OfOne, una startup que creó pedidos por IA de voz para restaurantes de comida rápida.

Para quién es

Deepgram se vende como API y SDK, así que el comprador suele ser un equipo que escribe código.

  • Desarrolladores y equipos de producto: la vía de autoservicio está pensada para desarrolladores y equipos de producto que quieren API flexibles.
  • Plataformas y socios: una vía para socios se dirige a plataformas que integran la IA de voz de Deepgram.
  • Empresas reguladas: los modelos personalizados y los contratos se dirigen a empresas con flujos de trabajo y necesidades de cumplimiento propios.
  • Equipos que planean autoalojar: está pensado para equipos que ya cuentan con recursos de DevOps.

Encaja peor con la narración en idiomas distintos del inglés con Flux TTS o con proyectos que necesitan una biblioteca de voces muy grande.

Plataformas

  • API en la nube: la opción alojada es un servicio en la nube multiinquilino sobre la infraestructura de Deepgram. Los límites de velocidad de la API se publican por separado para los endpoints de Norteamérica, Europa, Australia e India.
  • Dedicado y VPC: la Voice Agent API puede desplegarse totalmente gestionada, como instancia dedicada de un solo inquilino, en una VPC o autoalojada.
  • Autoalojado: está disponible para clientes Premium con requisitos de negocio específicos. Los contenedores autoalojados de Enterprise se ejecutan en la VPC del cliente o en hardware local y requieren GPU de NVIDIA. Deepgram puede autoalojarse en infraestructura en la nube, en servidores físicos (bare metal) o mediante ofertas del marketplace de Amazon SageMaker.
  • SDK: hay SDK de Deepgram para Java, JavaScript, Python, Go y .NET.
  • Frameworks de agentes de voz: Deepgram TTS se integra con LiveKit, Pipecat, Vapi y otros frameworks de orquestación de agentes de voz mediante API de streaming.
  • Telefonía: la Voice Agent API admite audio telefónico mu-law de 8 kHz mediante streaming WebSocket bidireccional. Deepgram documenta integraciones con Twilio, Genesys Cloud CX y Amazon Connect.
  • Playground: los modelos pueden probarse en el Playground, y hay aplicaciones de inicio publicadas en GitHub.

Precios

Los precios de Deepgram se basan en el uso y se dividen por producto y modelo, no por puesto.

Planes y concurrencia

Pay As You Go empieza con un crédito gratuito de $200 y después factura por uso; Growth empieza en $4K+ al año. Pay As You Go no tiene mínimos ni caducidad y no requiere tarjeta de crédito para empezar. Growth permite ahorrar hasta un 20 % con créditos anuales prepagados que se descuentan del uso real. Ventas cotiza las condiciones de Enterprise.

ServicioPay As You GoGrowth
Voz a texto (REST / WebSocket / Whisper Cloud)hasta 50 / 150 / 5hasta 50 / 225 / 5
Texto a voz (REST + WebSocket)hasta 45hasta 60
Voice Agent (WebSocket)hasta 45hasta 60
Audio Intelligence (REST)hasta 10hasta 10

Tarifas de voz a texto

Las tarifas de voz a texto en streaming figuran actualmente como tarifas promocionales por tiempo limitado; los precios habituales van entre paréntesis.

ModeloModoPay As You GoGrowth
Flux inglésStreaming$0.0065/min (habitual $0.0077)$0.0057/min (habitual $0.0065)
Flux multilingüeStreaming$0.0078/min$0.0068/min
Nova-3 monolingüeStreaming$0.0048/min (habitual $0.0077)$0.0042/min (habitual $0.0065)
Nova-3 multilingüeStreaming$0.0058/min (habitual $0.0092)$0.0050/min (habitual $0.0078)
Nova-3 monolingüePregrabado$0.0043/min$0.0036/min
Nova-3 multilingüePregrabado$0.0052/min$0.0043/min
Whisper LargePregrabado$0.0048/min$0.0048/min

Los complementos se cobran además de la tarifa del modelo:

  • La ocultación de datos sensibles (Redaction) cuesta $0.0020/min en Pay As You Go y $0.0017/min en Growth.
  • La indicación de términos clave (Keyterm Prompting) cuesta $0.0013/min en Pay As You Go y $0.0012/min en Growth.
  • El formato inteligente (Smart Formatting) está incluido en ambos planes.

La facturación es por segundo: un archivo de 14 segundos se cobra exactamente como 14 segundos. El audio multicanal se factura por la duración total procesada: un archivo estéreo de 10 minutos cuenta como 20 minutos.

Tarifas de texto a voz

ModeloPay As You GoGrowth
Flux TTS$0.0450 por 1.000 caracteres$0.0405 por 1.000 caracteres
Aura-2$0.030 por 1.000 caracteres$0.027 por 1.000 caracteres
Aura-1$0.0150 por 1.000 caracteres$0.0135 por 1.000 caracteres

Hasta el 31 de diciembre de 2026, el gasto en Flux TTS se iguala con créditos de hasta $500 en Pay As You Go y Growth. Un periodo gratuito de desarrollo con Flux TTS duró hasta el 12 de septiembre de 2026, y desde el 13 de septiembre de 2026 se aplican los precios estándar. Las preguntas frecuentes de la página del producto de texto a voz indican que Deepgram TTS parte de $0.15 por 1.000 caracteres, lo que no coincide con la tarifa de Aura-1 de la tabla anterior.

Tarifas de Voice Agent y Audio Intelligence

Nivel de Voice AgentPay As You GoGrowth
Estándar$0.075/min$0.068/min
Estándar con tu propio TTS$0.065/min$0.051/min
Personalizado con tus propios LLM y TTS$0.050/min$0.041/min
Avanzado$0.163/min$0.146/min
Avanzado con tu propio TTS$0.122/min$0.110/min

Los minutos de Voice Agent se calculan según el tiempo de conexión WebSocket. El resumen cuesta $0.0003 por 1.000 tokens de entrada y $0.0006 por 1.000 tokens de salida en Pay As You Go.

Créditos, excesos y reembolsos

  • Recarga automática: está activada por defecto y recarga $100 cuando el crédito restante llega a $10.
  • Plazo de reembolso: se puede solicitar el reembolso de los créditos no usados comprados en los últimos 30 días. Fuera de ese caso, cancelar no da derecho al reembolso de los créditos no usados, salvo lo que indique la Pricing List (lista de precios) vigente en ese momento.
  • Caducidad: los créditos caducan al cerrarse la cuenta o al cancelarse o rescindirse la suscripción.
  • Excesos en Growth: se facturan a la tarifa de Growth más un recargo, en lugar de pasar a los precios de Pay As You Go. Las preguntas frecuentes de precios lo llaman cargo por exceso del 10 %. Se cobran semanalmente a período vencido en la tarjeta registrada.
  • Transferencias: las preguntas frecuentes de precios indican que los créditos comprados pueden transferirse, previa solicitud, entre cuentas de la misma organización. Los Términos del servicio, en cambio, establecen que no son transferibles ni tienen valor en efectivo.
  • Startups: las startups aceptadas en su programa pueden recibir hasta $100,000 en créditos durante 12 meses.

Alternativas a Deepgram

La mayoría de las comparaciones publicadas en esta categoría proceden de los propios proveedores.

  • AssemblyAI: la propia comparación de Deepgram con AssemblyAI indica que ambos proveedores documentan el autoalojamiento y una vía para firmar un BAA, y considera factor decisivo una prueba en igualdad de condiciones con tu propio audio.
  • OpenAI Whisper: Whisper también está disponible dentro de Deepgram como Whisper Large para audio pregrabado. Un desarrollador de agentes de voz publicó una prueba de 13 proveedores de voz a texto con 100 llamadas reales de clientes. En esa prueba, Deepgram Flux tuvo la tasa de error por palabra más baja, del 15,86 %, y OpenAI Whisper la más alta, del 39,78 %. El reconocimiento de códigos postales superó el 50 % de tasa de error por palabra en todos los proveedores, Deepgram incluido. Es la prueba de un solo equipo con sus propios datos de llamadas, no una clasificación general.
  • ElevenLabs: Deepgram posiciona su TTS para agentes de voz en tiempo real y admite que ElevenLabs ofrece una biblioteca de voces más grande y una cobertura de idiomas más amplia, adecuadas para la creación de contenido.
  • Cartesia: Deepgram describe a Cartesia como conocida por su síntesis rápida, su control expresivo mediante etiquetas de texto y su amplia biblioteca de voces multilingües.

Limitaciones

Límites del producto y de uso

  • Idiomas de las voces: Flux TTS solo funciona en inglés; las voces en español, alemán, francés, neerlandés, italiano y japonés requieren Aura-2.
  • Whisper en la UE: los modelos Whisper no son compatibles con el endpoint de la UE.
  • Concurrencia de Whisper: la documentación de límites de velocidad de la API indica para Whisper Cloud hasta 3 solicitudes simultáneas de audio pregrabado en Norteamérica y que no está disponible en otras regiones, mientras que la página de precios muestra hasta 5.
  • Proyectos: los límites de velocidad se aplican por proyecto, y los proyectos secundarios de las cuentas de autoservicio están limitados a una transmisión simultánea.
  • Por encima del límite: en Pay As You Go, las solicitudes que superan el límite de concurrencia pueden quedar en cola o ser rechazadas.
  • Cargas defectuosas: los clientes pagan cada archivo procesado, incluidas las cargas defectuosas causadas por sus propios sistemas.

Reglas de uso de los Términos

  • Los Términos prohíben usar los servicios o los resultados con fines competitivos, incluidos el entrenamiento de modelos, el benchmarking y el análisis competitivo.
  • Los usuarios no deben presentar el audio generado como hecho por una persona y deben dar los avisos exigidos por la ley de que está generado por IA.
  • Los resultados pueden no ser únicos, y Deepgram no declara que los usuarios sean propietarios de resultados similares creados para otros clientes.
  • No se puede enviar información de salud protegida a menos que se haya firmado un acuerdo de socio comercial (BAA).

Uso de datos y privacidad

Las solicitudes a la API participan por defecto en el Model Improvement Program (programa de mejora de modelos), y Deepgram las conserva. Los Términos permiten a Deepgram usar las entradas y salidas de los clientes para mejorar sus servicios, incluido el entrenamiento y las pruebas de sus modelos.

  • Exclusión: configurar mip_opt_out=true en una solicitud la excluye de la conservación y, en un endpoint regional, la mantiene dentro de la región, salvo con proveedores externos de Voice Agent. Las solicitudes excluidas tienen retención de datos cero para audio, texto, transcripciones y audio sintetizado una vez devuelta la respuesta. La aplicación obligatoria de la exclusión en toda la cuenta o el despliegue está disponible contactando con Deepgram.
  • Registros: los metadatos de las solicitudes y los registros de uso se pueden consultar durante 90 días, y el uso agregado se conserva más tiempo.
  • Residencia de datos: una garantía completa de permanencia en la región requiere tanto un endpoint regional como mip_opt_out=true. Las solicitudes al endpoint de la UE nunca se enrutan fuera de la UE y fallan en lugar de recurrir a una alternativa si la región no está disponible.
  • Propiedad y uso compartido: Deepgram no reclama la propiedad de las entradas y salidas de los clientes. Además, afirma que no vende los datos de los clientes, no los usa para perfiles publicitarios ni los redistribuye sin permiso.
  • Alcance de la política: el aviso de privacidad del sitio web no se aplica al tratamiento de los datos de los clientes.
  • Flujo de datos en autoalojamiento: en un despliegue autoalojado típico, no se envía a Deepgram audio, transcripciones ni contenido que identifique solicitudes.
  • Certificaciones: Deepgram declara contar con las certificaciones SOC 2 Type 1 y Type 2. También firma acuerdos de socio comercial con clientes Enterprise que manejan ePHI.

Preguntas frecuentes

Q1. ¿Hay una forma gratuita de probar Deepgram?

Sí. Las cuentas nuevas de Pay As You Go empiezan con un crédito de $200 y sin tarjeta de crédito; después, el uso se factura por minuto, por 1.000 caracteres o por minuto de conexión del agente.

Q2. ¿Usa Deepgram mi audio para entrenar sus modelos?

Por defecto, sí: las solicitudes se suman al Model Improvement Program y se conservan. Añadir mip_opt_out=true a una solicitud la excluye y detiene la conservación de su contenido.

Q3. ¿Puede el procesamiento quedarse dentro de la UE?

Deepgram ofrece un endpoint dedicado de la UE cuyas solicitudes no se enrutan fuera de la UE. Un procesamiento completamente dentro de la región también requiere excluirse de la mejora de modelos, y los modelos Whisper no están disponibles allí.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas