Deepgram은 개발자용 API로 제공되는 음성 AI 플랫폼입니다. 실시간 및 녹음 오디오용 음성-텍스트 변환, 텍스트-음성 변환, Voice Agent API, Audio Intelligence 분석을 제공합니다. Deepgram은 음성-텍스트 변환, 텍스트-음성 변환, LLM 오케스트레이션을 하나의 Voice Agent API에 결합했으며, 회사는 이를 통해 복잡성, 지연 시간, 비용이 줄어든다고 설명합니다.
2026년 1월 Deepgram은 AVP가 주도한 시리즈 C 라운드에서 13억 달러 기업가치로 1억 3,000만 달러를 유치했다고 밝혔습니다. 회사는 또한 회의 노트 도구 Granola, 음성 에이전트 스타트업 Vapi, Twilio를 포함해 1,300곳이 넘는 조직이 자사 음성 AI 제품과 모델을 사용한다고 밝혔습니다.
Deepgram의 음성 인식 API는 실시간 전사를 위한 스트리밍 오디오와 일괄 처리를 위한 녹음 파일을 모두 받습니다.
정확도와 속도 수치는 업체 자체 발표입니다. Deepgram은 Nova-3의 단어 오류율이 경쟁사보다 스트리밍에서 54.2%, 일괄 처리에서 47.4% 낮다고 말합니다. 또한 300밀리초 이내에 전사 결과를 제공한다고 합니다. 키텀 프롬프팅은 핵심 단어 인식을 개선해 키워드 재현율을 최대 90% 높인다고 설명됩니다.
Voice Agent API에는 끼어들기 감지, 턴 테이킹 예측, 함수 호출, 세션 중 제어가 포함됩니다. 팀은 Deepgram의 오케스트레이션과 스트리밍 파이프라인을 유지하면서 자체 LLM이나 TTS 공급자를 가져올 수 있습니다.
Deepgram은 OpenAI, Anthropic, Google, NVIDIA 공급자 유형에 대해 관리형 LLM을 제공하므로, 이들에는 엔드포인트가 필요하지 않습니다. Groq와 Amazon Bedrock 모델은 Deepgram이 해당 LLM을 관리하지 않으므로 자체 엔드포인트가 필요합니다. 관리형 모델에는 가격 등급이 붙습니다. claude-sonnet-4-5는 Advanced(고급), claude-haiku-4-5는 Standard(표준)로 표시되며, 등급에 따라 분당 요금이 정해집니다.
Audio Intelligence는 전사본 위에 요약, 주제 감지, 의도 인식, 감정 분석을 더합니다. 감정 분석은 단어, 문장, 전사본 전체 수준에서 긍정, 중립, 부정 감정을 표시합니다. 이 기능들은 범용 대규모 언어 모델이 아니라 대화 데이터로 미세 조정한 경량 작업 특화 모델에서 실행됩니다.
Deepgram의 음성-텍스트 변환 API는 고객 지원, 의료, 미디어, 대화형 AI 분야의 전사를 겨냥합니다.
Deepgram은 API와 SDK 형태로 판매되므로, 구매자는 보통 코드를 작성하는 팀입니다.
Flux TTS로 영어 이외 언어의 내레이션을 만들거나 매우 큰 음성 라이브러리가 필요한 프로젝트에는 덜 적합합니다.
Deepgram 가격은 사용량 기반이며, 좌석 단위가 아니라 제품과 모델별로 나뉩니다.
Pay As You Go(종량제)는 $200 무료 크레딧으로 시작한 뒤 사용량에 따라 청구하며, Growth는 연간 $4K+부터 시작합니다. Pay As You Go는 최소 사용액과 만료가 없고 시작할 때 신용카드도 필요 없습니다. Growth는 실제 사용량에서 차감되는 연간 선불 크레딧으로 최대 20%를 절약할 수 있습니다. Enterprise 조건은 영업팀이 견적을 냅니다.
| 서비스 | Pay As You Go | Growth |
|---|---|---|
| 음성-텍스트 변환(REST / WebSocket / Whisper Cloud) | 최대 50 / 150 / 5 | 최대 50 / 225 / 5 |
| 텍스트-음성 변환(REST + WebSocket) | 최대 45 | 최대 60 |
| Voice Agent(WebSocket) | 최대 45 | 최대 60 |
| Audio Intelligence(REST) | 최대 10 | 최대 10 |
스트리밍 음성-텍스트 변환 요금은 현재 기간 한정 프로모션 요금으로 표시되어 있어, 정상가는 괄호 안에 적었습니다.
| 모델 | 방식 | Pay As You Go | Growth |
|---|---|---|---|
| Flux 영어 | 스트리밍 | $0.0065/분(정상가 $0.0077) | $0.0057/분(정상가 $0.0065) |
| Flux 다국어 | 스트리밍 | $0.0078/분 | $0.0068/분 |
| Nova-3 단일 언어 | 스트리밍 | $0.0048/분(정상가 $0.0077) | $0.0042/분(정상가 $0.0065) |
| Nova-3 다국어 | 스트리밍 | $0.0058/분(정상가 $0.0092) | $0.0050/분(정상가 $0.0078) |
| Nova-3 단일 언어 | 사전 녹음 | $0.0043/분 | $0.0036/분 |
| Nova-3 다국어 | 사전 녹음 | $0.0052/분 | $0.0043/분 |
| Whisper Large | 사전 녹음 | $0.0048/분 | $0.0048/분 |
부가 기능은 모델 요금에 더해 청구됩니다.
과금은 초 단위이므로 14초짜리 파일은 정확히 14초로 청구됩니다. 멀티채널 오디오는 처리된 총 길이로 청구되므로, 10분짜리 스테레오 파일은 20분으로 계산됩니다.
| 모델 | Pay As You Go | Growth |
|---|---|---|
| Flux TTS | 1,000자당 $0.0450 | 1,000자당 $0.0405 |
| Aura-2 | 1,000자당 $0.030 | 1,000자당 $0.027 |
| Aura-1 | 1,000자당 $0.0150 | 1,000자당 $0.0135 |
2026년 12월 31일까지 Pay As You Go와 Growth에서 Flux TTS 지출액만큼 크레딧이 최대 $500까지 매칭 지급됩니다. Flux TTS 무료 빌드 기간은 2026년 9월 12일까지였고, 2026년 9월 13일부터 표준 요금이 적용되고 있습니다. 텍스트-음성 변환 제품 페이지 FAQ는 Deepgram TTS가 1,000자당 $0.15부터 시작한다고 적고 있어 위 표의 Aura-1 요금과 맞지 않습니다.
| Voice Agent 등급 | Pay As You Go | Growth |
|---|---|---|
| 표준 | $0.075/분 | $0.068/분 |
| 표준(자체 TTS 사용) | $0.065/분 | $0.051/분 |
| 커스텀(자체 LLM 및 TTS 사용) | $0.050/분 | $0.041/분 |
| 고급 | $0.163/분 | $0.146/분 |
| 고급(자체 TTS 사용) | $0.122/분 | $0.110/분 |
Voice Agent 사용 시간은 WebSocket 연결 시간을 기준으로 계산됩니다. Pay As You Go에서 요약은 입력 토큰 1,000개당 $0.0003, 출력 토큰 1,000개당 $0.0006입니다.
이 분야에서 공개된 비교는 대부분 업체 자신이 낸 것입니다.
API 요청은 기본적으로 모델 개선 프로그램(Model Improvement Program)에 참여하며, Deepgram이 이를 보관합니다. 약관은 Deepgram이 모델 학습과 테스트를 포함해 서비스 개선에 고객 입력과 출력을 사용하는 것을 허용합니다.
네. 새 Pay As You Go 계정은 신용카드 없이 $200 크레딧으로 시작하며, 이후 사용량은 분당, 1,000자당 또는 에이전트 연결 시간 분당으로 청구됩니다.
기본적으로는 그렇습니다. 요청은 모델 개선 프로그램에 참여하고 보관됩니다. 요청에 mip_opt_out=true를 추가하면 제외되며 해당 내용의 보관도 중단됩니다.
Deepgram은 요청을 EU 밖으로 라우팅하지 않는 전용 EU 엔드포인트를 제공합니다. 리전 내 처리를 완전히 보장하려면 모델 개선에서도 옵트아웃해야 하며, 이 엔드포인트에서는 Whisper 모델을 사용할 수 없습니다.