Toolso.AI
Toolso.AI
모든 도구카테고리인기최신 도구가격블로그
Toolso.AI
Toolso.AI

💌AI 도구 위클리 구독

매주 선별된 최신 및 핫한 AI 도구와 트렌드를 받은편지함으로 받아보세요 구독

Toolso.AI
Toolso.AI

생산성을 높일 최고의 AI 도구 발견

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

인기 카테고리

  • AI 글쓰기
  • AI 이미지
  • AI 비디오
  • AI 코딩
  • 더 많은 카테고리

탐색

  • 최신 도구
  • 인기 도구
  • 더 많은 도구
  • 도구 제출
  • 요금

회사 소개

  • 회사 소개
  • 문의하기
  • 블로그
  • 변경 로그

법률

  • 쿠키 정책
  • 개인정보 보호정책
  • 서비스 약관
  • 환불 정책
© 2026 Toolso.AI 모든 권리 보유
기간 한정기간 한정 프로모션추천 등록24시간 우선 심사 · 백링크 불필요 · 30일 추천 노출$29.90이후 $59.9010월 31일 이후 $59.90로 인상종료까지--:--:--지금 제출
  1. 홈
  2. 모든 도구
  3. 음성 기술
  4. Deepgram
Deepgram 인터페이스 미리보기
Deepgram 로고

Deepgram

Deepgram은 분당 또는 1,000자당 과금되는 음성-텍스트 변환, 텍스트-음성 변환, Voice Agent API를 판매하며, $200 시작 크레딧, 리전 엔드포인트, 자격을 갖춘 엔터프라이즈 고객용 셀프 호스팅을 제공합니다.

음성 기술개발 도구AI 개발#텍스트 음성 변환#API#전사
무료로 사용해보기
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 10월 6일
도메인
deepgram.com
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

Deepgram 제품 정보

무료로 사용해보기
도구 정보
저장
방문 횟수
조회수
가격
부분 유료
출시일
2026년 10월 6일
도메인
deepgram.com
사용자 평점

이 도구를 사용해 보셨나요? 평점을 남겨 주세요

이 도구 평가하기

추천 도구

관련 도구

무료로 사용해보기

Deepgram, 어떤 도구인가요?

Deepgram은 개발자용 API로 제공되는 음성 AI 플랫폼입니다. 실시간 및 녹음 오디오용 음성-텍스트 변환, 텍스트-음성 변환, Voice Agent API, Audio Intelligence 분석을 제공합니다. Deepgram은 음성-텍스트 변환, 텍스트-음성 변환, LLM 오케스트레이션을 하나의 Voice Agent API에 결합했으며, 회사는 이를 통해 복잡성, 지연 시간, 비용이 줄어든다고 설명합니다.

2026년 1월 Deepgram은 AVP가 주도한 시리즈 C 라운드에서 13억 달러 기업가치로 1억 3,000만 달러를 유치했다고 밝혔습니다. 회사는 또한 회의 노트 도구 Granola, 음성 에이전트 스타트업 Vapi, Twilio를 포함해 1,300곳이 넘는 조직이 자사 음성 AI 제품과 모델을 사용한다고 밝혔습니다.

핵심 기능

Deepgram의 음성 인식 API는 실시간 전사를 위한 스트리밍 오디오와 일괄 처리를 위한 녹음 파일을 모두 받습니다.

음성-텍스트 변환 모델

  • Flux STT: 실시간 음성 에이전트를 위한 대화형 음성 인식 모델로, 10개 언어에서 작동하는 턴 감지와 끼어들기 처리가 내장되어 있습니다. 다국어 옵션은 영어, 스페인어, 프랑스어, 독일어, 힌디어, 러시아어, 포르투갈어, 일본어, 이탈리아어, 네덜란드어를 지원합니다.
  • Nova-3: 소음에 강하고 50개 이상 언어를 다국어로 지원하는 프로덕션 전사용 모델로 소개됩니다. 가격 페이지는 더 낮은 수치를 제시하며, Nova 모델이 화자 분리, 스마트 포맷팅, 키텀 프롬프팅, 자동 언어 감지와 함께 45개 이상 언어를 지원한다고 적고 있습니다.
  • Nova-2: Nova-2는 Nova-3가 아직 지원하지 않는 언어와 필러 단어 식별에 여전히 권장됩니다.
  • 업종별 튜닝 모델: 의료, 법률, 금융 같은 분야의 어휘와 구조를 겨냥합니다.
  • 커스텀 모델: 엣지 케이스 오디오를 위해 독점 데이터셋이나 새로운 데이터셋으로 학습시킬 수 있습니다.

정확도와 속도 수치는 업체 자체 발표입니다. Deepgram은 Nova-3의 단어 오류율이 경쟁사보다 스트리밍에서 54.2%, 일괄 처리에서 47.4% 낮다고 말합니다. 또한 300밀리초 이내에 전사 결과를 제공한다고 합니다. 키텀 프롬프팅은 핵심 단어 인식을 개선해 키워드 재현율을 최대 90% 높인다고 설명됩니다.

텍스트-음성 변환

  • Flux TTS: Flux TTS는 SSML, 스타일 태그, 프롬프트 엔지니어링 없이 세션 전체에서 어조, 속도, 감정 톤을 유지합니다. Deepgram은 프로덕션 부하에서도 Flux TTS 출력이 최저 80ms 만에 시작된다고 말합니다. 발신자가 끼어들면 API가 발신자가 실제로 들은 내용을 알려 줍니다.
  • Aura-2: 라인업에서 지원 언어가 가장 넓은 모델로, 7개 언어의 음성을 제공합니다.
  • Aura: Deepgram의 1세대 TTS 모델로, 영어 음성만 제공합니다.

Voice Agent API

Voice Agent API에는 끼어들기 감지, 턴 테이킹 예측, 함수 호출, 세션 중 제어가 포함됩니다. 팀은 Deepgram의 오케스트레이션과 스트리밍 파이프라인을 유지하면서 자체 LLM이나 TTS 공급자를 가져올 수 있습니다.

Deepgram은 OpenAI, Anthropic, Google, NVIDIA 공급자 유형에 대해 관리형 LLM을 제공하므로, 이들에는 엔드포인트가 필요하지 않습니다. Groq와 Amazon Bedrock 모델은 Deepgram이 해당 LLM을 관리하지 않으므로 자체 엔드포인트가 필요합니다. 관리형 모델에는 가격 등급이 붙습니다. claude-sonnet-4-5는 Advanced(고급), claude-haiku-4-5는 Standard(표준)로 표시되며, 등급에 따라 분당 요금이 정해집니다.

Audio Intelligence

Audio Intelligence는 전사본 위에 요약, 주제 감지, 의도 인식, 감정 분석을 더합니다. 감정 분석은 단어, 문장, 전사본 전체 수준에서 긍정, 중립, 부정 감정을 표시합니다. 이 기능들은 범용 대규모 언어 모델이 아니라 대화 데이터로 미세 조정한 경량 작업 특화 모델에서 실행됩니다.

가이드

  1. 계정 만들기: 무료 Deepgram 계정에 가입하면 API 키를 받을 수 있습니다.
  2. 모델과 언어 설정: 음성-텍스트 변환 모델은 language 파라미터로 따로 지정하지 않으면 영어가 기본값입니다. 텍스트-음성 변환은 모든 요청에 모델이 필요하며, Flux TTS는 /v2/speak, Aura-2와 Aura는 /v1/speak 엔드포인트에서 제공됩니다.
  3. 요청별 모델 학습 옵트아웃: 음성-텍스트 변환과 텍스트-음성 변환에서는 mip_opt_out=true를 쿼리 파라미터로 추가하고, Voice Agent에서는 Settings 메시지에 "mip_opt_out": true를 설정합니다. 옵트아웃한 요청은 Deepgram Console의 Usage > Logs에서 mip_opt_out이 true로 표시됩니다.
  4. 에이전트의 LLM 선택: Voice Agent의 LLM 모델도 같은 Settings 메시지에서 설정합니다.

Deepgram 활용 사례와 예시

Deepgram의 음성-텍스트 변환 API는 고객 지원, 의료, 미디어, 대화형 AI 분야의 전사를 겨냥합니다.

  • 콜센터와 음성 분석: 오디오를 텍스트로 변환해 대화를 분석하고 의도를 감지합니다.
  • 의료 전사: 의학 용어와 전문 키워드를 겨냥합니다.
  • 미디어와 팟캐스트: 팟캐스트, 동영상, 방송을 다루며 자막과 요약을 함께 제공합니다.
  • 고객 지원 및 아웃바운드 음성 에이전트: Deepgram 음성 합성 API는 끼어들기 처리와 턴 간 맥락 유지를 갖춘 아웃바운드 음성 에이전트용으로 포지셔닝되어 있습니다.
  • 식당 주문: Deepgram은 퀵서비스 레스토랑용 음성 AI 주문 시스템을 만든 스타트업 OfOne을 인수했습니다.

누구를 위한 것인가

Deepgram은 API와 SDK 형태로 판매되므로, 구매자는 보통 코드를 작성하는 팀입니다.

  • 개발자와 제품 팀: 셀프서비스 경로는 유연한 API를 원하는 개발자와 제품 팀을 겨냥합니다.
  • 플랫폼과 파트너: 파트너 경로는 Deepgram 음성 AI를 내장하는 플랫폼을 겨냥합니다.
  • 규제 대상 기업: 커스텀 모델과 계약은 고유한 워크플로와 컴플라이언스 요건이 있는 기업을 겨냥합니다.
  • 셀프 호스팅을 계획하는 팀: 기존 DevOps 리소스를 갖춘 팀을 위해 만들어졌습니다.

Flux TTS로 영어 이외 언어의 내레이션을 만들거나 매우 큰 음성 라이브러리가 필요한 프로젝트에는 덜 적합합니다.

플랫폼

  • 클라우드 API: 호스팅 옵션은 Deepgram 인프라에서 실행되는 멀티테넌트 클라우드 서비스입니다. API 속도 제한은 북미, 유럽, 호주, 인도 엔드포인트별로 따로 공개됩니다.
  • 전용 및 VPC: Voice Agent API는 완전 관리형, 전용 싱글테넌트, VPC 내부 또는 셀프 호스팅으로 배포할 수 있습니다.
  • 셀프 호스팅: 셀프 호스팅은 고유한 비즈니스 요건이 있는 Premium 고객에게 제공됩니다. Enterprise 셀프 호스팅 컨테이너는 고객 VPC나 온프레미스 하드웨어에서 실행되며 NVIDIA GPU가 필요합니다. Deepgram은 클라우드 인프라, 베어메탈 또는 Amazon SageMaker 마켓플레이스 등록 상품을 통해 셀프 호스팅할 수 있습니다.
  • SDK: Deepgram SDK는 Java, JavaScript, Python, Go, .NET용으로 제공됩니다.
  • 음성 에이전트 프레임워크: Deepgram TTS는 스트리밍 API를 통해 LiveKit, Pipecat, Vapi 및 기타 음성 에이전트 오케스트레이션 프레임워크와 연동됩니다.
  • 전화: Voice Agent API는 양방향 WebSocket 스트리밍으로 8kHz mu-law 전화 오디오를 지원합니다. Deepgram은 Twilio 연동과 함께 Genesys Cloud CX, Amazon Connect 연동도 문서화하고 있습니다.
  • Playground: Playground에서 모델을 테스트할 수 있으며, 스타터 앱은 GitHub에 공개되어 있습니다.

가격

Deepgram 가격은 사용량 기반이며, 좌석 단위가 아니라 제품과 모델별로 나뉩니다.

요금제와 동시 처리

Pay As You Go(종량제)는 $200 무료 크레딧으로 시작한 뒤 사용량에 따라 청구하며, Growth는 연간 $4K+부터 시작합니다. Pay As You Go는 최소 사용액과 만료가 없고 시작할 때 신용카드도 필요 없습니다. Growth는 실제 사용량에서 차감되는 연간 선불 크레딧으로 최대 20%를 절약할 수 있습니다. Enterprise 조건은 영업팀이 견적을 냅니다.

서비스Pay As You GoGrowth
음성-텍스트 변환(REST / WebSocket / Whisper Cloud)최대 50 / 150 / 5최대 50 / 225 / 5
텍스트-음성 변환(REST + WebSocket)최대 45최대 60
Voice Agent(WebSocket)최대 45최대 60
Audio Intelligence(REST)최대 10최대 10

음성-텍스트 변환 요금

스트리밍 음성-텍스트 변환 요금은 현재 기간 한정 프로모션 요금으로 표시되어 있어, 정상가는 괄호 안에 적었습니다.

모델방식Pay As You GoGrowth
Flux 영어스트리밍$0.0065/분(정상가 $0.0077)$0.0057/분(정상가 $0.0065)
Flux 다국어스트리밍$0.0078/분$0.0068/분
Nova-3 단일 언어스트리밍$0.0048/분(정상가 $0.0077)$0.0042/분(정상가 $0.0065)
Nova-3 다국어스트리밍$0.0058/분(정상가 $0.0092)$0.0050/분(정상가 $0.0078)
Nova-3 단일 언어사전 녹음$0.0043/분$0.0036/분
Nova-3 다국어사전 녹음$0.0052/분$0.0043/분
Whisper Large사전 녹음$0.0048/분$0.0048/분

부가 기능은 모델 요금에 더해 청구됩니다.

  • 민감 정보 가림(Redaction)은 Pay As You Go에서 $0.0020/분, Growth에서 $0.0017/분입니다.
  • 키텀 프롬프팅(Keyterm Prompting)은 Pay As You Go에서 $0.0013/분, Growth에서 $0.0012/분입니다.
  • 스마트 포맷팅(Smart Formatting)은 두 요금제 모두에 포함됩니다.

과금은 초 단위이므로 14초짜리 파일은 정확히 14초로 청구됩니다. 멀티채널 오디오는 처리된 총 길이로 청구되므로, 10분짜리 스테레오 파일은 20분으로 계산됩니다.

텍스트-음성 변환 요금

모델Pay As You GoGrowth
Flux TTS1,000자당 $0.04501,000자당 $0.0405
Aura-21,000자당 $0.0301,000자당 $0.027
Aura-11,000자당 $0.01501,000자당 $0.0135

2026년 12월 31일까지 Pay As You Go와 Growth에서 Flux TTS 지출액만큼 크레딧이 최대 $500까지 매칭 지급됩니다. Flux TTS 무료 빌드 기간은 2026년 9월 12일까지였고, 2026년 9월 13일부터 표준 요금이 적용되고 있습니다. 텍스트-음성 변환 제품 페이지 FAQ는 Deepgram TTS가 1,000자당 $0.15부터 시작한다고 적고 있어 위 표의 Aura-1 요금과 맞지 않습니다.

Voice Agent 및 Audio Intelligence 요금

Voice Agent 등급Pay As You GoGrowth
표준$0.075/분$0.068/분
표준(자체 TTS 사용)$0.065/분$0.051/분
커스텀(자체 LLM 및 TTS 사용)$0.050/분$0.041/분
고급$0.163/분$0.146/분
고급(자체 TTS 사용)$0.122/분$0.110/분

Voice Agent 사용 시간은 WebSocket 연결 시간을 기준으로 계산됩니다. Pay As You Go에서 요약은 입력 토큰 1,000개당 $0.0003, 출력 토큰 1,000개당 $0.0006입니다.

크레딧, 초과 사용, 환불

  • 자동 충전: 기본으로 켜져 있으며, 남은 크레딧이 $10가 되면 $100를 다시 충전합니다.
  • 환불 기간: 최근 30일 이내에 구매한 미사용 크레딧은 환불을 요청할 수 있습니다. 그 외에는 해지하더라도 당시 가격표(Pricing List)에 명시된 경우를 제외하고 미사용 크레딧을 환불받을 권리가 없습니다.
  • 만료: 계정이 폐쇄되거나 구독이 취소 또는 종료되면 크레딧이 만료됩니다.
  • Growth 초과 사용: 초과 사용분은 Pay As You Go 요금으로 전환되지 않고 Growth 요금에 할증을 더해 청구됩니다. 가격 FAQ는 이를 10% 초과 사용 수수료라고 부릅니다. 초과 사용 요금은 매주 후불로 등록된 카드에 청구됩니다.
  • 양도: 가격 FAQ는 구매한 크레딧을 요청 시 같은 조직 내 계정 간에 이전할 수 있다고 말합니다. 반면 서비스 약관은 크레딧이 양도 불가능하며 현금 가치가 없다고 명시합니다.
  • 스타트업: 스타트업 프로그램에 선정되면 12개월 동안 최대 $100,000의 크레딧을 받을 수 있습니다.

Deepgram 대안

이 분야에서 공개된 비교는 대부분 업체 자신이 낸 것입니다.

  • AssemblyAI: Deepgram 자체 AssemblyAI 비교 페이지는 두 업체 모두 셀프 호스팅과 BAA 체결 경로를 문서화하고 있다고 말하며, 사용자 자신의 오디오로 동일 조건에서 테스트하는 것을 결정 요인으로 봅니다.
  • OpenAI Whisper: Whisper는 Deepgram 안에서도 사전 녹음 오디오용 Whisper Large로 제공됩니다. 한 음성 에이전트 개발자가 실제 고객 통화 100건으로 음성-텍스트 변환 공급자 13곳을 비교한 테스트를 공개했습니다. 이 테스트에서 단어 오류율은 Deepgram Flux가 15.86%로 가장 낮았고 OpenAI Whisper가 39.78%로 가장 높았습니다. 우편번호 인식은 Deepgram을 포함한 모든 공급자에서 단어 오류율이 50%를 넘었습니다. 한 팀이 자체 통화 데이터로 진행한 테스트이며 일반적인 순위가 아닙니다.
  • ElevenLabs: Deepgram은 자사 TTS를 실시간 음성 에이전트용으로 포지셔닝하면서, ElevenLabs가 더 큰 음성 라이브러리와 더 넓은 언어 지원을 갖춰 콘텐츠 제작에 적합하다는 점을 인정합니다.
  • Cartesia: Deepgram은 Cartesia를 빠른 합성, 텍스트 태그를 통한 표현력 제어, 폭넓은 다국어 음성 라이브러리로 알려진 업체로 설명합니다.

제한 사항

제품 및 사용 제한

  • 음성 언어: Flux TTS는 영어 전용이며, 스페인어, 독일어, 프랑스어, 네덜란드어, 이탈리아어, 일본어 음성에는 Aura-2가 필요합니다.
  • EU의 Whisper: EU 엔드포인트에서는 Whisper 모델이 지원되지 않습니다.
  • Whisper 동시 처리: API 속도 제한 문서는 Whisper Cloud를 북미에서 사전 녹음 동시 요청 최대 3건, 다른 지역에서는 사용 불가로 표시하지만, 가격 페이지는 최대 5건으로 표시합니다.
  • 프로젝트: 속도 제한은 프로젝트 단위로 적용되며, 셀프서비스 계정의 보조 프로젝트는 동시 스트림 1개로 제한됩니다.
  • 한도 초과: Pay As You Go에서는 동시 처리 한도를 넘는 요청이 대기열에 들어가거나 거부될 수 있습니다.
  • 잘못된 업로드: 고객은 자체 시스템 때문에 발생한 잘못된 업로드를 포함해 처리된 모든 파일에 대해 비용을 지불합니다.

약관상 이용 규칙

  • 약관은 모델 학습, 벤치마킹, 경쟁 분석을 포함해 서비스나 출력물을 경쟁 목적으로 사용하는 것을 금지합니다.
  • 사용자는 오디오 출력물을 사람이 만든 것처럼 제시해서는 안 되며, 법적으로 요구되는 AI 생성 고지를 해야 합니다.
  • 출력물은 고유하지 않을 수 있으며, Deepgram은 다른 고객을 위해 생성된 유사한 출력물을 사용자가 소유한다고 진술하지 않습니다.
  • 비즈니스 협력자 계약(BAA)을 체결하지 않았다면 보호 대상 건강 정보를 전송할 수 없습니다.

데이터 이용과 개인정보

API 요청은 기본적으로 모델 개선 프로그램(Model Improvement Program)에 참여하며, Deepgram이 이를 보관합니다. 약관은 Deepgram이 모델 학습과 테스트를 포함해 서비스 개선에 고객 입력과 출력을 사용하는 것을 허용합니다.

  • 옵트아웃: 요청에 mip_opt_out=true를 설정하면 보관 대상에서 제외되며, 리전 엔드포인트에서는 서드파티 Voice Agent 공급자를 제외하고 요청이 해당 리전 안에 머뭅니다. 옵트아웃한 요청은 응답이 반환된 뒤 오디오, 텍스트, 전사본, 합성 오디오의 데이터 보관이 0입니다. 계정 또는 배포 전체에 대한 옵트아웃 강제 적용은 Deepgram에 문의하면 됩니다.
  • 로그: 요청 메타데이터와 사용 로그는 90일 동안 조회할 수 있으며, 요약된 사용량은 더 오래 보관됩니다.
  • 데이터 상주: 리전 내 처리를 완전히 보장하려면 리전 엔드포인트와 mip_opt_out=true가 모두 필요합니다. EU 엔드포인트 요청은 절대 EU 밖으로 라우팅되지 않으며, 해당 리전을 사용할 수 없으면 폴백하지 않고 실패합니다.
  • 소유권과 공유: Deepgram은 고객 입력과 출력에 대한 소유권을 주장하지 않습니다. Deepgram은 고객 데이터를 판매하거나 광고 프로필에 사용하거나 허가 없이 재배포하지 않는다고 말합니다.
  • 정책 범위: 웹사이트 개인정보 고지는 고객 데이터 처리에는 적용되지 않습니다.
  • 셀프 호스팅 데이터 흐름: 일반적인 셀프 호스팅 배포에서는 오디오, 전사본, 요청 식별 콘텐츠가 Deepgram으로 전송되지 않습니다.
  • 인증: Deepgram은 SOC 2 Type 1 및 Type 2 인증을 받았다고 밝힙니다. Deepgram은 ePHI를 다루는 Enterprise 고객과 비즈니스 협력자 계약을 체결합니다.

FAQ

Q1. Deepgram을 무료로 써 볼 방법이 있나요?

네. 새 Pay As You Go 계정은 신용카드 없이 $200 크레딧으로 시작하며, 이후 사용량은 분당, 1,000자당 또는 에이전트 연결 시간 분당으로 청구됩니다.

Q2. Deepgram이 제 오디오로 모델을 학습시키나요?

기본적으로는 그렇습니다. 요청은 모델 개선 프로그램에 참여하고 보관됩니다. 요청에 mip_opt_out=true를 추가하면 제외되며 해당 내용의 보관도 중단됩니다.

Q3. 처리를 EU 안에 머물게 할 수 있나요?

Deepgram은 요청을 EU 밖으로 라우팅하지 않는 전용 EU 엔드포인트를 제공합니다. 리전 내 처리를 완전히 보장하려면 모델 개선에서도 옵트아웃해야 하며, 이 엔드포인트에서는 Whisper 모델을 사용할 수 없습니다.

비슷한 도구를 아시나요?
다른 훌륭한 AI 도구를 알고 계시다면 저희에게 제출해 주세요