딥그램 API

-

Deepgram은 통합 API 세트를 통해 실시간 음성 인식(STT), 텍스트 음성 변환(TTS), 음성 에이전트 오케스트레이션 및 오디오 인텔리전스 분석을 제공하는 업계 최고의 음성 AI API 플랫폼입니다. Nova-3 모델은 300ms 미만의 전사 대기 시간으로 50개 이상의 언어를 지원합니다. Flux 대화형 모델에는 차례 감지 기능이 내장되어 있습니다. Aura-2 TTS 대기 시간은 200ms 미만입니다. 이 플랫폼은 SOC 2, HIPAA, GDPR 인증을 받았으며 기업 수준 고객으로는 Twilio, Cloudflare, Sierra 등이 있습니다.

딥그램 API 제품 인터페이스

Deepgram API의 포괄적인 분석: 음성 AI 인프라 통합

핵심 매개변수 및 통계

치수 사양
제품 포지셔닝 통합 음성 AI API 플랫폼(STT/TTS/음성 에이전트/오디오 인텔리전스)
배송 형태 클라우드 API(퍼블릭 클라우드/프라이빗 클라우드/자체 호스팅)
기본 모델 Nova-3(Universal Transcription, 50개 이상의 언어), Flux(대화형 STT, 10개 언어), Aura-2(TTS, 40개 이상의 영어 음성)
STT 지연 시간 라이브 스트리밍 <300ms(Nova-3), Flux 내장 회전 감지
TTS 지연 시간 스트리밍 <200ms(Aura-2)
지원되는 언어 STT 50개 이상의 언어, TTS는 주로 영어(다중 악센트 포함)
보안 규정 준수 SOC 2 유형 1 및 2, HIPAA(서명 BAA), GDPR, CCPA, PCI
배포 방법 퍼블릭 클라우드 API, 프라이빗 클라우드/싱글 테넌트 VPC, 로컬 셀프 호스팅
GitHub 조직 팔로워 658명, 리포지토리 115개, 별 450개 이상(Python SDK)
회사설립 2015년, 미국 샌프란시스코에 본사 위치
금융현황 2026년 1월 1억 3천만 달러 규모의 시리즈 C 완료, 가치 13억 달러(유니콘)
최신 버전 2026.07 — Flux 다국어 + 음성 에이전트 API GA

매개변수 해석: Deepgram의 핵심 경쟁 장벽은 통합 API 입구(단일 음성 에이전트 API가 STT/LLM/TTS를 통합함), 통합 스트리밍 인프라(STT와 TTS가 동일한 스트리밍 파이프라인을 공유하여 핸드셰이크 지연을 줄임), 통합 배포 솔루션(동일한 API가 퍼블릭 클라우드, 프라이빗 클라우드 또는 로컬에서 실행될 수 있음)이라는 세 가지 "통합"에 반영됩니다. 이 아키텍처 설계를 통해 종단 간 음성 상호 작용의 전체 링크 지연을 업계에서 가장 낮은 수준 중 하나로 압축할 수 있습니다. 개발자 입장에서 이는 여러 서비스 제공자 간에 STT, NLU, TTS의 세 가지 독립 시스템을 연결할 필요가 없음을 의미합니다. 음성 입력부터 음성 출력까지 하나의 API Key로 완료할 수 있습니다.

사용자 및 시장 인지도

엔터프라이즈 수준의 고객 범위: Deepgram의 고객 목록은 Twilio(통신 인프라), Cloudflare(에지 컴퓨팅), Sierra(엔터프라이즈 AI 에이전트), Cresta(고객 서비스 인텔리전스), Kore.ai(엔터프라이즈 대화 AI), Daily(실시간 커뮤니케이션 프레임워크), Vapi(음성 에이전트 플랫폼), Granola(회의 메모), Jack in the Box(패스트푸드 체인) 등을 포함한 여러 산업 분야의 주요 기업에 걸쳐 있습니다. 제품 페이지에는 고객 센터, 의료, 미디어, 금융 서비스 및 기타 분야에 걸친 고객이 나와 있습니다.

개발자 커뮤니티: GitHub 조직에는 658명의 팔로워가 있으며 공식 SDK에는 Python(별 450개), JavaScript/TypeScript(별 268개), Go(별 87개), .NET(별 53개), Java(별 8개) 및 Rust(별 66개)가 포함됩니다. 커뮤니티는 Discord 및 GitHub 토론에서 활발히 활동하고 있으며 공식 기술 문서 API Playground 및 샘플 코드 라이브러리가 제공됩니다.

시장 인지도: 2026년 1월 13억 달러 가치의 1억 3천만 달러 규모의 시리즈 C 파이낸싱을 완료하고 유명 투자 기관이 주도하는 유니콘 진영에 진입했습니다. 같은 기간에는 드라이브인 레스토랑용 음성 AI 기업인 오브원(OfOne)을 인수해 수직적 시나리오에서의 확장 야망을 드러냈다. 로이터, 실리콘앵글, 포브스 등 업계 매체가 이를 보도했다.

비용 이점

C측/개인 개발자

Deepgram은 $200 무료 크레딧을 제공하며, 신용카드를 묶지 않고도 등록하고 사용할 수 있습니다. 모든 공개 모델 엔드포인트는 무료 할당량 내에서 경험할 수 있습니다. 개인 개발자가 프로토타입 검증, 소규모 실험 또는 학습 통합을 수행하는 데 적합합니다.

API / 개발자 수준

청구 모델은 종량제이며 연간 패키지의 사전 구매를 지원합니다(성장 계획, 최대 20% 할인).

음성 인식(STT) 가격 비교:

모델 종량제(스트리밍/분) 성장(스트리밍/분) 종량제(사전 기록/시간) 성장(사전녹화/시간)
플럭스 영어 $0.0065/분 $0.0057/분 $0.0077/분 $0.0065/분
플럭스 다국어 $0.0078/분 $0.0068/분 위와 동일 위와 동일
Nova-3 단일어 $0.0048/분 $0.0042/분 $0.0077/분 $0.0065/분
Nova-3 다국어 $0.0058/분 $0.0050/분 $0.0092/분 $0.0078/분
맞춤 영업팀에 문의 영업팀에 문의 영업팀에 문의 영업팀에 문의

STT 추가 기능: 민감한 정보 둔감화(수정) $0.0020/분, 키워드 향상(키텀 프롬프트) $0.0013/분, 화자 분리(분할) $0.0020/분; 스마트 서식이 무료로 포함되어 있습니다.

음성 합성(TTS) 가격:

모델 종량제 성장
아우라-2 $0.030/1,000자 $0.027/1,000자
아우라-1 $0.015/1,000자 $0.0135/1,000자

음성 에이전트 API 가격(모두 포함):

패키지 종량제 성장
표준(Deepgram 풀스택) $0.075/분($4.50/시간) $0.068/분
표준 - BYO TTS $0.065/분 $0.051/분
맞춤형 - BYO LLM + TTS $0.050/분 $0.041/분
고급 $0.163/분 $0.146/분

오디오 인텔리전스: 요약 생성 $0.0003-$0.0006/1,000개 토큰(입력/출력), 주제 감지, 감정 분석 및 의도 인식이 가격에 포함됩니다.

기업/민영화 수준

엔터프라이즈 버전은 주문형 가격으로 책정됩니다. 확인을 위해 영업팀에 문의하세요. 사용자 정의 모델 교육, 단일 테넌트 VPC 배포, 로컬 자체 호스팅, HIPAA BAA 서명, 더 높은 동시성 제한 및 독점 SLA와 같은 차별화된 기능을 지원합니다. 월 평균 오디오 시간이 수만 시간이 넘는 사용량이 많은 시나리오의 경우 기업 계약은 성장 가격에 대해 추가 할인을 받는 경우가 많습니다.

숨겨진 비용 팁: Deepgram은 무음 세그먼트를 청구하거나 오디오 지속 시간을 반올림하지 않으며 실제 유효 비용은 원래 지속 시간을 기준으로 예상보다 낮을 수 있습니다. 다만, 추가 기능(민감화, 키워드 강화, 화자 분리)은 독립적으로 과금되며, 여러 추가 기능을 조합하여 사용할 경우 단일 전사 비용이 크게 증가합니다.

주요 기능

  • 실시간 음성 인식(스트리밍 STT): WebSocket을 통해 오디오를 스트리밍하는 Nova-3 모델은 300ms 미만의 지연으로 중간 결과를 반환하고 회전 감지 및 자동 문장 분할을 지원합니다. 음성 도우미, 온라인 고객 서비스 등 지연 시간이 짧은 피드백이 필요한 실시간 대화 시나리오에 적합합니다.

  • 사전 녹음된 오디오 전사(사전 녹음된 STT): REST API가 오디오 파일을 제출합니다(다중 채널 지원). Nova-3는 50개 이상의 언어를 지원하며 일괄 처리 속도는 경쟁 제품보다 최대 40배 빠릅니다. 팟캐스팅, 회의 녹음, 콜센터 품질 검사 등 비실시간 시나리오에 적합합니다.

  • 대화형 음성 인식(Flux): VAD(음성 활동 감지) 외부 구성 요소에 의존하지 않고 자연스러운 생각 전환 감지(사고 종료 감지) 및 중단 처리(바지인) 기능이 내장된 음성 에이전트용으로 특별히 설계된 인식 모델입니다. 10개 언어를 지원하며 다국어 버전은 2026년 7월 출시됩니다.

  • 텍스트 음성 변환(Aura-2 TTS): 200ms 미만의 지연 시간으로 신경망 음성 합성을 스트리밍하고 40개 이상의 영어 음성(미국, 영국, 호주 및 기타 악센트 포함)을 제공하고 상황 인식 음성 속도 및 감정 조정을 지원합니다. Deepgram Prompting 기술로 발음 스타일을 미세 조정하세요.

  • Unified Voice Agent API: 단일 API는 STT → LLM 오케스트레이션 → TTS 풀 링크를 통합하여 BYO LLM(OpenAI, Anthropic 등) 및 BYO TTS를 지원합니다. 세션 내 내장 함수 호출, 의도 라우팅 및 동적 구성 전환. 고정 가격은 시간당 $4.50입니다.

  • 오디오 지능형 분석: 경량 특화 모델을 기반으로 요약 생성, 감정 분석(3단계 단어/문장/대화), 의도 인식, 주제 감지 기능을 제공합니다. 값비싼 범용 대형 언어 모델을 호출하지 않고도 대화 오디오에서 구조화된 통찰력을 추출할 수 있습니다.

  • 고급 전사 향상: 화자 분리(분할)는 누가 언제 말했는지 자동으로 표시합니다. 자동 구두점/대문자/숫자 형식 지정(스마트 형식 지정); 키워드 강화(Keyterm Prompting)는 특정 분야의 용어에 대한 인식 및 회상률을 최대 90%까지 높일 수 있습니다. 민감한 정보 둔감화(수정)는 주민등록번호, 신용카드 번호와 같은 PII를 자동으로 제거합니다. Filler Words(필러 단어)는 "um" 및 "ah"와 같은 음성 표시를 유지합니다.

전문가의 견해: Deepgram의 제품 라인 간에는 상당한 시너지 효과가 있습니다. STT의 출력은 Audio Intelligence에 대한 직접 입력으로 사용될 수 있으며, Audio Intelligence의 요약은 자동 음성 보고서 생성을 위한 TTS의 입력으로 사용될 수 있습니다. Voice Agent API는 LLM 오케스트레이션 레이어를 통해 STT와 TTS를 엔드투엔드 음성 대화 파이프라인에 연결하므로 개발자는 스트리밍 오디오의 동기화, 코덱 및 연결 관리를 별도로 처리할 필요가 없습니다. 이 "획득-이해-생성" 기능은 Deepgram을 단순한 API 모음이 아니라 완전한 음성 AI 운영 체제로 만듭니다.

모델 및 버전의 진화

메인라인 출시

  • 2025.02 — Flux Conversational STT: 처음으로 회전 감지 기능이 음향 모델에 직접 내장되어 기존의 독립적인 VAD 구성 요소에 작별을 고했습니다. 영어 단일 언어를 지원하며 실시간 음성 Agent 시나리오를 지향합니다.
  • 2025.04 — Aura-2 TTS: 2세대 신경망 음성 합성 모델, 40개 이상의 영어 음성, 대기 시간 <200ms. Aura-1에 비해 발음 정확도, 자연성, 전문용어(의학용어, 금융용어) 처리 능력이 대폭 향상됐다.
  • 2026.01 — Nova-3 GA: 3세대 범용 전사 모델이 공식적으로 상용화되었습니다. 이전 세대 Nova-2에 비해 고유명사(제품명, 인명, 지명 등) 인식이 대폭 향상되었습니다. 핵심 용어 프롬프트를 사용하면 특정 용어의 인식 정확도를 10%에서 90% 이상으로 높일 수 있습니다. 50개 이상의 언어를 지원하며, 심한 소음 환경에서의 견고성이 크게 향상되었습니다.
  • 2026.06 — Flux 다국어 + 음성 에이전트 API GA: Flux가 10개 언어(영어/스페인어/독일어/프랑스어/힌디어/러시아어/포르투갈어/일본어/이탈리아어/네덜란드어)로 확장되었습니다. Voice Agent API가 공식적으로 상용화되어 Deepgram이 단일 API에서 풀 스택 음성 AI 플랫폼으로 전환하는 데 핵심 노드가 됩니다.
  • 2026.07 — 지속적인 반복: CLI 도구, 자체 호스팅 리소스 API 사양 및 기타 인프라가 지속적으로 업데이트되며 GitHub 조직 산하 115개 웨어하우스가 여전히 활발하게 활동하고 있습니다.

후보자 확인

Deepgram은 또한 기업 사용자가 독점 데이터 세트를 기반으로 Nova-3 모델을 미세 조정하여 가장자리 장면의 인식 정확도를 더욱 향상시킬 수 있는 맞춤형 모델 교육 서비스도 제공합니다. 이 서비스를 이용하려면 영업팀에 연락하여 데이터 양과 시나리오 요구 사항을 평가해야 합니다.

기술적인 장점

엔드 투 엔드 딥러닝 아키텍처: Deepgram은 2015년 설립 이후 (기존의 음향 모델 + 언어 모델 파이프라인 대신) 엔드 투 엔드 딥 러닝을 채택했으며, 단일 심층 신경망을 통해 오디오 파형에서 텍스트로의 매핑을 직접 학습합니다. 이 아키텍처의 장점은 기존 파이프라인의 모듈 간 정보 손실을 제거하고 모델이 추론을 위해 상황별 정보를 보다 완벽하게 활용할 수 있다는 것입니다.

통합 스트리밍 인프라: STT와 TTS는 동일한 스트리밍 인프라에서 실행되어 WebSocket 연결 관리, 오디오 코덱 및 스트리밍 버퍼 예약을 공유합니다. 이에 따른 직접적인 효과는 STT가 오디오를 텍스트 TTS로 변환한 후 응답 텍스트를 음성으로 변환할 때 중간에 서로 다른 서비스 간 네트워크 연결을 전환할 필요가 없고 종단 간 음성 통신 지연이 최소화된다는 점이다.

낮은 대기 시간 엔진: 제품 페이지에서는 Nova-3의 실시간 전사 중간 결과가 300ms 이내에 반환될 수 있고 Aura-2의 첫 번째 오디오 바이트가 200ms 이내에 도착할 수 있다고 주장합니다. Phonely CEO의 공개 의견에서 나온 측정 데이터에 따르면 Aura-2의 엔드투엔드 대기 시간은 일반적으로 200ms 미만이며, 이는 다른 주류 TTS 제공업체보다 2~4배 빠릅니다. 이러한 낮은 대기 시간은 음성 에이전트 시나리오에 매우 중요합니다. 인간의 귀는 300ms 이상의 대기 시간을 인식할 수 있으며, 그 이하에서는 자연스러운 대화 리듬을 얻을 수 있습니다.

특수 작업 모델 대 범용 대형 모델: 오디오 인텔리전스 기능은 범용 대형 언어 모델이 아닌 경량의 작업별 소형 모델을 사용하여 요약, 감정, 의도, 주제라는 4가지 차원에서 더 높은 도메인 정확도와 더 낮은 추론 비용을 달성합니다. 제품 페이지에는 이러한 모델이 도메인 대화 데이터에 대해 미세 조정되어 있으므로 유사한 비용의 범용 LLM 솔루션보다 특정 작업(예: 고객 서비스 대화 요약)에 더 정확하다는 것이 명확하게 나와 있습니다.

유연한 배포 토폴로지: 퍼블릭 클라우드 API → 프라이빗 클라우드/싱글 테넌트 VPC → 로컬 셀프 호스팅으로 프로토타입 검증부터 엄격한 규정 준수 기업까지 모든 배포 요구 사항을 충족합니다. 자체 호스팅 솔루션은 Docker/Kubernetes를 기반으로 하며 완전한 Helm 차트 및 배포 스크립트(GitHub: 자체 호스팅 리소스, 별 39개)를 제공합니다.

사용방법

등록 및 API 키

  1. console.deepgram.com에 접속하여 회원가입을 해주세요.
  2. 등록하면 $200 무료 크레딧을 받을 수 있습니다. 신용카드를 등록할 필요가 없습니다.
  3. 콘솔에서 API Key를 생성하고 필요한 권한(STT/TTS/Agent/Intelligence)을 선택하세요.
  4. REST API, WebSocket 또는 공식 SDK를 통해 요청을 시작합니다.

빠른 통화 예시

Python: 실시간 음성 인식(WebSocket):

``파이썬 deepgram import Deepgram에서 비동기 가져오기

dg_client = 딥그램('')

비동기 def transcribe_stream():

Nova-3 모델을 이용한 실시간 스트리밍 전사

연결 = dg_client.transcription.live를 기다립니다(
    {"모델": "nova-3", "언어": "en-US", "smart_format": True}
)
비동기 def on_message(self, result, **kwargs):
    인쇄(결과.채널.대안[0].transcript)
연결.온("transcript", on_message)

asyncio.run(transcribe_stream())


**cURL: 사전 녹음된 오디오 전사:**

``배쉬
컬 -X POST https://api.deepgram.com/v1/listen、model=nova-3&smart_format=true \
  -H "권한 부여: 토큰 <YOUR_API_KEY>" \
  -H "콘텐츠 유형: audio/wav" \
  --데이터 바이너리 @audio.wav

cURL: 텍스트 음성 변환(Aura-2):

``배쉬 컬 -X POST https://api.deepgram.com/v1/speak、model=aura-2-odysseus-en \ -H "권한 부여: 토큰 " \ -H "콘텐츠 유형: 애플리케이션/json" \ -d '{"text": "안녕하세요, Deepgram 음성 AI에 오신 것을 환영합니다."}' \ --speech.mp3 출력



**음성 에이전트 API 구성**: WebSocket을 통해 `wss://agent.deepgram.com/agent`에 연결하고 에이전트 구성(LLM 선택, 시스템 프롬프트 단어 TTS 음성)이 포함된 JSON 메시지를 전송하여 세션을 시작합니다. 전체 예를 보려면 [공식 문서](https://developers.deepgram.com/docs/voice-agent)를 참조하세요.

### 사용 가능한 SDK

Deepgram은 공식 SDK를 제공합니다: Python, JavaScript/TypeScript, Go, .NET, Java(Rust의 커뮤니티 버전도 사용 가능). 모든 SDK는 [github.com/deepgram](https://github.com/deepgram)에서 오픈소스로 제공됩니다. 또한 공식 CLI 도구는 터미널에서 직접 STT/TTS/오디오 스마트 기능 호출을 지원합니다.

## 제품 가격

**유료 모델 요약**:

| 레벨 | 적용대상 | 결제방법 | 시작 조건 |
|------|---------|---------|---------|
| 무료 할당량 | 개인 개발자, 프로토타입 검증 | $200 보너스 | 받으려면 등록하세요 |
| 종량제 | 중소기업 팀, 애플리케이션 증가 | 종량제, 최소 소비 없음 | 보너스 소진 후 자동 전환 |
| 성장 | 중간에서 높은 사용량의 애플리케이션 | 연간 요금제 사전 주문(20% 할인) | $4K+/년 |
| 기업 | 대규모 사용량, 규정 준수 요구 사항, 사용자 정의 요구 사항 | 영업팀에 문의 | 사업확인 |

**무료 크레딧 세부정보**: 모든 공개 API 엔드포인트(STT/TTS/Audio Intelligence/Agent)에 사용할 수 있는 $200 크레딧. 사용하지 않은 보너스는 만료되지 않습니다. 등록을 위해 신용카드를 등록할 필요가 없습니다.

**동시성 제한**: 종량제 50 동시성 WebSocket 150 동시성 하의 STT REST API; TTS 45 동시성; 음성 에이전트 45 동시성. 그에 따라 성장 패키지는 REST 50, WSS 225, TTS 60 및 Agent 60으로 업그레이드됩니다. 기업은 더 높은 동시성을 협상할 수 있습니다.

## 애플리케이션 시나리오

- **컨택 센터 및 고객 서비스 음성 AI**: 고객과 상담원의 대화를 실시간으로 기록하고, 오디오 인텔리전스와 결합하여 자동으로 통화 요약을 생성하고, 고객 감정을 감지하고, 의도를 식별하고, 주제별로 분류합니다. 일반적인 사용자로는 Stream It, Sharpen, Cresta, Revenue.io가 있습니다. **검증 초점**: 시끄러운 콜센터 환경에서 Nova-3의 말투와 잡음 견고성이 실제 인식률 요구 사항을 충족합니까? 핵심 용어 프롬프트가 비즈니스 관련 어휘를 다룰 수 있습니까?

- **음성 에이전트 및 대화형 AI**: 테이크아웃 주문(Jack in the Box), 고객 서비스(Sierra, Aircall), 의료 약속 등의 시나리오에서 사용할 수 있는 Voice Agent API를 기반으로 엔드투엔드 음성 AI 에이전트를 구축합니다. Flux에 내장된 순서 감지 및 방해 처리 기능은 대화 경험을 실제 사람 상호 작용에 더 가깝게 만듭니다. **검증 초점**: BYO LLM 모드에서는 LLM의 응답 지연이 종단 간 지연의 병목 현상이 됩니다. LLM 선택과 Deepgram 스트리밍 파이프라인의 적합성을 평가할 필요가 있습니다.

- **미디어 팟캐스팅 및 비디오 캡션**: 사전 녹음된 STT(실시간 속도 최대 40배)의 고속 일괄 처리 기능을 활용하여 캡션을 생성하고 팟캐스트, 비디오 및 라이브 스트림에 대한 색인을 검색합니다. 화자 분리 및 지능형 포맷 기능이 결합되어 수동 교정 비용이 크게 절감됩니다. **검증 핵심 포인트**: 다중 화자 시나리오에서의 분할 정확도가 제작 표준을 충족하는지 여부 다국어 콘텐츠의 경우 대상 언어가 지원 목록에 있는지 확인이 필요합니다.

- **의료 임상 문서**: HIPAA 규격 STT API를 통해 임상 대화의 실시간 기록을 가능하게 하고, 의료 용어를 지원하며(Keyterm Prompting으로 강화됨), 의사의 서류 작업 부담을 줄입니다. Deepgram 제품 페이지에는 수의학 분야(Talkatoo) 고객이 Nova-3를 통해 전문 용어 인식 정확도가 10%에서 625%로 향상되었음을 보여줍니다. **검증 핵심 사항**: BAA에 서명해야 합니다. 중국어 의학용어에 대한 지원은 독립적인 검증이 필요합니다.

- **음성 분석 및 엔터프라이즈 인텔리전스**: 고객 서비스 녹음, 영업 통화, 회의 기록을 대규모로 분석하고 Audio Intelligence를 통해 추세와 패턴을 추출합니다. Deepgram의 특화된 모델은 범용 LLM 솔루션에 비해 10~100배 저렴하며 하루 수백만 분 수준의 오디오 분석에 적합합니다. **검증 핵심 사항**: 요약/감정/의도의 정확성이 비즈니스 의사결정 요구 사항을 충족하는지 여부 사용자 정의 분류 시스템을 지원하는지 여부.

## 해당자

- **음성 애플리케이션 개발자**: 음성 비서, 음성 고객 서비스 또는 대화형 AI 제품을 구축하기 위해 지연 시간이 짧고 정확도가 높은 STT/TTS API가 필요한 백엔드 엔지니어입니다. Deepgram의 SDK는 주류 언어를 다루고 완전한 문서를 갖추고 있으며 API Playground를 통해 효과를 즉시 경험할 수 있습니다. **전제 조건**: REST API 또는 WebSocket 프로그래밍 기능이 있어야 합니다. $200 보너스는 MVP 인증을 완료하기에 충분합니다.

- **AI 에이전트 플랫폼 및 프레임워크**: Vapi, Daily(Pipecat), Cognigy, Kore.ai 등의 플랫폼 수준 제품에는 Deepgram의 음성 기능이 자체 플랫폼의 모듈로 내장되어 있습니다. Voice Agent API의 BYO LLM 기능을 통해 이러한 플랫폼은 자체적으로 선택한 모델을 유지할 수 있습니다. **전제 조건**: 더 높은 동시성과 SLA 보장을 위해서는 엔터프라이즈급 계약이 필요합니다.

- **엔터프라이즈 컨택센터 및 기술 리더**: 고객 서비스 시스템 업그레이드, 통화 품질 분석, AI 에이전트 도입을 담당하는 의사 결정자입니다. Deepgram의 SOC 2/HIPAA/GDPR 규정 준수 시스템과 Amazon Connect와의 기본 통합은 기업 조달에 대한 위험 임계값을 낮춥니다. **전제 조건**: 프라이빗 클라우드 또는 자체 호스팅 배포에는 일반적으로 6~12개월의 기술 평가 및 PoC 주기가 필요합니다.

- **뉴 미디어 및 콘텐츠 제작자**: 음성-텍스트 요구가 자주 발생하는 콘텐츠 팀(팟캐스트 기록, 인터뷰 편집, 비디오 자막) 사전 녹음된 STT의 일괄 처리 및 스마트 포맷 기능을 사용하여 몇 시간 분량의 오디오를 구조화된 문서로 몇 분 만에 변환할 수 있습니다. **전제 조건**: 도킹 도구 또는 자체 개발한 통합 스크립트가 필요합니다. Nova-3 Multilingual을 통해 중국어 지원이 가능하지만 정확도를 측정해야 합니다.

- **대중에게 적합하지 않음**: 극도로 낮은 예산으로 순수한 오프라인 대량 전사(네트워크 종속성 없음)가 필요한 프로젝트(Whisper와 같은 오픈 소스 솔루션을 고려하는 것이 좋습니다) 중국어 음성 합성을 사용해야 하는 고품질 TTS 시나리오(Deepgram의 현재 TTS는 주로 영어로 되어 있으며 중국어 음성 지원은 공개되지 않았으며 공식 문서의 적용을 받아야 함) 비디오 수준의 표현력 있는 감정 표현이 필요한 시나리오(게임 캐릭터 더빙, 오디오북 등) - Aura-2는 예술적인 연기 장면보다는 전문적인 대화 장면을 목표로 합니다.

## 요약 및 전망

Deepgram의 핵심 경쟁력은 "풀 스택 음성 AI의 통합 제공"에 있습니다. 기존에 API 세트에 접합되어 있던 STT, TTS, NLU 기능을 통합하고, 이를 기반으로 지연 시간이 짧은 스트리밍 엔진, 특화된 오디오 지능형 모델 및 유연한 배포 옵션을 추가합니다. 2026년 상반기 Flux 다국어 및 음성 에이전트 API GA 출시는 Deepgram이 "음성 인식 API 제공업체"에서 "음성 AI 운영 체제 플랫폼"으로 전환한 것을 의미합니다.

**현재 제한 사항 및 불확실성**:
- TTS의 음성 다양성은 여전히 주로 영어입니다. 다국어 TTS의 적용 범위와 적용 효과는 공개되지 않았습니다. 영어 이외의 국가에 있는 고객은 가용성을 확인해야 합니다.
- Voice Agent API의 BYO LLM 모드에서는 외부 LLM의 응답 속도에 따라 종단 간 지연이 제한됩니다. Deepgram이 제공하는 공식 가격 $4.50/hr는 권장 LLM 구성을 사용한다고 가정합니다.
- 중국어 등 아시아 언어의 STT 정확도는 Nova-3 Multilingual에서 지원되지만, 영어에 비해 공개 벤치마크 데이터가 적기 때문에 잠재적인 사용자는 실제 코퍼스 테스트를 수행해야 합니다.
- 자체 호스팅 배포의 리소스 요구 사항(GPU 모델, 추론 노드 수)이 공개 페이지에 명확하게 명시되어 있지 않습니다. 하드웨어 권장 사항을 얻으려면 판매점에 문의해야 합니다.
- Audio Intelligence의 요약/감정/의도 모델은 현재 맞춤 학습을 지원하지 않습니다. 기업의 수직적 분류 요구 사항이 높은 경우 추가 수동 규칙이 필요할 수 있습니다.

**조달 및 채택 위험 평가**:
- 중소 규모 팀의 경우 $200의 무료 할당량으로 시작하여 먼저 핵심 시나리오(STT 정확도, TTS 자연성, 엔드투엔드 대기 시간)가 비즈니스 기준을 충족하는지 확인한 후 필요에 따라 성장 계획으로 업그레이드하는 것이 좋습니다.
- 기업 수준 조달의 경우 PoC를 통해 세 가지 사항을 확인해야 합니다. ① 배포 토폴로지(퍼블릭 클라우드, 프라이빗 클라우드, 자체 호스팅)가 규정 준수 매트릭스를 충족하는지 여부. ② 주요 시나리오(특히 독점 어휘 및 소음 맥락)의 식별 정확도; ③ 연간 TCO가 예산 범위 내인지 여부(추가 기능 비용, 동시성 최대 비용, 추가 지원 가격 확인)
- Deepgram의 제품 반복 리듬(메이저 버전의 경우 약 2~3개월)에 주의하고, 계약서에 버전 업그레이드 및 API 포기에 대한 전환 기간 조항을 포함하는 것이 좋습니다.

관련 도구: elevenlabs, udio

버전 정보

  • Flux 다국어 + 음성 에이전트 API GA :Flux Multilingual 다국어 대화 음성 인식 모델(10개 언어) 출시, Voice Agent API가 공식적으로 상용화($4.50/hr), Aura-2 TTS 모델이 온라인 상태이며 Nova-3가 기본 생산 전사 모델이 됨
  • Nova-3 일반 가용성 :Nova-3 모델이 공식 출시되어 고유명사 및 소음 인식 정확도가 크게 향상되었으며, 50개 이상의 언어를 지원하고, Keyterm Prompting은 키워드 회상률을 최대 625% 향상시킵니다.
  • Aura-2 텍스트 음성 변환 출시 :Aura-2 TTS 모델 출시, 40개 이상의 영어 음성, 대기 시간 200ms 미만, 기업 수준 대화 시나리오에 최적화
  • Flux 대화형 STT 출시 :실시간 음성 에이전트 시나리오를 위해 특별히 설계된 차례 감지 및 방해 처리 기능이 내장된 Flux 대화형 음성 인식 모델 출시

사용자 후기

  • 후기를 불러오는 중...