ElevenLabs 음성 생태계가 더욱 발전했습니다. Scribe v2 및 ElevenAgents 표현 모드가 "말하기"를 "표현하기"로 업그레이드했습니다.
ElevenLabs는 음성 생태계를 지속적으로 확장하고 있습니다. Scribe v2 음성 인식 및 ElevenAgents의 표현 기능이 향상되었습니다. Music v2, Dubbing v2와 함께 3계층 제품 구조(창작/대화/API)가 동시에 강화되었습니다.
ElevenLabs는 음성 생태계를 더욱 발전시킵니다: Scribe v2 및 ElevenAgents Expressive Mode, "말하기"를 "표현하기"로 업그레이드
ElevenLabs는 2026년에도 음성 생태계를 계속 발전시킬 것입니다. 최신 업데이트는 Scribe v2 음성 인식(STT)과 ElevenAgents의 표현 모드 향상(Expressive Mode)이라는 두 가지 주요 라인에 중점을 두고 있으며 Music v2 및 Dubbing v2와 같은 창의적인 이정표에 겹쳐져 있습니다. 'AI 커뮤니케이션 플랫폼'으로 자리매김한 이 회사는 ElevenCreative, ElevenAgents, ElevenAPI의 3계층 구조를 통해 스피치(Speech)를 '세대'에서 '이해와 대화'로 발전시키고 있습니다.
- Scribe v2(STT): 2026-01년에 출시되었으며, 여러 음성 인식 벤치마크에서 98%의 정확도에 도달했다고 공식 공개하여 "음성 이해" 측면에서 플랫폼의 단점을 보완했습니다.
- 상담원을 위한 표현 모드: 2026-02년에 출시되어 고객 서비스/비즈니스 음성 상담원이 "정확하게 답변"할 수 있을 뿐만 아니라 어조와 감정을 표현할 수 있도록 하여 인간과 기계 대화의 자연스러움을 향상시킵니다.
- 창의적인 측면에서 두 배의 이정표: Music v2 및 Dubbing v2는 2026~05년에 출시되어 음악 생성 및 다국어 더빙 기능을 전체적으로 업그레이드할 예정입니다.
- 3계층 제품 구조 형성: ElevenCreative(생성), ElevenAgents(세션), ElevenAPI(개발자)는 동일한 기본 모델 및 자산 시스템을 공유합니다.
버전 배경
ElevenLabs의 핵심 자산은 텍스트 음성 변환, 음성 텍스트 변환, 음성 복제, 더빙, 음악 생성, SFX 및 이미지 및 비디오와 같은 기능을 다루는 음성 기본 모델입니다. 음성 모델 계보에는 Eleven Flash(75ms 초저 지연 시간), Eleven Multilingual v2(고충실도), Eleven v3(높은 표현력) 및 Scribe v2(STT, 98% 정확도)가 포함됩니다. 공식 웹사이트 주석은 70개 이상의 언어와 5000개 이상의 사전 설정 음성 라이브러리를 지원합니다.
2026년 업데이트의 주요 라인은 "음성 생성"과 "음성 이해"를 동일한 제품 링크에 넣어 기업 내 여러 공급업체의 결합으로 인해 발생하는 음색 불일치 및 데이터 섬 문제를 줄이는 것입니다. 이는 "TTS 도구"에서 "음성 인프라"로 업그레이드하는 핵심 단계이기도 합니다.
이번 버전의 하이라이트
음성이해 측면: Scribe v2
- 고정확도 전사: 다국어 시나리오를 다루는 98% 정확도의 여러 벤치마크를 공식적으로 공개했습니다.
- 폐쇄 루프 대화 지원: STT와 TTS는 협력하여 음성 에이전트가 단방향 방송이 아닌 "이해 및 응답"의 완전한 폐쇄 루프를 가질 수 있도록 합니다.
세션 측: ElevenAgents 표현 모드
- 감정 표현 능력: 상담원은 상황에 따라 어조와 감정 표현을 조정할 수 있어 고객 서비스 시나리오에서 청취 경험을 크게 향상시킬 수 있습니다.
- 비즈니스 구성 기능: 고객 서비스 및 비즈니스 프로세스를 위해 구성 및 모니터링 가능한 음성 및 텍스트 대화 에이전트를 제공합니다.
창의적인 측면: Music v2 및 Dubbing v2
- Music v2: 음악 생성 기능이 전체적으로 업그레이드되었으며, 창작자의 오디오 에셋 링크가 완성되었습니다.
- 더빙 v2: 영화, TV 및 콘텐츠의 전 세계 배포를 지원하기 위해 다국어 더빙 기능이 향상되었습니다.
개발자에게 의미
국내 개발자와 제품팀이 일레븐랩스의 생태적 진화에서 주목해야 할 두 가지 포인트가 있다. 첫째, 음성 에이전트는 고객 서비스, 아웃바운드 통화, 마케팅의 새로운 매체로 자리잡고 있으며, "표현성"은 기존 IVR과 구별되는 핵심 변수입니다. 표현 모드와 같은 기능은 사용자의 AI 고객 서비스 수용에 직접적인 영향을 미칩니다. 둘째, STT + TTS + Agent의 통합 솔루션은 음색 일관성 및 데이터 관리 측면에서 "다중 조립"보다 더 많은 이점을 가지고 있지만 음성 데이터의 규정 준수 및 개인 정보 보호 요구 사항에도 주의를 기울여야 합니다.
이에 비해 오픈 소스 측의 Whisper는 STT에서 무료 셀프 호스팅을 위한 또 다른 경로를 제공하는 반면 ElevenLabs의 가치는 관리 가능한 엔터프라이즈 수준 서비스에 대한 패키징 식별, 생성 및 세션에 있습니다. 둘 다 각각 "자체 구축된 데이터 파이프라인" 및 "빠른 실행" 팀에 적합합니다.
경로 제안 사용
- 크리에이터: ElevenCreative로 시작하여 음성 복제, 더빙 및 음악 생성을 경험하고 콘텐츠 제작 워크플로를 확인하세요.
- 엔터프라이즈 고객 서비스/아웃바운드 통화: ElevenAgents의 표현 모드 및 모니터링 기능을 평가하고, 소규모 트래픽으로 시험한 후 용량을 확장합니다.
- 개발자: ElevenAPI를 통해 TTS/STT/에이전트 기능을 통합하고 7가지 구독 수준(무료부터 기업까지) 및 사용 크레딧의 비용 모델에 중점을 둡니다.
추적할 가치가 있는 길찾기
- Scribe v2의 중국어 및 방언 적용 범위: 국내 현지화 시나리오에서 다국어 전사 품질 성능을 측정했습니다.
- 표현 모드 구현 시나리오: 고객 서비스, 오디오 콘텐츠 및 기타 시나리오의 채택률 및 사용자 수락 데이터입니다.
- 기업 규정 준수 및 데이터 보안: 중국에서 사용되는 음성 데이터에 대한 규정 준수 경로는 국내 팀이 액세스할 수 있는지 여부를 결정하는 핵심 전제 조건입니다.
후기