Eleven v3 공식 출시: AI 음성이 "실제 사람을 구별하기 어렵다"는 새로운 단계에 진입
ElevenLabs는 자사의 주력 음성 모델인 Eleven v3가 음성 자연성, 감정 표현, 다국어 기능 및 안정성 측면에서 새로운 수준에 도달하여 공식 출시(GA)되었다고 2월 2일 발표했습니다. Scribe v2, Dubbing v2, Music v2와 함께 완전한 오디오 기술 스택을 구성하며 "가장 현실적인 AI 음성"을 위한 기술 기반입니다.
2월 2일, ElevenLabs는 주력 음성 모델 Eleven v3이 정식 출시되었다고 발표했습니다. "현실주의"를 사명으로 하는 기업에게 v3의 GA는 자사의 음성 합성 기술이 새로운 세대에 진입했음을 의미합니다. 음성 자연성, 감정 표현, 다국어 기능 및 안정성이 동시에 새로운 수준에 도달하여 "가장 현실적인 AI 음성"을 위한 기술 기반이 되었습니다.
v1/v2에서 v3까지의 기술적 맥락
ElevenLabs의 음성 모델 반복 경로는 명확합니다. v1/v2는 음성 복제 및 TTS의 기반을 마련하는 반면 v3은 긴 텍스트 일관성, 감정/어조 제어 및 다중 언어(수십 개 언어 포함) 기능을 강화합니다. ElevenLabs는 v3와 동시에 Scribe v2(음성 텍스트 변환, 2026년 1월), Dubbing v2(더빙, 2026년 5월), Music v2(2026년 5월) 등을 출시/반복하여 "음성 합성 + 인식 + 번역 + 음악"의 완전한 오디오 기술 스택을 구성했습니다.
비즈니스 제국의 기초
v3의 중요성은 기술에만 국한되지 않습니다. ElevenLabs는 시리즈 D 파이낸싱(미화 110억 달러 상당)과 미화 5억 달러의 ARR을 결합하여 v3(음성 에이전트, 더빙, 오디오북, 고객 서비스)를 기반으로 음성 AI 비즈니스 제국을 구축하고 있습니다. 이러한 시나리오는 모두 "AI 음성은 충분히 생생하다"는 전제를 기반으로 합니다. v3의 GA는 이러한 비즈니스 시나리오의 기초에 "적격" 라벨을 붙이는 것과 같습니다.
업계 관점에서 Eleven v3의 GA는 AI 음성 품질이 "실제 사람과 구별하기 어려운" 새로운 단계에 진입했음을 나타냅니다. 이는 기술적 승리일 뿐만 아니라 새로운 질문도 불러일으킵니다. AI 음성이 실제 사람과 다르지 않은 경우 "음성 신뢰"를 어떻게 구축할 수 있을까요? 딥페이크의 거버넌스는 어떻게 유지될 수 있나요? 국내 음성 AI 기업(Byte, Alibaba, Mobvoi 등)에게 v3는 경쟁적 기준(충실도가 새로운 수준에 도달함)이자 안전 경고(충실도의 이면에는 남용의 위험이 있음)입니다. AI 보이스트랙 후반부에서는 '그렇게 보이느냐'뿐 아니라 '책임있게 사용할 수 있는가'도 경쟁을 펼칠 예정이다.
앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.
- v3와 v2의 실제 청취 차이: 실제 장면에서의 자연스러움과 감정 표현 비교.
- 다국어 지원 범위: 수십 개의 언어 중 중국어 및 기타 언어의 음질 수준.
- Deep Forgery Governance: ElevenLabs의 음성 워터마킹 및 추적성 솔루션.
- 국내 TTS의 후속작: 국내 음성 제조사들은 자연스러움의 격차를 줄일 수 있을까.
후기