ElevenLabs, 이미지 및 비디오 출시: 보이스 리더, 비주얼 세대 진입

ElevenLabs는 2025년 11월 17일 ElevenLabs Image & Video를 출시하여 음성 AI 회사가 이미지 및 비디오 생성 분야에 공식적으로 진출했으며, 사용자가 동일한 플랫폼에서 이미지, 비디오 및 음성 협업 생성을 완료할 수 있는 "음성 단일 양식"에서 "다중 모드 생성 플랫폼"으로 확장했습니다.

AI 보이스트랙에 해자를 쌓던 회사가 갑자기 이미지와 영상 제작에 나선 이유는 무엇일까? 11월 17일 ElevenLabs는 ElevenLabs 이미지 및 비디오라는 제품 출시를 통해 이 질문에 답했습니다. 이는 음성 AI 리더가 '음성 단일 양식'에서 '다중 모드 생성 플랫폼'으로 확장하는 시각적 생성 분야에 공식적으로 진출했음을 나타냅니다.

사운드에서 영상으로의 전략적 도약

ElevenLabs는 오랫동안 AI 음성 합성(TTS, 음성 복제, 더빙) 분야의 선두주자였습니다. 시각적 양식으로의 이러한 확장은 실질적인 다중 모드 변환입니다. 사용자는 동일한 플랫폼에서 이미지, 비디오 및 음성의 공동 생성을 완료할 수 있습니다. 이는 정확히 다른 다중 모드 플랫폼에서 가장 부족한 조합 기능입니다. 영상은 AI 더빙, 아바타 음성, 음악+영상 연동으로 결합됩니다. 이러한 시나리오는 ElevenLabs의 자연스러운 확장입니다.

끊임없이 확장되는 제품 환경

이미지 및 비디오는 ElevenLabs 제품 매트릭스의 일각에 불과합니다. Eleven v3 음성 모델, Scribe(ASR), Dubbing, Music v2, ElevenAgents 및 후속 ElevenMusic, Ads Engine, Flows Agent 등 - "오디오 및 비디오 제작 + 에이전트"를 포괄하는 완전한 콘텐츠 플랫폼이 구체화되고 있습니다.

업계 관점에서 일레븐랩스는 이미지/비디오 트랙에 진출해 런웨이, 피카, 루마 등 영상업체 및 이미지 모델 제조사와 직접 경쟁하고 있다. 차별화는 "오디오를 축으로 하는 다중 모드"에 있습니다. 다른 제조업체가 음성을 보너스 기능으로 취급하는 반면 ElevenLabs는 사운드를 핵심 내러티브로 취급하고 비전은 사운드의 확장입니다. 국내 다중 모드 AI 생성 도구(예: Meng, Keling 등)의 경우 이 신호는 경계할 가치가 있습니다. 다중 모드 경쟁의 최종 결과는 "모든 것을 갖추는 것"이 ​​아니라 "사람들이 그것 없이는 살 수 없을 만큼 강력한 핵심 모드가 있는지 여부"입니다. ElevenLabs가 음성을 앵커로 사용하기로 선택한 것은 바로 이러한 논리입니다.

앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.

  1. 이미지/영상과 음성의 협업 깊이: "더빙 및 립싱크를 하면서 영상을 생성"하는 것이 실제로 가능한지 여부.
  2. 런웨이/루마와의 직접적인 경쟁: 시각적 능력이 전문 창작의 한계점에 도달하는지 여부.
  3. 광고/마케팅 시나리오 구현: 광고 엔진과 이미지 및 비디오 간의 연결.
  4. 국내 멀티모달 제조업체를 위한 앵커 선택: 멀티모달에서 자신만의 '핵심 강력한 모달리티'를 찾을 수 있는 사람.
저작권: 콘텐츠 출처 ElevenLabs 공식 블로그 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...