ElevenLabs 发布 Image & Video:语音龙头杀入视觉生成

ElevenLabs 2025 年 11 月 17 日发布 ElevenLabs Image & Video,标志这家语音 AI 公司正式进入图像与视频生成领域,从"语音单模态"扩展为"多模态创作平台",用户可在同一平台完成图像、视频与语音协同创作。

一条在 AI 语音赛道筑起护城河的公司,为什么突然开始做图像和视频?11 月 17 日,ElevenLabs 用一次产品发布回答了这个问题:ElevenLabs Image & Video——它标志着这家语音 AI 龙头正式进入视觉生成领域,从"语音单模态"扩展为"多模态创作平台"。

从声音到画面的战略跃迁

ElevenLabs 长期占据 AI 语音合成龙头地位(TTS、语音克隆、配音)。此次向视觉模态扩张,是其实质性的多模态转型:用户可以在同一平台内完成图像、视频与语音的协同创作——这恰恰是其他多模态平台最稀缺的组合能力。视频配 AI 配音、虚拟形象语音、音乐 + 视频联动,这些场景对 ElevenLabs 而言是天然的延伸。

一张不断扩张的产品版图

Image & Video 只是 ElevenLabs 产品矩阵的一角:Eleven v3 语音模型、Scribe(ASR)、Dubbing、Music v2、ElevenAgents,以及后续的 ElevenMusic、Ads Engine、Flows Agent 等——一家覆盖"音视频创作 + Agent"的完整内容平台正在成型。

从行业视角看,ElevenLabs 进入图像/视频赛道,直接与 Runway、Pika、Luma 等视频公司及图像模型厂商竞争。它的差异化在于"以音频为轴心的多模态"——当其他厂商把语音当作附赠功能时,ElevenLabs 把声音当作核心叙事,视觉是声音的延伸。对国内多模态 AI 创作工具(即梦、可灵等)而言,这个信号值得警惕:多模态竞争的终局不是"样样都有",而是"有没有一个强到让人离不开的核心模态"。ElevenLabs 选择用语音当锚点,正是这个逻辑。

后续值得跟踪的几个方向:

  1. 图像/视频与语音的协同深度:是否真正做到"生成视频的同时配音、对口型"。
  2. 与 Runway/Luma 的直接竞争:视觉能力是否达到专业创作门槛。
  3. 广告/营销场景的落地:Ads Engine 与 Image & Video 的联动。
  4. 国内多模态厂商的锚点选择:谁能在多模态中找到自己的"核心强模态"。
版权声明:本文内容来自 ElevenLabs 官方博客 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...