MiniMax Speech 2.8 与 Music 3.0:语音与音乐生成的双线升级

MiniMax 6 月发布 Speech 2.8 语音模型与 Music 3.0 音乐模型,均通过 platform.minimax.io 提供 API;与 M3、H3 一起构成多模态矩阵,显示其在 C 端娱乐与 B 端 API 双线的商业化布局。

MiniMax 于 2026 年 6 月发布 Speech 2.8 语音模型与 Music 3.0 音乐模型,进一步强化其在语音与音乐生成领域的能力。两者均通过 platform.minimax.io 平台提供 API 与体验入口,与 M3、H3 一起构成 MiniMax 的多模态基础模型矩阵。

两个模型,两条商业线

Speech 2.8 面向语音合成与克隆场景,Music 3.0 面向音乐生成场景。它们虽然共享"音频生成"的技术底座,却对应 MiniMax 两条截然不同的商业化路径:

  • B 端 API:语音克隆与音乐生成的能力,通过 API 输出给开发者与企业客户——配音、有声内容、音乐制作等场景都能用。
  • C 端娱乐:配合 MiniMax AudioTalkie(AI 陪伴产品),把语音与音乐能力包装成面向 C 端用户的娱乐产品。

一条线卖能力、一条线卖体验,这正是 MiniMax "既做基础设施又做消费产品"的典型打法。

多模态矩阵的又一环

把 Speech 2.8 / Music 3.0 放回 MiniMax 的整体版图:官方将系列模型定位为"具备强大代码与 Agent 能力、超长上下文处理能力,可理解、生成并整合文本、音频、图像、视频与音乐等多模态"的通用基础模型。语音与音乐不是孤立的功能,而是这套多模态矩阵里"音频"维度的承载——当 M3 处理长任务、H3 生成视频、Speech 2.8 合成语音、Music 3.0 生成音乐,MiniMax 的全模态拼图正在成型。

从行业视角看,语音与音乐生成赛道的竞争同样激烈——ElevenLabs、Suno 等海外玩家已占据强心智。MiniMax 的差异化在于"全模态一体化":开发者可以在同一平台、同一套 API 体系里调用文本、语音、音乐与视频能力,减少多厂商拼装的技术债。对国内音频与音乐创作者而言,MiniMax 这套 API 也提供了国产化替代的选择。

后续值得跟踪的几个方向:

  1. 语音克隆的合规边界:深度伪造治理下,克隆能力的授权与审核机制。
  2. Music 3.0 的版权策略:生成音乐的版权归属与商用授权如何界定。
  3. Talkie 的 C 端表现:AI 陪伴产品对语音能力的商业化支撑。
  4. 全模态 API 的整合度:多模态能力在同一平台调用的体验与成本。
版权声明:本文内容来自 MiniMax 官方 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...