Aero-1-Audio
免费
Aero-1-Audio 是 LMMs-Lab 开发的轻量级音频模型,基于 Qwen-2.5-1.5B 构建,仅 1.5 亿参数。专为长音频处理设计,支持 15 分钟连续音频输入无需分段。在语音识别(ASR)任务中准确率高,在 AMI、LibriSpeech、SPGISpeech 等数据集上词错误率最低。
Aero-1-Audio
核心参数与统计
| 参数 | 官方可核验信息 |
|---|---|
| 产品定位 | Lightweight audio model for long-form audio |
| 基础模型 | Qwen-2.5-1.5B |
| 参数量 | 1.5 亿(150M) |
| 最大音频长度 | 15 分钟连续输入 |
| 训练数据 | ~50 亿 tokens(5 万小时音频) |
| 训练资源 | 16 个 H100 GPU,1 天内完成 |
| FLOP 利用率 | 0.34(通过序列打包优化) |
| 发布平台 | Hugging Face |
一句话简评:Aero-1-Audio 用 1.5 亿参数证明了小模型在音频任务上也能超越 Whisper 等大模型。
用户与市场认可
由 LMMs-Lab 开源发布在 Hugging Face。在 AMI、LibriSpeech、SPGISpeech 等数据集上词错误率(WER)表现最优,超越 Whisper 和 Qwen-2-Audio 等更大规模模型。
成本优势
C端/个人:完全开源免费,可从 Hugging Face 下载使用。需自行准备推理有境(GPU 推荐)。
开发者:免费开源,可集成到自有应用中。16 个 H100 训练 1 天的低成本训练方案对研究团队友好。
企业/私有化:开源可自行部署和微调。MIT 等开放许可允许商业使用(具体许可以官方为准)。
主要功能
- 长音频处理:支持长达 15 分钟的连续音频输入,无需分段,保持上下文连贯性。
- 语音识别(ASR):高准确率语音转文字,适用于实时转写、会议记录、讲座转录。
- 复杂音频分析:支持语音、音效、音乐等多种音频类型的分析和语义理解。
- 指令驱动任务:根据指令提取音频中的特定信息或执行特定操作。
- 轻量高效:仅 1.5 亿参数,在多个基准测试中超越更大规模的 Whisper 和 Qwen-2-Audio。
模型与版本演进
Aero-1-Audio 于 2025 年由 LMMs-Lab 发布。核心创新在于用极小参数量(1.5B base → 150M audio)和极小训练数据量(50 亿 tokens)实现了超越大模型的性能。训练效率优化(动态批处理 + 序列打包)是其技术亮点。
技术优势
主类型判断:基础大模型/API 基础设施——轻量级开源音频模型。
性能与吞吐:仅需 16 个 H100 GPU 训练 1 天。推理阶段的 FLOP 利用率通过序列打包技术从 0.03 提升至 0.34。TTFT 和 TPM/RPM 等在线服务指标未公开,以官方 Hugging Face 页面为准。
适配边界:最擅长语音识别(ASR)和长音频理解任务。在语音指令跟随和音频场景理解方面表现出色。但不擅长音乐生成、语音合成(TTS)等生成式音频任务。
训练方法:采用基于 token 长度的动态批处理策略,通过将样本分组到预定义的 token 长度阈值内提高计算资源利用率。
如何使用
| 入口 | 说明 |
|---|---|
| Hugging Face | 访问 huggingface.co/lmms-lab/Aero-1-Audio 下载模型 |
| 本地推理 | 通过 Transformers 库加载模型进行推理 |
产品定价
完全开源免费。自行部署需承担 GPU 计算资源成本。
应用场景
- 语音助手:为智能语音助手提供高效语音识别和理解能力。
- 实时转写:快速将语音内容转录为文字,适合会议、讲座等场景。
- 音频归档与搜索:为音频库添加内容标签,支持语义搜索。
- Agent 听力模块:为智能体赋予长语音理解能力,支持多轮对话。
适用人群
适合需要高质量语音识别能力的 AI 开发者和研究团队。适合需要长音频处理但不希望使用超大模型的计算资源受限场景。不适合需要语音合成或音乐生成的场景。
总结与展望
Aero-1-Audio 展示了用小模型解决大问题的工程能力——1.5 亿参数 + 5 万小时训练数据,在 ASR 基准上超越 Whisper。训练效率优化方案(动态批处理 + 序列打包)对资源受限的研究团队有参考价值。
不适配边界:不提供语音合成(TTS)能力;推理需要 GPU 资源;模型仅支持英文;非结构化长音频中的人声分离效果未公开;作为研究模型,生产有境的稳定性和支持需要自行评估。
采购建议:研究团队可直接下载模型复现和微调。生产有境部署前需在目标数据上验证 ASR 准确率,评估 GPU 推理成本。关注 LMMs-Lab 后续是否发布 larger 版本或专用微调版本。
版本信息
- Aero-1-Audio release :基于 Qwen-2.5-1.5B,支持15分钟连续音频,ASR 多基准最优。
- Aero-1-Audio preview :早期预览版本,核心音频处理架构验证。
用户评价