Aero-1-Audio 免费

-

Aero-1-Audio 是 LMMs-Lab 开发的轻量级音频模型,基于 Qwen-2.5-1.5B 构建,仅 1.5 亿参数。专为长音频处理设计,支持 15 分钟连续音频输入无需分段。在语音识别(ASR)任务中准确率高,在 AMI、LibriSpeech、SPGISpeech 等数据集上词错误率最低。

Aero-1-Audio 产品界面

Aero-1-Audio

核心参数与统计

参数 官方可核验信息
产品定位 Lightweight audio model for long-form audio
基础模型 Qwen-2.5-1.5B
参数量 1.5 亿(150M)
最大音频长度 15 分钟连续输入
训练数据 ~50 亿 tokens(5 万小时音频)
训练资源 16 个 H100 GPU,1 天内完成
FLOP 利用率 0.34(通过序列打包优化)
发布平台 Hugging Face

一句话简评:Aero-1-Audio 用 1.5 亿参数证明了小模型在音频任务上也能超越 Whisper 等大模型。

用户与市场认可

由 LMMs-Lab 开源发布在 Hugging Face。在 AMI、LibriSpeech、SPGISpeech 等数据集上词错误率(WER)表现最优,超越 Whisper 和 Qwen-2-Audio 等更大规模模型。

成本优势

C端/个人:完全开源免费,可从 Hugging Face 下载使用。需自行准备推理有境(GPU 推荐)。

开发者:免费开源,可集成到自有应用中。16 个 H100 训练 1 天的低成本训练方案对研究团队友好。

企业/私有化:开源可自行部署和微调。MIT 等开放许可允许商业使用(具体许可以官方为准)。

主要功能

  • 长音频处理:支持长达 15 分钟的连续音频输入,无需分段,保持上下文连贯性。
  • 语音识别(ASR):高准确率语音转文字,适用于实时转写、会议记录、讲座转录。
  • 复杂音频分析:支持语音、音效、音乐等多种音频类型的分析和语义理解。
  • 指令驱动任务:根据指令提取音频中的特定信息或执行特定操作。
  • 轻量高效:仅 1.5 亿参数,在多个基准测试中超越更大规模的 Whisper 和 Qwen-2-Audio。

模型与版本演进

Aero-1-Audio 于 2025 年由 LMMs-Lab 发布。核心创新在于用极小参数量(1.5B base → 150M audio)和极小训练数据量(50 亿 tokens)实现了超越大模型的性能。训练效率优化(动态批处理 + 序列打包)是其技术亮点。

技术优势

主类型判断:基础大模型/API 基础设施——轻量级开源音频模型。

性能与吞吐:仅需 16 个 H100 GPU 训练 1 天。推理阶段的 FLOP 利用率通过序列打包技术从 0.03 提升至 0.34。TTFT 和 TPM/RPM 等在线服务指标未公开,以官方 Hugging Face 页面为准。

适配边界:最擅长语音识别(ASR)和长音频理解任务。在语音指令跟随和音频场景理解方面表现出色。但不擅长音乐生成、语音合成(TTS)等生成式音频任务。

训练方法:采用基于 token 长度的动态批处理策略,通过将样本分组到预定义的 token 长度阈值内提高计算资源利用率。

如何使用

入口 说明
Hugging Face 访问 huggingface.co/lmms-lab/Aero-1-Audio 下载模型
本地推理 通过 Transformers 库加载模型进行推理

产品定价

完全开源免费。自行部署需承担 GPU 计算资源成本。

应用场景

  • 语音助手:为智能语音助手提供高效语音识别和理解能力。
  • 实时转写:快速将语音内容转录为文字,适合会议、讲座等场景。
  • 音频归档与搜索:为音频库添加内容标签,支持语义搜索。
  • Agent 听力模块:为智能体赋予长语音理解能力,支持多轮对话。

适用人群

适合需要高质量语音识别能力的 AI 开发者和研究团队。适合需要长音频处理但不希望使用超大模型的计算资源受限场景。不适合需要语音合成或音乐生成的场景。

总结与展望

Aero-1-Audio 展示了用小模型解决大问题的工程能力——1.5 亿参数 + 5 万小时训练数据,在 ASR 基准上超越 Whisper。训练效率优化方案(动态批处理 + 序列打包)对资源受限的研究团队有参考价值。

不适配边界:不提供语音合成(TTS)能力;推理需要 GPU 资源;模型仅支持英文;非结构化长音频中的人声分离效果未公开;作为研究模型,生产有境的稳定性和支持需要自行评估。

采购建议:研究团队可直接下载模型复现和微调。生产有境部署前需在目标数据上验证 ASR 准确率,评估 GPU 推理成本。关注 LMMs-Lab 后续是否发布 larger 版本或专用微调版本。

版本信息

  • Aero-1-Audio release :基于 Qwen-2.5-1.5B,支持15分钟连续音频,ASR 多基准最优。
  • Aero-1-Audio preview :早期预览版本,核心音频处理架构验证。

用户评价

  • 加载评价中...