AI音频
-
Voicemod Voicemod
实时AI变声工具,支持游戏、直播和社交场景的语音趣味化处理
-
3D-Speaker
ModelScope 开源的多模态声纹识别与说话人分离工具包
-
Voicebox Meta
Meta 研究团队提出的通用语音生成模型,核心卖点是零样本、多任务和更快推理
-
Gemini 3.1 Flash TTS Google
Google推出的新一代文本转语音模型,支持70+语言和音频标签导演级控制
-
FunASR Tongyi Lab
阿里通义实验室开源的工业级语音识别工具包,50+语言170x实时率、私有化部署
-
Typecast Typecast
710+ AI语音角色 + SSFM 语音合成模型——最有表现力的AI语音平台
-
Fun-CosyVoice 3.5 FunAudioLLM
阿里通义实验室FunAudioLLM团队推出的多语种语音生成模型,支持FreeStyle自然语言指令控制与零样本语音克隆
-
Tortoise TTS TortoiseTTS
高质量开源文本转语音模型,以自然度与语音克隆能力著称的 TTS 质量标杆
-
Fun-AudioGen-VD Alibaba Tongyi Lab
阿里通义实验室推出的音色设计模型,支持自然语言描述生成音色、情绪与场景化音频。
-
Superwhisper Superwhisper
面向 macOS、Windows 与 iOS 的 AI 语音输入工具,支持离线与云端转写
-
Fun-ASR1.5 阿里通义
阿里通义推出的端到端语音识别模型,单模型支持30种语言及七大方言
-
Suno V5.5 Suno
把 AI 音乐从一句提示词升级到可编辑、可分轨、可商用的浏览器工作站











