
Stable Audio
Stable Audio是Stability AI推出的AI音频生成工具,支持文本生成音乐、音效和音频修复。3.0版本提供开源权重,支持本地部署和商用授权,适合视频创作者和游戏开发者。
| 基本信息 | 详情 |
|---|---|
| 开发公司 | Stability AI |
| 上线时间 | 2023年 |
| 官网 | https://www.stableaudio.com/ |
| 支持平台 | Web、API、Hugging Face(开源权重) |
| 价格 | 免费层(每月有限积分);付费层含商用授权 |
| 核心定位 | 开源权重AI音乐与音效生成工具 |
Stable Audio是Stability AI推出的AI音频生成产品,能把一段文字描述变成完整的音乐曲目或音效。这家公司之前靠Stable Diffusion在图像生成领域打出了名堂,现在把同样的开源策略搬到了音频领域。2026年5月发布的Stable Audio 3.0是当前主力版本,包含四个模型:Small SFX、Small、Medium和Large,覆盖从手机端到企业部署的全场景。
和Suno或Udio这些主打"一键生成带人声歌曲"的产品不同,Stable Audio更像是声音设计师的工具箱。它擅长生成器乐曲目、背景音乐和音效,而不是带歌词的完整歌曲。如果你需要给视频配一段背景音乐、给游戏做音效,或者在本地跑模型做实验,Stable Audio是目前为数不多同时提供开源权重和商用授权的选择。
核心卖点很直接:所有模型都在已授权数据上训练,你生成的音频归你所有,可以商用。年营收超过100万美元的企业需要购买Enterprise License,个人和小团队用Community License就行。
核心功能
文本生成音乐
输入一段描述——比如"情绪化的民谣流行,Am调到明亮副歌的过渡,100 BPM,指弹吉他和扫弦副歌"——模型就能生成对应风格的音乐。支持50多种风格标签,从流行、摇滚、古典到电子、嘻哈、环境音乐。输出格式为44.1 kHz立体声,可下载WAV和MP3。
音效生成
用文字描述生成游戏音效、环境音、UI提示音等。比如"未来感UI确认音,带柔和玻璃质感,0.5秒"这类描述就能出效果。Stable Audio 3.0 Small SFX专为音效设计,可在手机和普通笔记本上本地运行。
可变长度生成
3.0版本引入了可变长度生成机制,支持秒级精度。Small模型可生成最多2分钟音频(上一代Open Small只有11秒),Medium和Large可生成超过6分钟的曲目。这个功能对需要精确控制时长的视频和播客制作者来说很实用。
音频修复与续写
Inpainting功能允许你只修改音轨的某一段而保留其余部分。支持单段编辑、多段编辑和因果续写(在音频末尾往后延伸)。不用因为一小段不满意就重新生成整首曲子。
LoRa微调训练
3.0 Small和Medium支持LoRa训练,你可以用自己的音频库定制模型。Stability AI首次发布了LoRa训练文档,企业License用户还能获得手把手的微调支持。
本地部署
Small SFX、Small和Medium三个模型是开源权重的,可在Hugging Face免费下载。Small模型是目前唯一能在设备上完成完整音乐合成的模型,不限于短样本,能产出完整曲目。也可在ComfyUI工作流中使用。
适合谁
适合: 视频创作者需要免版税背景音乐;游戏开发者需要快速生成UI音效和环境音;声音设计师想要一个可本地运行的生成工具;技术用户想在ComfyUI管道中集成音频生成。
不适合: 想要带歌词和人声的完整歌曲——Suno和Udio在这方面更擅长。免费层的生成限制在30秒且每月有积分上限,频繁使用需要付费。
同类竞品对比
| 产品 | 侧重 | 开源 | 人声歌曲 | 音效 | 本地部署 |
|---|---|---|---|---|---|
| Stable Audio | 器乐+音效 | 是(部分模型) | 弱 | 强 | 支持 |
| Suno | 完整歌曲(含人声) | 否 | 强 | 弱 | 不支持 |
| Udio | 完整歌曲(含人声) | 否 | 强 | 弱 | 不支持 |
| ElevenLabs音效 | 音效生成 | 否 | 无 | 强 | 不支持 |
FAQ
Stable Audio生成的音乐可以商用吗?
可以。在Community License下你拥有输出的完整所有权,可以分发和商用。年营收超过100万美元的组织需要购买Enterprise License,后者还提供法律赔偿保障。
免费版有什么限制?
免费层每月提供有限的生成积分,单次生成限制在约30秒。商用授权取决于你的订阅等级,发布前需要确认License条款。
Stable Audio 3.0的四个模型有什么区别?
Small SFX专做短音效,可在手机本地运行;Small可做完整音乐合成,同样在设备上运行;Medium提供更好的音乐结构和旋律连贯性,时长可达6分20秒;Large是最强模型,面向音乐平台和高并发场景。
和Suno比哪个好?
取决于用途。需要带人声的完整歌曲,Suno更强。需要器乐背景音乐、音效、或本地部署能力,Stable Audio更合适。Stable Audio的授权透明度也是优势——所有模型在已授权数据上训练。
可以在ComfyUI中使用吗?
可以。开源权重模型支持在ComfyUI工作流中运行,社区已有不少相关集成。
更新动态
2026年5月3.0发布是最重要的更新。四个模型覆盖了从手机端到企业部署的全链条,Small模型首次实现设备上的完整音乐合成。开源权重发布赢得了开发者社区的认可,已授权训练数据的策略也解决了品牌方对版权风险的顾虑。
客户评论
汇总评分:6.8/10(RECATOOLS评测)
"生成速度快,界面干净,授权故事让人放心。我们用它给客户视频配器乐背景,比买素材库灵活得多。" — 声音设计师
"作为本地AI管道的一部分,Stable Audio Open在ComfyUI里的表现稳定。缺点是器乐only,想要人声还得另找工具。" — 独立开发者
参考来源
- ▸Stability AI | Meet Stable Audio 3.0,官方发布公告,介绍3.0模型家族
- ▸Stable Audio | 官网,产品首页及功能介绍
- ▸RECATOOLS | Stable Audio评测,第三方AI工具目录的独立评测
- ▸Hugging Face | Stable Audio 3 Collection,开源模型权重下载页面
- ▸FairStack | Stable Audio Open,API平台上的模型信息与定价
