AI万址
Stable Audio

Stable Audio

Stable Audio是Stability AI推出的AI音频生成工具,支持文本生成音乐、音效和音频修复。3.0版本提供开源权重,支持本地部署和商用授权,适合视频创作者和游戏开发者。

Stable Audio
访问官网
基本信息详情
开发公司Stability AI
上线时间2023年
官网https://www.stableaudio.com/
支持平台Web、API、Hugging Face(开源权重)
价格免费层(每月有限积分);付费层含商用授权
核心定位开源权重AI音乐与音效生成工具

Stable Audio是Stability AI推出的AI音频生成产品,能把一段文字描述变成完整的音乐曲目或音效。这家公司之前靠Stable Diffusion在图像生成领域打出了名堂,现在把同样的开源策略搬到了音频领域。2026年5月发布的Stable Audio 3.0是当前主力版本,包含四个模型:Small SFX、Small、Medium和Large,覆盖从手机端到企业部署的全场景。

和Suno或Udio这些主打"一键生成带人声歌曲"的产品不同,Stable Audio更像是声音设计师的工具箱。它擅长生成器乐曲目、背景音乐和音效,而不是带歌词的完整歌曲。如果你需要给视频配一段背景音乐、给游戏做音效,或者在本地跑模型做实验,Stable Audio是目前为数不多同时提供开源权重和商用授权的选择。

核心卖点很直接:所有模型都在已授权数据上训练,你生成的音频归你所有,可以商用。年营收超过100万美元的企业需要购买Enterprise License,个人和小团队用Community License就行。

核心功能

01

文本生成音乐

输入一段描述——比如"情绪化的民谣流行,Am调到明亮副歌的过渡,100 BPM,指弹吉他和扫弦副歌"——模型就能生成对应风格的音乐。支持50多种风格标签,从流行、摇滚、古典到电子、嘻哈、环境音乐。输出格式为44.1 kHz立体声,可下载WAV和MP3。

02

音效生成

用文字描述生成游戏音效、环境音、UI提示音等。比如"未来感UI确认音,带柔和玻璃质感,0.5秒"这类描述就能出效果。Stable Audio 3.0 Small SFX专为音效设计,可在手机和普通笔记本上本地运行。

03

可变长度生成

3.0版本引入了可变长度生成机制,支持秒级精度。Small模型可生成最多2分钟音频(上一代Open Small只有11秒),Medium和Large可生成超过6分钟的曲目。这个功能对需要精确控制时长的视频和播客制作者来说很实用。

04

音频修复与续写

Inpainting功能允许你只修改音轨的某一段而保留其余部分。支持单段编辑、多段编辑和因果续写(在音频末尾往后延伸)。不用因为一小段不满意就重新生成整首曲子。

05

LoRa微调训练

3.0 Small和Medium支持LoRa训练,你可以用自己的音频库定制模型。Stability AI首次发布了LoRa训练文档,企业License用户还能获得手把手的微调支持。

06

本地部署

Small SFX、Small和Medium三个模型是开源权重的,可在Hugging Face免费下载。Small模型是目前唯一能在设备上完成完整音乐合成的模型,不限于短样本,能产出完整曲目。也可在ComfyUI工作流中使用。

适合谁

适合: 视频创作者需要免版税背景音乐;游戏开发者需要快速生成UI音效和环境音;声音设计师想要一个可本地运行的生成工具;技术用户想在ComfyUI管道中集成音频生成。

不适合: 想要带歌词和人声的完整歌曲——Suno和Udio在这方面更擅长。免费层的生成限制在30秒且每月有积分上限,频繁使用需要付费。

同类竞品对比

产品侧重开源人声歌曲音效本地部署
Stable Audio器乐+音效是(部分模型)支持
Suno完整歌曲(含人声)不支持
Udio完整歌曲(含人声)不支持
ElevenLabs音效音效生成不支持

FAQ

Q

Stable Audio生成的音乐可以商用吗?

A

可以。在Community License下你拥有输出的完整所有权,可以分发和商用。年营收超过100万美元的组织需要购买Enterprise License,后者还提供法律赔偿保障。

Q

免费版有什么限制?

A

免费层每月提供有限的生成积分,单次生成限制在约30秒。商用授权取决于你的订阅等级,发布前需要确认License条款。

Q

Stable Audio 3.0的四个模型有什么区别?

A

Small SFX专做短音效,可在手机本地运行;Small可做完整音乐合成,同样在设备上运行;Medium提供更好的音乐结构和旋律连贯性,时长可达6分20秒;Large是最强模型,面向音乐平台和高并发场景。

Q

和Suno比哪个好?

A

取决于用途。需要带人声的完整歌曲,Suno更强。需要器乐背景音乐、音效、或本地部署能力,Stable Audio更合适。Stable Audio的授权透明度也是优势——所有模型在已授权数据上训练。

Q

可以在ComfyUI中使用吗?

A

可以。开源权重模型支持在ComfyUI工作流中运行,社区已有不少相关集成。

更新动态

2026年5月3.0发布是最重要的更新。四个模型覆盖了从手机端到企业部署的全链条,Small模型首次实现设备上的完整音乐合成。开源权重发布赢得了开发者社区的认可,已授权训练数据的策略也解决了品牌方对版权风险的顾虑。

客户评论

汇总评分:6.8/10(RECATOOLS评测)

"生成速度快,界面干净,授权故事让人放心。我们用它给客户视频配器乐背景,比买素材库灵活得多。" — 声音设计师

"作为本地AI管道的一部分,Stable Audio Open在ComfyUI里的表现稳定。缺点是器乐only,想要人声还得另找工具。" — 独立开发者

参考来源