
Stable Audio 3.0 官方题图(来源:stability.ai)
5 月 20 号,Stability AI 正式发布了 Stable Audio 3.0——一套四款文本生成音频的扩散模型。最值得关注的是:Medium 模型开源了权重,1.4B 参数量,能生成 6 分钟以上的完整器乐曲目,MacBook Pro M4 就能跑。
这可能是目前「能在自己电脑上跑的」音频生成模型里能力最强的一个——不是之一。
为什么这事值得看一眼?
先说说背景。
过去两年 AI 音乐生成热闹归热闹,但有一个尴尬的现状:能做出好听的带人声歌曲的工具(Suno、Udio),全都是闭源云服务。你给不了它们自己电脑里的数据,也调不了模型参数,每生成一首还得算额度。反过来,开源的音频生成模型一直停留在「能跑」但「不好用」的阶段——Stable Audio Open(2024)只能生成 47 秒,Meta 的 AudioCraft 质量参差不齐。
Stable Audio 3.0 打破了这堵墙。
Medium 模型开源权重、1.4B 参数量、6 分 20 秒全长、MacBook 上几秒出结果——这三个数字放在一起,意味着你可以真正在自己电脑上做 AI 配乐了。
四款模型,两个可以本地跑

Stable Audio 3.0 四款模型规格对比(来源:stability.ai)
| 模型 | 参数量 | 能力 | 是否开源权重 |
|---|---|---|---|
| Small SFX | 459M | 音效生成,最长 2 分钟 | ✅ |
| Small | 459M | 音乐生成,最长 2 分钟 | ✅ |
| Medium | 1.4B | 完整曲目,最长 6 分 20 秒 | ✅ |
| Large | 2.7B | 同上,质量更好 | ❌ 仅 API/企业 |
Small 和 Medium 都直接可以从 Hugging Face 下载权重,用 stable-audio-3 或 stable-audio-tools 库加载推理。Large 模型只能通过 Stability AI 的 API 或企业授权使用,但 Medium 的质量已经足够惊人。
官方数据是:H200 GPU 上推理不到 2 秒,MacBook Pro M4 上也只需几秒。我没测过,但如果真是这个量级,那基本是实时出音频了。
跟 Suno / Udio 有什么区别?
这个对比很关键——因为很多人会问「我有 Suno 了,为什么还要看这个?」
AI 音乐生成方案全面对比(SVG 自绘)
| 对比维度 | Stable Audio 3.0 | Suno / Udio |
|---|---|---|
| 开权重本地部署 | ✅ | ❌ |
| 生人声/歌词 | ❌(仅器乐) | ✅ |
| 最长输出 | 6 分 20 秒 | ~4 分钟 |
| 微调/定制 | ✅ | ❌ |
| 训练数据授权 | ✅ 完全授权 | ❓ 面临诉讼 |
| 商用法律风险 | 低 | 高 |
一句话概括:Suno 是给人唱歌听歌的,Stable Audio 3.0 是给开发者做配乐和音效的。
如果你要做 YouTube 视频的 BGM、独立游戏的场景音乐、播客的 Intro,那 Stable Audio 3.0 是现在最稳妥的选择——不花钱、不担心版权、本地直接跑。
训练数据这件事,其实比音质更重要
这可能是很多人忽略的一点。
Suno 和 Udio 目前被华纳音乐、环球音乐、索尼音乐集体起诉,指控它们未经授权抓取 YouTube 音频训练模型。不管最后判谁赢,你跟它们放在一起用,本身就承担了连带的法律不确定性。
Stable Audio 3.0 的路线完全不同:
- 80 万条录音来自 AudioSparx(商业授权合作)
- 47 万条来自 Freesound(CC-0 / CC-BY / CC Sampling+)
- 所有可能含版权的音乐片段用 PANNs 分类器 + 第三方公司人工审核双重过滤
而且 Stability AI 已经和华纳音乐、环球音乐签了正式合作,要一起开发面向专业音乐人的创作工具。前任 Universal Audio CDO Ethan Kaplan 也加入了团队。
这个「开源权重 + 许可数据」的组合,可能比技术本身更能决定谁能活下来。
怎么上手?
如果你有 Hugging Face 账号(需要同意许可协议),Medium 模型在这里:
https://huggingface.co/stabilityai/stable-audio-3-medium安装和使用很简单:
pip install stable-audio-3
from stable_audio_3 import StableAudioModel
model = StableAudioModel.from_pretrained("medium")
audio = model.generate(
prompt="Ambient electronic track with warm pads and gentle bass, 90 BPM",
duration=120
)或者用 stable-audio-tools 有更灵活的采样器控制,支持 inpainting(局部替换音频片段),适合做精细化编辑。
官方建议的系统配置是 NVIDIA GPU 8GB+ VRAM,但 Medium 模型用 M4 MacBook 也能跑——如果苹果上 Metal 加速支持到位的话。
需要注意什么
- 不能生人声。这是目前最大的限制。如果你需要带歌词的歌曲,还要用 Suno/Udio 或者其他方案。
- 开源的是权重,不是完整训练流程。你能跑也能微调,但训练代码和数据没有完全公开。这不是 Stable Diffusion 那种级别的开放。
- 商用要分情况。Small 和 Medium 的个人/非商业用途基本自由,企业商用要查 Stability AI 的授权条款(年收入超 100 万刀的公司需要单独授权)。
总结
Stable Audio 3.0 的 Medium 模型是目前本地可跑的最强音频生成模型。它不能替代 Suno,但它覆盖了一个更重要、更靠谱的场景:为你的项目生成免版税的、可定制的背景音乐和音效。
如果你在做独立游戏、视频、播客,或者只是想在 Mac 上玩一玩 AI 作曲,现在可以去下载了。