Stable Audio 3.0 发布:Stability AI 开源了目前最强的本地音乐生成模型

Stable Audio 3.0
Stable Audio 3.0 官方题图(来源:stability.ai)

5 月 20 号,Stability AI 正式发布了 Stable Audio 3.0——一套四款文本生成音频的扩散模型。最值得关注的是:Medium 模型开源了权重,1.4B 参数量,能生成 6 分钟以上的完整器乐曲目,MacBook Pro M4 就能跑。

这可能是目前「能在自己电脑上跑的」音频生成模型里能力最强的一个——不是之一。

为什么这事值得看一眼?

先说说背景。

过去两年 AI 音乐生成热闹归热闹,但有一个尴尬的现状:能做出好听的带人声歌曲的工具(Suno、Udio),全都是闭源云服务。你给不了它们自己电脑里的数据,也调不了模型参数,每生成一首还得算额度。反过来,开源的音频生成模型一直停留在「能跑」但「不好用」的阶段——Stable Audio Open(2024)只能生成 47 秒,Meta 的 AudioCraft 质量参差不齐。

Stable Audio 3.0 打破了这堵墙。

Medium 模型开源权重、1.4B 参数量、6 分 20 秒全长、MacBook 上几秒出结果——这三个数字放在一起,意味着你可以真正在自己电脑上做 AI 配乐了。

四款模型,两个可以本地跑

Stable Audio 3.0 模型对比
Stable Audio 3.0 四款模型规格对比(来源:stability.ai)

模型参数量能力是否开源权重
Small SFX459M音效生成,最长 2 分钟
Small459M音乐生成,最长 2 分钟
Medium1.4B完整曲目,最长 6 分 20 秒
Large2.7B同上,质量更好❌ 仅 API/企业

Small 和 Medium 都直接可以从 Hugging Face 下载权重,用 stable-audio-3stable-audio-tools 库加载推理。Large 模型只能通过 Stability AI 的 API 或企业授权使用,但 Medium 的质量已经足够惊人。

官方数据是:H200 GPU 上推理不到 2 秒,MacBook Pro M4 上也只需几秒。我没测过,但如果真是这个量级,那基本是实时出音频了。

跟 Suno / Udio 有什么区别?

这个对比很关键——因为很多人会问「我有 Suno 了,为什么还要看这个?」

Stable Audio 3.0 vs Suno vs Udio 对比
AI 音乐生成方案全面对比(SVG 自绘)

对比维度Stable Audio 3.0Suno / Udio
开权重本地部署
生人声/歌词❌(仅器乐)
最长输出6 分 20 秒~4 分钟
微调/定制
训练数据授权✅ 完全授权❓ 面临诉讼
商用法律风险

一句话概括:Suno 是给人唱歌听歌的,Stable Audio 3.0 是给开发者做配乐和音效的

如果你要做 YouTube 视频的 BGM、独立游戏的场景音乐、播客的 Intro,那 Stable Audio 3.0 是现在最稳妥的选择——不花钱、不担心版权、本地直接跑。

训练数据这件事,其实比音质更重要

这可能是很多人忽略的一点。

Suno 和 Udio 目前被华纳音乐、环球音乐、索尼音乐集体起诉,指控它们未经授权抓取 YouTube 音频训练模型。不管最后判谁赢,你跟它们放在一起用,本身就承担了连带的法律不确定性

Stable Audio 3.0 的路线完全不同:

  • 80 万条录音来自 AudioSparx(商业授权合作)
  • 47 万条来自 Freesound(CC-0 / CC-BY / CC Sampling+)
  • 所有可能含版权的音乐片段用 PANNs 分类器 + 第三方公司人工审核双重过滤

而且 Stability AI 已经和华纳音乐、环球音乐签了正式合作,要一起开发面向专业音乐人的创作工具。前任 Universal Audio CDO Ethan Kaplan 也加入了团队。

这个「开源权重 + 许可数据」的组合,可能比技术本身更能决定谁能活下来。

怎么上手?

如果你有 Hugging Face 账号(需要同意许可协议),Medium 模型在这里:

https://huggingface.co/stabilityai/stable-audio-3-medium

安装和使用很简单:

pip install stable-audio-3

from stable_audio_3 import StableAudioModel

model = StableAudioModel.from_pretrained("medium")
audio = model.generate(
    prompt="Ambient electronic track with warm pads and gentle bass, 90 BPM",
    duration=120
)

或者用 stable-audio-tools 有更灵活的采样器控制,支持 inpainting(局部替换音频片段),适合做精细化编辑。

官方建议的系统配置是 NVIDIA GPU 8GB+ VRAM,但 Medium 模型用 M4 MacBook 也能跑——如果苹果上 Metal 加速支持到位的话。

需要注意什么

  • 不能生人声。这是目前最大的限制。如果你需要带歌词的歌曲,还要用 Suno/Udio 或者其他方案。
  • 开源的是权重,不是完整训练流程。你能跑也能微调,但训练代码和数据没有完全公开。这不是 Stable Diffusion 那种级别的开放。
  • 商用要分情况。Small 和 Medium 的个人/非商业用途基本自由,企业商用要查 Stability AI 的授权条款(年收入超 100 万刀的公司需要单独授权)。

总结

Stable Audio 3.0 的 Medium 模型是目前本地可跑的最强音频生成模型。它不能替代 Suno,但它覆盖了一个更重要、更靠谱的场景:为你的项目生成免版税的、可定制的背景音乐和音效

如果你在做独立游戏、视频、播客,或者只是想在 Mac 上玩一玩 AI 作曲,现在可以去下载了。

发表评论