ACE-Step v1.5:开源 AI 音乐生成追平 Suno,4GB 显存本地跑起来

最近 AI 音乐圈出了个大新闻:ACE-Step v1.5 在多项评估指标上追平甚至超越了 Suno v5,而且完全开源、本地就能跑。如果你一直在纠结 Suno 的月费,或者想要一个能自己掌控的 AI 音乐工具,这个值得认真看看。

ACE-Step v1.5 混合架构图

是什么

ACE-Step 是 ACE Studio 和 StepFun(跃点星尘)联合开发的开源音乐生成基础模型,2025 年 5 月首次发布,2026 年 1 月底推出 v1.5 大版本更新。Apache 2.0 许可证,生成的音乐可商用。

v1.5 的核心卖点是:消费级硬件上跑商业级质量。最低 4GB 显存就能运行,RTX 3090 生成一首歌不到 10 秒。

架构上,v1.5 采用了”语言模型 + 扩散模型”的混合设计:

  • 语言模型做规划器:先理解你的输入(风格标签 + 歌词),通过思维链推理生成完整的歌曲蓝图——结构、段落、配器方案,相当于”编曲人在脑子里先想好再动手”
  • 扩散 Transformer(DiT)做合成器:拿蓝图生成实际音频,解决了纯 LLM 方案推理慢、纯扩散方案结构松散的老问题

另外还有一个 v1.5-XL 版本,DiT 解码器参数量 4B,效果更强但资源需求也更高。

为什么值得关注

先看数据。v1.5-XL 和几个商业模型的对比:

指标 ACE-Step 1.5-XL Suno v5 MinMax-2.5 Udio v1.5
AudioBox 7.76 7.69 7.76 7.45
SongEval 8.12 7.87 8.06 7.65
歌词对齐 8.42 8.29 8.42 8.03
音乐性 47.9 46.8 45.2 34.9
自然度 35.8 34.2 31.5 24.8

关键结论:开源模型在综合评分上已经追平甚至超过了主流商业产品。尤其是自然度指标,v1.0 几乎是 0,v1.5-XL 直接干到 35.8,进步非常夸张。

ACE-Step 模型矩阵

怎么用

方式一:在线体验

不用装任何东西。访问 Hugging Face Spaceacemusic.ai 直接在浏览器里玩。免费,但有排队。

方式二:本地部署

git clone https://github.com/ace-step/ACE-Step-1.5.git
cd ACE-Step-1.5
pip install -r requirements.txt

模型权重会自动从 Hugging Face 下载。8GB 以下显存建议加启动参数:

python generate.py 
  --torch_compile true 
  --cpu_offload true 
  --overlapped_decode true

macOS 用户注意:需要加 --bf16 false,否则会报错。

不同硬件的生成速度参考:

设备 生成 1 分钟音频耗时
RTX 4090 ~2 秒
RTX 3090 ~5 秒
MacBook M2 Max ~26 秒

方式三:ComfyUI

ComfyUI 有 ACE-Step 的自定义节点,可视化拖拽操作,适合不想写命令行的创作者。还能和 Stable Diffusion、视频生成等工作流串联。

核心功能

ACE-Step v1.5 不只是”文生歌”,它有几个独到的编辑能力:

文本转音乐(Text2Music):输入风格标签 + 歌词 → 生成完整歌曲。支持 50+ 种语言,中文效果在第一梯队。

重绘(Repainting):不满意某段配器?不用重新生成整首歌,只改指定部分。比如把鼓换成真鼓,把合成器贝斯换成 upright bass。

歌词编辑(Lyric Edit):保留旋律和人声的前提下修改歌词。想换个词?直接改,不用从头来。

变体生成(Retake):保持基本风格,通过调节噪声混合比例生成不同版本。有点像 Stable Diffusion 的”换个种子”。

人声转 BGM:有人声 Demo,想要纯器乐伴奏?一键生成。

LoRA 个性化:拿几首自己喜欢的歌就能训练风格 LoRA,让模型学会你的口味。

ACE-Step v1.5 功能概览

有什么坑

  1. 显存是硬指标:虽然官方说 4GB 能跑,但那是极限状态。实际体验下来,8GB 以上才比较舒服。4GB 场景下必须开 cpu_offload,生成速度会明显下降。
  2. Mac 用户体验打折:M 系列芯片能跑,但速度比 NVIDIA GPU 慢 5-10 倍。M2 Max 生成 1 分钟音频要 26 秒,日常玩玩行,批量产出还是得靠显卡。
  3. 长曲子结构偶尔会飘:虽然 v1.5 在长程连贯性上比 v1.0 进步很大,但生成 5 分钟以上的曲子时,段落过渡偶尔会出现不太自然的衔接。
  4. 中文歌词对齐还有提升空间:整体不错,但涉及复杂节奏的中文说唱,咬字和节奏的匹配偶尔会翻车。官方已经发布了专门的中文说唱 LoRA(RapMachine),可以缓解这个问题。
  5. 首次下载模型需要时间:模型权重约 7-8GB,网络不好的时候下载可能要等一阵。
  6. 许可证细节:核心模型是 Apache 2.0,但某些 LoRA 权重或第三方集成可能有不同条款。商用前务必仔细核对。

和 Suno/Udio 怎么选

简单说:

  • 要省事、不在乎月费、只管出歌 → Suno/Udio
  • 要本地控制、可编辑、可定制、零订阅 → ACE-Step
  • 两者都用 → 日常快速出稿用 Suno,精细调整用 ACE-Step,也是很多人的选择

ACE-Step 最大的优势不是”比 Suno 强”,而是可控性。重绘、歌词编辑、人声转 BGM 这些功能,商业产品基本都不提供。对于有创作需求、不满足于”一键出歌”的人来说,这些能力比生成质量的一两个百分点差异重要得多。


项目地址:github.com/ace-step/ACE-Step-1.5
在线体验:Hugging Face Space
技术报告:arxiv.org/abs/2506.00045

发表评论