最近 AI 音乐圈出了个大新闻:ACE-Step v1.5 在多项评估指标上追平甚至超越了 Suno v5,而且完全开源、本地就能跑。如果你一直在纠结 Suno 的月费,或者想要一个能自己掌控的 AI 音乐工具,这个值得认真看看。

是什么
ACE-Step 是 ACE Studio 和 StepFun(跃点星尘)联合开发的开源音乐生成基础模型,2025 年 5 月首次发布,2026 年 1 月底推出 v1.5 大版本更新。Apache 2.0 许可证,生成的音乐可商用。
v1.5 的核心卖点是:消费级硬件上跑商业级质量。最低 4GB 显存就能运行,RTX 3090 生成一首歌不到 10 秒。
架构上,v1.5 采用了”语言模型 + 扩散模型”的混合设计:
- 语言模型做规划器:先理解你的输入(风格标签 + 歌词),通过思维链推理生成完整的歌曲蓝图——结构、段落、配器方案,相当于”编曲人在脑子里先想好再动手”
- 扩散 Transformer(DiT)做合成器:拿蓝图生成实际音频,解决了纯 LLM 方案推理慢、纯扩散方案结构松散的老问题
另外还有一个 v1.5-XL 版本,DiT 解码器参数量 4B,效果更强但资源需求也更高。
为什么值得关注
先看数据。v1.5-XL 和几个商业模型的对比:
| 指标 | ACE-Step 1.5-XL | Suno v5 | MinMax-2.5 | Udio v1.5 |
|---|---|---|---|---|
| AudioBox | 7.76 | 7.69 | 7.76 | 7.45 |
| SongEval | 8.12 | 7.87 | 8.06 | 7.65 |
| 歌词对齐 | 8.42 | 8.29 | 8.42 | 8.03 |
| 音乐性 | 47.9 | 46.8 | 45.2 | 34.9 |
| 自然度 | 35.8 | 34.2 | 31.5 | 24.8 |
关键结论:开源模型在综合评分上已经追平甚至超过了主流商业产品。尤其是自然度指标,v1.0 几乎是 0,v1.5-XL 直接干到 35.8,进步非常夸张。

怎么用
方式一:在线体验
不用装任何东西。访问 Hugging Face Space 或 acemusic.ai 直接在浏览器里玩。免费,但有排队。
方式二:本地部署
git clone https://github.com/ace-step/ACE-Step-1.5.git
cd ACE-Step-1.5
pip install -r requirements.txt
模型权重会自动从 Hugging Face 下载。8GB 以下显存建议加启动参数:
python generate.py
--torch_compile true
--cpu_offload true
--overlapped_decode true
macOS 用户注意:需要加 --bf16 false,否则会报错。
不同硬件的生成速度参考:
| 设备 | 生成 1 分钟音频耗时 |
|---|---|
| RTX 4090 | ~2 秒 |
| RTX 3090 | ~5 秒 |
| MacBook M2 Max | ~26 秒 |
方式三:ComfyUI
ComfyUI 有 ACE-Step 的自定义节点,可视化拖拽操作,适合不想写命令行的创作者。还能和 Stable Diffusion、视频生成等工作流串联。
核心功能
ACE-Step v1.5 不只是”文生歌”,它有几个独到的编辑能力:
文本转音乐(Text2Music):输入风格标签 + 歌词 → 生成完整歌曲。支持 50+ 种语言,中文效果在第一梯队。
重绘(Repainting):不满意某段配器?不用重新生成整首歌,只改指定部分。比如把鼓换成真鼓,把合成器贝斯换成 upright bass。
歌词编辑(Lyric Edit):保留旋律和人声的前提下修改歌词。想换个词?直接改,不用从头来。
变体生成(Retake):保持基本风格,通过调节噪声混合比例生成不同版本。有点像 Stable Diffusion 的”换个种子”。
人声转 BGM:有人声 Demo,想要纯器乐伴奏?一键生成。
LoRA 个性化:拿几首自己喜欢的歌就能训练风格 LoRA,让模型学会你的口味。

有什么坑
- 显存是硬指标:虽然官方说 4GB 能跑,但那是极限状态。实际体验下来,8GB 以上才比较舒服。4GB 场景下必须开 cpu_offload,生成速度会明显下降。
- Mac 用户体验打折:M 系列芯片能跑,但速度比 NVIDIA GPU 慢 5-10 倍。M2 Max 生成 1 分钟音频要 26 秒,日常玩玩行,批量产出还是得靠显卡。
- 长曲子结构偶尔会飘:虽然 v1.5 在长程连贯性上比 v1.0 进步很大,但生成 5 分钟以上的曲子时,段落过渡偶尔会出现不太自然的衔接。
- 中文歌词对齐还有提升空间:整体不错,但涉及复杂节奏的中文说唱,咬字和节奏的匹配偶尔会翻车。官方已经发布了专门的中文说唱 LoRA(RapMachine),可以缓解这个问题。
- 首次下载模型需要时间:模型权重约 7-8GB,网络不好的时候下载可能要等一阵。
- 许可证细节:核心模型是 Apache 2.0,但某些 LoRA 权重或第三方集成可能有不同条款。商用前务必仔细核对。
和 Suno/Udio 怎么选
简单说:
- 要省事、不在乎月费、只管出歌 → Suno/Udio
- 要本地控制、可编辑、可定制、零订阅 → ACE-Step
- 两者都用 → 日常快速出稿用 Suno,精细调整用 ACE-Step,也是很多人的选择
ACE-Step 最大的优势不是”比 Suno 强”,而是可控性。重绘、歌词编辑、人声转 BGM 这些功能,商业产品基本都不提供。对于有创作需求、不满足于”一键出歌”的人来说,这些能力比生成质量的一两个百分点差异重要得多。
项目地址:github.com/ace-step/ACE-Step-1.5
在线体验:Hugging Face Space
技术报告:arxiv.org/abs/2506.00045