AI 写歌这事,过去一年挺热闹,但落到「自己能用的开源工具」上,一直有点尴尬:要么是人声和伴奏分开生成,要么得串好几个模型,要么干脆是闭源订阅——歌词传到别人服务器上,生成出来的歌版权还说不清。
前几天翻到 DiffRhythm(中文名「谛韵」),感觉是少数把「端到端 + 开源 + 能本地跑」同时做齐的方案。它不需要你喂参考音频,只要一份带时间戳的歌词和一个风格提示,就能在十秒上下吐出一首包含人声和伴奏的完整歌曲,最长能到 4 分 45 秒。
是什么
DiffRhythm 是高校音频实验室开源的歌曲生成模型,底层是潜在扩散(latent diffusion)加非自回归的 DiT 结构。非自回归是它快的关键——不像那种一个 token 一个 token 蹦的模型,它是一次性把整首歌的潜空间「扩散」出来,所以才敢说十秒出歌。
目前有两个尺寸:
- base 版:约 1 分 35 秒,门槛低;
- full 版:约 4 分 45 秒,更完整。
v1.2 是当前的稳定版,重点修了早期版本容易出现的重复段和漏词问题,编曲也更丰富,还加了歌曲的「续写 / 编辑」能力。授权是 Apache-2.0——可以商用、可以改、可以再分发,对自托管玩家很友好。
除了「歌词 + 参考音频」这条主线,它还支持两种省事模式:
- 文本提示模式:直接写一句风格描述(比如
Pop Emotional Piano、Jazzy Nightclub Vibe),不用任何音频参考; - 纯音乐模式:给一段画面感的描述,比如「极地科考站,theremin 极光」,它就生成纯器乐。

DiffRhythm 的输入输出结构:歌词 + 风格提示,一次性扩散出完整歌曲
带时间戳歌词
.lrc
风格提示
text prompt
DiffRhythm
扩散模型
完整歌曲
人声+伴奏 .wav
为什么值得本地跑
Suno / Udio 这类闭源产品,歌词和旋律都过别人的服务器,商用授权一直含糊。DiffRhythm 开源、Apache-2.0,最重要的是能完全跑在你自己的机器上:歌词不出本机,生成的音频就在本地磁盘,想怎么存怎么改都行。对在意数据留在自己手里的人来说,这点比「生成得多好听」还关键。
显存门槛也还算亲民:base 版最低 8GB 显存(配合 --chunked 分块推理),这意味着一张入门级游戏卡或者带独显的小主机就能试。当然真要跑 full 版、还想快,还是得上更稳的卡。
本地怎么部署
下面按官方文档的步骤来。我自己的机器还没把 full 跑满,base + chunked 这条路验证过思路,写出来给你省点查文档的时间。
1. 拉代码、装依赖:
git clone https://github.com/ASLP-lab/DiffRhythm.git
cd DiffRhythm
# 先装 espeak-ng(中文音素要用到)
sudo apt-get install espeak-ng # Debian / Ubuntu
# brew install espeak-ng # macOS
python -m venv venv && source venv/bin/activate
pip install -r requirements.txt
2. 准备歌词。需要一个 .lrc 文件,每行带时间戳:
[00:12.00] 擦身而过太多寂寞
[00:16.50] 每当你说你也想我
官方在 HuggingFace Space 上给了生成 lrc 的小工具,不想手敲时间戳可以直接用。
3. 跑推理:
# 用参考音频
bash scripts/infer_wav_ref.sh
# 用文本风格提示
bash scripts/infer_prompt_ref.sh
# base 版显存紧张时加 --chunked
嫌命令行麻烦的,仓库里带了 Docker 目录(三个文件):改一下挂载路径,docker compose up -d,进容器到 scripts 下跑同样的脚本就行。
有哪些坑
- 显存是硬门槛:full 版对显存要求明显更高,8GB 只够 base + chunked 勉强跑;Mac 上走 MPS 能跑但慢,别指望实时。
- lrc 时间戳要规范:人声对不对得上,基本取决于时间戳准不准。时间轴乱了,唱出来的词就会错位。
- 中文依赖 espeak-ng:Windows 上还要手动设
PHONEMIZER_ESPEAK_PATH环境变量,漏了就报 phonemizer 的错。 - 质量还有波动:偶尔人声和歌词对不齐,长歌尾段可能重复(v1.2 已经改善很多,但不是完全消失)。把它当灵感工具而非成品工具更现实。
- 模型权重不小:首次下载权重留意磁盘,别把小主机的空间吃满。
想先试再决定?
不想动显卡的,直接去官方的 HuggingFace Space 在线 demo 玩——网页里输入歌词和风格,几秒出歌,不注册也能试大多数功能。等确认自己真用得上,再考虑往本地搬。
小结
谛韵这一类开源端到端歌曲模型,真正意义在于把「AI 写歌」从订阅制产品里解放出来:Apache-2.0 授权、八 G 显存起步、数据留本地。它现在最适合的角色是灵感原型 / BGM / 快速 demo——别指望直接出成品专辑,但拿来探索旋律方向、给视频配个氛围曲,已经很够用。最后提醒一句:AI 参与生成的内容记得标注,套用有明显版权的风格时也悠着点。