八月初,MiniMax 一口气开源了两个重量级生成模型——先是视频模型 H3,紧跟着把音乐生成模型 MiniMax Music 3 也放了出来。这不是又一个只能生成几秒铃声玩具模型的那种开源,而是能一次性产出最长 5 分钟、带人声、结构完整的歌曲,并且权重直接公开、本地可跑。
对一直在盯本地 AI 音乐这条线的我来说,这个动作挺关键。闭源平台(Suno、Udio 之类)确实好用,但下载受限、不可本地化、按次收费的日子迟早让人不舒服;而此前能跑的开源音乐模型大多停留在几十秒的短片段。Music 3 等于把”开源 + 完整长曲 + 结构可控 + 本地运行”这几个特性第一次凑齐了。
它到底是什么
MiniMax Music 3 是一个条件音乐生成模型。你给它两段输入:一段是歌词(可以带 [Verse]、[Chorus]、[Bridge] 这类段落标签),另一段是音乐描述(曲风、情绪、人声音色、编曲、BPM、调式等)。它输出 32kHz / 16-bit 立体声的 WAV 文件,最长约 5 分钟。
架构上它挺有意思,走的是分层自回归路线,不是一个大黑盒:
- Global LLM(8B):负责整首歌的长程结构和语义推进,从 Qwen3-8B 初始化后重训成音乐 token 模型,逐帧预测第一层 RVQ 码本。
- Local LLM(0.6B):负责帧内的七层声学细节还原。
- 连续隐状态合成:不只用离散 token 解码,而是把两个 LLM 的隐藏状态融合,再经过 2.4B 的 Flow Matching 和 123M 的 Flow-VAE 解码器,合成连续波形。
训练用的音乐分词器是八层残差向量量化(RVQ):第一层语义码本 16384 词条管结构和语义,剩下七层各 1024 词条管声学残差。这个设计的目的很明确——让 5 分钟的长歌在后半段不至于”崩坏”,主题、节奏、人声身份、编曲推进都能稳住。
为什么值得本地玩家关注
几个点放在一起才有价值:
一是结构可控。你可以用 [Intro] / [Verse] / [Chorus] / [Bridge] / [Outro] 这些标签直接编排歌曲段落,音乐描述还能精确到 vocal 音色、和声、Auto-Tune、乐器进出点。对想做”指定结构编曲”的人来说,这比纯自然语言瞎聊靠谱得多。
二是开源可微调。权重在 Hugging Face 和 GitHub 上都发了,还顺手开源了一个 music-caption-rewriter 技能——把你一句简短描述自动扩写成结构化的 Music Caption(Global Metadata / Vocal Details / Arrangement 三段),不需要外部 API。这意味着社区后面训练风格的 LoRA 是看得见的路径。
三是本地闭环无上限。不依赖订阅、没有生成次数天花板,对做短视频配乐、独立游戏 BGM、播客片头的创作者尤其友好——批量出歌不用看平台脸色。
怎么把它跑起来
官方目前主推的本地部署方式是通过 SGLang-Omni 起服务。从仓库 README 看,流程大致是这样:
第一步,下模型:
hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm
第二步,起服务(从 SGLang-Omni 仓库根目录跑):
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000
第三步,调用共享的语音 API 生成。歌词放 input 字段,音乐描述放 instructions 字段,输出 WAV:
curl http://127.0.0.1:8000/v1/audio/speech -H 'Content-Type: application/json' -d '{"model":"minimax_ttm","input":"[Verse]nMorning light...","instructions":"A warm acoustic pop song...","response_format":"wav","seed":7,"max_new_tokens":9000}' --output out.wav
另外,ComfyUI 那边社区也已经有人做了工作流模板,不想碰命令行的可以走图形界面。官方也放了一个在线 Demo 页,先看试听再决定要不要下模型,是更省事的开局方式。
有什么坑,先说清楚
别被”本地可跑”四个字冲昏头,README 里白纸黑字写了几条限制,我照实转述:
硬件门槛不低。推理需要两块 CUDA GPU——GPU 0 跑 Qwen3 加八码本 RVQ 自回归生成,GPU 1 跑 Flow Matching 和波形解码。这不是单卡游戏显卡能轻松扛的活儿,真要本地玩得有双卡环境。网上有社区说靠 CPU 卸载能塞进小显存,但官方文档并没有承诺这个路径,别当成保底方案。
只支持非流式生成。当前只能一次性出整段,不支持边生成边播放,交互体验上和某些闭源服务的实时感有差距。
提示词有上限。文本 token 限制在 5000,音频生成限制在 9000 个声学帧。5 分钟基本是天花板,想更长不行。
控制是软约束不是硬保证。段落标签和音乐描述给的是”生成倾向”,不是符号级的精确约束。生成的 tempo、调式、配器、歌词和曲式不一定每一步都完全贴合你的指令,需要多 seed 试几遍挑满意的。
许可不是标准开源协议。仓库 LICENSE 指向的是 Hugging Face 上的 MiniMax-Music3 社区许可,不是 Apache/MIT 那种。商用前一定自己读一遍许可条款,年收入超过某个阈值可能需要书面授权——别默认当 MIT 用。
我的判断
Music 3 的出现,让”本地生成完整歌曲”从”勉强能 demo”变成”真能日用”的距离又近了一大步。它不是终点——双卡门槛、软约束的控制精度、社区生态都还需要时间——但它把开源音乐模型的天花板直接抬到了 5 分钟完整长曲这一档。
如果你手上有能凑出双 CUDA 卡的环境,又一直想摆脱闭源平台的下载限制和订阅费,这个项目值得下下来跑一首带结构标签的短测。先把官方 Demo 页的试听过一遍,确认听感方向对了,再用 ComfyUI 或 SGLang-Omni 本地闭环——你会第一次直观感受到,”生成一首歌”和”写完一首歌”之间,差的真的只剩你的歌词和描述。