它是什么
这两年本地跑大模型越来越顺手,但音频生成一直是个”慢半拍”的环节。像 Stable Audio、MMAudio 这类扩散模型,生成 10 秒声音要迭代几十到上百步,等个几秒十几秒是常态,离”实时”还差得远。所以我看到 AudioX-Turbo 这个仓库时有点意外——它把采样压到了 4 步,在单张 RTX 4090 上生成 10 秒音频只要 0.24 秒(RTF 0.02),而且是完全开源的,推理代码、训练代码和模型权重都放出来了。
AudioX-Turbo 是 Noiz AI 联合香港科技大学、清华大学搞的一个”Anything-to-Audio”统一框架。前身是 ICLR 2026 的 AudioX,这次的 Turbo 版本重点不在”能做更多”,而在”做得快”。

底层思路:把老师模型蒸馏成”快学生”
它的做法是 teacher–student 蒸馏。先用一个 2.7B 参数的多模态扩散 transformer(MMDiT,带一个多模态自适应融合模块)当老师,在文本、视频、音频多种条件下做高保真合成;再用分布匹配蒸馏(DMD)+ 对抗蒸馏,把它压成只走 4 步的学生模型。相比原先 50–200 步的扩散采样,前向计算量砍了约 25 倍。

有意思的是,因为加了对抗判别器做少步生成的对抗训练,学生模型在部分指标上还反超了 100 步的老师。配合一份约 920 万条”强指令”数据集(IF-caps-Pro),它第一次把”时间戳”和”先后顺序”这类精细控制做扎实了。

能干什么
它吃文本、视频、音频三种条件,任意组合:
- 文生音频(T2A):给一句”键盘敲击声”,出环境音;
- 文生音乐(T2M):给”钢琴加小提琴的曲子”,直接生成配乐;
- 视频生音频 / 音乐(V2A / V2M):喂一段视频,自动配环境音或配乐;
- 带时间戳的强指令:比如”先来一段蝉鸣,然后吉他切入”——老模型经常把顺序和数量搞错,它能听懂。
怎么跑
仓库里给了 Gradio demo 和 Python API 两条路,最省事的是下面这套:
git clone https://github.com/NoizAI/AudioX-Turbo.git
cd AudioX-Turbo
conda create -n audiox-turbo python=3.8.20
conda activate audiox-turbo
conda install -c conda-forge ffmpeg libsndfile
pip install -r requirements.txt
pip install -e . --no-deps
bash scripts/download_checkpoints.sh
python run_gradio.py # http://localhost:7860
权重放在 Hugging Face 上(HKUSTAudio/AudioX-Turbo),下载脚本会帮你拉学生模型、VAE,以及视频条件生成要用的 Synchformer。纯文生音频 / 音乐不需要显卡视频编码,但视频条件那条路得额外加载 Synchformer。
有什么坑
说几个实话:
第一,它对硬件有门槛。 推理需要 CUDA 12.1 的 N 卡,Apple 芯片的 Mac 和多数家用 NAS 都没法直接跑。想纯本地部署,基本得有一张 NVIDIA 显卡,或者临时开一台带 GPU 的云主机。就我个人那台 Mac 加 NAS 的组合,想本地跑它还差一张卡。
第二,授权是 CC-BY-NC 4.0,非商用。 模型还带了水印,商业项目别直接拿来用。个人折腾、做 demo、研究学习完全没问题。
第三,依赖有点挑。 官方把环境钉死在 Python 3.8.20,部分路径在 Windows 上未必顺,最好老老实实在 Linux 或 macOS 的 conda 环境里折腾。
值不值得跟
如果你是做音效、配音、互动内容的人,这个项目把”实时生成”往前推了一大步——0.24 秒的出声速度意味着游戏实时拟音、互动剧配音这种场景,终于有了开源可落地的选项。就算暂时没显卡跑不起来,把仓库和论文(arXiv 2606.12555)收着也不亏,蒸馏这条路大概率会成为音频生成模型的标配。