微软 2025 年 8 月底开源的 VibeVoice,9 月 3 日还在发新版本,但这是两个故事。TTS 发布 11 天就被微软自己撤回代码,仓库里的 Quick Try 标签直接标 Disabled;同一仓库的 ASR 线却一路开到 9 月初,CPU 量化版、Transformers 集成、流式识别一气呵成。同一屋檐下两个方向,开源的姿势差太多。

这张是官方给的 VibeVoice 架构图。一个 LLM(Qwen2.5 家族)做语义理解,加一个声学和语义 tokenizer 把音频压到 7.5Hz 极低帧率,再用一个 diffusion head 出声学细节。整条线从骨架到效果都比较干净,是有点意思的工作。
说说 TTS 这条线干过什么。2025-08-25 微软开源 VibeVoice-TTS 1.5B:单遍合成最长 90 分钟音频、支持最多 4 个说话人,论文被 ICLR 2026 收为 Oral。模型基于 Qwen2.5-1.5B,挂一个 7.5Hz 的连续语音 tokenizer。从指标上看很硬。
然后 11 天后,2025-09-05,仓库 News 区更新了一条:
After release, we discovered instances where the tool was used in ways inconsistent with the stated intent. Since responsible use of AI is one of Microsoft’s guiding principles, we have removed the VibeVoice-TTS code from this repository.
训练代码、推理代码全撤。HF 上的 1.5B 权重还在,但官方不再给推理路径,README 表格里 TTS-1.5B 的 Quick Try 列写 “Disabled”。整个 TTS 仓库变成一个发不出去的礼物。
下面是 ASR 这条线的时间线:
- 2026-01-21:开源 VibeVoice-ASR,60 分钟单遍、说话人识别 + 时间戳 + 自定义热词,原生支持 50+ 语言,微调代码一起放出。
- 2026-03-06:进 HuggingFace Transformers,常规 pipeline 能直接用。
- 2026-07-23:VibeVoice-ASR-BitNet,边缘 CPU 推理引擎。异构量化把 4.62GB 模型压到 1.58GB,3 线程 CPU 实时 RTF<1,不用 GPU。
- 2026-09-03:VibeVoice-ASR-Streaming,流式 ASR,音频还在送进来的同时按段输出文字,自定义热词,10 种语言。
一整年里 ASR 更了四次,每次都给真代码,连 CPU 实时跑这种边缘场景都专门做了一个变体。中间还顺手把 vLLM 推理、Transformers 集成、流式识别全做齐了。

这张是 VibeVoice GitHub 仓库页的现状。53.9k stars、6.1k forks、MIT license 一切正常,但 TTS 那个 1.5B 模型的 Quick Try 列就是一片灰底。
同一公司、同一个仓库、两种节奏,这种分化本身就是个信号。TTS 是深度伪造、诈骗、冒充电话的重灾区,ASR 主要就是会议转写、字幕、检索,怎么看都是 TTS 风险更高。微软选了”撤 TTS、留 ASR”的路线,看得出来风险偏好在哪儿。
但撤代码这事,怎么说呢,更像是堵错了出口。HF 上的 1.5B 权重全网可下,真想做坏事的人不缺推理路径。撤仓库代码只让正经的本地玩家、研究者、应用开发者更难用——我们既没法本地体验 90 分钟长 TTS,也没法拿代码去研究 tokenizer 的细节,最多只能下个权重干瞪眼。
我比较期待的是另一头。VibeVoice-ASR-BitNet 的 1.58GB CPU 实时版本,对本地党太友好了。理论上塞进 NAS、塞进小主机都不需要显卡,60 分钟单遍带说话人分离的转写在 CPU 上实时跑出来,这个事儿在以前要么靠云 API、要么本地跑 Whisper 然后自己堆 diarization,现在能直接换上去。
更轻的 Realtime-0.5B 流式 TTS(~300ms 首音延迟、最长 10 分钟)微软倒是留了下来。猜测是因为 0.5B 体量下滥用门槛更高、对生成内容也加了水印之类的措施,相对安全。这一支可以装上玩,但是 90 分钟长文那条线基本废了。
官方效果图里给的对比是这样:

90 分钟长文、4 说话人、自然的轮换和情绪连贯,从感官上看比一般的开源 TTS 强一截。问题是,这个图对应的 1.5B 模型现在没代码可用,社区有第三方逆向或重建方案前都跑不起来。
我的态度很简单:与其撤回,不如在推理层加水印和免责声明,像 Realtime-0.5B 那样保住一个受限可用的版本。”只开源权重、不开源代码”这种半截开源,对生态的伤害比不开源还大——权重全在 HF 上挂着,本地真要用还是得自己想办法,把”开源”当了一回营销。
ASR 线倒是越做越扎实,值得跟踪。如果本地跑会议转写嫌 Whisper 的说话人分离太弱,等 BitNet 版直接换上去基本没成本。
资料来源:
- microsoft/VibeVoice(MIT,53.9k stars,9/3 仍在更新)
- VibeVoice-TTS 技术报告
- VibeVoice-ASR 技术报告
- ASR-Streaming-7B 权重
- VibeVoice-ASR-BitNet(CPU 推理引擎)