Voicebox 这个项目在 GitHub 上 40k 多 star,1 月份才建仓,半年冲到 v0.5.0。我前几天装了试了下,感觉这东西把语音 AI 这件事想明白了——不是又做了一个 TTS 包装器,而是把语音输入(听写)、输出(合成+克隆)、Agent 交互整成一个闭环,全跑在本地。
之前我一直在用某个云服务的 TTS,按字符计费不说,每次生成都得把文本传上去。偶尔想批量做点播客旁白,账单能让人犯高血压。WisprFlow 的全局听写很方便,但它是另一家的方案,跟 TTS 根本不在一个体系里。Voicebox 把这两件事都做了。
装的过程没什么可说的,macOS 直接下 DMG 拖进 Applications。Windows 有 MSI。Linux 暂时得从源码编译,官方文档还算清楚。装完第一次启动会自动下载模型,看你要用哪些引擎,Qwen3-TTS 那个 1.7B 大概要下 4GB 多。用 MLX 后端跑的话,Apple Silicon 上推理比 PyTorch 快好几倍。

有意思的几个点:
7 个 TTS 引擎随便切。不是那种”给你两个选项看着办”的做法,是每种场景有不同选择。要质量就用 Qwen3-TTS 1.7B,想省资源跑 LuxTTS(1GB 显存、CPU 上 150 倍实时速度),做多语言有 Chatterbox Multilingual 覆盖 23 种语言。切换引擎的时候不需要重新加载整个应用,就是下拉菜单选一下的事。Kokoro 那个 82M 的小模型质量居然还不错,做快速预览很实用。
语音克隆几秒就够。上传 5-10 秒的参考音频就能生成一个 Voice Profile,然后拿这个音色去合成任意文本。自己试了下中文效果——Qwen3-TTS 的中文自然度明显是最好的,语调停顿都挺自然。Chatterbox Multilingual 覆盖面广但中文有些字发音差点意思。这个不是模型的问题,是当前开源 TTS 的普遍情况。

MCP 支持让 Agent 开口说话。这是最意外的功能。Voicebox 内置了 MCP 服务器,暴露 voicebox.speak 和 voicebox.transcribe 两个工具。Claude Code、Cursor 这些支持 MCP 的 Agent 可以直接调用,用你克隆的音色播报结果。试了一下让 Claude Code 改完代码后念一句”搞定了”,感觉比看终端输出舒服不少。不过目前 MCP 走的是 HTTP 传输(端口 17493),stdio 方式要用一个 Rust shim 包装,略显麻烦。
后处理效果不是摆设。用了 Spotify 的 pedalboard 库,Pitch Shift、Reverb、Delay、Compressor 之类 8 种效果。内置了 Robotic、Radio、Echo Chamber 几个预设,调参手感跟 DAW 插件差不多。这个功能对做播客和配音的人可能比 TTS 本身还重要。

几个不太满意的地方:
长文本生成其实挺慢的,虽然做了自动分块+交叉淡入,但几千字的文章生成下来得等几分钟,看引擎和硬件。二是 Stories 编辑器的交互还比较早期,拖拽偶尔不太跟手,更像技术预览。三是模型管理——7 个引擎每个都有自己的模型文件,全装下来轻松 15-20GB,目前没有”一键卸载不用引擎”的快捷操作,得手动去设置里一个一个卸。
话说回来,这东西才半年,v0.5.0,有这些问题不奇怪。如果你正好在找本地语音工具——不管是做视频配音、播客旁白,还是想让 Agent 有声有色地跟你交互——Voicebox 目前是这件事上最好用的开源选择。