趁官方归档前囤下来:Supertonic 3,99M 参数的本地 TTS 真能打

最近在折腾本地语音合成,需求其实很朴素:不想把录音和文字传到云端,也不想为 ElevenLabs 那种按月订阅的额度买单。看了一圈开源方案,撞见一个挺有意思的项目——Supertonic 3。它最抓我的点是参数量只有 99M,却宣称能在 M1 上跑到 1000+ 字符/秒,而且还支持浏览器端 WebGPU 直接跑。

但动手前我先去翻了它的仓库公告,结果看到一条 2026-07-23 的警告:这个项目要归档了,官方说 2026-08-31 之后不再开发、不再提供支持,Voice Builder 也不再能访问。所以这篇文章不是来吹它有多活跃,而是想说——趁现在模型权重还能下载,把它囤到本地,以后离线跑完全不依赖官方,反而更安心。

是什么:一个小到离谱的本地 TTS

Supertonic 是 Supertone 开源的端侧文本转语音系统,底层跑在 ONNX Runtime 上,完全本地推理,不调任何云 API。第三代(2026-04-29 发布)把支持语言扩到了 31 种,并且改进了朗读准确率和重复/跳读的问题。

它最反常识的地方在体积。常见的开源 TTS 动辄 0.7B~2B 参数,Supertonic 3 只有 99M,是它们的零头。代价是语言覆盖偏欧洲系——31 种里没有中文,这点后面说坑。但换来的好处很实在:模型下载快、冷启动快、内存占用低,树莓派和电子书阅读器都能跑。

音频质量上它直接输出 44.1kHz / 16-bit 的 WAV,不用外接上采样器,拿来做播客垫乐、视频配音够用。还有 10 个内联表情标签(比如 <laugh><breath><sigh>),不用参考音频就能给语音加语气,这点比很多同体量模型贴心。

hero

为什么值得趁早囤:官方要撤了

2026-07-23 的公告写得很直白:仓库会归档,开源模型不再有后续开发,Voice Builder(云端声音克隆工具)在 2026-08-31 之后停止访问。也就是说,现在是你最后一次能方便地从官方渠道拉到模型资产和声音克隆 JSON 的时间窗口。

好消息是模型权重本身是 MIT(代码)/ OpenRAIL-M(模型) 许可,归档不等于删除,Hugging Face 上的权重大概率还在。但官方一旦停止维护,链接失效、文档搬迁都是常态。我的做法是:现在就把 ONNX 模型和 Python 包缓存到本地 NAS,以后重装系统也不用临时去网上找。

怎么用:三条路,从一行命令到本地服务

最轻量的方式是用 Python SDK,第一次运行会自动从 Hugging Face 下载模型:

pip install supertonic
from supertonic import TTS

tts = TTS(auto_download=True)
style = tts.get_voice_style(voice_name="M1")

wav, duration = tts.synthesize(
    text="Supertonic is a lightning fast, on-device TTS system.",
    lang="en",
    voice_style=style,
    total_steps=8,   # 质量 5(低)~12(高),默认 8
    speed=1.05,
)
tts.save_audio(wav, "output.wav")

如果你想像调 API 一样用,可以起一个本地 HTTP 服务,它自带 /v1/tts 和 OpenAI 兼容的 /v1/audio/speech 端点:

pip install 'supertonic[serve]'
supertonic serve --host 127.0.0.1 --port 7788

跑起来之后,本地 Agent、浏览器插件、Electron 应用都能直接打这个地址,不用每个工具都嵌一套推理逻辑。我自己的本地模型控制台就是这么接的——统一走 HTTP,前端都不用改。

preview

更野的路子是浏览器端。它支持 WebGPU 和 WASM,Hugging Face 上有官方 Demo Space,理论上手机浏览器打开就能合成,零安装。我在 Mac 的 Safari 和 Chrome 上都试过,WebGPU 路径确实能跑,就是第一次加载模型要等几秒。

除了 Python,官方还给了 Node.js、Java、C++、C#、Go、Swift、iOS、Rust、Flutter 的 SDK 示例。覆盖面在开源 TTS 里算相当全的,做移动端或桌面端嵌入不用自己造轮子。

metrics_size

有什么坑:实话实说

1. 没有中文。 31 种语言里清一色是欧洲/中东/东南亚系(英、日、韩、西、葡、德、法等),中文不在列表。不知道语种时可以传 lang="na" 让它自动判断,但实测对中文支持也是没有的。如果你主要合成中文,这个项目先划掉,去看 Qwen3-TTS 或 Kokoro 那条线。

2. 官方要停更。 上面说了,2026-08-31 是个节点。趁现在把模型和包缓存好,别等要用的时候才发现 Voice Builder 进不去了。归档后社区会不会接手不好说,issue 区现在还有 130+ 未关闭,维护一停这些都不会自己解决。

3. 音质定位是”够用”而非”惊艳”。 99M 的参数决定了它天然比不过几 B 级的大模型。做有声书、视频配音、工具朗读完全 OK,但如果你追求主播级拟真或者复杂情感演绎,它给不了。表情标签能补一点语气,但别期待太多。

4. 首次运行有下载。 auto_download=True 会从 Hugging Face 拉 ONNX 资产,没网或网络不稳会卡住。在内网环境部署的话,建议先在有网机器上跑一次把缓存落到本地,再拷到目标机。

voicebuilder

我的小结

Supertonic 3 不是最强的开源 TTS,但它是目前最容易落地的端侧方案之一:99M 体积、31 语言、浏览器都能跑、MIT 可商用。对于不想碰云订阅、又不需要中文的场景(比如英文视频配音、工具朗读、Agent 语音输出),它几乎是开箱即用。

唯一的紧迫感来自官方归档倒计时。我的建议很直接:这周把模型权重和 Python 包下载缓存到本地,这样哪怕 8 月底官方关服,你手里的合成能力一点都不减。开源项目的浪漫就在于——代码给了你,它就真的是你的了。

发表评论