订阅制听写太贵,我换了开源 FluidVoice

Mac 上的听写方案,要么订阅制每月扣费,要么自己折腾 STT 模型。最近看到一个开源项目 FluidVoice(altic-dev/FluidVoice,GPLv3),GitHub 上 9.7k stars,1.6.8 最新版两天前刚发——可能是目前最干净的本地替代。

FluidVoice 干的事很直白:本地语音转文字。GitHub 主页上写着「Fastest and only macOS Dictation app with on-device STT and custom trained AI enhancement model」,本地优先写在第一位——语音和文字默认不上云,除非自己主动接入 OpenAI、Groq 之类的云端模型。

几个有意思的细节:

  • Fluid Intelligence。1.6.0 引入的本地 AI 后处理——智能格式化、上下文感知大写、纠错,不用 API key。代价是多占约 3.5GB 磁盘。这部分仓库本身没开源(README 写明「privately maintained」),但核心听写代码全在 GitHub。
  • 听写模型可选。Nemotron Speech 3.5(流式、低延迟、~40 语言、~670MB)、NVIDIA 的 Parakeet 系列(Flash / TDT v3 / TDT v2,最低延迟)、Cohere Transcribe(~1.4GB、含中文普通话)、Apple Speech(系统自带、零下载)、Whisper 系列(最大兼容、99 语言、Intel Mac 唯一选择)。
  • 全局热键,任意应用一键呼出,写完自动通过辅助功能 API 塞进当前光标位置——不用切换窗口。
  • Command Mode 用语音启动应用、跑快捷指令;Write Mode 能改写选中的文本。
  • 菜单栏常驻,Live Preview 悬浮窗带刘海屏自适应。

按官方文档,Apple Silicon 的 Mac 上跑 brew install --cask fluidvoice 一行装完,第一次启动会引导选模型和热键。Parakeet TDT v3 是默认推荐,但 25 种语言全是欧洲语系——中文场景需要切到 Cohere Transcribe(含普通话、~1.4GB)或 Whisper 系列。理论上延迟 200ms 出头,Live Preview 应该跟得上语速。

要不要上 Fluid Intelligence 取决于你。如果已经习惯让 AI 帮你把口语化的句子整理成邮件/文档格式、顺手修一下错别字,开 3.5GB 换这个本地后处理挺值。如果只是单纯把语音转成文字,原版模型已经够用。

跟订阅制对比感受最深:每个月交钱、订阅到期前邮件提醒、续费价格悄悄涨——一次安装之后就没我什么事。要说缺点,Intel Mac 用户只能用 Whisper(其他模型要 Apple Silicon),iOS 和 Windows 还在 waitlist,Linux 排在后面。Fluid Intelligence 闭源这件事,作者自己也写了「为了可持续地把核心听写免费做下去」,可以理解。

我之前写过好几篇本地 TTS 的文章(Pocket TTS、MOSS-TTS、Fish Audio S2),STT/听写这边正好补上。Mac 用户、想省订阅费、又不想让语音流到云上的,可以试试这个。

发表评论