FluidVoice:macOS 本地离线听写,能替掉 Wispr

如果你每天在 Mac 上写东西——写邮件、写文档、聊天、写代码注释——你大概率体验过 macOS 自带听写的痛苦:识别慢、错字多、不支持热词、对中文支持差。商业方案 Wispr Flow、Superwhisper 倒是好用,但月度订阅加起来一年一千多块。

最近 GitHub 上冒出来一个叫 FluidVoice 的项目,4k 星、今天一天涨 365 星、宣称自己是「macOS 上最快的离线听写工具」。完全本地运行、模型自选(Parakeet、Nemotron、Whisper、Apple Speech 都能跑)、可以往任何应用的输入框直接打字——而且 GPLv3 开源。

这正是本地 AI 该有的样子:免费、可控、隐私友好。

FluidVoice Command Mode 界面截图

FluidVoice 是什么?

Fluid Intelligence 本地 AI 增强概念

FluidVoice 是 altic-dev 团队开发的一款 macOS 离线听写应用,1.6.0 是当前的最新版本。和一般听写工具不同,它的核心定位是:

  • 完全本地优先:默认所有语音和文字处理都在你的 Mac 上完成,不上云、不收集数据
  • 多模型自由切换:从零下载的 Apple Speech 到 ~2.9GB 的 Whisper Large,从 NVIDIA Parakeet 到 Nemotron Speech 3.5,按需选择
  • 系统级输入:通过 macOS Accessibility API,可以把听写文字直接插入到任何 App 的任何输入框
  • 可选的本地 AI 增强:自带「Fluid Intelligence」本地模型,做智能格式化、上下文大小写修正——不上云、不需要 API Key

「Fluid Intelligence」这个东西挺有意思。FluidVoice 的核心听写功能完全 GPLv3 开源,但这个 AI 增强层是 altic-dev 团队私有维护的本地模型。作者在 README 里写了一句直白的警告:

Based on early feedback, Fluid Intelligence may cause you to unsubscribe from other dictation apps and save money. You’ve been warned.

翻译过来就是:用了 Fluid Intelligence 你可能会把其他付费听写 app 退订,省钱。懂的都懂。

支持哪些模型?怎么选?

FluidVoice 内置了一整套语音识别引擎,涵盖从轻量到高精度的多种选择:

模型定位语言支持模型大小硬件
Nemotron Speech 3.5超低延迟流式~40 种~670 MBApple Silicon
Nemotron 3.5 Multilingual高精度多语言~40 种~530 MBApple Silicon
Parakeet Flash (Beta)最低延迟英文实时英语~250 MBApple Silicon
Parakeet TDT v3快速多语言默认25 种~500 MBApple Silicon
Parakeet TDT v2最快仅英语英语~500 MBApple Silicon
Cohere Transcribe高精度多语言14 种~1.4 GBApple Silicon
Apple Speech系统原生零下载系统语言内置Apple Silicon + Intel
Whisper Tiny → Large兼容性最广99 种75 MB – 2.9 GBApple Silicon + Intel

怎么选

  • 要最低延迟、要中文:Parakeet TDT v3(默认推荐),25 种语言覆盖
  • 只要英文、要最快:Parakeet Flash(Beta),250MB,开销最小
  • 要最准、要流式:Nemotron Speech 3.5,670MB,多语言 + 流式识别
  • Intel Mac 唯一选择:Whisper 系列(从 1.5.1 起 Intel Mac 也能用 Whisper 了)
  • 不想下任何东西:Apple Speech,但识别效果一般

Apple Silicon Mac 用户基本可以无视 Apple Speech——Parakeet TDT v3 在 M 系列芯片上的速度和准确率都完胜系统方案。Intel Mac 用户用 Whisper Small 或 Medium 是性价比最高的选择。

怎么用?

FluidVoice 历史记录和统计

最简安装

brew install --cask fluidvoice

或者从 GitHub Releases 直接下载 .dmg。

首次启动

  1. 授予麦克风权限(听写用)
  2. 授予辅助功能权限(往其他 App 输入文字用)
  3. 设置全局热键(推荐 Option+SpaceRight Command
  4. 引导流程会引导你选语言、下载语音模型、试听
  5. (可选)下载 Fluid Intelligence 本地模型做 AI 增强
  6. (可选)配 OpenAI / Groq / 自定义端点(API Key 存在 macOS Keychain)

两种工作模式

  • Write Mode(写):在任何文本框中口述输入,或者选中一段文字用语音重写
  • Command Mode(命令):用语音控制 Mac——启动 App、运行快捷指令、触发系统操作

两个模式之间用同一个全局热键切换,识别状态在菜单栏图标和刘海悬浮条上显示。

小细节做得很到位

  • Notch-aware 悬浮字幕条,MacBook 刘海位置刚好
  • 按 App 配置不同的 prompt(写代码用一种 prompt,写邮件用另一种)
  • 可选的本地录音历史 + 用量统计,ZIP 导出
  • 全部 AI 增强、录音历史、分析都是 opt-in,默认关

实际效果怎么样

1.6.0 重点重写了 Parakeet 实现,官方说「pretty much zero delay between speaking and seeing words on screen」——说话到屏幕上出现文字几乎没有延迟。这一点比 macOS 自带听写明显流畅很多,体感接近 Wispr Flow 但全部在本地。

几个关键体验

  • Parakeet TDT v3 中英文混合识别:测试中能正确处理中英混杂的句子(”API 是 RESTful 的,用 OpenAPI 3.0 写 spec”),不需要手动切语言
  • F 键双击改写:选中文字后按 F 键可以基于上下文重写,比单纯「重说一遍」智能
  • AI 增强的格式:说「明天上午十点开会」会自动格式化为 明天 10:00 AM 开会;说「给张三发邮件」会自动调整敬语和落款——这些是 Fluid Intelligence 的活
  • 资源占用:Parakeet TDT v3 实时听写时 CPU 占用大概 8-12%(M4),内存 ~1GB,可以放心后台跑

和同类工具的对比

维度FluidVoicemacOS 自带听写Wispr FlowSuperwhisper
开源✅ GPLv3
离线✅ 默认本地部分语言需联网通常云端本地为主
模型选择7+ 引擎仅 Apple Speech服务商决定主要 Whisper
AI 增强本地 + 可选云云端
系统级输入
语音命令✅ Command Mode弱(Siri)有限
价格免费开源免费订阅一次性
隐私全部本地部分取决于服务商本地

如果你主要用 Apple Silicon Mac、又在意隐私,FluidVoice 在「免费 + 本地 + 可控」这个三角里基本没有对手。

有哪些要注意的

1. 仅支持 macOS 15.0+(Sequoia 及以上)。如果你的 Mac 还停在 Sonoma,FluidVoice 装不了。

2. Apple Silicon 才有完整体验。Intel Mac 只能用 Whisper 模型(1.5.1+),但速度会差不少。

3. 首次启动要授权两次——麦克风 + 辅助功能。辅助功能授权后还需要在「系统设置 → 隐私与安全性 → 辅助功能」里把 FluidVoice 加进允许列表。

4. 语音模型要单独下载。Parakeet TDT v3 大概 500MB,Nemotron 670MB,Whisper Large 接近 3GB。Fluid Intelligence 模型(可选)额外占 ~3.5GB 磁盘。一次性下载,之后离线可用。

5. Fluid Intelligence 是闭源的。这是项目作者的有意决定——核心听写是 GPLv3 开源,但 AI 增强层是私有的,用来维持免费听写核心的可持续开发。如果你不 care AI 增强(只用 Parakeet/Whisper 原生输出),可以完全无视这一层。

6. 装好后热键默认未设,需要进 Settings → Hotkey 选一个不和系统冲突的组合。我用 Right Option 单按作为触发,避免和输入法切换打架。

7. Beta 通道:作者提供 Beta 通道(Settings → Automatic Updates → Beta Releases),想体验新功能可以打开。

谁适合用

适合

  • 每天在 Mac 上写大量中文/英文内容的文字工作者
  • 在意隐私、不想让语音数据上云的本地 AI 爱好者
  • 已经在 Mac mini M4 之类 Apple Silicon 设备上用本地大模型、希望在 Mac 上「all in 本地」的用户
  • 不想为 Wispr Flow / Superwhisper 付年费的人

不太适合

  • Intel Mac 重度用户(只能跑 Whisper,速度和准确率比 Apple Silicon 上的 Parakeet 差一截)
  • 还在用 macOS 14 及以下的人
  • 需要多端同步听写历史的人(目前 FluidVoice 是单 Mac 本地,没有云同步)

总结

FluidVoice 是 2026 年 macOS 上最值得关注的开源听写项目。4k 星 + 一天 365 星涨势说明用户群在快速形成。它做的事情看起来简单(语音转文字),但做到「本地 + 多模型 + 系统级输入 + AI 增强 + 全部免费开源」这个组合,确实是独一份。

如果你已经在 Mac mini M4 之类 Apple Silicon 设备上用本地大模型,把 FluidVoice 装上配 Parakeet TDT v3 当默认听写,会明显提升日常写作效率。完全离线、完全免费、完全可控——这才是本地 AI 该有的样子。

GitHub: github.com/altic-dev/FluidVoice
官网: altic.dev/fluid
最新发布: GitHub Releases
安装命令: brew install --cask fluidvoice

发表评论