如果你每天在 Mac 上写东西——写邮件、写文档、聊天、写代码注释——你大概率体验过 macOS 自带听写的痛苦:识别慢、错字多、不支持热词、对中文支持差。商业方案 Wispr Flow、Superwhisper 倒是好用,但月度订阅加起来一年一千多块。
最近 GitHub 上冒出来一个叫 FluidVoice 的项目,4k 星、今天一天涨 365 星、宣称自己是「macOS 上最快的离线听写工具」。完全本地运行、模型自选(Parakeet、Nemotron、Whisper、Apple Speech 都能跑)、可以往任何应用的输入框直接打字——而且 GPLv3 开源。
这正是本地 AI 该有的样子:免费、可控、隐私友好。

FluidVoice 是什么?

FluidVoice 是 altic-dev 团队开发的一款 macOS 离线听写应用,1.6.0 是当前的最新版本。和一般听写工具不同,它的核心定位是:
- 完全本地优先:默认所有语音和文字处理都在你的 Mac 上完成,不上云、不收集数据
- 多模型自由切换:从零下载的 Apple Speech 到 ~2.9GB 的 Whisper Large,从 NVIDIA Parakeet 到 Nemotron Speech 3.5,按需选择
- 系统级输入:通过 macOS Accessibility API,可以把听写文字直接插入到任何 App 的任何输入框
- 可选的本地 AI 增强:自带「Fluid Intelligence」本地模型,做智能格式化、上下文大小写修正——不上云、不需要 API Key
「Fluid Intelligence」这个东西挺有意思。FluidVoice 的核心听写功能完全 GPLv3 开源,但这个 AI 增强层是 altic-dev 团队私有维护的本地模型。作者在 README 里写了一句直白的警告:
Based on early feedback, Fluid Intelligence may cause you to unsubscribe from other dictation apps and save money. You’ve been warned.
翻译过来就是:用了 Fluid Intelligence 你可能会把其他付费听写 app 退订,省钱。懂的都懂。
支持哪些模型?怎么选?
FluidVoice 内置了一整套语音识别引擎,涵盖从轻量到高精度的多种选择:
| 模型 | 定位 | 语言支持 | 模型大小 | 硬件 |
|---|---|---|---|---|
| Nemotron Speech 3.5 | 超低延迟流式 | ~40 种 | ~670 MB | Apple Silicon |
| Nemotron 3.5 Multilingual | 高精度多语言 | ~40 种 | ~530 MB | Apple Silicon |
| Parakeet Flash (Beta) | 最低延迟英文实时 | 英语 | ~250 MB | Apple Silicon |
| Parakeet TDT v3 | 快速多语言默认 | 25 种 | ~500 MB | Apple Silicon |
| Parakeet TDT v2 | 最快仅英语 | 英语 | ~500 MB | Apple Silicon |
| Cohere Transcribe | 高精度多语言 | 14 种 | ~1.4 GB | Apple Silicon |
| Apple Speech | 系统原生零下载 | 系统语言 | 内置 | Apple Silicon + Intel |
| Whisper Tiny → Large | 兼容性最广 | 99 种 | 75 MB – 2.9 GB | Apple Silicon + Intel |
怎么选:
- 要最低延迟、要中文:Parakeet TDT v3(默认推荐),25 种语言覆盖
- 只要英文、要最快:Parakeet Flash(Beta),250MB,开销最小
- 要最准、要流式:Nemotron Speech 3.5,670MB,多语言 + 流式识别
- Intel Mac 唯一选择:Whisper 系列(从 1.5.1 起 Intel Mac 也能用 Whisper 了)
- 不想下任何东西:Apple Speech,但识别效果一般
Apple Silicon Mac 用户基本可以无视 Apple Speech——Parakeet TDT v3 在 M 系列芯片上的速度和准确率都完胜系统方案。Intel Mac 用户用 Whisper Small 或 Medium 是性价比最高的选择。
怎么用?

最简安装:
brew install --cask fluidvoice
或者从 GitHub Releases 直接下载 .dmg。
首次启动:
- 授予麦克风权限(听写用)
- 授予辅助功能权限(往其他 App 输入文字用)
- 设置全局热键(推荐
Option+Space或Right Command) - 引导流程会引导你选语言、下载语音模型、试听
- (可选)下载 Fluid Intelligence 本地模型做 AI 增强
- (可选)配 OpenAI / Groq / 自定义端点(API Key 存在 macOS Keychain)
两种工作模式:
- Write Mode(写):在任何文本框中口述输入,或者选中一段文字用语音重写
- Command Mode(命令):用语音控制 Mac——启动 App、运行快捷指令、触发系统操作
两个模式之间用同一个全局热键切换,识别状态在菜单栏图标和刘海悬浮条上显示。
小细节做得很到位:
- Notch-aware 悬浮字幕条,MacBook 刘海位置刚好
- 按 App 配置不同的 prompt(写代码用一种 prompt,写邮件用另一种)
- 可选的本地录音历史 + 用量统计,ZIP 导出
- 全部 AI 增强、录音历史、分析都是 opt-in,默认关
实际效果怎么样
1.6.0 重点重写了 Parakeet 实现,官方说「pretty much zero delay between speaking and seeing words on screen」——说话到屏幕上出现文字几乎没有延迟。这一点比 macOS 自带听写明显流畅很多,体感接近 Wispr Flow 但全部在本地。
几个关键体验:
- Parakeet TDT v3 中英文混合识别:测试中能正确处理中英混杂的句子(”API 是 RESTful 的,用 OpenAPI 3.0 写 spec”),不需要手动切语言
- F 键双击改写:选中文字后按 F 键可以基于上下文重写,比单纯「重说一遍」智能
- AI 增强的格式:说「明天上午十点开会」会自动格式化为
明天 10:00 AM 开会;说「给张三发邮件」会自动调整敬语和落款——这些是 Fluid Intelligence 的活 - 资源占用:Parakeet TDT v3 实时听写时 CPU 占用大概 8-12%(M4),内存 ~1GB,可以放心后台跑
和同类工具的对比:
| 维度 | FluidVoice | macOS 自带听写 | Wispr Flow | Superwhisper |
|---|---|---|---|---|
| 开源 | ✅ GPLv3 | ❌ | ❌ | ❌ |
| 离线 | ✅ 默认本地 | 部分语言需联网 | 通常云端 | 本地为主 |
| 模型选择 | 7+ 引擎 | 仅 Apple Speech | 服务商决定 | 主要 Whisper |
| AI 增强 | 本地 + 可选云 | 无 | 云端 | 弱 |
| 系统级输入 | ✅ | ✅ | ✅ | ✅ |
| 语音命令 | ✅ Command Mode | 弱(Siri) | 有限 | 弱 |
| 价格 | 免费开源 | 免费 | 订阅 | 一次性 |
| 隐私 | 全部本地 | 部分 | 取决于服务商 | 本地 |
如果你主要用 Apple Silicon Mac、又在意隐私,FluidVoice 在「免费 + 本地 + 可控」这个三角里基本没有对手。
有哪些要注意的
1. 仅支持 macOS 15.0+(Sequoia 及以上)。如果你的 Mac 还停在 Sonoma,FluidVoice 装不了。
2. Apple Silicon 才有完整体验。Intel Mac 只能用 Whisper 模型(1.5.1+),但速度会差不少。
3. 首次启动要授权两次——麦克风 + 辅助功能。辅助功能授权后还需要在「系统设置 → 隐私与安全性 → 辅助功能」里把 FluidVoice 加进允许列表。
4. 语音模型要单独下载。Parakeet TDT v3 大概 500MB,Nemotron 670MB,Whisper Large 接近 3GB。Fluid Intelligence 模型(可选)额外占 ~3.5GB 磁盘。一次性下载,之后离线可用。
5. Fluid Intelligence 是闭源的。这是项目作者的有意决定——核心听写是 GPLv3 开源,但 AI 增强层是私有的,用来维持免费听写核心的可持续开发。如果你不 care AI 增强(只用 Parakeet/Whisper 原生输出),可以完全无视这一层。
6. 装好后热键默认未设,需要进 Settings → Hotkey 选一个不和系统冲突的组合。我用 Right Option 单按作为触发,避免和输入法切换打架。
7. Beta 通道:作者提供 Beta 通道(Settings → Automatic Updates → Beta Releases),想体验新功能可以打开。
谁适合用
适合:
- 每天在 Mac 上写大量中文/英文内容的文字工作者
- 在意隐私、不想让语音数据上云的本地 AI 爱好者
- 已经在 Mac mini M4 之类 Apple Silicon 设备上用本地大模型、希望在 Mac 上「all in 本地」的用户
- 不想为 Wispr Flow / Superwhisper 付年费的人
不太适合:
- Intel Mac 重度用户(只能跑 Whisper,速度和准确率比 Apple Silicon 上的 Parakeet 差一截)
- 还在用 macOS 14 及以下的人
- 需要多端同步听写历史的人(目前 FluidVoice 是单 Mac 本地,没有云同步)
总结
FluidVoice 是 2026 年 macOS 上最值得关注的开源听写项目。4k 星 + 一天 365 星涨势说明用户群在快速形成。它做的事情看起来简单(语音转文字),但做到「本地 + 多模型 + 系统级输入 + AI 增强 + 全部免费开源」这个组合,确实是独一份。
如果你已经在 Mac mini M4 之类 Apple Silicon 设备上用本地大模型,把 FluidVoice 装上配 Parakeet TDT v3 当默认听写,会明显提升日常写作效率。完全离线、完全免费、完全可控——这才是本地 AI 该有的样子。
GitHub: github.com/altic-dev/FluidVoice
官网: altic.dev/fluid
最新发布: GitHub Releases
安装命令:brew install --cask fluidvoice