Gemma 4 最狠的地方,不是 31B 参数追上了闭源前沿,而是 Google DeepMind 把多模态模型里最累赘的“翻译官”给砍了。

传统的多模态模型像个胶水项目。视觉靠 CLIP,音频靠 Whisper,先把像素和波形转成向量,再塞进 LLM。这个做法能跑,但内存被撕裂、协同优化也困难。Gemma 4 12B 直接扔了独立编码器,只留一个 35M 的投影层,把原始图像块和 40ms 的音频波形块直接丢进统一 Transformer。一条模型同时看、听、想。
这听起来像是学术炫技,但意义很实际。过去我们说“端侧模型”时,潜台词是“云端的缩水版”。本地只能跑点文本对话,多模态和深度推理是数据中心的特权。Gemma 4 用架构证明,这个预设可能是错的。

更过分的是 2.3B 的 E2B 版本也带 thinking 模式。这意味着一台普通手机或轻薄本,就能跑一个会“慢慢想”的模型。我手边的机器已经能塞进几个这样的模型,NAS 上再挂一个服务也不是难事。推理不一定非要发给千里之外的数据中心。
有人可能会说,端侧模型的上限还是比不上 GPT-5 或 Claude 那种巨型模型。这话没错。但绝大多数应用并不需要 frontier 级别的能力。翻译一页文档、识别监控视频里的异常、给代码补个注释、离线时回答几个问题——这些任务如果被本地模型覆盖,云端 API 的调用量会断崖式下跌。
云端 AI 真正的护城河,不是模型能力,而是方便和生态。但现在“方便”的代价越来越明显:每月账单、网络延迟、隐私合规、数据出境。每多一次本地能完成的调用,都是在给这些成本找替代方案。
Gemma 4 不是终点,它更像一个信号。开源权重、原生多模态、深度思考下放,这三件事加在一起,意味着端侧模型正在从“够用”变成“好用”。我还会继续在某云上跑大模型,但本地模型的优先级,显然要往上提了。
云端不会死,但它独霸 AI 的理由,已经少了一条。