开源大模型打到闭源公司的成本底线了

7 月 27 号晚上,月之暗面把 Kimi K3 的完整权重扔上 Hugging Face,2.8 万亿参数,30 分钟拿到 4000 多个赞,直接登顶趋势榜。HF 的 CEO 发 X 说,这是平台上线以来涨得最快的一次发布。

同一天,Anthropic 的 CEO 单独发了篇长文,解释自己为什么没签那份支持开放权重的产业公开信。两个动作挨得这么近,本来就很说明问题——但我盯着的不是硅谷谁撕谁。我盯着的是 Mozilla 7 月 14 号发的那份《开源 AI 现状》报告,里面有几组数据让我这个本地跑模型的人看了好几遍。

tokenshare

成本真的掉了 50 倍

36 个月,GPT-4 级别的推理价格从 $20 / 百万 token 跌到了 $0.4 / 百万 token。50 倍降幅,不是单纯的价格战——是模型架构、训练流程、推理优化这条线全面成熟的产物。vLLM、SGLang、llama.cpp、MLX 这一整套开源工具链把部署成本压到了普通人能承受的范围。我那台 16GB 的小主机上能跑 35B 量级的 8bit 量化模型,就是这一波基础设施红利的直接受益者。

costdrop

OpenRouter 上更直观:到 2026 年 6 月,平台上 50% 以上的 token 流量已经流向开放权重模型。前五名全是开源的:DeepSeek V4 Flash、小米的 MiMo-V2.5、腾讯的 Hy3 preview,再加一票国内的旗舰。闭源厂商的护城河从 token 数量上已经守不住了。

能力差距还在,只是换了个形状

从 2024 年初到现在,开源和闭源在 Chatbot Arena 上的能力差距从 8.04% 缩到 0.5%,又反弹到 3.3%。3.3% 这个数字有意思——它不是均匀分布的。在编程、指令跟随、通用知识这些场景,开源基本追平了;在深度推理、长上下文、agent 规划这些场景,闭源还是领先 15 到 30 个百分点。

capability

换句话说,开源打赢了日常任务,闭源保住了高判断力任务。这种分工短期内不会消失——也别指望它会消失。两边的资源分布不一样、激励机制不一样、商业模式不一样,自然会停在不同的均衡点。

本地玩家的真实处境

作为跑本地模型的人,我得诚实说一句:开源权重爆发对我的直接影响,比很多人想的小。

Kimi K3 听起来很猛,2.8 万亿参数,1M 上下文,听着让人兴奋——但部署需要 8 卡 B300 服务器。我这台 16GB 的小主机装不下,连围观都要掐着流量看。我常驻的 35B-A3B 8bit 量化版要占 40GB 内存,已经是在内存边缘跳舞,再大一档就得退回到 4bit 极端量化。

开源大爆发真正改变的是云端那一层:以前 1 美元跑 100 万 token,现在能跑 5000 万 token。这意味着我写代码、做信息整理这种高频任务,可以无脑走云端开源模型,本地留给真正敏感或离线的场景。

至于那些吵得不可开交的”开源 vs 闭源”——说实话,本地玩家不太 care。我在乎的是这个模型我能不能下下来,能不能跑得动,跑起来够不够我用。够用就完了,没人愿意为了信仰多花冤枉钱。

真正赢的是企业

开源大模型确实打到了闭源公司的成本底线——但这场战争的真正受益人不是我们这些本地玩家,是那些每天烧几十亿 token 的企业。Linux Foundation 引用的一个估算显示,如果企业把能切换到开源权重的负载全部切过去,每年能省下来大概 248 亿美元。

Mozilla 报告里有一句话挺扎心的:“开源在 token 量上赢了,闭源在请求数上还领先,但这个领先的本质是闭源还在守着那些真正需要前沿推理的高判断力任务。”

所以你看,闭源厂商的策略其实已经很清楚了——不卷通用任务,守住真正难的那一摊子。开源模型负责把日常任务的成本打到地板,闭源模型负责把最难任务的定价保住。这个分工反而比以前清晰了。

至于我这个本地跑模型的人,下一步打算再攒一根 64GB 的内存条——不是为了追开源大爆发的热度,是因为 35B-A3B 真的快把内存吃光了。

发表评论