模型发布会越来越热闹,说明书越写越薄

8 月 12 日这一天,xAI、DeepSeek、阿里三家接连出招。Grok 4.6 上线、Qwen3.8-Max 放出 2.4T 参数、DeepSeek-V4-Pro 在 API 价格表里悄悄换了版本号。三场发布会,声量都不小。但如果你回头找这些模型的”说明书”——模型卡、架构细节、复现脚本、安全测试报告——会发现该有的东西越来越薄,甚至直接没有

这是一种悄悄的趋势,不是哪家一时疏忽。

xAI:模型卡永远是迟到的事

Grok 4.6 在 2026 年 8 月 12 日上线,官方说法是”对标 GPT-5.6 Sol 的综合智能分数”。前 OpenAI 政策研究员 Miles Brundage 当天就转发了一个事实:这次发布还是没有模型卡。他列了 xAI 的”老毛病”:Grok 4.5 的模型卡是在模型发布一周之后才补上的;Grok 4.3 的模型卡——至今没补。

更要关心的是架构这一栏。Forkast 的拆解写得清楚:模型卡里 Grok 4.6 只被归入”1.5T-scale model family”,但专家数、激活参数、网络层数、注意力方案一项都没披露。在 CSDN 的一篇技术解析里也提到,”1.5T 级”不能自动推导出每个 token 都计算 1.5 万亿参数;Grok 历史上用过 MoE,但 4.6 没有给出专家路由或激活参数,所以严谨来说没法跟 DeepSeek、Qwen 这种公开了激活参数的模型横比

这不是必要的细节。是”我愿意不愿意让你算账”的问题。对照看:Meta、Google、OpenAI、Anthropic 几乎在模型发布当天同步附 system card,把训练数据范围、行为评估、红队测试、已知失败模式列得清清楚楚。xAI 不是没东西可写——它只是没写。

DeepSeek:GA 和”开源权重”,现在不是一回事了

同一天附近的另一件事更值得警惕。DeepSeek-V4-Pro 在 8 月 13 日宣布 GA,但社区发现的事实是这样的:8 月 12 日,V4-Pro-0813 这个版本号就先出现在了价格表里,没有任何公告;32 小时之后才补上 changelog 和官宣。换句话说,模型已经悄悄在跑生产流量了,开发者才知道有这件事。

但 V4-Pro 的 GA 没有带来权重。Hugging Face 上的 deepseek-ai 组织现在还挂着 4 月 24 日的 preview 版本(MIT),0813 这个 checkpoint 至今没有任何下载链接。DeepSeek 没有说”不发”,也没有说”什么时候发”。

对比它自己之前的节奏:4 月 24 日 V4 preview + weights(MIT);7 月 31 日 V4-Flash GA + weights(MIT);8 月 13 日 V4-Pro GA + 没有 weights。Aibacon 的总结说得很到位:”你现在能下载的 DeepSeek 旗舰,和你实际为之付费的 DeepSeek 旗舰,已经不是同一个东西了。”

另一个细节在 benchmark 上。流传的”V4-Pro 在 SWE-bench Verified 80.6%、GPQA Diamond 90.1%、LiveCodeBench 93.5%”——这几个数字其实是 DeepSeek 在 4 月 preview 报告里发的,被人错误地接到了 0813 的 GA 头上。没有任何一个 harness 是跑在 0813 上的。

Meta 和 Qwen:开源声明里的暗门

Meta 在 8 月 10 日发了 Muse Glimmer(30B,Apache 2.0),扎克伯格还专门写了 6500 字长文,主题是”个人超级智能”。但 Muse Glimmer 不是从零训练的——它是从闭源的 Muse Spark 蒸馏出来的轻量化版本。Muse Spark 1.2 的权重虽然已经”宣布”会开放,但截至目前没发。你可以下载 Glimmer,但你拿不到它在哪个闭源模型里继承的能力细节。

Qwen3.8-Max 的发布同样有争议点。2.4T 参数、激活 950 亿,宣称”模型在无人工干预下16 天自主完成了一个软件工程项目。业内立刻有人提出:16 天是按日历算还是按算力小时算?期间有多少次回滚?最终代码有没有经过 review?这个数字被到处转载,但没人追问。Kanerika 公司的 AI 开发经理 Amit Yena 直接说:”发布权重和开放 API 是两回事。在仓库地址、许可协议和 model card 都到位之前,所谓’开放权重’只是一种意图。”

这种趋势是怎么来的

三个案例并到一起不是偶然:

  • 第一,发布会声量 = 算力账本。训练和推理算力都在涨,能把”模型发布”做成公众事件的边际收益很高,把工程师时间花在写模型卡上反而显得”低 ROI”。
  • 第二,”开源”和”开放权重”的边界被刻意模糊。发一个 Apache 2.0 协议的 checkpoint 不等于你能审计它的训练数据、复现它的后训练、研究它的失败模式。”权重可见”是结果,”过程透明”才是真开源。
  • 第三,开发者越来越被动。如果旗舰模型的可自部署版本和可调用版本是两回事,企业里把”最差情况下我们自托管”写在容灾方案的团队,会发现自己的备选方案是落后四个月的快照。审计人员想看安全测试报告,可能要先签 NDA。

我自己的应对

从开发者的角度,这个月下来我自己的做法越来越明确:

  • 不再为”某家公司发了新模型”这件事激动,先看 model card 写没写清楚;
  • 多模型混用,每个任务类型至少有两个可替代项,避免被单家 GA 节奏卡死;
  • 真正重要的能力(编码、长上下文、agentic),都用自己手上的真实任务跑一遍——官网分数只能当起点,不能当结论。

8 月这一波发布教会我一件事:发布会热闹的时候,恰恰是你最需要看说明书的时候。说明书越来越短,意味着你越不能完全信发布会。

发表评论