MiniMax M3 发布:首个同时做到编码开源最强、百万上下文、原生多模态的开放权重模型

6 月 1 日,MiniMax 正式发布了 M3,一个在好几个维度上都让人眼前一亮的开放权重模型。在本地 AI 模型圈子里,我们见过擅长编码的、见过堆长上下文的、也见过主打多模态的,但 M3 是第一个同时做到这三件事的开源权重模型——而且每一件做得都不含糊。

这不是一篇新闻摘要,我更想从「这模型对本地 AI 玩家意味着什么」的角度来聊聊。

MiniMax M3 发布海报
MiniMax M3 官方发布海报(来源:minimax.io)

MSA:让百万上下文不再只是噱头

先说架构。M3 的核心创新叫 MSA(MiniMax Sparse Attention),本质上是一种更聪明的稀疏注意力机制。

之前大家做长上下文,要么用 DSA(DeepSeek 的方案),要么用 MoBA(MoE-style attention)。MSA 的思路又进了一步:先把 KV cache 切成块,加一道预过滤,只挑出跟当前 query 相关的块来做完整计算。听起来思路不复杂,但关键是把这个思路上 GPU 做到了极致——同一查询需要的 KV 块连续读取、不同查询共享同一块时一起 batch 处理,每块只读一次。

结果是实打实的:在 1M 上下文下,每个 token 的计算量只有前代的 1/20,prefill 快了 9 倍,decoding 快了 15 倍。对比现有的开源稀疏注意力方案,MSA 整体也快了 4 倍以上

这意味着什么?百万级上下文第一次在开放权重模型上变得实用,而不是停留在跑分演示上。

MSA(MiniMax Sparse Attention)架构示意图
MSA 稀疏注意力架构示意图——将 KV cache 分块预过滤,仅计算相关块(来源:MiniMax 官方博文)

跑分不是重点,但确实能打

SWE-Bench Pro 59.0%、Terminal-Bench 2.1 66.0%、BrowseComp 83.5(超过 Opus 4.7 的 79.3)——如果只看这些数字,M3 在编码和 Agent 类任务上已经进入了闭源前沿模型的梯队。

不过在我看来,MiniMax 放出的三个「真实任务演示」更有说服力:

论文复现:M3 花了 12 小时,自主复现了一篇 ICLR 2025 的论文《Learning Dynamics of LLM Finetuning》,完成了 18 次代码提交、生成 23 张实验图,最终确认了 SFT 趋势、DPO 挤压效应等核心发现。全程无人干预。

CUDA 优化:给了个不完整的 Triton 骨架代码,让 M3 优化 Hopper FP8 GEMM 内核。它跑了将近 24 小时、提交了 147 次,把硬件利用率从 7.6% 一路拉到了 71.3%,实现了 9.4 倍的加速。最让我意外的是,最优解出现在第 145 次提交——换句话说,模型在经历多次性能平台期后仍然没有放弃,而是在持续尝试中找到突破口。这个特性在实际开发场景中比单次跑分更有意义。

PostTrainBench:给 4 个没有下游能力的 Base 模型,让 M3 自主完成数据合成、训练、评估、迭代。12 小时后,结果略低于 Opus 4.7 和 GPT-5.5,但明显高于其他测试的模型。

说实话,这三个演示加在一起,比任何单一跑分都更能说明问题:M3 不只是「能做某一道题」,而是能在长时间、多步骤的真实任务中持续工作——这对 Agent 场景来说是关键能力。

MiniMax M3 关键跑分对比表
M3 在编码、Agent、搜索等评测中的表现(来源:MiniMax 官方博文)

原生多模态,而不是后装

M3 的另一个值得关注的特征是:它的多模态是从训练第一步就融入的,不是拿一个纯文本模型后期 fine-tune 图像能力。

MiniMax 重新设计了整个文本预训练管线,大量产出了文本+图像交错的训练数据(规模约 100T token)。这种做法的好处是,文本和图像的语义空间从一开始就融合在一起,而不是后期硬凑。

这一点在论文复现任务中体现得很清楚:模型需要看懂论文里的公式、图表、以及代码的对应关系,这恰恰是「原生多模态 + 编码能力 + 长上下文」三者结合才能完成的。

开放程度与可用性

MiniMax 承诺在发布后 10 天内把权重和技术报告上传 Hugging Face 和 GitHub。到写这篇文章时应该已经可以下载了。更重要的是,配套的 MiniMax Code Agent 桌面应用也会开源——这样你在本地就能跑一个能持续工作数天的自主编码 Agent。

API 层面,Token 计划从 $20/月(约 1.7B tokens)到 $120/月(约 9.8B tokens),所有模态共用额度。支持 Thinking Mode 开关,512K 以内上下文按标准费率计费。

M3 与其他开源编码模型核心能力对比
MiniMax M3 与 DeepSeek-V4、Qwen3 在编码、长上下文、多模态、开放权重等维度对比

怎么看这件事?

作为一个偏实干的本地 AI 爱好者,我觉得 M3 的意义不在于「又一个模型跑分超过 GPT」,而在于:

  1. 稀疏注意力终于有了一个实用、可复现的实现参考。MSA 的设计思路和性能数据对社区后续的长上下文模型很有借鉴价值。
  2. 开源模型在长时间自主任务上第一次拿出了有说服力的演示。持续 12 小时甚至 24 小时不间断工作,这对现实世界中的开发/研究场景来说是真正的生产力。
  3. 中国 AI 公司在这波开源浪潮中越来越不可忽视。从 DeepSeek 到 Qwen,再到现在的 MiniMax M3,开放权重模型的主力军里中国团队的比例在明显上升。

如果你对 M3 感兴趣,现在就可以去 Hugging Face 搜 MiniMax/M3 拉权重,或者先通过 API 试玩。我个人会关注的是它在 Mac 上用 MLX 跑的效果——毕竟这是目前最能打的开源编码模型里,少数承诺能本地跑的。

发表评论