GLM-5.2
全量开源:744B 参数的国产旗舰,MIT 协议随便用
6 月 13 日,智谱(Z.ai)把 GLM-5.2 的权重扔到了 HuggingFace
上,协议是 MIT。
这件事的意义不只是”又多了一个开源模型”。在 Claude Fable 5
因政策原因全球下线的同一周,一个能力接近 Claude Opus
量级、可以随便下载、随便商用、没人能关掉的模型宣布开源——这个时间点的象征意义,可能比模型本身的技术指标更值得咀嚼。
先看清参数:大,但有门道
| 指标 | 数值 |
|---|---|
| 架构 | MoE(混合专家) |
| 总参数量 | 7440 亿(744B) |
| 激活参数量 | 约 400 亿(40B)/ token |
| 上下文窗口 | 1,000,000 token |
| 最大输出 | 131,072 token |
| 训练数据 | 28.5 T token |
| 开源协议 | MIT(允许商用) |
| HuggingFace | zai-org/GLM-5.2 |
MoE 架构是”大而不笨”的关键:总参数 744B,但每次推理只激活约
40B。换句话说,它的”智商”是 744B 级别的,但跑起来时的计算量更接近一个
40B 的稠密模型。
1M token
的上下文窗口是这次最夸张的指标。整个中型代码仓库可以一次性塞进去,不用做
RAG、不用做 chunking、不用操心上下文丢失。

MIT 开源,意味着什么?
MIT 协议 = 你可以做任何事,只要保留版权声明。
- 商用 ✅
- 二次分发 ✅
- 改模型架构 ✅
- 拿来做成产品卖钱 ✅
对比一下:Llama 3 的协议有月活 7 亿以上的使用限制;DeepSeek R2
的协议也有人对其商用合规性存疑。GLM-5.2 的
MIT,是目前主流开源大模型里限制最少的之一。
本地能跑吗?现实检查
坦白说:对大多数人来说,跑不了。
| 量化档次 | 最低内存/显存需求 | 能跑的硬件 |
|---|---|---|
| 2-bit 动态量化(UD-IQ2_XXS) | ~241 GB | M4 Ultra Mac Studio(256GB 统一内存) |
| 4-bit(Q4_K_M) | ~476 GB | 2× A100 80GB 或 4× RTX 6000 Ada |
| FP16(全精度) | >1.7 TB | 企业级 GPU 集群 |
2-bit 量化下,M4 Ultra 256GB 可以跑,但生成速度大约 3-9
token/s——能跑,但不快。
如果你没有 256GB 内存的设备,有三个务实的选择:
- Ollama 远程跑:在有 big iron 的服务器上部署,本地用
API 调 - n1n.ai 之类的聚合 API:云端跑,速度有保障
- 等量化版出炉:社区还在压 GGUF
的更小量化版,未来可能有 3-bit 或更好的 2-bit 变体
怎么跑起来?
方案 A:llama.cpp(性能最好)
# 克隆并编译
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B build -DGGML_CUDA=ON # N 卡
# 或 -DGGML_METAL=ON for Mac
cmake --build build --config Release -j
# 下载 GGUF 模型(2-bit 量化版)
# 从 HuggingFace: lmstudio-community/GLM-5.2-GGUF
# 启动服务
./build/bin/llama-server \
--model models/GLM-5.2-UD-IQ2_XXS.gguf \
--ctx-size 32768 \
--host 0.0.0.0 --port 8080
方案 B:Ollama(最简单)
ollama run glm5
# 如果 Ollama 官方库还没有,可以手动导入 GGUF
方案 C:LM Studio(图形界面)
在模型浏览器搜
GLM-5.2-GGUF,下载符合你显存的量化版本,加载即可。还自带
OpenAI 兼容的本地 API,可以直接接 Cline、Aider 这些编程插件。
它适合做什么?
根据社区早期反馈,GLM-5.2 在以下场景表现突出:
- 跨文件代码重构:1M
上下文可以吞掉整个中型项目,理解代码结构后统一修改 - 长文写作/技术文档:输出 128K
token,一本小册子可以直接出 - Agentic 编程:官方同期发布了 ZCode 3.0,就是基于
GLM-5.2 的编程 Agent 工具

坑在哪?
- 中文训练数据占比高,英文任务的表现相对弱一些(虽然官方说做了双语优化)
- 2-bit
量化质量损失:量化越激进,模型”智商”掉得越多,关键任务建议用
4-bit 以上 - 推理速度:在消费级硬件上基本跑不动,就算 M4 Ultra
也是勉强 - 社区生态还在建设:Ollama 官方库可能还没有现成的
GLM-5.2 条目,需要手动导 GGUF
一句话总结
GLM-5.2
开源不是”又一个大模型”,而是在正确的时间点,把一个正确规格的模型,用正确的协议放了出来。它现在可能跑不动在你的笔记本上,但它证明了”云端
API
随时可能被关掉”这件事,有一个开源的、没人能单方面撤下的备选方案。
这很重要。