GLM-5.2 全量开源:744B 参数的国产旗舰,MIT 协议随便用

GLM-5.2
全量开源:744B 参数的国产旗舰,MIT 协议随便用

6 月 13 日,智谱(Z.ai)把 GLM-5.2 的权重扔到了 HuggingFace
上,协议是 MIT

这件事的意义不只是”又多了一个开源模型”。在 Claude Fable 5
因政策原因全球下线的同一周,一个能力接近 Claude Opus
量级、可以随便下载、随便商用、没人能关掉的模型宣布开源——这个时间点的象征意义,可能比模型本身的技术指标更值得咀嚼。

先看清参数:大,但有门道

指标 数值
架构 MoE(混合专家)
总参数量 7440 亿(744B)
激活参数量 约 400 亿(40B)/ token
上下文窗口 1,000,000 token
最大输出 131,072 token
训练数据 28.5 T token
开源协议 MIT(允许商用)
HuggingFace zai-org/GLM-5.2

MoE 架构是”大而不笨”的关键:总参数 744B,但每次推理只激活约
40B。换句话说,它的”智商”是 744B 级别的,但跑起来时的计算量更接近一个
40B 的稠密模型。

1M token
的上下文窗口是这次最夸张的指标。整个中型代码仓库可以一次性塞进去,不用做
RAG、不用做 chunking、不用操心上下文丢失。

GLM-5.2 综合 benchmark 对比

MIT 开源,意味着什么?

MIT 协议 = 你可以做任何事,只要保留版权声明。

  • 商用 ✅
  • 二次分发 ✅
  • 改模型架构 ✅
  • 拿来做成产品卖钱 ✅

对比一下:Llama 3 的协议有月活 7 亿以上的使用限制;DeepSeek R2
的协议也有人对其商用合规性存疑。GLM-5.2 的
MIT,是目前主流开源大模型里限制最少的之一。

本地能跑吗?现实检查

坦白说:对大多数人来说,跑不了。

量化档次 最低内存/显存需求 能跑的硬件
2-bit 动态量化(UD-IQ2_XXS) ~241 GB M4 Ultra Mac Studio(256GB 统一内存)
4-bit(Q4_K_M) ~476 GB 2× A100 80GB 或 4× RTX 6000 Ada
FP16(全精度) >1.7 TB 企业级 GPU 集群

2-bit 量化下,M4 Ultra 256GB 可以跑,但生成速度大约 3-9
token/s
——能跑,但不快。

如果你没有 256GB 内存的设备,有三个务实的选择:

  1. Ollama 远程跑:在有 big iron 的服务器上部署,本地用
    API 调
  2. n1n.ai 之类的聚合 API:云端跑,速度有保障
  3. 等量化版出炉:社区还在压 GGUF
    的更小量化版,未来可能有 3-bit 或更好的 2-bit 变体

怎么跑起来?

方案 A:llama.cpp(性能最好)

# 克隆并编译
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B build -DGGML_CUDA=ON  # N 卡
# 或 -DGGML_METAL=ON  for Mac
cmake --build build --config Release -j

# 下载 GGUF 模型(2-bit 量化版)
# 从 HuggingFace: lmstudio-community/GLM-5.2-GGUF

# 启动服务
./build/bin/llama-server \
  --model models/GLM-5.2-UD-IQ2_XXS.gguf \
  --ctx-size 32768 \
  --host 0.0.0.0 --port 8080

方案 B:Ollama(最简单)

ollama run glm5
# 如果 Ollama 官方库还没有,可以手动导入 GGUF

方案 C:LM Studio(图形界面)

在模型浏览器搜
GLM-5.2-GGUF,下载符合你显存的量化版本,加载即可。还自带
OpenAI 兼容的本地 API,可以直接接 Cline、Aider 这些编程插件。

它适合做什么?

根据社区早期反馈,GLM-5.2 在以下场景表现突出:

  • 跨文件代码重构:1M
    上下文可以吞掉整个中型项目,理解代码结构后统一修改
  • 长文写作/技术文档:输出 128K
    token,一本小册子可以直接出
  • Agentic 编程:官方同期发布了 ZCode 3.0,就是基于
    GLM-5.2 的编程 Agent 工具
GLM-5.2 长上下文任务 benchmark

坑在哪?

  1. 中文训练数据占比高,英文任务的表现相对弱一些(虽然官方说做了双语优化)
  2. 2-bit
    量化质量损失
    :量化越激进,模型”智商”掉得越多,关键任务建议用
    4-bit 以上
  3. 推理速度:在消费级硬件上基本跑不动,就算 M4 Ultra
    也是勉强
  4. 社区生态还在建设:Ollama 官方库可能还没有现成的
    GLM-5.2 条目,需要手动导 GGUF

一句话总结

GLM-5.2
开源不是”又一个大模型”,而是在正确的时间点,把一个正确规格的模型,用正确的协议放了出来。它现在可能跑不动在你的笔记本上,但它证明了”云端
API
随时可能被关掉”这件事,有一个开源的、没人能单方面撤下的备选方案。

这很重要。

模型地址:https://huggingface.co/zai-org/GLM-5.2

发表评论