StableLearn Logo

搜索内容

News 9 min read

GLM-5.2 今日正式开源:753B 参数打赢 GPT-5.5,成本只要 1/6

Z.ai(智谱 AI)今日正式开源旗舰模型 GLM-5.2,753B 参数 + 100 万 token 上下文 + MIT 协议,FrontierSWE 超越 GPT-5.5,成本只有 1/6。这是继 MiniMax M3 后,中国大模型开源的又一重磅炸弹

Cover image for GLM-5.2 今日正式开源:753B 参数打赢 GPT-5.5,成本只要 1/6

本文发布于 94 天前,内容可能已过时,请注意甄别。

今天,GLM-5.2 正式开源了

6月17日,Z.ai(原智谱 AI)正式开源旗舰大模型 GLM-5.2,MIT 协议,权重全开放。

这不是”有限开源”,不是”仅供研究”,而是完全商业可用、无国界限制。你可以在 Hugging Face、ModelScope 直接下载权重,爱怎么用怎么用。

核心数据直接上:

项目数据
参数规模753B(MoE 架构,单 token 激活 40B)
上下文窗口100 万 token(最大输出 12.8 万 token)
开源协议MIT(最宽松的商业许可)
API 定价输入 $1.4/百万 token,输出 $4.4/百万 token
成本优势仅为同级别闭源模型的 1/4 到 1/6

比 MiniMax M3 晚两周,但这个开源力度更狠——753B 参数的 MoE 模型,完全开放权重。

性能:FrontierSWE 超越 GPT-5.5

GLM-5.2 的定位很明确:长周期任务(Long-Horizon Tasks)+ 自主软件工程 Agent。

什么叫”长周期”?不是写个函数、改个 bug,而是连续数小时到数十小时的开源项目级开发任务——编译器优化、内核调试、多系统协同开发。

核心 Benchmark 数据:

1. 长周期工程级代码评测

BenchmarkGLM-5.2GPT-5.5Claude Opus 4.8
FrontierSWE74.4%72.6%75.1%
PostTrainBench34.3%28.4%37.2%
SWE-Marathon13.0-26.0

FrontierSWE 是评估 Agent 在长达数小时至数十小时的开源技术项目上的执行表现。GLM-5.2 达到 74.4%,超越 GPT-5.5 的 72.6%,与 Claude Opus 4.8 的差距只有 0.7%。

PostTrainBench 测试 Agent 能否通过训练提升小模型。GLM-5.2 得分 34.3%,领先 GPT-5.5 近 6 个百分点。

SWE-Marathon 是高难度的编译器、内核优化等系统级开发测试。GLM-5.2 得分 13.0,虽然与 Opus 4.8 的 26.0 还有差距,但相比同类开源模型(如 Gemini 3.1 Pro 的 4.0)保持明显优势。

2. 传统编程与通用能力测试

BenchmarkGLM-5.2前代 GLM-5.1
Terminal-Bench 2.181.063.5
SWE-bench Pro62.158.4
MCP-Atlas76.8-
AIME 202699.2-

Terminal-Bench 2.1 得分 81.0,成为首个在该评测中突破 80% 的开源权重模型。

MCP-Atlas(工具调用机制测试)得分 76.8,领先 GPT-5.5 的 75.3。

AIME 2026(数学竞赛测试)得分 99.2,在复杂数学逻辑推理上表现出色。

3. 盲测竞技场(Arena)表现

  • LMArena 编码性能盲测:GLM-5.2 超越 Claude Opus 4.7 和 4.8,排名世界第二
  • Design Arena 设计编程评测:击败 Claude Fable 5,排名世界第一

这是开源模型第一次在盲测中打赢顶级闭源模型。

技术:1M 上下文 + IndexShare 架构优化

GLM-5.2 的技术升级主要集中在三个方向:

1. 实用的 1M 无损上下文(Solid 1M Context)

上下文窗口从前代 GLM-5.1 的 20 万 token 提升至 100 万 token,最大单次输出可达 12.8 万 token。

关键不只是”长”,而是”实用”。Z.ai 针对 1M 上下文进行了大规模的 Agent 训练,覆盖了代码库实现、自动化研究、性能优化和复杂调试等混乱且漫长的 Agent 轨迹。

在处理超长文本和多系统工程时,GLM-5.2 的理解和连贯性更加稳定。不是”能读 100 万 token”,而是”读懂 100 万 token 并且能干活”。

2. 硬件与架构优化:IndexShare

长上下文的痛点是计算资源消耗过大。Z.ai 提出了 IndexShare 机制:

  • 通过在每 4 个稀疏注意力层(Sparse Attention Layers)中复用同一个轻量级索引器(Indexer)
  • 在 1M 上下文长度下,成功将每个 token 的计算量(FLOPs)降低了 2.9 倍
  • 改进了用于猜测解码(Speculative Decoding)的多 Token 预测(MTP)层,使 Token 的接受长度提升了多达 20%

简单说:用 1/3 的算力干同样的事。

3. 灵活的思考深度(Flexible Effort)

支持在调用时自定义思考深度级别(包括 High 和 Max 模式)。对于复杂、多步骤的编码任务,选择 Max 模式可以通过消耗更多的计算时间(和 Token)换取更高的推理正确率。

这是给开发者的”调节阀”:简单任务快速跑,复杂任务慢慢想。

生态:已接入主流工具链

GLM-5.2 的开源不是”扔个权重文件就跑路”,而是配套了完整的工具链支持:

本地运行支持

已完成对主流本地推理框架的适配:

  • transformers
  • vLLM
  • SGLang
  • xLLM
  • ktransformers
  • Ollama

下载权重就能跑,不用自己造轮子。

工具接入

支持无缝集成至当前主流的代码 Agent 框架:

  • Claude Code
  • OpenCode
  • Cline
  • Z.ai 官方的 ZCode 桌面端

开发者可以直接把 GLM-5.2 当成”替换芯片”,插进现有工作流。

定价:1/6 的成本打同样的仗

API 官方定价:

  • 输入 $1.4/百万 token
  • 输出 $4.4/百万 token

对比闭源模型:

  • GPT-5.5:输入约 $8/百万 token,输出约 $24/百万 token
  • Claude Opus 4.8:输入约 $10/百万 token,输出约 $30/百万 token

GLM-5.2 的成本只有它们的 1/4 到 1/6。

关键是,性能不是 1/6,是持平甚至反超。

这不是”便宜没好货”,这是”好货还便宜”。

为什么现在开源?

GLM-5.2 的开源时间点很微妙:

  • 6月12日:Anthropic 最强模型 Claude Fable 被美国政府强制下线
  • 6月13日:智谱宣布 GLM-5.2 即将开源
  • 6月17日:GLM-5.2 正式开源,权重全开放

Z.ai 的官方口号是:“GLM-5.2 is Fully Open, Frontier Intelligence Belongs to Everyone.”

这不只是产品发布,这是一种立场:你们封锁,我们开放;你们建墙,我们拆墙。

结合上周 MiniMax M3 的开源,中国大模型厂商的策略已经很清楚:

  • 不跟你比”谁的模型最强”(短期追不上)
  • 跟你比”谁的生态最大”(开源是捷径)
  • 用成本优势 + 开放策略,快速占领开发者心智

闭源模型的护城河是技术优势,但技术优势会被追平。开源模型的护城河是生态锁定,而生态一旦建立,就很难被撼动。

谁会用 GLM-5.2?

这个模型的目标用户很明确:

1. 需要长周期 Agent 的开发者

  • 自动化代码库重构
  • 多系统协同开发
  • 复杂性能优化
  • 长时间自主调试

2. 预算有限但要求不低的团队

  • 成本只有闭源模型的 1/6
  • 性能持平甚至反超 GPT-5.5
  • 可以本地部署,数据不出域

3. 想基于大模型做二次开发的研究者

  • MIT 协议,无限制
  • 可以蒸馏、微调、商业化
  • 权重全开放,架构可研究

最后说一句

GLM-5.2 的开源,加上两周前 MiniMax M3 的开源,中国大模型的路线已经很清楚了:

不跟你玩闭源护城河的游戏,直接掀桌子。

OpenAI、Anthropic、Google 组建”模型保护联盟”,把模型权重当芯片一样保护。智谱和 MiniMax 选择全面开源,把选择权交给开发者。

两种策略,现在还看不出输赢。但有一点可以确定:

当性能差距缩小到 10% 以内,成本差距是 6 倍,而且一个开源一个闭源——开发者会用脚投票。

一年后,我们会知道谁赌对了。


相关资源:

分享文章

更多文章