StableLearn Logo

搜索内容

News 6 min read

DeepSeek-V3.2 发布:开源模型首次达到 GPT-5 水平,IMO/IOI 金牌级推理能力

DeepSeek-V3.2 是 DeepSeek 推出的最新开源大语言模型,在推理能力和智能体性能上实现重大突破,性能媲美 GPT-5 和 Gemini-3.0-Pro。

Cover image for DeepSeek-V3.2 发布:开源模型首次达到 GPT-5 水平,IMO/IOI 金牌级推理能力

本文发布于 291 天前,内容可能已过时,请注意甄别。

DeepSeek 团队发布了最新的开源大语言模型 DeepSeek-V3.2,这是一款在计算效率、推理能力和智能体性能上实现全面突破的模型。DeepSeek-V3.2 的性能已经可以与 GPT-5 相媲美,而其高算力变体 DeepSeek-V3.2-Speciale 更是超越了 GPT-5,达到了与 Gemini-3.0-Pro 相当的推理水平。

核心技术突破

1. DeepSeek 稀疏注意力 (DSA)

DeepSeek-V3.2 引入了全新的 DeepSeek Sparse Attention (DSA) 机制,这是一种高效的注意力机制,能够在保持模型性能的同时大幅降低计算复杂度。

DSA 主要由两个组件构成:

  • 闪电索引器 (Lightning Indexer):计算查询 token 与前序 token 之间的索引分数,决定哪些 token 应该被选中
  • 细粒度 token 选择机制:仅检索索引分数最高的 top-k 个键值对条目

这种设计将核心注意力复杂度从 O(L²) 降低到 O(Lk),其中 k 远小于序列长度 L。在 128K 上下文场景下,DSA 实现了显著的端到端加速,同时在长上下文任务上没有明显的性能下降。

2. 可扩展的强化学习框架

DeepSeek-V3.2 开发了一套稳定且可扩展的强化学习协议,允许在后训练阶段进行大规模计算扩展。值得注意的是,该框架的后训练计算预算超过了预训练成本的 10%,从而解锁了更高级的能力。

后训练流程包括:

  • 专家蒸馏 (Specialist Distillation):针对数学、编程、逻辑推理、智能体任务等六个专业领域训练专门模型
  • 混合 RL 训练:采用 GRPO 算法,将推理、智能体和人类对齐训练合并到一个 RL 阶段
  • 多样化奖励机制:推理和智能体任务使用基于规则的结果奖励,通用任务使用生成式奖励模型

3. 大规模智能体任务合成流水线

为了将推理能力整合到工具使用场景中,DeepSeek 开发了一套新颖的合成流水线,系统性地大规模生成训练数据:

  • 自动合成了 1,827 个不同的环境 和 85,000+ 个复杂提示
  • 覆盖代码智能体、代码解释器智能体、通用智能体等多种场景
  • 合成任务具有”难以解决但易于验证”的特点,非常适合强化学习

性能评测

推理能力

基准测试DeepSeek-V3.2-ThinkingDeepSeek-V3.2-SpecialeGPT-5-HighGemini-3.0-Pro
AIME 2025 (Pass@1)93.1%96.0%94.6%95.0%
HMMT Feb 202592.5%99.2%88.3%97.5%
LiveCodeBench83.3%88.7%84.5%90.7%
CodeForces Rating2386270125372708
HLE (Pass@1)25.1%30.6%26.3%37.7%

竞赛级成绩

DeepSeek-V3.2-Speciale 在顶级数学和编程竞赛中取得了金牌级表现:

竞赛得分奖牌
IMO 2025 (国际数学奥林匹克)35/42🥇 金牌
CMO 2025 (中国数学奥林匹克)102/126🥇 金牌
IOI 2025 (国际信息学奥林匹克)492/600🥇 金牌 (第10名)
ICPC WF 2025 (ACM-ICPC 世界总决赛)10/12🥇 金牌 (第2名)

智能体能力

DeepSeek-V3.2 在智能体任务上显著缩小了开源与闭源模型之间的差距:

基准测试DeepSeek-V3.2GPT-5-HighClaude-4.5-Sonnet
SWE-Verified (Resolved)73.1%77.2%74.9%
Terminal Bench 2.035.2%54.2%42.8%
τ²-Bench (Pass@1)80.3%84.7%80.2%
Tool Decathlon35.2%38.6%29.0%

推理成本优势

得益于 DSA 机制,DeepSeek-V3.2 在长序列场景下的推理成本大幅降低:

  • 预填充阶段:在 128K token 位置,成本约为 DeepSeek-V3.1-Terminus 的 1/3
  • 解码阶段:在 128K token 位置,成本约为 DeepSeek-V3.1-Terminus 的 1/2

这使得 DeepSeek-V3.2 成为智能体场景中极具成本效益的选择。

开源与部署

DeepSeek-V3.2 延续了 DeepSeek 的开源传统,模型权重和推理代码已在 Hugging Face 上开源:

技术要点总结

  1. 架构创新:DSA 稀疏注意力机制将长序列计算复杂度从 O(L²) 降至 O(Lk)
  2. 训练策略:后训练计算预算超过预训练的 10%,采用专家蒸馏 + 混合 RL 训练
  3. 数据合成:自动化流水线生成 1,827 个环境和 85,000+ 个复杂任务
  4. 性能突破:首个在 IMO、IOI、ICPC WF 等顶级竞赛中获得金牌的开源模型
  5. 成本优化:长上下文场景推理成本降低 50-70%

未来展望

  • Token 效率:DeepSeek-V3.2-Speciale 的 token 效率仍低于 Gemini-3.0-Pro
  • 上下文管理:128K 上下文限制在某些智能体任务中仍是瓶颈
  • 自我验证:模型倾向于进行冗余的自我验证,导致轨迹过长

DeepSeek-V3.2 的发布标志着开源大模型首次在综合能力上达到 GPT-5 水平,为 AI 社区提供了一个强大且高效的选择。这不仅证明了开源路线的可行性,也为未来的研究和应用开辟了新的可能。

相关链接

分享文章

更多文章