DeepSeek-V3.2 发布:开源模型首次达到 GPT-5 水平,IMO/IOI 金牌级推理能力
DeepSeek-V3.2 是 DeepSeek 推出的最新开源大语言模型,在推理能力和智能体性能上实现重大突破,性能媲美 GPT-5 和 Gemini-3.0-Pro。
本文发布于 291 天前,内容可能已过时,请注意甄别。
DeepSeek 团队发布了最新的开源大语言模型 DeepSeek-V3.2,这是一款在计算效率、推理能力和智能体性能上实现全面突破的模型。DeepSeek-V3.2 的性能已经可以与 GPT-5 相媲美,而其高算力变体 DeepSeek-V3.2-Speciale 更是超越了 GPT-5,达到了与 Gemini-3.0-Pro 相当的推理水平。
核心技术突破
1. DeepSeek 稀疏注意力 (DSA)
DeepSeek-V3.2 引入了全新的 DeepSeek Sparse Attention (DSA) 机制,这是一种高效的注意力机制,能够在保持模型性能的同时大幅降低计算复杂度。
DSA 主要由两个组件构成:
- 闪电索引器 (Lightning Indexer):计算查询 token 与前序 token 之间的索引分数,决定哪些 token 应该被选中
- 细粒度 token 选择机制:仅检索索引分数最高的 top-k 个键值对条目
这种设计将核心注意力复杂度从 O(L²) 降低到 O(Lk),其中 k 远小于序列长度 L。在 128K 上下文场景下,DSA 实现了显著的端到端加速,同时在长上下文任务上没有明显的性能下降。
2. 可扩展的强化学习框架
DeepSeek-V3.2 开发了一套稳定且可扩展的强化学习协议,允许在后训练阶段进行大规模计算扩展。值得注意的是,该框架的后训练计算预算超过了预训练成本的 10%,从而解锁了更高级的能力。
后训练流程包括:
- 专家蒸馏 (Specialist Distillation):针对数学、编程、逻辑推理、智能体任务等六个专业领域训练专门模型
- 混合 RL 训练:采用 GRPO 算法,将推理、智能体和人类对齐训练合并到一个 RL 阶段
- 多样化奖励机制:推理和智能体任务使用基于规则的结果奖励,通用任务使用生成式奖励模型
3. 大规模智能体任务合成流水线
为了将推理能力整合到工具使用场景中,DeepSeek 开发了一套新颖的合成流水线,系统性地大规模生成训练数据:
- 自动合成了 1,827 个不同的环境 和 85,000+ 个复杂提示
- 覆盖代码智能体、代码解释器智能体、通用智能体等多种场景
- 合成任务具有”难以解决但易于验证”的特点,非常适合强化学习
性能评测
推理能力
| 基准测试 | DeepSeek-V3.2-Thinking | DeepSeek-V3.2-Speciale | GPT-5-High | Gemini-3.0-Pro |
|---|---|---|---|---|
| AIME 2025 (Pass@1) | 93.1% | 96.0% | 94.6% | 95.0% |
| HMMT Feb 2025 | 92.5% | 99.2% | 88.3% | 97.5% |
| LiveCodeBench | 83.3% | 88.7% | 84.5% | 90.7% |
| CodeForces Rating | 2386 | 2701 | 2537 | 2708 |
| HLE (Pass@1) | 25.1% | 30.6% | 26.3% | 37.7% |
竞赛级成绩
DeepSeek-V3.2-Speciale 在顶级数学和编程竞赛中取得了金牌级表现:
| 竞赛 | 得分 | 奖牌 |
|---|---|---|
| IMO 2025 (国际数学奥林匹克) | 35/42 | 🥇 金牌 |
| CMO 2025 (中国数学奥林匹克) | 102/126 | 🥇 金牌 |
| IOI 2025 (国际信息学奥林匹克) | 492/600 | 🥇 金牌 (第10名) |
| ICPC WF 2025 (ACM-ICPC 世界总决赛) | 10/12 | 🥇 金牌 (第2名) |
智能体能力
DeepSeek-V3.2 在智能体任务上显著缩小了开源与闭源模型之间的差距:
| 基准测试 | DeepSeek-V3.2 | GPT-5-High | Claude-4.5-Sonnet |
|---|---|---|---|
| SWE-Verified (Resolved) | 73.1% | 77.2% | 74.9% |
| Terminal Bench 2.0 | 35.2% | 54.2% | 42.8% |
| τ²-Bench (Pass@1) | 80.3% | 84.7% | 80.2% |
| Tool Decathlon | 35.2% | 38.6% | 29.0% |
推理成本优势
得益于 DSA 机制,DeepSeek-V3.2 在长序列场景下的推理成本大幅降低:
- 预填充阶段:在 128K token 位置,成本约为 DeepSeek-V3.1-Terminus 的 1/3
- 解码阶段:在 128K token 位置,成本约为 DeepSeek-V3.1-Terminus 的 1/2
这使得 DeepSeek-V3.2 成为智能体场景中极具成本效益的选择。
开源与部署
DeepSeek-V3.2 延续了 DeepSeek 的开源传统,模型权重和推理代码已在 Hugging Face 上开源:
- 模型地址:https://huggingface.co/deepseek-ai/DeepSeek-V3.2
- 推理代码:https://huggingface.co/deepseek-ai/DeepSeek-V3.2/tree/main/inference
技术要点总结
- 架构创新:DSA 稀疏注意力机制将长序列计算复杂度从 O(L²) 降至 O(Lk)
- 训练策略:后训练计算预算超过预训练的 10%,采用专家蒸馏 + 混合 RL 训练
- 数据合成:自动化流水线生成 1,827 个环境和 85,000+ 个复杂任务
- 性能突破:首个在 IMO、IOI、ICPC WF 等顶级竞赛中获得金牌的开源模型
- 成本优化:长上下文场景推理成本降低 50-70%
未来展望
- Token 效率:DeepSeek-V3.2-Speciale 的 token 效率仍低于 Gemini-3.0-Pro
- 上下文管理:128K 上下文限制在某些智能体任务中仍是瓶颈
- 自我验证:模型倾向于进行冗余的自我验证,导致轨迹过长
DeepSeek-V3.2 的发布标志着开源大模型首次在综合能力上达到 GPT-5 水平,为 AI 社区提供了一个强大且高效的选择。这不仅证明了开源路线的可行性,也为未来的研究和应用开辟了新的可能。
相关链接
更多文章