StableLearn Logo

搜索内容

News 8 min read

DeepSeek-V4-Flash 正式上线:性能超过 GLM,逼近 Opus 4.8,价格更狠

DeepSeek-V4-Flash 正式版 API 公测:Terminal-Bench 2.1 达 82.7,超过 GLM-5.2 的 81.0,Agent 能力逼近 Claude Opus 4.8;输入 1 元、输出 2 元/百万 tokens。

Cover image for DeepSeek-V4-Flash 正式上线:性能超过 GLM,逼近 Opus 4.8,价格更狠

本文发布于 50 天前,内容可能已过时,请注意甄别。

DeepSeek-V4-Flash 正式版来了。

7 月 31 日,DeepSeek 在 API 更新日志中宣布:DeepSeek-V4-Flash 正式版 API 上线公测。这次更新的重点很明确:不是换一个更大的模型结构,而是通过重新后训练,把 Flash 的 Agent 能力往前推了一大步。

对开发者来说,这可能是最近最值得测试的一次 DeepSeek API 更新。

这次到底更新了什么?

一句话:DeepSeek-V4-Flash 正式版接入 API 公测,并重点强化 Agent 能力。

官方说明里有三个关键点:

  • Agent 能力大幅增强,多项基准测试远超 V4-Pro-Preview
  • 原生支持 Responses API 格式,并针对 Codex 做了适配
  • 模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,这次主要是重新后训练

也就是说,DeepSeek 这次没有把故事讲成“更大参数、更大模型”,而是把重点放在更实际的方向:让模型更会用工具、更会跑任务、更适合 Code Agent。

官方测试成绩

DeepSeek 官方更新日志公布了 DeepSeek-V4-Flash 正式版在 Agent、代码和工具调用任务上的 9 项成绩:

测试集DeepSeek-V4-Flash 正式版
Terminal-Bench 2.182.7
NL2Repo54.2
CyberGym76.7
DeepSWE54.4
Toolathlon verified70.3
Agent Last Exam25.2
AutomationBench (Public)25.1
DSBench-FullStack68.7
DSBench-Hard59.6

DeepSeek-V4-Flash 与其他模型的测评对比图

DeepSeek-V4-Flash 官方测评与其他模型的对比。

这些测试覆盖终端执行、代码仓库生成、网络安全、软件工程、工具调用、长周期专业工作流以及全栈开发。由于不同测试集的任务形式和评分方式不同,不能把 9 个分数简单相加后得出一个“总分”。

性能先超过 GLM

最直观的一项是 Terminal-Bench 2.1:DeepSeek-V4-Flash 得分 82.7,GLM-5.2 为 81.0,前者高出 1.7 个百分点。

这不是“国产模型互相吹”的模糊判断,而是同一测试集上的公开成绩。Flash 已经超过 GLM-5.2;放到更大的 Agent 竞争里看,它也开始逼近 Claude Opus 4.8 所处的高端工作区间。需要说清楚的是,不同模型的评测 harness、推理档位和测试版本可能不同,这个结论代表能力区间接近,不等于全面击败 Opus 4.8。

价格却完全不是一个画风

DeepSeek-V4-Flash 官方 API 价格为:缓存命中输入 0.02 元/百万 tokens,缓存未命中输入 1 元/百万 tokens,输出 2 元/百万 tokens。

Claude Opus 4.8 的官方 API 价格仍是输入 5 美元/百万 tokens、输出 25 美元/百万 tokens。对于需要长时间运行、频繁调用工具的 Agent,价格差异会被每一次循环放大。

更巧的是,GLM 今天刚好给开发者上了一堂“忠诚度定价”公开课。智谱 7 月 30 日公告显示,GLM Coding Plan 已改版;当前页面的连续包月价格为 Lite 94.4 元、Pro 430.4 元、Max 862.4 元,而公告列出的旧 V2 价格是 Pro 149 元、Max 469 元。

所以,喜欢 GLM 的朋友当然可以继续支持,只是现在支持的方式更像给账单做强化学习:模型还在比性能,套餐已经先把价格跑出了长上下文。 在性能已经被 Flash 追上甚至超过的部分测试上,GLM Coding Plan 却选择今天涨价,这个反差很难不被开发者拿来比较。

为什么这次 Flash 更重要?

V4-Pro 负责上限,Flash 负责规模。

如果一个模型定位为 Flash,它真正的价值不是“在最难题上压过旗舰模型”,而是能不能在大量日常任务里变成默认选择:写代码、跑脚本、查项目、改文件、生成文档、调用工具、交给 Codex 这类编码环境去执行。

这次更新最关键的信号是:DeepSeek 开始把 Flash 当成 Agent 工作流里的主力模型来训练,而不是只把它当作低价替代品。

这也是为什么“后训练”比“结构变大”更值得关注。Agent 场景里,模型不只是回答问题,还要连续做决定:下一步该查什么、该调用什么工具、怎么判断结果是否完成。后训练如果能把这些行为压准,实际体验会比单纯堆参数更明显。

Codex 用户也该注意

官方明确提到,正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配 Codex。

这句话对开发者很重要。因为现在 Code Agent 的竞争,已经不是“模型能不能写一段函数”,而是“模型能不能接住一个真实仓库任务”:读文件、理解上下文、修改代码、跑测试、修失败、再交付结果。

如果 DeepSeek-V4-Flash 能在 Codex 类工作流里稳定输出,它的意义会比普通 API 模型更新大得多。

还有哪些限制?

这次更新也有边界:

  • 本次仅升级 DeepSeek-V4-Flash 的 API 接口
  • DeepSeek-V4-Pro API 没有变化
  • DeepSeek App / Web 端模型 没有变化
  • DeepSeek-V4-Pro 正式版还没有发布,官方称会尽快推出

所以,这不是一次全线升级。想体验新版 Flash,需要走 API。

最后

DeepSeek-V4-Flash 正式版最值得关注的地方,不是名字里的 “Flash”,而是它正在变成一个更实用的 Agent 执行模型。

大模型竞争已经进入一个更现实的阶段:用户不只关心模型懂不懂,更关心它能不能把任务做完。DeepSeek 这次把 V4-Flash 的升级重心放在 Agent、Responses API 和 Codex 适配上,方向非常清楚。

对开发者来说,接下来最值得做的不是围观,而是把现有 Code Agent、自动化脚本和工具调用任务重新跑一遍。很多原本需要更贵模型完成的执行环节,可能现在就可以交给 DeepSeek-V4-Flash。

来源:

分享文章

更多文章