DeepSeek V4 Flash 发布,基测超过 GLM-5.2

DeepSeek发布V4 Flash正式版API,增强Agent与Coding能力,多项基准测试超过GLM-5.2。

核心内容:

  • V4 Flash正式版API上线,重点增强Agent和Coding Agent能力。
  • 基准测试显示在多项Agent及编程基准中超过预览版和GLM-5.2。
  • 原生支持Responses API,并针对Codex优化,V4-Pro正式版预计8月初发布。

7月31日,DeepSeek上线V4-Flash正式版API。此次更新没有调整模型结构和尺寸,只是在预览版基础上重新进行后训练,重点增强 Agent 与 Coding Agent 能力。

目前仅 API 接口完成升级,DeepSeek-V4-Pro 以及 App、网页端模型均未变化,据DeepSeek 官网透露,V4-Pro 正式版将于8月初发布。

DeepSeek公布的测试结果显示,V4-Flash 正式版在 9项 Agent 及编程基准中均明显超过 Flash 预览版,并全部高于V4-Pro-Preview。

Terminal Bench 2.1得分由61.8升至82.7,超过 V4-Pro 预览版的 72.1 和 GLM-5.2 的81.0,仅低于 Opus 4.8 的 85.0;CyberGym 由38.7升至76.7,DeepSWE 则从7.3跃升至54.4。

Terminal-Bench 2.1主要测试 AI Agent 在真实命令行环境中,能否独立完成复杂的端到端任务。

在工具使用任务中,新模型的 Toolathlon-Verified 得分为70.3,Agents’ Last Exam为25.2,分别接近Opus 4.8的76.2和25.7。

AutomationBench也从10.8提高至25.1,接近Opus 4.8的27.2。

不过,上述成绩来自DeepSeek在指定Harness及参数下完成的官方测试,实际表现仍有待第三方评测和生产任务验证。

接口适配也是此次更新的重点。

V4-Flash正式版原生支持 Responses API,并针对Codex进行优化,可作为 Codex 的后端模型使用。

DeepSeek官方文档显示,目前 Responses API 仅支持 V4-Flash,V4-Pro 预计于8月初接入。 此前发布的 V4预览版已支持 100万Token 上下文,Flash 被定位为速度和成本优先的版本。

参考链接:

https://api-docs.deepseek.com/zh-cn/guides/responses_api/?wxwork_userid=lyxia