刚刚,DeepSeek-V4-Flash正式版API公测上线
7月31日,
9项基准测试成绩全面披露,多项指标远超此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的天花板又顶高了一截。
从Terminal Bench到DSBench-Hard,从网络安全对抗到全栈开发,
这意味着什么?意味着AI不再只是“能写代码”,而是开始真正像工程师一样工作——打开终端、分析仓库、调用工具、完成端到端任务。
9项基准测试成绩单:数据说话
这一次,
其中,Terminal Bench 2.1以82.7的高分领跑,这意味着模型在终端环境下的任务执行能力已经相当成熟——能够理解复杂的命令行操作、编写脚本、调试错误,几乎是“AI运维工程师”级别的表现。
Cybergym拿下76.7分,展示了出色的网络安全对抗能力。DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,说明模型不仅能够写单个函数,还能胜任从前端到后端的完整开发链路。
测试说明:透明且严谨
注1:对于公开基准测试集中的Code Agent任务,正式版
注2:DSBench-FullStack是内部使用的全栈开发测试集,DSBench-Hard是内部使用的Coding Agent难题测试集。
值得一提的是,
原生支持Responses API,适配Codex
除了基准成绩的飞跃,正式版V4-Flash在工程适配上也有重要更新——原生支持Responses API格式,并针对性适配了Codex。
这意味着开发者可以更自然地将V4-Flash接入现有的Codex工作流,降低迁移成本。具体配置方法可参考
模型结构未变,后训练是关键
一个值得注意的细节是:
换句话说,底座没有变,变的是"后天教育"。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。
此次升级范围:仅限V4-Flash API
升级范围说明
已升级:
未升级:
未升级:APP端 / WEB端模型
即将发布:
需要注意的是,本次升级仅涉及
而关于大家关心的V4-Pro正式版,
行业观察:Agent时代正式开启?
从Terminal Bench到Cybergym,从DeepSWE到Toolathlon,这9项基准测试的名字本身就揭示了一个趋势:AI的能力评测,正在从"写一段代码"进化到"完成一个工程任务"。
当AI能够熟练地操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时,我们或许正在见证一个新时代的开启:AI不再只是代码助手,而是成为了真正的AI工程师。
而
本文来自微信公众号“CSDN”,整理:梦依丹,36氪经授权发布。















