Deepseek V4 Pro发布,除了多模态,满足我对模型的所有想象

鲸选AI·2026年08月13日 08:16
斩杀线成立

DeepSeek V4 Flash 以超高性价比震撼发布后,大家越来越期待Deepseek V4 Pro正式版,将会带来怎样的斩杀线。

今晚,DeepSeek官方文档更新了模型日期:Deepseek-V4-Pro-0813,这也意味着正式版模型来了。目前已经在官方API中提供。

V4 Pro采用MoE设计,根据此前公开的架构规格总参数规模1.6万亿,每次推理激活约490亿参数。这次正式版应该也没有变化。

V4 Pro接口侧提供100万Token上下文、最高38.4万Token输出,并支持思考开关、工具调用、结构化JSON、Responses API以及OpenAI和Anthropic两种兼容格式。

换句话说,DeepSeek这次强化的不仅有模型“想得多深”,还从装入大型代码库、理解海量资料,到连续调用工具完成长流程任务入手,Agent能力大幅强化。

不服跑个分的环节,还是要有,从下图可以看到,相对预览版是翻天覆地的变化,正式版已经无限接近 Fable 5。

V4 Pro预览版的Terminal Bench 2.1只有72.1,正式版直接冲到87.9,一口气涨了15.8分。

DeepSWE更离谱,从12.8暴涨到62.7,接近原来的4.9倍。预览版在这个项目上基本属于“不会做”,正式版已经能和全球第一梯队的代码Agent正面碰一碰。

其他几个长任务评测,同样不是挤牙膏。

AutomationBench从12.8涨到31.8;DSBench-FullStack从41.8提升到71.1;DSBench-Hard从31.1冲到67.2,不但翻倍,还多涨了一截;安全攻防测试CyberGym也从52.7拉到了83.3。

再看与其他模型的横向对比。

Terminal Bench 2.1上,V4 Pro拿到87.9,距离Kimi K3的88.3只差0.4分,高于DeepSeek对比图中Opus 4.8的85.0。

高难推理方面,HLE开启工具后的成绩是60.0,仅次于Fable 5的63.0,也明显超过GLM-5.2的54.7。

代码工程方面,NL2Repo拿到61.5,低于Opus 4.8的69.7,但已经站稳第一梯队。DSBench-FullStack和DSBench-Hard分别达到71.1和67.2,面对完整工程和高难数据科学任务,已经没有明显短板。

到了安全攻防,V4 Pro在CyberGym上拿到83.3,甚至略高于Fable 5的83.1和Opus 4.8的78.3。

真正值得关注的是,V4 Pro正式版几乎没有哪项能力掉出第一梯队。

单项第一并不稀奇。有人代码强,有人工具强,也有人推理分数特别高。难的是在终端操作、代码工程、工具调用、安全攻防和长任务执行上同时不瘸腿。

然后再看价格也不错:

截至发稿,DeepSeek官方给出的Pro版百万Token价格是:缓存命中输入0.025元,缓存未命中输入3元,输出6元。

确实比Flash版的1元输入、2元输出贵,但放到旗舰Agent模型里看,依然低得离谱。

作为参考,Kimi K3当前的API价格为缓存未命中输入3美元、输出15美元;Fable 5更是输入10美元、输出50美元。即使考虑币种差异,DeepSeek的价格也只是海外同级模型的一个零头。

而且它给了1M上下文和最高384K输出。

这两个数字对普通聊天可能意义不大,对长任务Agent却是硬刚需。大型代码库、几十份资料、长时间运行日志和连续工具调用,都会快速吃掉上下文。窗口不够大,Agent就只能不断压缩记忆,压着压着,前面做过什么也忘了。

而且,API兼容性也没忘记。

V4 Pro目前支持OpenAI格式、Anthropic格式、Responses API、Tool Calls和JSON Output,官方已经给出了Claude Code、OpenCode、OpenClaw等Agent工具的接入方案。对于已有工作流,迁移成本比重新适配一套私有协议低得多。

当然代价也有。

V4 Pro的账号并发上限是500,Flash是2500。能力更强、单次任务更长,意味着它更适合复杂任务和高价值工作流,而不是拿来无脑承接所有高频小请求。

还有一个重要提醒:DeepSeek已经在价格页注明,近期计划整体上调API价格,而且预计涨幅较大。

所以现在这套价格更像一个窗口期,不能直接理解成永久承诺。

总之来看,V4 Pro正式版用暴涨的Agent分数、1M上下文和地板级价格,把这道门槛又往下砸了一截。

模型调用名没有变,但你今天通过老API拿到的,已经不是昨天那个V4 Pro。

最近鲸哥有几个项目,准备接入V4 Pro,让其在代码Agent、数据分析或自动化工作流等场景中,用真正复杂的任务跑一遍。

看看它到底是跑分好看,还是已经真的能干活。

本文来自微信公众号“鲸选AI”,作者:鲸哥,36氪经授权发布。

+1
32

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

字节暂时领先一个身位

40分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业