实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里
一夜之间,三款重磅模型罕见撞车。
Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。
总参数达到 2.4T 的 Qwen3.8 Max 也如期开放权重;
看完 V4 Pro 正式版的跑分图,我只能说,这波提升还是肉眼可见的。
但这年头,跑分没输过,实际体验没赢过的模型我们也见得太多了。因此,我们也第一时间将 deepseek-v4-pro 接进 Codex 和 Claude Code,看看实际效果如何。
V4 Pro 正式版到底好不好用?
先从文字能力开始。
我让 V4 Pro 正式版模仿鲁迅,写一篇约 400 字的短文,吐槽现代人饿着肚子也要先给饭菜拍照发朋友圈,同时要求兼顾年代感、讽刺和幽默。
结果如下:
说实话,第一眼看过去,离真正的鲁迅先生肯定还有距离。
开头甚至直接借用了鲁迅最具辨识度的经典句式,模仿痕迹相当明显。但 V4 Pro 正式版至少没有把「鲁迅风」机械理解成半文半白、生僻词和之乎者也。
它能抓住句式节奏,也知道把「吃饭拍照」从一个日常行为慢慢引向展示欲、面子和旁观者评价。
更重要的是,整篇文章的「AI 命题作文味」已经比较淡。虽然还算不上一代文豪,但至少没有那种让人两眼一黑的模板拼接感。
如果说模仿鲁迅多少还有点「考试」意味,接下来这封商务邮件,就更接近日常工作了。
我假设公司内部失误,导致一个大客户的定制系统延期一周,让它写一封道歉邮件,要求承认责任、提出补偿,同时不能把客户合作信心写没了。
V4 Pro 正式版没有用「多方面因素」「项目节奏调整」这类常见的职场模糊表达,而是直接承认「此次延期完全源于我方内部的失误」,随后给出了延长质保、增加免费培训和专属运维三项补偿。
整封邮件 28 秒左右完成,正文基本到了修改一下信息就能使用的程度。
有意思的是,邮件写完以后,它又额外解释了一遍为什么这么写,颇有一种交完卷还要给老师讲解答题思路的执着。
文笔测完以后,我把
我也测试了几个编程任务。
我先丢给它一个很典型的「大而全」前端需求。
经典的 macOS 风格 Web OS,要求所有代码放进单个 HTML 文件,同时加入文本编辑器、Terminal、代码编辑器、游戏、文件管理、画图和视频编辑等应用。
单看完成度,这应该是我此前测试过的同类模型里,功能最丰富的一版。多个应用都做出了基本界面和交互,系统框架也搭得比较完整,只不过审美嘛,就比较中规中矩了。
随后我又测试了一个拍立得相机案例,需要完整模拟按快门、闪光、出纸和 8 到 10 秒化学显影的过程,同时叠加复古偏色、轻微杂色以及类似宝丽来照片的表面质感。
从成品来看,动画之间的衔接也是比较自然流畅的。
再比如直接上 Three.js 和 WebGL,让它生成可以交互的黑洞吸积盘,鼠标改变观察角度以后,星空、吸积盘和光线弯曲都要跟着变化。
面对 WebGL 这类对性能敏感的场景,V4 Pro 对粒子数量、实时计算、渲染开销和动画复杂度的控制仍然偏激进。光打开网页,我的 M2 电脑已经开始明显掉帧。
最后则是一套科幻飞船驾驶舱 HUD,需要同时处理动态准星、雷达、航向、速度、能量、目标锁定和鼠标移动后的惯性偏移。V4 Pro 正式版最终把主要交互关系都做了出来。
总的来说,如果不存在官方部署 bug 的前提下,V4 Pro 正式版应对复杂任务的完整度还是有所提高,只不过,整体体验下来,我也总感觉少了一些特别惊艳感,甚至有些地方没有比 V4 Flash 拉开想象中那么大的差距。
不过放到 Agent 场景里,如果 Flash 已经能完成 80% 甚至 90% 的任务,Pro 只负责少数高难度节点,那么真正高效的系统,会动态决定什么时候调用 Flash,什么时候调用 Pro,而不会全程挂着最贵的模型。
换句话说,模型之间的能力梯度,本身可以变成 Agent 的成本优化空间。
DeepSeek 的下一张牌,藏在 Harness 里
规格上,
普通聊天基本用不到这么大的窗口,但 Coding Agent 很容易需要同时处理几十个文件、历史修改、工具返回结果和长时间任务状态。上下文越长,模型能够留在手里的项目资料越多。
代价也是不言而喻的,Token 会迅速上涨。
这也解释了
当前 V4 Pro 正式版缓存命中的输入价格为每百万 tokens 0.025 元,缓存未命中输入 3 元,输出 6 元。V4 Flash 则分别是 0.02 元、1 元和 2 元。
Pro 的输入和输出价格基本是 Flash 的三倍,但放到全球市场里,依然十分便宜。
另一个值得注意的地方是,按照现有模型信息,它的主要能力仍集中在文本、推理、Coding、Tool Calls 等方向,暂时还没有看到图像、视频等原生输入能力。简言之,多模态目前并不是 V4 Pro 正式版的重点。
相比之下,V4 Pro 正式版发布前后,
在过去的两三个月里,我们也看到正式挂帅
包括一个名为 「
Harness 是今天 Agent 竞争里经常被模型光环遮住的一层。
模型负责推理,真正决定 Agent 如何读文件、调工具、管理上下文、失败重试和持续执行的,还有外面的整个运行框架。
Claude Code 和 Codex 的实际体验,也从来不只由底层模型决定。
尤其当
在模型的成本优势上,我们已经见识到了
同理,现在
让模型更少重复读取上下文,让工具调用更高效,让长任务尽量避免无意义消耗,让同样一个任务需要的 Token 更少,再把底层模型本身的价格优势叠加上去。
到那时,哪怕
本文来自微信公众号“APPSO”,作者:发现明日产品的APPSO,36氪经授权发布。















