梁文锋和马斯克对垒,DeepSeek V4 Pro给全球最强上压力
过去,高性能模型遥遥领先,而即便是性能较差的模型也可能依靠低价拿下一定市场份额。但在DeepSeekV4系列、Gork4.6等主打性价比的高性能模型发布后,这种单纯的发展路线大概是要正式告吹了。
酝酿了多时,
8 月 12 日深夜,
最先发现变化的依旧是开发者们。随后,一张评测对比表从
需要注意的是,备受关注的Harness依旧保持悬念。凤凰网科技检索平台信息发现,“
8月1日,
据测试过的开发者表述,“参与内测并深度体验2天后,我愿称
就在V4 Pro正式发布六天前,
一边是性能追平全球顶尖模型,一边是预告大幅涨价。这家以性价比横扫市场的公司,正在讲述一个截然不同的新故事。
01
0.1 分的距离,与全球最强模型厮杀
这张刷屏的评测表显示,Terminal Bench 2.1,一项衡量 AI 智能体在真实终端环境中完成复杂任务能力的测试,V4 Pro 正式版拿到 87.9 分。全球第一的 Anthropic Fable 5 是 88.0 分。差距只剩0.1。
作为参照,上一版 V4 Pro 预览版的成绩是 72.1 分。三个月,有了15.8 分的跃升。
此外,还有两项反超。在 AI 安全智能体基准 Cybergym 上,V4 Pro 拿到 83.3 分,以 0.2 分的微弱优势压过 Fable 5 的 83.1;在工作流智能体测试 AutomationBench 中,31.8 分对 29.1 分,同样胜出。而在衡量软件工程能力的 DeepSWE 上,分数从预览版的 12.8 分跃升至 62.7 分,接近原来的五倍,超过了 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分。
需要说明的是,这些数据目前来自
智能体是理解这次升级的关键词。与传统大模型比拼知识问答和数学推理不同,Terminal Bench、DeepSWE 这类测试考察的是 AI 能不能真正干活—— 调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。
据
这一次更新的时间点也非常有意思。就在 V4 Pro 上线前几个小时,马斯克旗下 SpaceXAI 发布了 Grok 4.6,在面向真实知识工作的 GDPVal-AA v2 评估中以 1753 Elo 登顶,超过 Fable 5 的 1741 和 GPT-5.6 Sol Max 的 1728。两款主打高性价比的模型同夜撞车,不约而同地将矛头指向同一件事:让 AI 在长任务中稳定交付可用成果。梁文锋与马斯克双强对垒,纷纷拿出兼具高性能与高性价比的产品,真正感到有压力的恐怕还是OpenAI与Anthropic。
目前,Fable 5 每百万输出 Token 定价 50 美元,GPT-5.6 Sol Max 为 30 美元,Grok 4.6 为 6 美元,而
0.1 分的跑分差距背后,是五十七倍的价格鸿沟。这个等式,足以让每一个开发者重新审视自己的技术选型。
02
一张涨价预告函的底气
此次
8 月 6 日,不少开发者登录
这也是
市场之所以震动,是因为
梳理其今年的定价时间线:4 月 V4 发布时,V4 Pro API 以 2.5 折优惠上线;5 月 31 日优惠结束后,直接永久降至原价的四分之一,输入(缓存未命中)3 元 / 百万 Token、输出 6 元 / 百万 Token,较首发价降幅达 75%;6 月 29 日又引入峰谷计费,工作日高峰时段价格翻倍。
从永久降价到预告大涨,中间只隔了两个多月。
调用量是蜜糖,也是负担。每一次 API 调用背后都是真金白银的算力消耗,长时间低价跑量,持续吞噬的是现金流。
但如果只把涨价理解为“扛不住成本”,可能低估了
一个容易被忽略的细节是:仅仅两个月前的 6 月 16 日,
手握重金却选择涨价,这更像是一次主动的定价策略切换,而非被动的成本转嫁。
摩根士丹利 8 月 9 日发布的研报给出了三个驱动因素:其一,V4 模型需求旺盛,支撑了更强的定价能力;其二,厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;其三,更多使用国产芯片可能带来更高的推理成本。
报告认为,模型智能,而非价格,才是大模型竞争的终极壁垒。当 V4 Pro 在 Terminal Bench 上距 Fable 5 仅差 0.1 分时,
03
价格战的终局信号
把视野拉到整个行业,这条涨价曲线也已经浮现。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、
拐点早已出现。今年一季度,智谱 API 定价较去年底累计上调约 83%,但调用量反而增长了 400%—— 量价齐升,说明开发者愿意为更强的模型付费。7 月,月之暗面发布
据 36 氪报道,过去两年国内大模型赛道深陷 Token 价格厮杀,厂商靠压低接口报价抢占开发者与企业客户。但进入 2026 年下半年,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。
逻辑其实并不复杂。有行业分析指出,Agent 任务的算力消耗是普通对话的十到一百倍,而当模型开始真正进入企业的生产流程——写代码、做分析、跑流程——客户对价格的敏感度会让位于对可靠性和能力的要求。智谱涨了 83% 依然供不应求,已经说明了问题。
摩根士丹利将其概括为一个飞轮:更强的模型带来更多收入,更多收入支撑更大投入,更大投入再次推高模型能力。头部厂商可以随时推出低价轻量版本覆盖大众市场,但中等厂商想要向上突破至顶尖水平,难度完全不在一个量级。
这或许才是
当然,考题也随之而来。涨价之后,那些对成本极度敏感的中小开发者是否会迁移?“涨幅较大”究竟是多大?在 Grok 4.6 等同梯队选手仍以低价猛攻的背景下,
这些问题,会在涨价正式落地后才能回答。但有一点可以确定:当最擅长打价格战的玩家开始收枪,中国大模型行业的竞争逻辑,已经翻过了一页。
本文来自微信公众号“凤凰网科技”,作者:Dale,编辑:董雨晴,36氪经授权发布。















