“牛来”击穿DeepSeek

秋水笔弹·2026年09月02日 17:40
在占据了推理成本90%的输出成本上面,国产“牛来”比DeepSeek还要低30%。

8月末,“牛来”击穿了DeepSeek

击穿的不是价格表上的某一个数字,而是DeepSeek过去两年对行业定价权的垄断。

一个匿名的“隐身模型”,在没有品牌背书的情况下,冲上OpenRouter和OpenCode双平台榜首,终结了DeepSeek长达56天的霸榜纪录。过去一周调用量达23.2万亿Token,是DeepSeek-V4-Flash的两倍多。

其Artificial Analysis评分持平Claude Opus 4.8的同时,将顶尖智能的获取成本直接砍到了美金定价体系的2.5%,且远低于DeepSeek的同类闪电模型。

开发者社区叫它“牛来”。

8月26日,智谱认领了它:GLM-5.3-Flash,320B总参数、18B激活参数,GLM-5系列首个原生多模态模型。

这不是靠流量补贴,而是靠彻底重构底层架构。混合注意力机制压缩了4.4倍KV缓存——将“高高在上的前沿智力”打成廉价的工业粗粮。

技术降本,依然是驱动大模型爆发力的第一性原理。

价格斩杀线:GLM打到了DeepSeek的“三分之一”

DeepSeek刚完成一轮提价。

DeepSeek在8月17日后将V4-Flash在工作日高峰期的价格大幅上调,其涨幅高达400%。

提价导致OpenCode平台上的DeepSeek V4-Flash日消耗量从18万亿的峰值暴跌超过50%,直接给全行业留下了将近10万亿Token的巨大市场空白。

在竞品由于成本或算力压力选择防守提价时,智谱选择了全力进攻,给出了极其震撼的定价策略:

GLM-5.3-Flash标准定价:输入0.8元/百万Token、输出2.8元/百万Token、缓存命中0.23元。首发两周五折。

横向对比DeepSeek-V4系列的完整价格体系,差距清晰可见:

🔥 GLM 五折  输入:0.40元 | 输出:1.40元 | 缓存命中:0.115元

👉 仅为DeepSeek非高峰的 27% / 31%

GLM 标准 输入:0.80元 | 输出:2.80元 | 缓存命中:0.23元

👉 DeepSeek非高峰的 53% / 62%

🧊 DeepSeek Flash 非高峰  输入:1.50元 | 输出:4.50元 | 缓存命中:0.05元

🛡️ 缓存命中是DeepSeek最后防线

DeepSeek Flash 高峰  输入:3.00元 | 输出:9.00元 | 缓存命中:0.10元

⚠️ 是GLM五折的4-6倍

DeepSeek Pro 非高峰  输入:4.50元 | 输出:13.50元 | 缓存命中:—

💡 GLM以1/3价格超越其智能

Claude Opus 4.8价格说明:标准模式输入5美元/百万Token、输出25美元/百万Token;快速模式(速度约2.5倍)为输入10美元、输出50美元。

在首发五折期间(至2026年9月9日24:00),GLM-5.3-Flash的输入与输出价格(0.4元/1.4元)仅为DeepSeek V4-Flash高峰期价格的13%到15%左右。

最重要的是,即便恢复标准价,GLM的输入(0.8元)和输出(2.8元)仍大幅低于DeepSeek V4 Flash的非高峰价格(输入1.50元、输出4.50元)。

海外定价(输入0.15美元,输出0.50美元)更是展现出“约为Claude Opus 4.8的四十分之一”的惊人性价比。

唯一未能击穿的是缓存命中场景。这是DeepSeek最后一道“价格护城河”。这意味着在高频重试、长上下文多轮对话且缓存高度命中的极特殊场景下,DeepSeek依然保留了微弱的价格优势。

缓存命中的防线守住了,却无法改变整体账单的结构性劣势——在同等日调用量下,GLM五折的月账单比DeepSeek涨价前便宜约25%。这不是靠缓存,是靠设计。

以双方实际表现为基准,DeepSeek缓存命中率95%(官方值),GLM缓存命中率84%(社区实测值),按每天1亿Token、输入90%、输出10%的典型Agent任务结构测算月成本。

关键结论:DeepSeek的缓存价再低(0.02元 vs GLM的0.115元),也只能在缓存费上每省出0.70元。但GLM在输出费 一项就比DeepSeek便宜了6元——覆盖缓存劣势后仍有5元优势, 仅输出费一项就比DeepSeek节省30%。

更重要的是,输出成本一向是大模型算力成本的大头,无论是在DeepSeek,还是GLM,输出成本在大模型推理总成本中都占据90%以上的比重,决定胜负的不是价格表上最小的数字,而是最大那个。DeepSeek的缓存价格再低,也无法对冲其输出价格的高昂。

84%命中率下,GLM月成本¥463.50,而DeepSeek涨价前(95%命中率)为¥618.60,GLM便宜约四分之一。 

能力呢?Artificial Analysis Intelligence Index评分57分,与Claude Opus 4.8持平,高于DeepSeek旗舰V4 Pro正式版的53分。在Terminal-Bench 2.1上,GLM拿下84.3分,DeepSeek-V4-Flash为82.7分;DeepSWE则是63.4对54.4,领先9分。

DeepSeek-V4 Pro约三分之一的价格(输入0.8 vs 4.5,输出2.8 vs 13.5),提供超越其能力的智能(57 vs 53)——这才是“斩杀线”被重新定义的真实含义。

这个模型展现出了“强推理+强Agent+顶尖工程落地”的特征。它不仅在传统的文科、理科综合能力上(AI Index)追平或超越了中外顶尖旗舰,更在代码、终端控制、软件工程等高价值的生产力场景中拿下了统治级的技术优势。

这不是价格战,这是成本结构的重构。

1/3到1/4的API调用成本,意味着原本因为Token消耗太大而无法落地的多Agent协同、长文本反思重试等方案,在商业上全部变得完全可行。

如果再算上端到端软件工程,和终端自动化带来的工程落地效率提升,企业在实际研发和运维场景中支付的“综合智力成本”会被稀释得更低。

架构创新将算力需求整体压缩了3倍

为了在物理层面上降低算力开销,智谱对底层模型结构进行了颠覆性的精简:

激活参数与层数几乎减半:总参数量为320B(与GLM-4.5的355B相当),但通过极端优化,将激活参数从32B砍到18B,层数从92层骤减到45层。

线性与稀疏混合架构(Hybrid Attention):将线性注意力层(通过递归机制捕获局部依赖)与稀疏注意力层交错堆叠。稀疏注意力借助轻量级索引器召回全局上下文。

IndexPool技术降延时:为了降低1M(百万级)超长上下文下检索引器的延迟与内存开销,智谱引入IndexPool,通过加权池化将检索引器的4个缓存向量压缩为1个。

工业级降本:4.44倍的KV缓存压缩

这种架构上的激进创新带来了实打实的工程质变:

算力与显存双减负:相比GLM-5.3,注意力计算量降低3.01倍,最核心的硬件瓶颈KV缓存直接缩小了4.44倍。

KV缓存是长文本大并发场景下最吃显存、最昂贵的硬件瓶颈。压缩4.4倍意味着相同的显卡硬件,智谱能跑出数倍于竞品的吞吐量。

恐怖的吞吐能力:这解释了为什么它能抗住OpenCode上每日100万亿Token的庞大算力供给,并在单周内轻松承载23.2万亿Token的调用洪峰,而没有发生服务雪崩。

由于它通过混合注意力机制大幅压缩了KV缓存,极其适合长文本、高并发、高上下文(如代码库分析、多轮长对话Agent)的场景。

混合注意力正在成为行业“必答题”。从面壁的端侧突破到蚂蚁、阿里的云端布局,混合注意力已从某一家公司的技术选型,变成了中国AI产业的集体共识。

架构创新将算力需求整体压缩了3倍,使得国产芯片的规模化部署直接从“可选项”变成了“可行项”。智谱正在引导全行业“用软件架构的进化削弱硬件生态的粘性”,打破单一芯片巨头的生态垄断。

历史性跨越:10万张国产芯片集群的真实盲测

GLM-5.3-Flash(牛来)不仅是一次模型反超,更是国产芯片在“推理侧替代”上的历史性合围。

过去,市场对国产芯片普遍存在“能用、不好用、生态差”的顾虑。智谱用一次匿名测试打碎了所有疑虑:超过10万张国产芯片(据《晚点LatePost》了解,或来自华为、摩尔线程与海光)组成的集群,在用户完全不知道模型名称、不知道底层芯片的前提下,纯靠速度和稳定性承载了全球高并发流量。这是国产算力第一次完成如此大规模的商业化实战验证。

由于国产芯片在单卡性能和内存带宽(尤其是1M超长上下文)上与英伟达顶尖GPU仍有物理差距,智谱交出了一套教科书级的全栈极限工程方案:

恐怖的实战高负载:10万张来自华为、摩尔线程、海光等国产芯片组成的超大集群,在OpenRouter和OpenCode上硬抗下了5天超过50万亿Token的全球高并发盲测流量。

软件极限抹平硬件:通过“SGLang定制引擎+W8A8混合量化+EPD分离式架构(将编码、预填充、解码拆成独立工作池)”,端到端性能暴增3倍,硬件效率和单Token成本成功追平了英伟达主流GPU。

半导体研究机构SemiAnalysis随即评论道:“继OpenAI自研芯片Jalapeño之后,CUDA护城河再度受到考验。”不过,这个评价需要分层理解。

在推理侧,国产芯片已经“击穿”了可用性门槛。10万张国产芯片承载来自OpenRouter和OpenCode的全球真实并发负载,五天累计超过50万亿Token,打破了下游客户对“国产芯片能用不好用”的顾虑。

推理侧的意义不止于技术验证。黄仁勋在GTC 2026大会上指出,AI产业正从训练向推理全面转向,推理算力消耗已远超训练阶段,直接决定了AI商业模式的可行性。作为AI产业最大的增量市场,推理为国产芯片的起步提供了极为有利的市场窗口。

在预训练侧,国产芯片刚刚迈过“从0到1”的起点。2026年4月,DeepSeek V4首次将华为昇腾与英伟达并列写入硬件验证清单,人民日报报道称双方实现了“芯模协同”。黄仁勋直言,若DeepSeek率先在华为平台发布,“对美国AI战略地位将是灾难性打击”。“Day0适配”已成国产芯片的标准实践,仅2026年,DeepSeek V4、MiniMax H3、Qwen3.8等主流开源模型均在发布当日完成对等多款国产芯片的适配。推理侧生态正在从“试点”走向“制度化”。

真正的“击穿”,取决于昇腾等国产芯片能否在未来一两年内,在训练效率、集群互联、生态工具链上持续缩小与英伟达的差距。

架构创新压缩了每Token的算力需求,让国产芯片的性能短板被软件优化填平;国产芯片的规模化部署,反过来验证了架构创新的商业价值。

两个算力账本:英伟达模式与国产芯片模式

DeepSeek和GLM-5.3-Flash的算力成本结构差异,本质上是两套截然不同的算力供应体系。

DeepSeek模式是英伟达生态下的“极致榨汁机”。外界曾普遍认为DeepSeek过去超低的价格是在“亏本烧钱换市场”。但据The Information报道,2026年前七个月,DeepSeek API业务毛利率高达82.9%,公司综合毛利率为44.6%。这意味着即使在涨价前,DeepSeek也并非“低于成本烧钱换份额”,而是赚得盆满钵满。它的低价建立在英伟达H100/H800集群上,通过算法工程将硬件性能榨干到极限——这是在成熟美元硬件生态里的“极致工程优化”。

智谱走了一条更具战略自主权的路:算力底座是10万张国产芯片,同时通过“混合注意力架构”从模型层将计算量和KV缓存分别压缩3.01倍和4.44倍,用软件填平了国产芯片的物理性能短板,最终让单Token成本追平了主流英伟达GPU。

智谱目前并未披露单模型毛利率或集群TCO。因此,虽然两者商业定价打得头破血流,但智谱模式在财务上是否已达到DeepSeek那般恐怖的82.9%毛利率,外界尚无法看透。DeepSeek已进入规模化商业运营的数据披露期,智谱则处于技术验证与市场抢占期。

真正的悬念不在于谁当前的毛利率更高,而在于国产芯片的成本优势能否在更大规模下持续,以及智谱能否在足够短的时间内用足够多的Token调用量摊销前期的工程投入。

全局战场:DeepSeek丢掉了整场战争的价格主动权

国产“牛来”击穿DeepSeek了吗?

击穿了。但方式不是“全面碾压”,而是“错位合围”。

缓存命中场景下,DeepSeek依然固守着最后防线——非高峰期0.05元/M Token,GLM五折价(0.115元)是其2.3倍,标准价(0.23元)是4.6倍。

DeepSeek守住了细分防线上的阵地,但是,整场战争的价格主动权丢了。

“击穿”发生在三个关键维度:

第一,账单主体定价全面低于DeepSeek 五折限时价:GLM输入仅为DeepSeek非高峰的27%,输出仅为31%。恢复标准价后,仍分别便宜47%和38%。

第二,用低阶价格超越高阶智能。 GLM评分57,压制DeepSeek V4-Pro(53分),价格仅为其三分之一——Pro被超越了,Flash被击穿了。

第三,一套新的成本公式成立。 DeepSeek的低价来自英伟达GPU的极致工程优化。GLM的低价来自混合注意力架构(计算量降3倍、KV缓存缩4.4倍)+10万张国产芯片(端到端性能提升3倍) 的全新组合。换了一条赛道重新定义了“便宜”。

CUDA曾被视为不可撼动的软件生态,智谱通过混合注意力架构+10万张国产芯片集群,在全球真实负载下跑出了与英伟达GPU相当的成本效率,直接开辟了第二战场,完成了对大模型斩杀线的重新定义。

无论是DeepSeek在英伟达生态里的极致压榨,还是智谱在国产芯片上的全栈重构,最终指向的命题是同一个:谁能用更便宜的芯片、更便宜的结构、跑出更强的模型,谁就拥有定价权。

本文来自微信公众号“探花AI飞刀”,作者:摘花飞刀,36氪经授权发布。

+1
0

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

苹果能不能定义硬件。

11分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业