“牛来”击穿DeepSeek
8月末,“牛来”击穿了
击穿的不是价格表上的某一个数字,而是
一个匿名的“隐身模型”,在没有品牌背书的情况下,冲上OpenRouter和OpenCode双平台榜首,终结了
其Artificial Analysis评分持平Claude Opus 4.8的同时,将顶尖智能的获取成本直接砍到了美金定价体系的2.5%,且远低于
开发者社区叫它“牛来”。
8月26日,智谱认领了它:GLM-5.3-Flash,320B总参数、18B激活参数,GLM-5系列首个原生多模态模型。
这不是靠流量补贴,而是靠彻底重构底层架构。混合注意力机制压缩了4.4倍KV缓存——将“高高在上的前沿智力”打成廉价的工业粗粮。
技术降本,依然是驱动大模型爆发力的第一性原理。
价格斩杀线:GLM打到了DeepSeek的“三分之一”
提价导致OpenCode平台上的
在竞品由于成本或算力压力选择防守提价时,智谱选择了全力进攻,给出了极其震撼的定价策略:
GLM-5.3-Flash标准定价:输入0.8元/百万Token、输出2.8元/百万Token、缓存命中0.23元。首发两周五折。
横向对比
🔥 GLM 五折 输入:0.40元 | 输出:1.40元 | 缓存命中:0.115元
👉 仅为
GLM 标准 输入:0.80元 | 输出:2.80元 | 缓存命中:0.23元
👉 为
🧊
🛡️ 缓存命中是
⚠️ 是GLM五折的4-6倍
💡 GLM以1/3价格超越其智能
Claude Opus 4.8价格说明:标准模式输入5美元/百万Token、输出25美元/百万Token;快速模式(速度约2.5倍)为输入10美元、输出50美元。
在首发五折期间(至2026年9月9日24:00),GLM-5.3-Flash的输入与输出价格(0.4元/1.4元)仅为
最重要的是,即便恢复标准价,GLM的输入(0.8元)和输出(2.8元)仍大幅低于
海外定价(输入0.15美元,输出0.50美元)更是展现出“约为Claude Opus 4.8的四十分之一”的惊人性价比。
唯一未能击穿的是缓存命中场景。这是
缓存命中的防线守住了,却无法改变整体账单的结构性劣势——在同等日调用量下,GLM五折的月账单比
以双方实际表现为基准,
关键结论:
更重要的是,输出成本一向是大模型算力成本的大头,无论是在
84%命中率下,GLM月成本¥463.50,而
能力呢?Artificial Analysis Intelligence Index评分57分,与Claude Opus 4.8持平,高于
以
这个模型展现出了“强推理+强Agent+顶尖工程落地”的特征。它不仅在传统的文科、理科综合能力上(AI Index)追平或超越了中外顶尖旗舰,更在代码、终端控制、软件工程等高价值的生产力场景中拿下了统治级的技术优势。
这不是价格战,这是成本结构的重构。
1/3到1/4的API调用成本,意味着原本因为Token消耗太大而无法落地的多Agent协同、长文本反思重试等方案,在商业上全部变得完全可行。
如果再算上端到端软件工程,和终端自动化带来的工程落地效率提升,企业在实际研发和运维场景中支付的“综合智力成本”会被稀释得更低。
架构创新将算力需求整体压缩了3倍
为了在物理层面上降低算力开销,智谱对底层模型结构进行了颠覆性的精简:
激活参数与层数几乎减半:总参数量为320B(与GLM-4.5的355B相当),但通过极端优化,将激活参数从32B砍到18B,层数从92层骤减到45层。
线性与稀疏混合架构(Hybrid Attention):将线性注意力层(通过递归机制捕获局部依赖)与稀疏注意力层交错堆叠。稀疏注意力借助轻量级索引器召回全局上下文。
IndexPool技术降延时:为了降低1M(百万级)超长上下文下检索引器的延迟与内存开销,智谱引入IndexPool,通过加权池化将检索引器的4个缓存向量压缩为1个。
工业级降本:4.44倍的KV缓存压缩
这种架构上的激进创新带来了实打实的工程质变:
算力与显存双减负:相比GLM-5.3,注意力计算量降低3.01倍,最核心的硬件瓶颈KV缓存直接缩小了4.44倍。
KV缓存是长文本大并发场景下最吃显存、最昂贵的硬件瓶颈。压缩4.4倍意味着相同的显卡硬件,智谱能跑出数倍于竞品的吞吐量。
恐怖的吞吐能力:这解释了为什么它能抗住OpenCode上每日100万亿Token的庞大算力供给,并在单周内轻松承载23.2万亿Token的调用洪峰,而没有发生服务雪崩。
由于它通过混合注意力机制大幅压缩了KV缓存,极其适合长文本、高并发、高上下文(如代码库分析、多轮长对话Agent)的场景。
混合注意力正在成为行业“必答题”。从面壁的端侧突破到蚂蚁、阿里的云端布局,混合注意力已从某一家公司的技术选型,变成了中国AI产业的集体共识。
架构创新将算力需求整体压缩了3倍,使得国产芯片的规模化部署直接从“可选项”变成了“可行项”。智谱正在引导全行业“用软件架构的进化削弱硬件生态的粘性”,打破单一芯片巨头的生态垄断。
历史性跨越:10万张国产芯片集群的真实盲测
GLM-5.3-Flash(牛来)不仅是一次模型反超,更是国产芯片在“推理侧替代”上的历史性合围。
过去,市场对国产芯片普遍存在“能用、不好用、生态差”的顾虑。智谱用一次匿名测试打碎了所有疑虑:超过10万张国产芯片(据《晚点LatePost》了解,或来自华为、摩尔线程与海光)组成的集群,在用户完全不知道模型名称、不知道底层芯片的前提下,纯靠速度和稳定性承载了全球高并发流量。这是国产算力第一次完成如此大规模的商业化实战验证。
由于国产芯片在单卡性能和内存带宽(尤其是1M超长上下文)上与英伟达顶尖GPU仍有物理差距,智谱交出了一套教科书级的全栈极限工程方案:
恐怖的实战高负载:10万张来自华为、摩尔线程、海光等国产芯片组成的超大集群,在OpenRouter和OpenCode上硬抗下了5天超过50万亿Token的全球高并发盲测流量。
软件极限抹平硬件:通过“SGLang定制引擎+W8A8混合量化+EPD分离式架构(将编码、预填充、解码拆成独立工作池)”,端到端性能暴增3倍,硬件效率和单Token成本成功追平了英伟达主流GPU。
半导体研究机构SemiAnalysis随即评论道:“继OpenAI自研芯片Jalapeño之后,CUDA护城河再度受到考验。”不过,这个评价需要分层理解。
在推理侧,国产芯片已经“击穿”了可用性门槛。10万张国产芯片承载来自OpenRouter和OpenCode的全球真实并发负载,五天累计超过50万亿Token,打破了下游客户对“国产芯片能用不好用”的顾虑。
推理侧的意义不止于技术验证。黄仁勋在GTC 2026大会上指出,AI产业正从训练向推理全面转向,推理算力消耗已远超训练阶段,直接决定了AI商业模式的可行性。作为AI产业最大的增量市场,推理为国产芯片的起步提供了极为有利的市场窗口。
在预训练侧,国产芯片刚刚迈过“从0到1”的起点。2026年4月,
真正的“击穿”,取决于昇腾等国产芯片能否在未来一两年内,在训练效率、集群互联、生态工具链上持续缩小与英伟达的差距。
架构创新压缩了每Token的算力需求,让国产芯片的性能短板被软件优化填平;国产芯片的规模化部署,反过来验证了架构创新的商业价值。
两个算力账本:英伟达模式与国产芯片模式
智谱走了一条更具战略自主权的路:算力底座是10万张国产芯片,同时通过“混合注意力架构”从模型层将计算量和KV缓存分别压缩3.01倍和4.44倍,用软件填平了国产芯片的物理性能短板,最终让单Token成本追平了主流英伟达GPU。
智谱目前并未披露单模型毛利率或集群TCO。因此,虽然两者商业定价打得头破血流,但智谱模式在财务上是否已达到
真正的悬念不在于谁当前的毛利率更高,而在于国产芯片的成本优势能否在更大规模下持续,以及智谱能否在足够短的时间内用足够多的Token调用量摊销前期的工程投入。
全局战场:DeepSeek丢掉了整场战争的价格主动权
国产“牛来”击穿
击穿了。但方式不是“全面碾压”,而是“错位合围”。
缓存命中场景下,
“击穿”发生在三个关键维度:
第一,账单主体定价全面低于
第二,用低阶价格超越高阶智能。 GLM评分57,压制
第三,一套新的成本公式成立。
CUDA曾被视为不可撼动的软件生态,智谱通过混合注意力架构+10万张国产芯片集群,在全球真实负载下跑出了与英伟达GPU相当的成本效率,直接开辟了第二战场,完成了对大模型斩杀线的重新定义。
无论是
本文来自微信公众号“探花AI飞刀”,作者:摘花飞刀,36氪经授权发布。















