算力成生死线,巨头疯抢“超节点”

中国企业家杂志·2026年07月23日 10:55
超节点狂飙背后,大模型的基础设施战争。
超节点
A++轮广东省2011-04
三维视觉技术团队和解决方案提供商
我要联系

刚刚结束的WAIC(世界人工智能大会)上,“超节点”的风头盖过了大模型,占领了展馆的中心位置。

“超节点”(Super Node)顾名思义,指在物理上由多个计算节点(如AI加速卡/NPU/GPU)通过高效互联协议紧密连接组成的,具备“一台计算机”特征的计算系统。

随着AI大模型算力需求剧增,算力需求正在从“单机八卡”向“万卡/十万卡”的集群演变。在算力普遍紧缺的背景下,头部云厂商、大模型厂商、政企客户不约而同地将规模算力采购锚定为标配,也直接推动了超节点的规模化商用。

在资本市场,超节点正在成为“造富机器”。7月1日到22日,《中国企业家》统计:紫光股份股价累计上涨58%,市值1300亿元;浪潮信息上涨41%,市值近1400亿元。

与之伴生的,是超节点产能的上扬。5月,一位服务器厂商高管告诉《中国企业家》:从2026年下半年到2027年,超节点都会呈现出快速上量的趋势。“如果GPU、存储等供应进一步充足,你们会看到更垂直的上量。”

该高管直言:目前公司和互联网公司客户谈的都已是2027年、2028年的供货。“互联网客户第一句话就是,你有10万片的供应,我们再谈。如果你没有,我们就先不浪费时间了。”

摄影:闫俊文

《中国企业家》获悉,新华三正在杭州建设新的AI超级工厂,以AI整机柜为主,规模为3.5万立方米,大概可以容纳200~300个测试点位,每个点位可达到240~300千瓦规模。

WAIC上,新华三展示了其UniPoD S80000 超节点,覆盖从32卡至1024卡规模全系列产品,训练性能提升70%、推理性能提升3倍。

华为也披露了自己的“A384超节点”的出货量,累计规模商用超过750套。其最新版“昇腾950超节点”以1024张NPU(神经网络处理单元)的真机状态亮相,已具备量产交付能力。

一些AI芯片创业公司也主动投身超节点浪潮。今年1月,从商汤大芯片部门拆分,独立运营的“曦望”推出了GPU芯片S3,并发布了超节点解决方案。

算力芯片公司奕行智能则发布了首个RISC-V AI算力超节点——单机柜支持64到128颗芯片全互联,单芯互联带宽达3.2T,这一产品已经落地在奕行智能与合作伙伴联合打造的“全球首套全栈RISC-V万卡超节点AI Token工厂”,一期预计将在今年8月建成。今年4月,奕行智能完成了15亿元的B轮融资。

某算力公司高管告诉《中国企业家》:超节点的价格比传统服务器要贵50%,利润比单卡利润要高。但其性能可以提升10倍,“客户能算过来账”。

芯和半导体副总裁仓巍告诉《中国企业家》:不论是AI大算力芯片厂商,还是整机系统厂商,都在从两个方向同时发力——芯片厂商自下而上,从芯片架构、封装、互联层层向上延伸,最终触达超节点系统层。整机厂商则自上而下入手,从系统需求倒推,向下定义互联规格、芯片接口乃至封装形态。

两个方向如何在系统中间层汇合,意味着超节点的跨层级协同能力正成为厂商的竞争焦点。

01

“十万卡”已经不够用了

今年,几家头部模型公司都推出了更为先进的模型,但他们不约而同地,被“卡”在了算力上,无法卖出更多的Token套餐。2月,智谱发布GLM-5大模型;7月,月之暗面发布了高达2.8万亿参数的Kimi K3大模型。但他们都不得不靠提价、限购等措施,来抑制需求。

九章云极创始人方磊告诉《中国企业家》:对于大模型公司而言,行业普遍呈现1美元的收入对应约0.8美元的算力成本。但当下,1美元收入也对应着X倍的市值/估值——算力规模仍是大模型公司最重要的增长手段。

智谱已经等不及了。7月21日,智谱宣布收购国产AI异构算力软件公司中科加禾,并落地建成了1GW级国产AI算力数据中心——此举推动智谱股价单日大涨近37%。

“十万卡已经不算什么了,马斯克、黄仁勋要建百万卡集群,中国厂商还得往前冲。”一位中兴通讯的超节点员工如此说。他也提到了Kimi K3,“未来,模型的参数会越来越大,这意味着需要更强大的算力基础设施来支撑训练。”

另有半导体人士告诉《中国企业家》,Kimi K3的部署建议是使用64张以上加速卡组成的超节点——这标志着大模型对超节点规模的算力已经有了门槛要求。

“模型参数规模的竞赛没有停止的迹象。今天是2.8万亿,到明年可能是5万亿、10万亿。每一次模型规模的跃升,都会把算力需求的基准线往上推一个台阶。这是超节点需求持续增长的底层逻辑,不是短期现象。”上述人士说。

摩尔线程创始人张建中在WAIC演讲中提到:模型能不能达到Frontier Model(前沿模型)的水平,它的Benchmark(基准)、精度、能力,它能干的所有事情,完全取决于模型工厂的基础设施能力。

摩尔线程创始人张建中来源:受访者

“你不知道下一个要训练的模型是什么。大语言模型发布之后,能不能尽快把下一个模型扩展到多模态?仅仅多模态还不够,未来还要训练各种各样和人类工业生产、生活相关的模型,包括跟物理、科学研究、数学相关的模型,以及与我们日常世界打交道的世界模型。”张建中说。摩尔线程已经拿出了自己的“MTT C256超节点”,并为此搭建了自己的模型训练工厂和Token(词元)生产工厂。

各家逐鹿下,超节点的算力密度和规模不断提升,已经变成了一场以数字为中心的比拼游戏。

华为最新的“昇腾950超节点”标准版为1024张卡,单柜64卡,由16个柜台组成,最大可拓展至8192卡。中兴通讯7月发布的“OEX超节点”,单柜可容纳128张GPU,集群可扩展至万卡规模。中科曙光也在7月发布了首个全国产十万卡AI的“曙光8000(登峰)”超节点,并接入了国家超算互联网。

摄影:闫俊文

蜂拥上新背后,各家技术路线不尽相同,华为“昇腾950超节点”的特点是从芯片、互联协议到散热,是全栈自研。这种路线的优势是各层之间可以深度协同优化,整体系统效率远高于各层独立堆砌,但对研发体量的要求也极高。

中兴通讯联合壁仞科技、沐曦股份、燧原科技等多家合作伙伴打造的超节点,走的则是另一条路——开放生态、多芯协同,不押注单一芯片,让客户可以在不同算力芯片之间灵活组合。

阿里平头哥“真武M890”与“磐久AL128”,百度旗下的昆仑芯“天池超节点”,以及沐曦、清微智能、摩尔线程等企业也都带来了各自的算力系统。这些厂商大多从云厂商或特定垂直场景出发,更强调推理效率和性价比,不追求纯粹的算力规模。

仓巍说:“现在判断最终格局还为时尚早。”真正拉开差距的地方,不在算力数字,而在系统工程的完整性——从芯片、互联,到软件栈、运维工具,能否用一套完整的产品和系统能力交付给客户,而不是单点优势,将是这场竞争最终的判断标准。

“上述各家路线针对的客户群体和应用场景本来就不重叠,可能最终形成的是多元格局,而非赢者通吃。”仓巍说。

02

账面看,超节点不是最优解?

不过,超节点在性能强大的同时,价格也很昂贵。

据《中国企业家》了解,超节点产品投入可能在数百万元到几千万元之间,不论是训练还是推理,关键是Token的吞吐效率要“跑满”,这也是厂商选择自购还是租赁的关键考量——并不是GPU数量越多越好,硬件越高级越好,关键是符合市场需求,能算清ROI。

这也让动辄千万元的超节点产品,注定是少数科技大厂和头部创业公司的游戏,难以成为中小公司、创业公司的选项。

摄影:闫俊文

例如,阿里云除了推出性能更强大的“磐久AL128”超节点整机之外,也主打“灵骏真武M890超节点”。该产品以标准化超节点形态,向客户交付具备高速互联能力、开箱即用的64卡高性能算力单元。

九章云极目前拥有3万P的智算规模,未来数年,计划建设为10万P的智算集群工厂,达到10万亿Token/日的流转承载力。

方磊如此描述建设规模算力中心的方式——类似于高速公路和换电站。方磊说:“某种程度上,我们更像一个AI基础设施和算力资产运营平台。”

此外,中兴通讯、华为、新华三等员工也均提到了超节点的运维成本,比如电力架构、异构算力的算子融合等。

过去,半导体竞争更多围绕单颗芯片的性能展开,而AI时代,真正决定竞争力的已经是整套系统的高效协同。相关人士表示:把很多芯片连接起来并不难,难的是让它们像一个整体一样工作,这涉及到高速互联网络、液冷、电力供应等诸多挑战。

要解决超节点里的能源和电力的问题,远比大多数人意想的复杂。超节点表面上是“耗电多”,深层考验的是整个供电链路的协同设计问题。

散热同样如此,机柜内的热分布不只是“装几台风扇”这样简单,而是要和芯片功耗分布、封装热阻、液冷板流量设计相互耦合。例如,华为展出的风冷超节点,便是解决了传统风冷机房向高密度智算升级的难题,无需进行高昂的液冷改造,即可部署超节点技术。

在互联方面,伴随着集群规模增大,纯铜缆互联在带宽和距离上已触及天花板,对光互联的需求越来越迫切。但光互联也带来了电、光、热三个物理场的全新设计挑战——光模块对温度极敏感,和高功耗AI芯片封装在一起,热耦合问题更加棘手。

这也让超节点的系统工程师被纳入科技大厂的招聘范围。比如字节跳动正在招收“系统分析师”,其职责是深入分析字节跳动大规模AI集群的性能瓶颈和需求,做AI基础设施(服务器/互联/超节点)的架构设计和优化。

03

GPU成了最不重要的一环

显而易见地,在超节点的系统工程里,曾经作为核心的GPU重要性正在下降。大公司更着眼于CPU、存储、网络交换卡的系统优化层面。

最明显的变化是GPU和CPU的数量比例变化。《中国企业家》观察到:2025年,在超节点架构里,GPU:CPU的比值是8:1甚至4:1。但到了2026年,一些厂商预言:未来CPU与GPU的比变成1:2甚至1:1都有可能。

其背后原因是,多智能体的系统更需要CPU的调度和内存。

摄影:闫俊文

一位华为鲲鹏高管在近期的演讲中谈到:Agent多轮推理时,更多记忆系统工作在CPU中展开,最后才交给GPU去推理,任务的负载已经更多扩散到了内存、CPU等环节上。“NPU变成了CPU的模板,由CPU来安排NPU做什么。”

某服务器厂商高管提到,Agentic有很多活是要交给CPU干的。所以智算机房以后不仅仅是智算服务器、智算整机柜,可能将演变为以CPU为中心的通算整机柜。

在各大类型的超节点中,CPU的比例不断上升,超节点机柜也在从“GPU中心”走向“GPU+CPU+存储协同”。

不过,目前CPU、HBM(高带宽内存)、先进封装等关键资源都同样紧张;CPU需求增长比产业预期更快,短期供给难以迅速跟上。行业也同步出现了CPU涨价、交付周期拉长的供需失衡现象。

7月6日,英特尔宣布:上调旗下多款消费级与服务器级CPU的建议零售指导价。其中,面向服务器端的旗舰级至强6980P单颗售价上调1495美元,涨价金额近乎等同于一台中端消费处理器的原价。

存储也是超节点供应链中的关键一环,智能体需要依赖长期记忆、知识库、上下文缓存(KV Cache)以及海量数据的高速读写,未来存储的价值也将更多体现到容量、带宽和低时延能力,而不仅仅是成本上来。

供应链的价格波动正指挥着超节点的狂飙节拍——尽管这是一个价值数千亿元的大生意,但可以为其买单的客户太过集中,超节点玩家们将面临的,仍将是更加残酷的性能与价格搏杀。

本文来自微信公众号“中国企业家杂志”(ID:iceo-com-cn),作者:闫俊文,编辑:李原 何伊凡,36氪经授权发布。

+1
2

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪寻求报道

咨询报道审核和入驻
联系
36氪寻求报道订阅号
关注

报道的项目

超节点
我要联系
三维视觉技术团队和解决方案提供商

下一篇

调改不停,博弈不止

40分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业