AI推理专用infra商业潜力被验证,Etched估值飙到103亿美元

阿尔法公社·2026年07月29日 19:24
NVIDIA的CUDA生态,被撕开了一个角。

随着AI在真实工作流中的深度渗透,我们几年前的预测正在变成现实:AI推理的算力负载需求正远远超过AI训练的需求,AI推理正在成为AI基础设施领域最大的市场。

训练一款模型是相对集中的资本投入,而推理成本会随着用户数量、调用频率和模型输出长度持续增长。用户的每一次使用,都会带来真实的芯片计算,数据储存/传输和电力消耗。

2024年,Etched获得1.2亿美元的A轮融资,由Primary Venture Partners领投,Peter Thiel、GitHub首席执行官Thomas Dohmke等个人投资人参投。

它当时在打造一款基于ASIC,只针对Transformer模型推理负载的专用芯片Sohu,根据它公布的数据,搭载8块Sohu芯片的服务器,推理算力是同样数量H100芯片服务器的20倍。

此后, Etched在2025年底获得Stripe领投的5亿美元的B轮融资,估值上升到50亿美元,台积公司(TSMC)、Jane Street、Ribbit Capital,以及Andrej Karpathy、李飞飞和Peter Thiel等投资人共同参投。

2026年7月,它又获得由Sequoia Capital领投,a16z、Jane Street、Diffusion和SK Hynix参投的3亿美元C轮融资,这使它的估值飙升到103亿美元。

在背后支撑这个估值的,是Etched已经流片成功的A0芯片,正在构建的前沿推理集群和已经获得的10亿美元的客户合同。

Etched正在证明,绕开NVIDIA GPU和CUDA生态、围绕特定架构AI模型构建专用推理基础设施,开始从技术设想走向规模化商业验证。

当AI推理计算负载崛起,专用推理基础设施成为刚需

Etched由Gavin Uberti、Chris Zhu和Robert Wachen三位哈佛背景年轻创业者共同创立。Gavin是公司的技术核心,曾在OctoML和Xnor.ai从事AI编译器开发,并参与开发TVM的Cortex-M后端;Chris拥有数学和高性能计算研究背景;Robert负责商业化、融资和组织建设。

图片来源:Etched

此后,Etched围绕芯片架构、软件、机柜系统和量产搭建起完整的资深团队。前Cypress Semiconductor CTO Mark Ross担任公司CTO;参与NVIDIA V100、A100和H100架构设计的Saptadeep Pal负责ASIC与底层架构;曾在NVIDIA从零搭建HGX和DGX系统的Brian Loiler负责平台工程;曾建立Google TPU v1至v5软件团队的David Munday负责软件栈;拥有Apple和Google硬件量产经验的Wayne Cao则负责生产与供应链。

纵观计算机算力发展史,当某一类计算负载呈现出多变且不稳定的特征时,它通常处于技术生命周期早期阶段,人们会为它的通用性买单;但当某类计算负载规模呈指数级增长,且计算特征逐渐趋于稳定,那么通过专用化设计,便能大幅优化其单位经济模型。

这时,这类计算负载会逐渐向专为其量身定制的硬件迁移:先是定制化芯片,进而演变为围绕这些芯片构建的整套定制系统。

简而言之:一项计算负载越重要、其计算特征越稳定,为其量身打造专属硬件的商业逻辑就越容易成立。

图形任务的计算负载崛起(由3D游戏推动),催生了GPU(图形处理器),互联网崛起,催生了专用网络传输芯片,现在AI推理负载的需求也呈现指数化提升。

例如,据Google披露,其产品和API每月处理的token数量,从2024年5月的9.7万亿增长至2025年5月的480万亿,到2026年5月又超过3.2千万亿,两年增长超过300倍。

这种指数化的提升,背后离不开AI产品形态的变化。ChatGPT等产品,最初就是ChatBot,一问一答间,每次消耗的token数量在数千个。此后,OpenAI推出了更消耗Token的思考模型o1,产品也逐渐Agent化。由于Agent产品需要完成复杂任务,并调用多个工具,所以它一次任务消耗的Token数量相比ChatBot是指数级提升的。

到2026年,内置了Agent功能的ChatGPT周活用户超过9亿,Codex与新推出的ChatGPT Work合计用户快速增长到1000万。

推理的需求,也直接体现在了NVIDIA的收入上,NVIDIA数据中心业务季度收入从2023年初的36.2亿美元,增长至2024年春季的226亿美元,到2026年初进一步达到623亿美元;按季度收入年化计算,分别约为145亿、904亿和2492亿美元。

2024年,Etched打造了一款基于ASIC,只针对Transformer模型推理负载的专用芯片Sohu,当时它的内部实测数据,一台拥有8个Sohu芯片的服务器,用来推理Llama 70B,可以达到500,000 token/s的推理速度,是8个H100芯片服务器的20倍。

图片来源:Etched

2026年早些时候,Etched在台积电(TSMC)成功流片了其A0版芯片。随后,在短短40天内,Etched团队成功点亮了首个芯片集群。

图片来源:Etched

现在,他们正验证其首款机架级(rack)产品。

AI模型的推理,有两个核心环节:预填充(prefill)和解码(decode),预填充的作用是读取大量的文本;解码则是利用这些数据生成输出的token。

低电压推理(LVI)

在进行预填充时,主要任务不是预测token,是让模型的内存(KV Cache)进入正确的状态;然后才能利用这个KV Cache来进行解码。

对于预填充,关键是FLOPs和算力密度,但AI芯片在扩展FLOPs时不可避免地会受到散热限制,这使得在现有的GPU上,根据工作负载的不同,通常只能得到20%到50%的模型算力利用率,大量GPU的算力,因为芯片过热导致降频,而浪费掉了。

注:FLOPs(Floating Point Operations,浮点运算量):通常用于衡量芯片的计算能力,文中主要指芯片单位时间内能够提供的理论算力。

根据登纳德缩放定律,晶体管尺寸缩小时,供电电压也应同步降低,从而在增加晶体管数量的同时,避免芯片功耗快速上升。由于芯片的动态功耗大致与电压的平方成正比,在其他条件不变时,电压提高一倍,功耗约增至4倍;电压减半,功耗则约降至四分之一。

于是Etched设计了一种全新架构,叫低电压推理(LVI),它使芯片计算单元的运行电压不到大多数AI芯片的一半。这实现了当前AI芯片数倍的FLOPs密度。

在推理万亿参数的稀疏MoE模型时,它们能够以80%以上的峰值FLOPs持续运行,且不会触发降频。

运行LVI需要在从晶体管到token的每个层级上对整个集群进行协同设计:包括新型可拆分计算阵列、电路技术、创新的切片与调度算法、供电网络、VRM架构、先进封装以及冷板设计等。

针对低延迟负载的集群级内存(CSM)

解码端,内存的重要性提升,加载模型和KV Cache的速度越快,每秒能生成的token就越多;这个时候,内存带宽是瓶颈。

此前,人们比较关注的是单颗芯片的内存带宽是多少,但真正重要的可能是整个纵向扩展集群(scale-up cluster)的内存带宽是多少。

Etched在整个纵向扩展域(scale-up domain)内构建了一个延迟极低的共享内存池。通过专有的超低延迟、高带宽互连技术,实现了跨芯片的极速内存访问。

它的HBM/SRAM混合设计同时解决了内存容量和内存间延迟的问题,从而兼顾了高吞吐量与快速响应。CSM不仅改善了延迟,还规避了当今纯SRAM芯片、3D DRAM芯片或光互连技术在成本、可靠性、良率、散热及计算能力方面的权衡妥协。

Etched表示,在它们早期客户的测试中,在处理推理负载时,其系统实现了当前最优(SOTA)的吞吐量、延迟和能效表现。Etched的主要投资人表示,在尽职调查中,有客户反馈,Etched是首个能真正在规模化应用中颠覆其推理单位经济模型的系统。

目前,Etched的首批机架将于今夏发货,同时它已全面启动量产,以履行超过10亿美元的客户合同。

Etched已经初步验证,脱离NVIDIA GPU和CUDA生态,独立构建一套AI推理基础设施,在技术上是可行的,也具备走向规模商业化的潜力。

中国市场的自有专用AI推理基础设施需求强劲,创业机会显现

AI推理基础设施从通用走向专用,已经不再只是一个技术设想。随着推理负载的需求扩大、计算模式逐渐稳定,围绕特定模型结构重新设计芯片、内存和整套系统,正在成为降低每个token成本的必然选择。

中国的AI模型与全球前沿模型的差距,已经明显缩小,尤其是开源模型,更是全球领先。例如,DeepSeek率先在推理能力、开源生态和成本效率上对全球头部厂商形成正面冲击,Kimi的K3则在智能体和长周期知识任务上跻身全球前三。

DeepSeekKimi都开源了它们在AI推理在软件层面的底层优化成果。例如DeepSeek的FlashMLA、DeepGEMM、DeepEP,以及能一定程度摆脱CUDA依赖的TileLang;Kimi则开源Mooncake,重构长上下文推理中的KV Cache和集群调度。这些技术已经进入算子、编译、通信和内存管理等底层环节,处于全球AI推理infra创新的前沿。

在中国市场,海外高端芯片的供应稳定性和可得性存在较大不确定性,随着推理需求增长,催生了打造自有专用AI推理基础设施的强劲需求。

以开源EDA工具和成熟制程为基础的ASIC路线更加开放,AI也开始进入芯片设计和优化流程。Kimi K3曾在48小时内,基于开源EDA工具和45nm工艺库,自主完成一款面向Nano模型的专用芯片设计与仿真验证。

同时,面向云端和数据中心的推理芯片对先进制程的要求相对宽松,创业公司可以避开与通用GPU在制程和规模上的正面竞争。

设计门槛、制造条件和推理需求的变化,正在共同打开一个新的创业窗口。

真正能够抓住这个窗口的,仍会是少数团队。它们既要对模型演进和计算负载有足够深的判断,能够持续做出正确的架构选择,也要保持极快的工程节奏,让硬件迭代跟上模型变化,并不断拓宽芯片的能力边界。成功流片和量产经验只是起点,专用推理芯片最终比拼的,是跨越架构、软件栈、产品和客户需求的长期迭代能力。

本文来自微信公众号“阿尔法公社”(ID:alphastartups),作者:发现非凡创业者的,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪寻求报道

咨询报道审核和入驻
联系
36氪寻求报道订阅号
关注

下一篇

二维半导体产业链条正在成型。

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业