把模型“刻进”AI推理专用芯片里,AMD为什么收购Taalas?

阿尔法公社·2026年08月12日 20:25
AI推理专用芯片,是适合中国创业公司的机会。

在AI推理领域,什么因素具有商业价值?速度肯定是其中之一。

我们平时用的Chatbot服务,要感到使用流畅,至少需要数十tokens/s(以下简写为:TPS)的推理速度。

近两年,不少模型厂商,也推出了高速推理的模型API,将推理速度提升到了200-1000 TPS/user这个量级,价格也相应提高数倍。AI芯片制造商Cerebras,甚至将Llama 3.1 8B的商业推理速度优化到了接近2000 TPS/user。

最近,AMD宣布收购AI推理专用芯片公司Taalas,它可以将Llama 3.1 8B的推理速度提升到接近17000 TPS/user,而且它们采用了一种很“激进”的技术路线,将模型直接“刻进”芯片里。AMD本次收购后,会将Taalas的技术与AMD Instinct™ GPU结合,打造系统级解决方案,为客户提供差异化的推理性能与能效优势。

此前,Taalas在2024年完成了总额5000万美元的早期投资,Quiet Capital与Eclipse Ventures顾问Pierre Lamond领投;在2026年2月,它获得1.69亿美元融资,投资方包括Quiet Capital、Fidelity以及Pierre Lamond,累计融资2.19亿美元。

把模型“刻进”芯片里,推理速度超GPU一个数量级

自ChatGPT发布,已经约3年零8个月,它的月活用户也超过了10亿,但相比移动互联网时代C端产品的应用广度,以及企业软件在商业和工业流程中的应用深度,AI还有不足。

这一方面是因为AI的技术还偏向早期,还不够完善,但另一个极为重要的原因,就是AI推理的性能和技术也需要革新。

需要革新的方面,可以拆成两个,一是速度,二是成本。AI推理的实时性,目前显然不足,这在物理AI领域,尤其成为瓶颈。

而AI推理的高成本,已经让一些鼓励员工使用AI的企业预算超支,例如今年4月,Uber的CTO向媒体表示,公司已经在年初的几个月内耗尽了原本为整个2026年准备的AI预算,不得不对每名员工设置单工具每月1500美元的预算上限。

为什么AI推理的速度和成本现在成为瓶颈?本质还是技术特性有关。

我们可以把AI模型推理的主要步骤粗略的分为预填充和解码。其中预填充负责将上下文窗口的输入token进行处理,解码负责生成Token;GPU集群更擅长预填充,AI专用推理芯片更擅长解码。

而这两个系统分别擅长的部分,不但和计算特性有关,也和储存有关,更详细的组合是GPU+HBM储存,以及AI推理芯片+SRAM储存。

以NVIDIA为例,Blackwell GPU在部分模型上已经能够实现1000+ TPS/user,但这是以特定模型和服务配置实现的。

当模型规模、上下文长度和并发量上升,GPU继续提高单用户生成速度,就需要明显牺牲系统整体吞吐和能效。NVIDIA今年在GTC展示的推理曲线中,当单用户速度提高到400TPS时,GPU的整体吞吐效率已经明显下降。

图片来源:NVIDIA

这也是专用推理芯片存在的意义。NVIDIA在下一代Vera Rubin系统中引入Groq 3 LPX,把解码阶段最吃延迟的计算交给专用芯片,在提高单用户生成速度的同时,尽量避免整体吞吐效率快速下降。

GPU真正的弱项,是要在大规模服务中同时做到低延迟、高吞吐和低成本很难。要提升推理负载的承载能力,就必须扩建更多的算力中心,消耗更多的能源,进而让TCO(总拥有成本)的数字很难看,这是它在成本上的劣势。

如果说GPU是通用计算在AI计算领域的代表,那么Groq、SambaNova、d-Matrix和Cerebras等公司就是专业AI推理的代表。专注在推理,让他们的推理速度和成本相比GPU有明显优势。

在专用化推理上,再往前走一步,是Etched,它的芯片和推理系统,在初期专注推理Transformer架构的模型,累计融资已经达到11亿美元,初步验证了AI推理专用infra的商业潜力。

那么在Etched的基础上,再往专业化走一步,就是Taalas,它直接把AI模型“刻进”芯片里,一款芯片只能推理一款模型,却将推理速度直接推到了万级TPS,同时大幅降低了推理成本。

当然,要走这么“激进”的技术路线,创始团队肯定在技术上得有足够的积累和洞见。

Taalas的创始团队。图片来源:Taalas

Taalas由Ljubisa Bajic、Drago Ignjatovic和Lejla Bajic共同创立。在联合创立Taalas之前,Ljubisa于2016年创立了Tenstorrent,Drago和Lejla随后作为早期工程负责人加入。

其中,Ljubisa Bajic是Taalas的联合创始人兼CEO,他此前也是Tenstorrent的CEO,更早之前他是AMD的CPU-GPU融合芯片设计架构师兼高级经理,也曾在NVIDIA担任高级架构师,之后又回到AMD集成电路设计总监。

Ljubisa的妻子Lejla Bajic担任Taalas的COO,她曾担任ATI的高级工程师,在AMD收购ATI后成为系统工程高级经理。

另一位联合创始人Drago Ignjatovic曾是负责AMD APU和GPU的高级设计工程师,之后升任ASIC设计总监。

截至今年2月,Taalas整个团队只有24人。媒体报道称,其中大多数是曾在AMD、Apple、Google、NVIDIA和Tenstorrent工作过的工程师,拥有从芯片设计到系统落地的长期经验。

模型是怎么“刻进”芯片的?

Taalas的首款技术验证芯片是Taalas HC1,Taalas将当时比较主流的小型开源模型Llama 3.1 8B“刻进”了芯片,实现了接近17000 TPS/user的推理速度。

Taalas HC1。图片来源:Taalas

对比NVIDIA的H200、B200,以及Groq、SambaNova和Cerebras的芯片,它的推理性能是断层级别的领先。

Taalas HC1对于Llama 3.1 8B模型的推理速度,断层领先。图片来源:Taalas 

针对单一模型的推理,使用Taalas的产品,Llama 3.1 8B的成本仅为每百万token 0.75美分,DeepSeek R1推理模型为7.6美分。其中Llama的测试数据基于第一代实体芯片,DeepSeek的数据则为模拟结果。

Taalas的推理成本。图片来源:Taalas

作为对比,其他方案处理Llama 8B和DeepSeek R1的成本分别为3.79美分和28.6美分(分别针对吞吐量和延迟优化),而GPU的成本则在20至49美分之间。Taalas的成本和功耗是GPU的几十分之一。

这个性能具体是怎么达到的?模型是怎么“刻进”芯片的,根据Taalas产品副总裁Paresh Kharya的介绍,应该是以下这样的。

Taalas的理念是“模型即计算机”,其基本架构是创建了一个完全由硬件定义的AI核心模型,然后把模型和权重硬编码到“基于掩膜ROM的权重读取结构”(mask-ROM-based recall fabric,以下简称:掩膜ROM结构),并辅以基于SRAM的读取结构(SRAM-based recall fabric)。

模型和权重主要固化在“掩膜ROM结构”中,可编程SRAM则用于存放微调权重和KV Cache。

Taalas的技术栈。图片来源:Taalas

针对“掩膜ROM结构”,Taalas可以用单个晶体管存储4位数据并完成相关的乘法运算,所以达成了很高的计算密度。

Taalas打造这个结构,其设计出发点是彻底消除内存和计算之间的壁垒,它们计算效率的关键在于采用了存内计算(CIM)理念。CIM将计算功能集成到内存中,直接在内存内执行计算,无需在计算单元与内存之间频繁传输数据,从而消除了“内存墙”瓶颈,并减少了计算过程中的多余延迟与功耗。

Taalas的HC1,交付形式是PCIe加速卡,可直接插入标准服务器,不需要搭配HBM,不需要CUDA式复杂的软件栈和大量底层Kernel优化,就能让硬件跑起来。

Taalas的单机架功耗仅为12至15千瓦,而GPU机架通常高达120至600千瓦。并且它采用风冷散热,免去了数据中心高昂的液冷改造费用。

图片来源:Taalas

在兼容性上,Taalas推理服务器可部署在现有的任何数据中心中,而且尽管它是将模型刻进了芯片里,仍然支持通过LoRA对模型进行微调,以优化它在特定领域的表现。

但是这里有个问题,就是模型“刻在”芯片里了,这个芯片就不能推理其它模型了,而目前AI模型的迭代速度是以月计算的,芯片的更新速度,却相对较慢。

Taalas的解决办法是两种,第一就是,它会先批量制造出包含约100层结构的准成品芯片,通过“掩膜ROM结构”存储模型权重,只需要修改2层掩膜即可进行定制化修改,使芯片能够推理新的AI模型。这个过程大约需要花费2个月。 

此外,他们构建了大量自动化工具,以便快速将模型转化为RTL代码,虽然还不能完全的一键生成,但大约只需一周的工作量。

目前它的第一代HC1芯片可存储8B(80亿)参数的模型,下一代HC2则计划支持20B(200亿)参数,而通过几十颗芯片互连即可容纳万亿参数级推理模型及其权重。这与当今市场上的其他方案相比,成本规模要小得多。

AI推理专用芯片,是适合中国创业公司的机会,尤其在端侧

在AI计算领域,NVIDIA的GPU+CUDA范式,在很长一段时间内,仍然会领先,仍然会是主流,因为它代表的是AI的通用计算,无论是训练还是推理,无论是什么类型的模型,它都能适应,所以无论是模型厂商,还是大型云厂商,在它的生态里,都是“安全”的,尽管它的效率不算最高。 

但为什么,仍然有这么多AI推理的专用芯片存在?因为GPU只是能完成所有类型的AI计算负载,但它在AI推理上的效率并不顶尖。而AI推理和训练不一样,它不是“一锤子”买卖,是很有持续性的运营生意,除了性能外,成本是一个绝对需要关注的指标,而这恰恰是GPU的弱项,也就给了创业公司机会。

Groq、SambaNova和Cerebras就是这么起来的,专用计算,在它的领域通常优于通用计算。往专用性上走得更远的Etched和Taalas获得了更惊艳的性能和功耗表现,但牺牲了灵活性,Etched最初专注在Transformer架构,Taalas更是将特定模型直接“刻在”芯片里。

Taalas和Etched的路线,付出了专用化必须付的代价(灵活性,兼容性),但是这个代价,对于中国的创业公司来说,没有那么大,反而可能是好的机会和好的参照。

中国创业公司做AI推理专用芯片,完全可以选择基于开放指令集和软件生态的ASIC路线,选择不需要HBM等高价且供应受限的高价存储的场景。如果做成针对云端的,可以不需要使用那么前沿的制程,如果用在边缘和端侧,中国产业链目前的制程也足够。

尤其要进一步强调的是边缘和端侧,专用性到极致,灵活度低,只能算特定的模型架构或模型,对于云端确实是“缺点”,但对于边缘侧和端侧,这个缺点的负面效应就大大降低了。因为干重复性,但隐私性高的活(边缘),或者直接让芯片在AI原生硬件里推理(端侧),本来就不需要只使用前沿先进模型;端侧硬件的开发周期,也让它不能频繁更换芯片,他们要求的是可靠性,是推理速度带来的实时性,以及最重要的低成本。

恰好,中国有非常好的AI原生硬件成长土壤,也已经生长出数家全球领先的AI原生硬件创业公司,未来对于低功耗、低成本、高性能的端侧AI推理专用芯片有需求,一旦AI原生硬件进一步进入主流,那么这个领域的需求会爆发,创业机会也很大。

本文来自微信公众号 “阿尔法公社”(ID:alphastartups),作者:发现非凡创业者的,36氪经授权发布。

+1
5

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

商业化可以奔跑,但信任与透明不能掉队。如果平台可以平衡商业收益、商家权益、用户体验三方诉求,AI会成为本地生活新的增长引擎。倘若只追求变现速度,忽略规则建设,那么今天的流量红利,终将转化为未来的信任危机。

49分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业