大模型价格战下半场:将推理价格打下去
“买一批设备回来,10个月收回成本就够了,希望能以合理价格买到芯片,这样就不用自己做芯片了”,近日在投资会上,
值得注意的是,在本次投资会之前,就有媒体爆料称:
从中我们不难看出,主打低价格的
那么对于以
【1】DeepSeek带动行业降价
2026年,对于国内大模型产业来说,是集体降价冲刺的一年:
5月23日,
5月28日,小米旗下MiMo-V2.5全系列API接口永久下调资费,部分细分调用场景降价比例逼近99%,并宣布不再区分上下文窗口长度,统一按低价计费,解决开发者长文本处理的成本焦虑。
6月底,腾讯云平台内上线的
这波降价幅度有多大?以
价格成为杀手锏,企业和用户开始用脚投票,对于大多数需求来说,使用成本往往比性能参数更重要,OpenRouter数据显示:在调低价后,
(来源:
为什么对外部融资不感兴趣的
一是利用精妙的算法和工程优化,大幅度降低了算力成本,如处理百万级Token长上下文时,V4系列算力消耗仅为上代产品的27%,缓存机制降低了10%,真题训练成本降低了10%;
二是摆脱对英伟达的依赖,采购国产算力芯片,如华为昇腾节点全系列产品已支持
可以说,在软件算法和采购国产硬件双管齐下的情况下,
【2】推理芯片成为价格限制期
但随着模型创新和国产替代带来的价格优势逐渐缩小,
这意味着,如果企业打不掉推理成本,就无法将AI普及。推理芯片对于大模型的价格影响体现在两方面:
一是采购数量和采购成本,此前大模型厂商是以模型训练为主,但随着AI商业化逐步落地应用,行业的玩法变了。推理芯片成为大模型厂商的采购主力。
阿里云在“2026年算力倍增计划”中,AI资本开支中,推理芯片的采购预算占到总预算的60%;Meta预计将在2026年底建立60万张GPU等效算力的推理集群,占到其AI总预算的55%……
“约70%—80%的AI算力用于训练,20%—30%用于推理,但是未来这一趋势会倒过来,用于推理的AI算力将占到70%以上”,在今年五月的联想业绩发布会上,联想集团董事长兼CEO杨元庆表示,推理芯片的时代即将来临。
二是全生命周期的成本,与一次性投入的训练芯片不同,推理芯片因为要回到用户问题,所以其成本产生是长期的,而且会随着用户问答数量的飙升而飙升,有数据显示:在生产环境中,推理芯片投入占大模型生命周期计算成本的80%至90%。
短期内采购量大+全生命周期费用占比高,让推理芯片成为AI商业化落地时代下最重的成本。
因此对于
【3】推理芯片自研很有难度
其实降低推理芯片的成本已经有很多企业在做了。
在完成首轮510亿元外部融资后,
今年6月,OpenAI发布了与博通联合开发的首款定制推理芯片Jalapeño,以替换掉英伟达推理芯片,从而降低约50%的推理成本。
(来源:互联网)
Anthropic就从OpenAI挖来了其自研芯片团队的早期核心成员Clive Chan,负责整个AI推理芯片的自研。
几乎所有大厂都将自研推理芯片作为优先选项,但自研这条路并不轻松,甚至会耽误大模型企业的进展。
首先是研发难度,AI大模型企业擅长算法架构这类软件层面,AI芯片此前只是上游的工具,如今要自研AI推理芯片,是要从软件领域跨界到完全陌生的硬件领域,需要在人员技术上重新积累。
其次是芯片厂商的迭代速度,相比大模型厂商,华为昇腾、寒武纪、英伟达这类AI芯片厂商有技术基础,他们对接整个大模型行业,能够根据市场需求快速研发生产,而大模型厂商只是针对自身需求定制推理芯片,再加上研发能力与芯片厂商有差距,这就可能导致出厂即落后的情况发生。
最后自研推理芯片最大的难题在于没有生态支持,以英伟达为例,其AI芯片除了算力性能外,更重要的是超过400万开发者的CUDA生态,这意味着,有庞大的开发者愿意适配芯片框架,愿意采购,进而增加芯片的采购量,从而降低成本。
而智普AI、
可以说,对于智普AI、
2026年的AI大模型行业,已经从“能不能做出好模型”的工程师时代,进入了“能不能把成本降到足够低”的工业时代。而AI大模型厂商能不能推出并使用自研推理芯片,这关系到这些公司是一家AI产品公司,还是一家AI时代的基础设施公司。
本文来自微信公众号“司库财经”,作者:质子,36氪经授权发布。















