卡住端侧AI的不是内存

王智远·2026年07月24日 19:42
三条曲线,三种活法

今年新发布的手机,厂商开始花大量时间讲同一句话:我们的手机,能本地跑大模型,不联网。不调云端。芯片自己算。

不只手机,眼镜、汽车座舱,也在做同样的事。

这件事放在两年前讲,你大概率会觉得是个噱头;放在2026年,它确实开始变成常态了。

为什么偏偏是今年?是三条原本各自独立的技术曲线,在2026年,第一次同时走到了同一个位置了。

第一样:模型越来越「浓缩」了。

2024年底,清华孙茂松、刘知远团队和开源社区OpenBMB提了一个概念,叫「能力密度」。说人话就是:一个模型,每一亿个参数里能装多少「聪明」。

他们的结论比较直接,大模型的能力密度,大约每100天翻一倍。

什么概念呢?每隔三个多月,你只需要一半大小的模型,就能达到跟现在最强的模型一样的水准。

跟摩尔定律放一块看更有意思,芯片在同样价格下的算力,大概每两年翻一倍。模型呢?

一百天;一边是两年,一边是一百天;前者决定你的手机能塞进多大的模型,后者决定塞进去之后它能有多聪明。

这事儿不光是理论。

截至今年7月,清华的MiniCPM系列在全球已经被下载了3800万次,GitHub上超过14万颗星;今年5月发布的MiniCPM5,参数量只有1B,效果比三个月前发布的Qwen3.5-2B还要好,体积砍半,反而更聪明。

第二样:芯片终于够快了。

模型再聪明,最终得跑在硅片上,你得有足够快的芯片,这条线,2026年才算真正跨过了一道坎。

我特意查了一下,高通骁龙8 Elite Gen5,AI算力到了100 TOPS;联发科天玑9500,超性能NPU的峰值也是100 TOPS,而且功耗比上一代砍了一半多,还支持一种叫低比特推理的技术,让模型跑起来更省电。

PC端的骁龙X2 Elite,NPU也有80 TOPS。

你可能对这些数字没什么感觉,记住一件事就够了:这批芯片真正装进量产手机,时间点正好卡在2025年底到2026年。

第三样:拿到了「准入证」。

这条线不在技术范畴里,它的约束力一点都不比前两条小,没有它,前面两样再好也等于零。

今年7月15日,国家网信办发了一份公告,7款手机端侧的AI服务完成了备案:但有个细节很多人没注意,目前全国做完备案的生成式AI服务已经快一千款了。

专门给手机端侧列一张清单,这是第一次,这张清单里最能说明问题的是谁呢?苹果。

Apple Intelligence在2024年6月的WWDC上就亮相了。端侧基础模型大约30亿参数,技术上两年前就准备好了。

它在中国市场等了两年半,最后国行版的AI能力,交给阿里千问、百度来做,两年半,等的就是那一张清单上的一个名字。

三条线放一块:模型每百天浓缩一倍,百TOPS芯片今年铺开,合法开机的许可7月8日生效。同一年汇合,落地才成立。

......

不过这里有一个细节,100 TOPS这个数字,值得讲一下。

如果你去问做端侧部署的工程师,他大概率会说:这个数,参考价值有限,决定手机能跑多大模型的,从来不是它。

TOPS是纸面算力,翻译过来就是「每秒能做多少次运算」,端侧真正卡脖子的地方在哪呢?

内存容量、内存带宽、数据搬运、缓存管理;很多时候模型是被内存拖慢的,路太窄,车再快也跑不起来。

这话听着抽象,我给你举个例子。

iOS上有个机制叫Jetsam,一个App占的内存超了限,系统直接把它杀掉,连个弹窗都不给。安卓那边也有,叫LMK,一样的逻辑。

所以,端侧跑大模型,你得给系统和其他App预留三到四成内存,手机标称8GB,真正能给模型用的,远没有8GB。

这就是端侧、云端最本质的区别。

云端约束是钱,不够加机器就行了;端侧的约束是物理,内存就这么多、电池就这么大、散热就靠那一点面积。

于是每一类设备,都被自己的内存预算和功耗预算,锁死在一个很窄的尺寸区间里。

智源发了份《端侧智能2026》,里面有一张表,我觉得是最有价值的东西,它把不同设备能塞进多大的模型,按照INT4量化口径估了一遍:

你把这张表看一遍,规律很直接:

越贴身、越省电、越要求实时的设备,能装的模型越小;越是电源管够、散热空间大的,尺寸越往上走。

眼镜为什么只有1B到3B?它得挂在你鼻梁上。

一副国产无屏AI眼镜的整机重量,普遍控制在40克以内,最轻的35.5克;这个重量里要塞进电池、摄像头、扬声器、主控芯片。

留给内存和散热的,就指甲盖那么点空间。

AI盒子为什么能到70B+?它插着电,放桌上,可以塞大内存,可以做主动散热,不受那份罪。

手机夹在中间,3B到4B;是它得跟相机、导航、后台服务抢同一块内存。大家都在排队吃饭,谁也别想多占。

这张表还有一个动态的部分:格子会变大。

我查了下,座舱主控芯片从高通8295往8397、8797迭代,本地能承载的模型规模也从大约0.9B涨到了4B到8B,旗舰平台已经能摸到14B。

同一个品类,两年时间,尺寸区间往上抬了一个数量级,多模态座舱智能体这件事,就是这么成立的。

我拿面壁的MiniCPM-V 4.6举个例子,1.3B参数,Q4量化之后连视觉编码器一块打包,整体部署体积大概1.6GB,能在6GB内存的手机上跑。

1.3B,正好落在「手机3B到4B」这个格子的下沿。1.6GB的体积,对6GB内存的手机来说完全安全;他们从一开始就是照着这个约束设计的。

那另一个问题就来了:为什么端侧模型厂商全都在死磕量化?

说到底,量化就是连接「模型能干什么」和「硬件跑得动什么」之间的一座桥。

端侧这个行当里,能不能在精度、体积、速度三者之间找到最优平衡点,已经成了衡量一家模型厂商工程能力的标尺。

还有一件事,挺容易被忽略的,你手机跑大模型,最要命的是能跑多久。

手机持续高负载会怎么样?发烫,降频,电量掉,系统抢资源;麻烦的是,很多端侧AI要做的事,偏偏就是长时间挂着的那种。

于是整个端侧推理的思路就得跟着变,现在得比「谁能稳定跑一个下午还不烫手」。

不能只看第一个词出得多快,还得看费多少电、烫不烫、放后台会不会被杀。

最后给你一个数:端侧模型的上下文长度,通常只敢开到512到2048;云端呢,随随便便128K。为什么差这么多?会吃内存,内存吃超了,系统就会把软件杀掉,你还敢开吗?

......

内存不敢开大,是硬件不让,还有一种不敢,跟硬件没关系。那七款完成备案的,拿到了牌照,这牌照到底值什么?我给你拆开看。

咱们这套制度:你要向国内公众提供生成式AI服务,得走大模型备案;安全评估报告、语料标注规则、拦截关键词列表、评估测试题集,先交这些。

过属地网信办,再做技术测试、专家评审,最后中央网信办终审。流程是真的重。

苹果等了两年半,就等这玩意儿,拿到牌以后,你的东西就不一样了;系统级权限、跨应用调度、开机自启的智能体,只有持牌方配碰。

你会看到一个现象:拿到牌这批,带着牌往下走了。

华为AI眼镜跑自家的小艺,小米AI眼镜接小爱,夸克G1接千问,小度AI眼镜接小度,理想Livis接理想同学。

第二层,租牌的。如果自己不炼模型,只是调别人备过案的API,走的程序叫登记。

调用情况说明、服务协议、内容安全管理制度等等,这些乱七八糟的一套,交到省级网信办,省里点头给你个上线编号,不用上中央终审,圈里实操下来,大概四到五个月。

比备案轻多了。代价两个。

第一个,只能租,不能改。你调用的模型做了微调,或者喂了自己语料训练,就不满足登记条件,被踢回去走完整备案。

这事儿放在端侧这个行当里,很要命;端侧AI最值钱的是什么?本地个性化、私有数据适配、越用越懂你。三件事,全踩在「改没改模型」这条线上。

第二个,牌是别人的。

Rokid把「可自由切换千问DeepSeek、Gemini」做成了公开卖点,媒体说你在大厂之间左右逢源;确实是一种活法,不绑死任何一家,你切换的前提是有得切,每一个都是别人的。

影目的INMO AIR3、GO2接大模型做同传,微光科技的玄景M6接千问DeepSeek,这些独立硬件厂商,走的都是租牌这条路。

租牌的人在变多,我查了下,网信办自己的数字:2025年底,748款备案、435款登记;今年6月底,988款备案、598款登记。半年时间,登记多了163款,涨幅比备案还快。

而且这张牌是明牌。网信办要求所有上线的生成式AI应用,在显著位置公示模型名称和备案号。你用的是谁家的,写在那。

还有一件事,很多做硬件的会低估:没牌,你连渠道都进不去。

AI陪伴、AI绘画、AI写作这些品类,安全评估报告没有、备案没有,就不给上架;今年4月网信办启动了一轮专项行动,重点整治的头一条就是没按规定备案登记,第一阶段处置了1.4万多款违规AI产品。

第三层,这个行业里最不起眼的一群人。可能也是最舒服的。

《生成式人工智能服务管理暂行办法》第二条:利用生成式AI技术,向境内公众提供生成文本、图片、音频、视频等内容的服务。

卖芯片的不在里面。

瑞芯微、恒玄科技、星宸科技、全志科技、晶晨股份,它们卖的就是那块硅片,让模型能在设备上跑起来。一张证不用办。

这一层靠什么吃饭?终端出货。

A股有个现成的窗口:到7月20号,AI眼镜产业链60多家公司发了上半年业绩预告;大家在预告里说的驱动因素是什么?存储芯片暴增、终端放量。没一家提合规。

牌照是别人的事,牌照决定终端能不能上架卖,终端卖多少,决定它们出多少货。这条链,隔了一层。

三层。持牌的带着牌往下走,租牌的等四个月拿个编号,不碰牌的一张证不用办。谁苦谁甜,自己心里有数。

......

说了这么多能跑通的,来说说跑不通的。三件事,现在还堵着。

第一件:你做的模型,换了芯片就不好使。

云端就那几种架构,端侧不一样。你去数数,手机里跑AI的芯片,高通是一套,联发科是一套,每套还有自己的工具链、自己的规则。

这还只是手机,加上PC、汽车、机器人、IoT模组,每家都自己搞一套。

结果就是:在这块芯片上跑得飞起,换一块,重来;N个模型乘M种芯片乘K种终端,根本适配不完。

麻烦还不只是活多,主流AI开发到今天,默认就是给英伟达优化的。

全球海量的开源模型、算子,都在CUDA上跑,国产芯片算力做得再好,没人给你写适配,你就接不住社区的更新速度。

智源今年搞了个FlagOS,就想解决这事儿。

我查了下,3月发的2.0版本,统一算子库497个,覆盖了18家厂商、32款芯片;实测把Qwen的CUDA依赖全换了,推理性能从原来35%提到了接近最优的95%。

听着不错,支持32款。到32款上都好用,中间还有得磨。

第二件:三角,你只能选两样。端侧做AI,精度、省电、便宜,三件事互相打架。

你要模型聪明,就得做大;做大了吃内存、吃电、手机发烫。你要省电,就得把模型压小、精度往下砍。压狠了,变傻。

你要便宜,就用低端芯片,低端芯片内存小、NPU慢,大模型根本塞不进去。

这三件事的边界在物理手里,制程往前走一步、内存带宽提一档,它才勉强往外挪一丝。急不来。

你可能想起前面说的密度定律,模型每百天浓缩一倍,不就是在破这个三角吗?没有。

密度定律干的活,是把三角的边界往外推。推的是边界,三角还在,任何一个时间点上,还是只能选两样。

第三件:最赚钱的事和最省事的办法,撞车了。

端侧AI到底比云端强在哪?数据不出你的手机,模型认得你,越用越懂你;终端厂商愿意掏钱,掏的就是这个。

要做到越用越懂你,模型就得改,调一调,喂点你自己的数据继续训;还记得登记那事吗?模型改过了,登记就不算了,得回去排备案。

租牌的人怎么办?两条路。

不改模型,保四五个月上线,产品就是个壳,问什么都回答个通用的;要么把个性化做深,做出别人做不了的东西,代价是回去排队。

谁都没错;合规问你「模型是谁的」,产业问你「模型有多懂我」,两把尺子,量的压根不是同一件事。

大厂不受这个罪,自己持牌,爱怎么改怎么改。

这条约束的真正效果是:它把个性化这条最值钱的路,留给了一开始就有牌的那批人。

核心数据参考:

[1].中央网信办公开公告及《生成式人工智能服务管理暂行办法》、智源研究院《端侧智能2026》报告、清华大学密度法则研究成果(Nature Machine Intelligence)、智源社区FlagOS 2.0发布信息

本文来自微信公众号 “王智远”(ID:Z201440),作者:王智远,36氪经授权发布。

+1
8

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000
特邀作者

畅销书《复利思维》作者;有关营销、科技、AI的一切。

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪寻求报道

咨询报道审核和入驻
联系
36氪寻求报道订阅号
关注

下一篇

AnySearch 希望进一步降低开发者的创新门槛,推动更多 AI 应用从探索走向落地。

48分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业