今年世界模型开始考真题了
我查了一下:
这届WAIC,1100多家企业,300多款产品全球首发。全场最热的词,世界模型。
01
有多挤?做机器人的在发,做AI影视的在办论坛,连做农业的都搞出来一个植物生长世界模型。
7月19号,昆仑万维专场,直接说今年是世界模型的元年;你可能跟我一样,第一反应是:新技术嘛,今年刚冒出来。还真不是。
往回数三年:
2024年初,谷歌DeepMind发了Genie,AI第一次从视频里自己学会什么叫「动作」。2025年8月,Genie 3做到实时交互,你可以在一个AI现场生成的世界里走来走去。
2025年11月,李飞飞的World Labs把世界模型做成了商业产品;三年,四级跳,每一级都有人喊过「重大突破」。
昆仑万维自己早就进场了,Matrix-Game 做到第三代,而且这个系列在圈里的待遇,有点特殊。
第二代开源后,DiT 作者、纽约大学助理教授谢赛宁团队拿它当底座,做出了全球第一个多人视频世界模型 Solaris;第三代,NVIDIA 跟浙大联合发布的 Light Interaction,同样是基于它研发的。
更有意思的是另一件事:NVIDIA 的 SANA-WM、Adobe 的 RELIC,这些国际大厂自己发世界模型的时候,把 Matrix-Game 拿去当了对比基准。
什么意思?别人考试,拿你当分数线。
开源模型混到这个地位,说明什么?去年就能用了。东西早就能用,元年却从今年算起。差别在哪?
是考卷。机器人领域有一张所有模型都要考的卷子,叫LIBERO。
给机器人一堆标准任务,看完成率。这张卷子考了三年,今年考出来的结果有点尴尬:十几家主流模型,分数全挤在96分到99分之间,头部几家互差不到一分,人人接近满分。
相当于高考全省前十名的总分差,还没有一道选择题大。这卷子还能排出名次吗?能,但排出来的名次,连出卷人自己都不信了。
人人接近满分的卷子,说明什么?
卷子废了,测不下去了,你排第几,取决于你把谁放进对手名单;换一批对手,第一名换一个人,这两年发布会上那句「刷新SOTA」越来越不值钱。
根子就在这里:大家刷同一张接近满分的卷子。
世界模型的另一半,也一样;视频生成比什么?画面稳不稳、场景真不真;这些东西有个共同点:全靠人眼。
评委看屏幕打分,观众看演示鼓掌;人眼,是这三年唯一的考官,而这位考官,快被哄满意了。
这就是2026年的处境,旧卷子考不出差距,旧考官快被哄到顶了;一项技术走到这一步,只剩两条路,要么继续在旧卷子上争小数点,要么,换一张不考情面的卷子。
所以,看今年世界模型,别数谁发的东西多;这届WAIC,把三张新卷子一次摆上台面的,是昆仑万维。
02
新卷子第一张,是一台得了零分的机器人。
主角叫 Riemann-1.0。昆仑万维子公司黎曼动力成立后交的第一份作业:一个机器人的「通用大脑」。
先说这个零分怎么来的。
黎曼的技术材料里有一组对照实验:不做预训练,从零训一版模型,装到一台双臂机器人上,做四类家务。叠衣服、收餐具、整理桌面、堆积木。
成功率,0%,不是动都不动。
手伸出去了,东西碰到了,动作做对了大概两成;但四件事,一件都没做完,这就是新卷子的性质。
仿真里那套模型能考 95 分,因为仿真给「过程分」,手伸对了,给一点;方向偏了,扣一点;物理世界不给。
图解:Riemann-1.0技术架构图:画面、机器人状态、动作,在同一个模型里排成一条因果链;先决定怎么动,再预测世界会变成什么样
为什么仿真里的好学生,一到真机就交白卷?
因为仿真是个好脾气的考官:光线永远均匀,桌子永远不晃,衣服的褶皱都是算出来的。
真实世界不惯着,布料会滑,光会反,你夹起衣角的那一下,力道差一点,后面全盘皆输。
这中间的落差有个行话,叫「从仿真到现实的鸿沟」,机器人这一行,多少团队倒在这条沟里。
衣服叠好了就是叠好了,没叠好就是没叠好,没有「差一点」这个分数档,你得诚实;你看,旧卷子上小数点后两位的荣耀,到这里,一次性清零。
那从 0 分到 85 分,中间隔着什么?
23.2 万个小时的录像。
黎曼给这个大脑喂的训练数据里,86% 是人类第一视角的日常视频。人怎么叠衣服、怎么收桌子、怎么把笔插进笔筒。
说白了,这个机器人大脑是看人类过日子长大的。剩下那一小半,才是机器人自己的操作数据。
看录像学来的本事,到底能不能落到机器人手上?19 号这天,昆仑交了卷;官方公布的真机评测里,四类家务,Riemann-1.0 平均成功率 85%,比最强的开源对手高出 15 个百分点。
还有一个更大的考场:RoboCasa-365。
你不知道是啥,没关系,记住它是最接近真实家务的一张考卷就行;365 类厨房长流程任务,从拿食材到洗碗,一套动作做完才算分。它考了 62.6%,第二名 54.2%。
注意这两组数的形状,是拉开身位的领先。新卷子刚换上,区分度就回来了。
还有两个数,比分数更能说明问题。
第一个:整套大脑跑在一张 RTX 4090 上,对,就是你打游戏那张显卡,一个机器人「通用大脑」的硬件门槛,一万多块钱。
第二个:评测里有一项,让它把魔方放进收纳盒;训练里从来没教过魔方,也没教过这个盒子,十次,十次成功。
没教过的事它也会,这才是那 23 万小时录像真正换来的东西:见过世面的。
这张新卷子有个代价:很贵,贵到逼着每个来考试的,都得拿别的东西去换,屏幕里的那个模型,刚交了一笔学费。
03
另一笔学费是什么呢?答案是:速度。
这个模型叫 Matrix-3.5,前面提过那个被谢赛宁团队当底座的 Matrix-Game 系列,最新一代。
它的发布材料里有一个数,放在任何一场发布会上都像印刷错误:上一代每秒 40 帧,这一代每秒 20 帧。
慢了,整整一半。
这个行业发布会的语法只有一种:「更快了」;帧数翻倍、延迟减半、响应提升,观众一听就懂,评委一看就给分,你找不出第二家主动说「我们变慢了」的公司。
所以,这个数只有一种解释:它拿这一半的速度,换了一个它认为更值钱的东西,换的是记性和算力轻量化。
以前的 AI 生成世界有个毛病,像金鱼;你往前走,楼是楼、树是树;转个身再回头,楼没了,原地换了栋新的,它把自己一秒钟前造的东西,忘了。
世界模型喊了三年「构建虚拟世界」,卡就卡在这里:想让世界记得住自己。
Matrix-3.5 干的事,说白了,就一句话:
把 AI 看过的每一块画面,标上三维坐标,存进档案,你转回头,它是去档案里把原来那栋调出来。
转身,楼还在;走出去一分钟再回来,楼还在原处,窗户还是那几扇;这一分钟的「还在」,就是那 20 帧买回来的东西。
得说清楚:慢一半,是多卡变单卡,选了以后再拼命往回追。
为了不让 20 帧继续掉成 10 帧,工程上把生成步数从几十步压到 3 步,解码器砍掉四分之三的体积,先选记性,再把速度一点点捞回来,最后停在 20 帧这个两头都还能用的位置。
这是一笔算得清清楚楚的账。
顺便说一句「转身楼还在」这道题的行情:此前全球做得最好的是谷歌 Genie 3,闭源,只能看演示,Matrix 这套,开源。
你发现没有,这个选择跟机器人是同一个动作,机器人把评分交给物理世界,屏幕外考了一张不考情面的卷子。
Matrix-3.5 放弃「更快」换「记得住」,屏幕里主动挑了一道更难的题;快,讨好眼睛;记得住,讨好把这个世界当真的人。
屏幕外考了一张,屏幕里考了一张。还剩最后一个考场,它永远不会有标准答案。
04
比如:音乐。音乐请不出去。一首歌好不好听,宇宙里没有任何一条定律能裁决;这道题的考官永远是人的耳朵。你换不掉。
那在换不掉考官的考场里,「元年」两个字怎么立?
昆仑这场论坛发的第三个模型,AI 音乐 Mureka,给了一个答案:换不掉考官,就对考官交实底。
它的技术材料里有一个数,我很少在发布材料里见到这么不讨喜的数:
让新模型生成一百首歌,请专业评审同口径打分;能听、能用、没跑题,三关全过的,二十八首;这一轮评测里的综合可用率,28%。
这数好看吗?不好看。
你先别替它可惜。想想自己,你用 AI 生过图吗?写过文案吗?十次里,能一个字不改直接拿去用的,有几次?
对,就这感觉;28% 这个数,跟每个用过 AI 的人的手感,是对得上的。
而且你倒过来想:一家公司敢把 28% 印出来,说明它心里有另一本账。
这 28% 是三关全过的成品率,卡「直接能用」的标准;放宽一关,只算「能听」,这个数立刻高出一大截。它不放宽。
因为它清楚,用户手里的体感是藏不住的:你报 90%,用户用三次就戳穿了;你报 28%,用户用三次,反而觉得你没骗他。
而「对得上」这三个字,在今年的发布会季里,比任何一个漂亮数字都稀缺;满场都是 99% 和「遥遥领先」,你有多久没见过一家公司,把自己不到三成的良品率印在发布材料上了?
不止这一个数,同一份材料还认了另一笔账:
为了让歌听起来「更有人味、更少 AI 味」,编曲的丰满度做了让步,这一项在同轮测试里,不是最高。
这个取舍,论坛现场刚好来了个人证。
圆桌上,黄晓明说起自己录新歌的经历:作曲是人写的,唱 demo 的全是 AI。他第一反应是「怎么唱得这么好听,我要是能唱到这个程度就好了」。
结果制作人给他泼了盆冷水:就因为他是 AI,太完美了,好到完全没有呼吸,没有人味。
一个唱了几十年歌的人,被 AI 的「太好」扎了一下;太完美,恰恰是 AI 味的来源;有呼吸、瑕疵,才是人味的来源。
Mureka 把编曲的丰满度让出去,换「更少 AI 味」,赌的就是这个方向。
图释:WAIC昆仑万维世界模型与多模态范式革命论坛专场
你看,短板,自己写出来的,这就是没有标准答案的考场里的考法:给不了物理世界那种铁面的分数,就给一个不掺水的分数。
顺便说一句,黄晓明真用过。
他让Mureka 照着杨宗纬的风格生成了一首抒情歌,他给出的评价是「Mureka确实也不错」,还特意补了一句:词还挺触动人心的。
前两个考场,靠换考官立信,这个考场靠对考官诚实立信;路不同,方向是同一个:让分数重新变得可信。
至于 Mureka 这次发布本身,我认为重点在流水线。
它把 AI 音乐从「生成一首歌」做成了「从一个念头一路做到 MV」。你给一句话,它出歌词、出人声、出角色、出成片。
而且,台下坐着的爱奇艺高级副总裁,是这条流水线的客户;AI 音乐商业化走到哪一步,看谁来支持,谁打的这张牌,这个生态怎么玩就够了。
三个考场,都交卷了。
回头看昆仑这场论坛说的「2026 是世界模型元年」。元年这个词,通常被理解成「这一年,我们做成了什么」。
三张卷子放在一起看,意思恰恰相反:元年,是从这一年起,分数开始算数了。
机器人的 85%,是物理世界给的分;那一分钟的「还在」,是三维坐标给的分;音乐的 28%,是对着人的耳朵报的实底;三个分数,没有一个需要发布会的掌声来撑。
旧卷子上的满分年年有,新卷子上的分数,今年是第一批,至于这批分数到年底能涨到哪?卷子刚发下去,别急着对答案。
你就记住一件事:这一行,开始考真题了。
核心数据参考资料:
[1]黎曼动力Riemann-1.0技术报告、昆仑万维Matrix-3.5及Mureka V9.5/O3发布材料;Google DeepMind Genie系列公开论文、LIBERO与RoboCasa-365基准公开数据、WAIC 2026官方数据
本文来自微信公众号 “王智远”(ID:Z201440),作者:王智远,36氪经授权发布。















