刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位
前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了——
就在刚刚,全球首个多模态世界模型 Atlas 正式登场!
官方博客🔗 https://www.worldlabs.ai/blog/atlas
按照官方定义,Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。
先来看最直观的炸场操作:
Camera Controlled Generation(相机控制生成)。
以前大家玩视频生成模型,多少有点玄学抽奖。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天保佑。
对比之下,Atlas 的做法是:直接把「相机位姿参数」当作底层原生输入。
你要什么角度、什么轨迹、走多快?
直接给坐标!
只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成最长达 1 分钟、1440p 分辨率 的大片。
画面不崩,空间几何丝滑一致,堪称外挂级运镜。
更夸张的是它的空间「脑补力」。
输入一张只拍到机器人正面的照片?Atlas 能把人家背影完完整整脑补出来;
给一张泳池边角照?它靠着脑子里的「世界常识」,默默帮你把隔壁没拍到的草坪和远山给修好了。
从官方放出的 Demo 来看,Atlas 在镜头运动和空间一致性上确实比普通视频生成模型更进一大步。
不过,镜头一旦进入原图没有拍到的区域,Atlas 实际上仍然需要依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露出来。
换句话说,它生成的更像是一个视觉上合理的三维世界,未必就是原来那个世界的精确数字复刻。
而种种操作的背后,也绕不开一个名为 Spatial Context(空间上下文)的行业术语。
大语言模型看上文接下文,Atlas 则是给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。
说得更直白一点,Atlas 很多能力的底层,其实都绕不开 多视角合成 。
它会把来自不同角度、不同机位的图片和视频,一起塞进同一个三维空间里,先判断它们彼此之间的相对位置,再补足没拍到的区域,继续生成新的视角。
单张图输入时,它更多依赖模型先验去「脑补」世界;输入视角一旦变多,它就更像是在做一次带空间约束的多视角融合,把零散画面慢慢拼成一个连续、可漫游的三维场景。
甚至你随便抓两张八竿子打不着的照片往空间里一扔,Atlas 都能强行给你脑补出走廊、大门和房间,把俩场景无缝焊在一起。
导演系同学看到这里,战术沉默,缓缓打出一个问号:合着以后运镜不用实拍,直接在电脑里「云开机」就完事了?
除此之外,Atlas 还有第二张王牌:Spatial Reconstruction(空间重建)。
传统的 3D 高斯泼溅(3D GS)或者点云扫描,得扛着专业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。
但 Atlas 再次露出神秘的微笑:一边去,哪来这么多的规矩。
官方直接甩出了一个斯坦福大学 Main Quad 案例,只需把 2 到 25 张游客视角的地面平拍照片塞进去,就能轻松还原草坪、拱廊以及纪念教堂外墙的全部细节。
镜头随后直接拔地而起,来了一段上帝视角航拍的漫游。
在 DTU、ETH3D、ScanNet 等一堆公开数据集上,专门测稀疏视角重建误差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分数(分数越低越好)。
对比之下,Pi3X 是 28.7,Depth Anything 3 飙到 39.3,MapAnything 更是高达 47.7。
而且输出直接对接点云和 3D Gaussian Splatting,能无缝接进 World Labs 自家的 Marble 平台,高帧率即时渲染。
更绝的还有「子弹时间」式的 Reframing Video。
不用好莱坞几百台相机的环形阵列,研究员拿三五个普通手机、运动相机随手一架,塞进背包带走;
拍一段日常打闹,Atlas 就能在虚拟空间里随意切换视角,原地复刻《黑客帝国》。
当然,李飞飞和她旗下的公司 World Labs 折腾这一大出,终极目标肯定不是为了跟好莱坞抢特效饭碗。她的星辰大海,是这代 AI 最大的痛点:
具身智能与机器人。
现在搞机器人训练的朋友都知道,具身智能的最大痛点其实就是「虚拟训练场不够用」。
让机器人真的去工厂、仓库和家庭里反复试错,数据采集速度慢,成本也高;换到仿真环境里训练,又得先花大量人力搭建 3D 场景、材质、光照和物体。
业内甚至有一种估算,如果完全依靠传统方式收集足够规模的机器人训练数据,最终成本可能达到 100 万亿美元的量级。
Atlas 给出的 Real to Sim 路线,相当于直接省掉了中间大量人工搭建仿真世界的工作。
拿手机拍两段 24 帧的工厂或房间视频,喂给模型;Atlas 原地吐出一个高精度的 3D 物理空间,机器人就可以钻进这个孪生空间里疯狂「跑图」试错。
甚至机器人走到哪,Atlas 就当场渲染出机载摄像头应该看到的 RGB 图和深度图。
机械臂碰一下刚性箱子、拉一下铰链柜门、捏一下软体海绵,Atlas 统统能模拟出受力反馈。
只要录一段真实现场,就能衍生出千万种光照、摆放和障碍物条件。
技术底座上,World Labs 这次掏出了一套极其硬核的组合拳:
Multimodal Autoregressive Diffusion Transformer, 多模态自回归扩散 Transformer 。
拆开来看,它兼采了当前两大主流范式的长处:
Multimodal:原生融通文本、二维图像、相机位姿与 3D 深度;
Autoregressive(自回归):像语言模型预测下一个词一样,在时空序列中逐级预测新的空间状态;
Diffusion(扩散机制):基于 Rectified Flow 逐步去噪,确保连续高维信号的画质与几何精度;
Transformer:以最成熟的矩阵乘法结构为底座,无缝适配现有大规模算力集群。
这套架构让 Atlas 能够同时享受到 LLM 领域的 KV Cache、分布式推理优化,以及扩散模型的采样蒸馏与先验引导。
在针对镜头运动控制的真人 Blind Test(盲测)里,战况简直是一场单方面的骑脸输出:
面对
除了世界生成和空间重建,Atlas 还顺带具备了不错的图像生成能力。虽然这不是它的主攻方向,但复杂 Prompt、文字渲染,以及写实、电影感、油画、漫画等多种风格,它都能处理。
更有意思的是,Atlas 还能直接根据文字或图片生成 360° 全景图。相比普通文生图只要保证一个固定画面成立,360° 场景还要处理前后左右的空间连续性,对模型的空间理解要求更高。
值得一提的是,除了性能,World Labs 在 Atlas 身上强调的另一个关键词是 Scaling。
官方博客提到,随着参数量和计算力成倍上翻,模型展现出了类似大语言模型那种「突然开窍」的涌现能力。
暴力 Scaling 依然是版本答案。
目前 Atlas 已经向部分合作伙伴开放 Early Access,并将在未来成为 Marble 和 World Labs 其他产品的底层模型。
回过头看,从二十年前奠基计算机视觉的 ImageNet,到斯坦福实验室十年来深耕「视觉+机器人学习」,再到创办 World Labs,李飞飞本质上是死磕同一条轨道。
ImageNet 解决的是「让机器在像素中识别世界」,而她越来越关心的,是一个更难的问题:机器看见一张图之后,究竟有没有理解背后的三维空间,以及下一秒会发生什么?
李飞飞曾把今天的大语言模型形容为「黑暗里的文字高手」,能谈论现实,却缺少真正生活在现实中的经验。
一个模型可以解释杯子为什么会从桌上掉下来,但机器人真要伸手拿杯子,还得知道杯子离桌边多远、手从哪个方向过去,以及碰到它以后整个场景会发生什么变化。
Atlas 所代表的空间智能,某种程度上就是给已经十分发达的语言智能继续加上一层关于几何、物理、时间和行动的世界经验。
LLM 把互联网里的知识交给了机器,世界模型接下来争夺的,则可能是机器从数字世界走向现实世界的那张最真实的入场券。
本文来自微信公众号“APPSO”,作者:发现明日产品的,36氪经授权发布。















