具身智能的下一轮 Scaling,正在从任务模型转向世界模型

时氪分享·2026年08月24日 14:43
武伟谈以物理为中心的具身智能世界模型新范式

在 2026 世界机器人大会上,Manifold AI 流形空间创始人武伟围绕“以物理为中心的世界模型新范式”发表演讲。他认为,具身智能正在进入新的发展阶段:行业竞争的重点不再只是让机器人完成更多单点任务,而是让同一套智能在变化的环境、本体和任务之间迁移。

过去,Scaling 更多被理解为扩大参数规模、增加数据或覆盖任务;在物理世界中,模型还必须理解环境变化、预测动作后果,并把预测转化为行为。世界模型由此成为基础层。

从“完成任务”到“在变化中泛化”

当前的机器人系统仍大量依赖专用模型。在结构化环境里,系统可以完成预设动作;但当物体形态、场景或控制方式发生变化时,往往需要重新采集数据、训练和调试。真正的行业瓶颈,正在从“能否完成一个任务”转向“能否在变化环境中持续泛化”。

在这场演讲中,武伟把问题指向了基础模型层:具身智能缺少的不是更多彼此割裂的任务模型,而是能够学习物理规律、预测环境演化并支持动作规划的世界模型。生成式预训练也因此开始从语言和图像生成,走向时空理解与物理推演,让模型根据当前观测和动作预测未来状态,再生成机器人下一步的行动。

世界模型的合格线,不是“看起来真实”

如果世界模型要成为具身智能的基座,视觉逼真远远不够。一个画面看起来合理,并不代表状态演化符合物理规律。模型还要处理跨视角一致性、三维空间结构、接触关系和动作后果,才能真正服务于机器人训练、策略评估和长流程规划。

据现场分享,Manifold AI 先后在自动驾驶和机器人环境中探索世界模型的物理可控性。DriveScape关注多摄像头视角对齐、长时生成和物理规律注入;RoboScape进一步把世界模型用于合成数据生成和策略评估,探索如何减少机器人对大规模真实数据的依赖。

这条路线也改变了评价方式:视频是否清晰只是第一层指标,更重要的是,合成环境能否训练出有效策略,模型预测能否与真实状态变化一致,以及它能否支持多步交互。世界模型的价值,最终要落到“物理上是否成立、功能上是否有效”。

从世界预测到动作生成,数据闭环成为关键

在架构设计上,WorldScape采用统一的 MoE(Mixture of Experts,混合专家)架构,让共享专家学习共同的世界动力学,同时为移动、手部动作、相机轨迹和机械臂操作保留专门能力,再回到统一的环境建模过程。对于 Physical AI,Scaling 不能只等同于参数变大,模型还要进入实际系统。

在动作生成层面,世界模型回答“接下来会发生什么”,WorldScape Policy进一步回答“接下来应该做什么”。由于让一个模型零样本泛化到所有任务仍然困难,Manifold AI把 In-Context Learning(上下文学习)视为一个中间状态:机器人可以根据语言、目标图像或人类操作视频理解任务,在不重新微调参数的情况下调整行动。

现场展示的柔性 SKU 分拣、毫米级孔位对齐、飞机盒处理和衣物折叠等任务,体现了机器人根据新指令、目标状态或示范视频完成模仿与推理的应用方向。

在这条技术链路中,WorldData沉淀并回流物理世界经验,WorldScape理解和预测环境变化,WorldScape Policy将预测转化为行动,部署数据再回到训练管线。其核心是让一次训练形成的能力,在更多任务、本体和场景中复用。

评测标准也要从视频走向真实功能

随着世界模型开始承担数据生成、策略评估和行动规划,评测体系也必须同步变化。WorldArena把模型放到这些真实功能中检验;WorldArena 2.0进一步探索视觉—触觉联合建模、在线强化训练和真实具身场景。评价重点也从“视频是否真实”扩展到“模型是否理解接触、空间和动作后果”。

武伟也提到,世界模型现阶段仍不能完全替代真实模拟器,sim-to-real差距依然存在,但它已成为连接数据、模型与机器人执行的基础层。具身智能的竞争可能由单点 Demo 转向基础能力复用:同一套模型跨任务、跨本体、跨场景迁移,并通过部署持续积累经验。

+1
6

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

从优势品类到“经营负担”。

59分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业