刚刚,能预测多智能体交互的世界模型来了
世界模型我见过不少,但把输入、动作、预测这条链路展示得这么明明白白的,还真·头一次见。
刚刚,Scalabot发布首个世界模型HERON-World Model。
只消给它一张当前画面,再告诉它接下来要执行什么动作,就能直接看到,机器人把这个动作做下去,接下来会发生什么。
而且更有意思的是,它还不只会预测单个智能体。
当多个智能体同时参与时,HERON也能预测彼此动作的配合与影响,以及这些动作共同作用后,世界会发生怎样的变化。是不是很神奇?
没完!还不只是Demo看起来像那么回事。
据Scalabot团队透露,HERON-World Model采用WorldArena 1.0 Track 1的开源测试方案进行离线评估,目前综合得分(EWMScore_P)达到75.80分。
这是怎么做到的?
让机器人在动手前,先预演动作后果
在快进到怎么做的之前,咱们先看看这次的Demo,展示了HERON-World Model的哪些能力。
整体来看,大致可以归成三类:物理规律、状态记忆,以及多智能体交互。
最直观的是物理规律。比如丢网球时,HERON-World Model能够根据动作预测小球飞出、下落、碰撞和反弹的过程。
第二类,是状态记忆与时序一致性。给杯子盖盖子时,模型要记住哪些杯子已经盖好、各自处在什么位置;
画画时,它不仅记住了此前落笔的位置和已有画面,更理解动作会带来什么后果:笔尖划过哪里,哪里就留下颜色,后续预测也会遵循此前发生的因果关系,保证状态演化一致。
面对当前画面里没有直接出现的信息,HERON-World Model还能结合动作进行补全。
比如输入一张关闭的冰箱照片,再给出“打开冰箱”的动作,模型便会继续预测门后的内部空间。
第三类,就是HERON-World Model这次的亮点之一:世界模型预测多智能体交互。
相比大多数聚焦单一智能体“动作—状态变化”的世界模型,HERON-World Model进一步把预测范围扩展到了多个智能体共同参与的场景。
也就是说,模型不只要判断“一个机器人做出动作后,世界会怎么变”,还要同时考虑多个智能体彼此配合或干扰,以及他们与环境共同作用后,会把世界推向什么状态。
而这件事的难点也在这里:一旦从单智能体进入多人协作场景,变量会明显增多。模型既要处理人物与物体之间的交互,还要理解不同智能体的动作叠加之后,会共同触发怎样的物理结果。
比如两个人同时拉动毛巾控制小球运动时,模型需要同时保持人物动作、毛巾形变与小球滚动之间的关系合理。
再比如两个人一起编花绳,双方动作会持续改变绳子的形态,模型也需要让后续的花绳变化与两人的动作保持一致。
最后,在Demo之外,对应到WorldArena分项成绩上,模型在物理交互、空间透视、运动动态、轨迹准确性四项中分别取得95.60、99.20、92.61和56.66分,分别验证了模型在物理关系、空间一致性、运动变化和轨迹预测等不同维度上的表现。
而这些能力,恰恰构成了世界模型“预测未来”的基础。
那么,机器人的具身大脑为什么需要世界模型预测未来的能力?
原因其实很简单。当机器人真正进入工厂、家庭等真实生产力场景时,它不仅要知道“下一步该做什么”,还要能够预判“这样做会带来什么后果”。
世界模型的视频生成能力,恰好把这种预测直观地展开成一段连续的未
机器人可以在真正执行动作之前,先在模型中“预演”可能的结果,再据此选择更合理的行动。
不过,想要让世界模型的预测真正有用,模型仍需从高质量数据中,学习丰富的动作与结果对应关系。
HERON-World Model给出的路径,是先通过多源数据,让模型见过足够丰富的世界;再把不同来源的动作转化为同一种“语言”,让这些经验能够共同参与训练;最后通过MoT+MoE架构,提升模型推演未来的能力。
数据金字塔:让模型获得丰富的交互经验
传统的具身“数据金字塔”里,互联网和人类视频打底,仿真数据居中,真机数据位于塔尖。越往上,数据越贴近真实执行,但也越难规模化。
今年,随着Ego第一视角人类操作视频受到重视,其易于Scaling、又包含丰富交互信息的特点,也让不少路线开始把它作为金字塔的底座。
HERON-World Model这次的预训练,就采用了Ego人类操作视频、真实场景重建的仿真数据和真机数据三类来源。
其中,真机数据承担了“真实执行锚点”的角色。
它同时记录机器人的视觉观测、动作、本体状态和控制命令,让模型直接学习一组关键关系:机器人做了什么,真实世界又如何变化。
据悉,HERON-World Model的数据覆盖单臂、双臂、轮臂和人形等多种构型,让模型接触不同“身体”下的运动与交互方式。
相比其他数据类型,真机数据能够完整记录机器人看到了什么、执行了什么动作,以及动作发生前后的本体状态和环境变化。
但真机数据也有一个非常现实的问题:贵、难scaling,且很难覆盖长尾。
说白了这就跟以前的自动驾驶差不多。有些场景本身就很少出现,有些动作采集成本很高,还有一些失败轨迹甚至存在设备损坏和安全风险。
因此,HERON-World Model引入了仿真数据,补充稀有状态、危险交互、失败轨迹和特定场景组合,让模型在真机提供的可靠参照之外,进一步拓展“执行—后果”的经验。
最后,Ego数据进一步拓宽了日常交互的覆盖,用来补充真机和仿真难以覆盖的日常交互经验,例如工具使用、双手协作和家庭物体操作。
至此,上面三类数据就构成了HERON-World Model的预训练数据金字塔:
真机提供真实行动经验,仿真扩展特殊情况,人类视频拓宽交互覆盖。
异构数据统一
有了真机、仿真和Ego三类数据,接下来的问题就是:
怎么把它们整理成同一个模型能够理解的形式?
毕竟,机器人可以直接记录关节角和控制指令,人类视频里却只有画面。
此外,即便数据里都有动作记录,不同设备的时间频率、空间坐标和身体结构也不一样。
针对这一问题,HERON-World Model首先从不同来源的数据中恢复出可用的动作信息。
对于真机和仿真数据,可以从已有记录中提取动作与状态;
对于Ego视频,则需要先清洗片段,再估计三维手部姿态、恢复相机轨迹,经过轨迹验证与质量过滤,提取出相机运动、手部运动和抓取状态。
这样,人类视频也有了可供训练的动作线索,而这些估计得到的“伪标签”,也可以作为弱监督信号参与训练。
接下来,HERON-World Model又进一步让动作在时间和空间上对齐。
在时间上,HERON-World Model以视频帧时间戳为基准,把动作、状态和画面同步起来。
在空间上,则将不同来源的关节轨迹转换成末端执行器位姿,再通过标定和坐标变换,把运动统一到可比较的参照系中。
经过这一步,上面三类数据中的动作就被统一整理为自身运动、操作端运动和抓取状态。
其中,运动不再依赖某一个机器人具体的关节定义,而是以视频片段首帧为起点,描述后续时刻在统一的动作空间中对于起点发生了怎样的变化。
不过,光是不同数据的表征方式统一了,但本体的差异依旧还在,双臂、双手和不同夹爪的动作,仍然难以完全靠规则统一。
为此,HERON-World Model为不同数据域配置轻量动作编码器,把这些动作进一步映射成固定维度的Action Token,再交给共享网络学习动作与后续视觉变化之间的关系。
最后,针对遮挡、视野丢失等现实情况,HERON-World Model还会通过掩码和置信度控制,避免把“看不到动作”误判为“没有动作”,从而保留仍有价值的视频样本。
综上,经过动作提取、时空对齐和统一编码,三类数据最终进入同一套训练流程,让模型学习同一件事:
做出一个动作之后,世界会怎样变化。
MoT+MoE,多专家合理分工
最后,为了让世界模型能够吃下不断scaling的数据,在架构上,HERON-World Model采用了MoT+MoE的组合设计。
其中,MoT要解决的核心问题是:让模型学会预测动作后果的同时,尽量保留VLM原有的理解能力,也就是所谓的知识隔离(knowledge isolation)。
之所以需要这么做,是因为VLM在大规模预训练中,已经积累了丰富的通用世界知识。
比如,机械臂受到关节约束、刚体不会无缘无故发生形变,这些先验本身就能帮助模型判断未来状态是否合理。
但在后续世界模型训练中,大量围绕具体操作的数据又可能让模型不断适应新任务,同时逐渐干扰甚至覆盖原有知识。
因此,HERON-World Model通过MoT将VLM与生成分支的参数进行分离,并配合单向注意力机制:让生成分支能够读取VLM已有的世界知识,同时尽量避免生成训练反过来影响这些知识。
这样一来,HERON-World Model既能利用VLM已有的理解能力来约束未来状态预测,又能减少训练过程中出现的知识遗忘。
而MoE解决的,则是另一类随着数据规模扩大越来越明显的问题:不同动作,需要建模的运动规律并不一样。
比如机器人整体移动时,更重要的是全局运动和场景结构;而到了抓取、碰撞和接触的瞬间,则更依赖局部几何与精细交互。
到了多智能体场景,这种复杂度还会进一步上升。模型不仅要处理单个智能体与环境的交互,还要同时建模多个智能体动作叠加后产生的配合、冲突,以及共同触发的物理变化。
如果全部交给同一套参数处理,随着动作类型越来越多,不同模式之间也更容易产生参数竞争。
HERON-World Model因此将DiT生成过程进一步拆成高、低噪声两个专家:高噪声专家先确定未来的大体结构和粗粒度运动。低噪声专家再补充局部几何、视觉细节和精细交互。
简单来说,MoT解决的是“知识怎么协作”,MoE解决的是“生成怎么分工”。
据Scalabot团队介绍,这套混合专家设计,也是在为后续Scaling留出空间:通过专家分工,缓解数据规模扩大、动作与交互形式更加复杂时的参数竞争,支持更稳定的训练与生成。
回看HERON-World Model的技术路线,数据、处理流程与架构由此连在了一起:多源数据提供交互经验,异构动作统一让模型学习这些经验,MoT+MoE则承接未
对于动作条件世界模型,见过多少世界,最终还要落到能否更准确地预测:当机器人采取一个动作,接下来会发生什么。HERON-World Model此次发布的,正是围绕这一问题搭建的一套方案。
本文来自微信公众号 “量子位”(ID:QbitAI),作者:henry,36氪经授权发布。















