谷歌和李飞飞之外,世界模型的第三条路线
很多年后回望,在人类迈向AGI的征程中,2026年或将被标注为“世界模型元年”。
近日,在交互式视频世界模型评测基准WBench榜单的核心Navi分榜中,一个“陌生”的名字悄然登顶——HiDream-O1-World。它以平均分80.9的成绩,引发行业关注。这款模型来自智象未来,它的突围,让世界模型这一赛道再次成为焦点。
在海外,世界模型的忠实信徒Yann LeCun,自立门户后创立AMI Labs,仅凭行业号召力和对世界模型的单压,就拿下了超10亿美元的融资。随后,预发布于去年8月的通用世界模型Genie 3掀开神秘面纱,在1月30日向开放Project Genie,用户可以通过文字或图片生成可交互的3D虚拟世界;AI教母李飞飞创立的World Labs,专注于3D世界生成的商业产品Marble上线,公司同步也完成超10亿美元融资,估值超50亿美元。
在国内,4月16日,腾讯和阿里同日亮剑,发布了各自的世界模型产品。腾讯拿出的是开源的混元3D世界模型2.0(HY-World 2.0),阿里端出的是主打实时交互的HappyOyster。一周后,字节正式发布新一代3D生成大模型——Seed3D 2.0。
一时间,世界模型群雄逐鹿各自突围,但也各有局限。
其中,谷歌和李飞飞的World Labs是两大主要技术流派。谷歌专注于实时交互式世界建模,用户只需按下一个键,画面随之而动。但在多模态输入的统一表达和音视频联合生成上尚存挑战;今年6月,李飞飞将世界模型渲染器、模拟器、规划器的路线图的三条路线进行了系统阐述。World Labs的Marble正是模拟器方向的第一步产品,走的是3D空间结构化重建路线——从三维几何出发生成结构精确、可编辑的3D空间,它追求的不是画面多逼真,而是结构的精确与可操作。这一路线在静态场景的结构保真度上优势明显,但在长时序动态生成与物理交互方面,目前仍处于早期探索阶段。
路线有分歧,行业缺共识,却恰恰意味着——没有谁已经锁定了终局,每一家企业都有机会。
8月17日,智象未来正式发布原生全模态交互式世界模型HiDream-O1-World。该模型首次亮相即登顶WBench榜单核心的Navi分榜。值得注意的是,其中物理(Physical)维度73.3分位列第一,一致性(Consistency)维度88.0分,位居前列。这意味着在交互式世界模型领域公认的核心技术挑战——时空一致性与物理一致性上,HiDream-O1-World取得了关键性突破。
在“无界畅游”和“长时交互”上撕开突破口
这意味着,HiDream-O1-World与当前主流的交互式世界模型并驾齐驱。
模型具备漫游、编辑两大核心功能,支持文本、图像、操控等多模态输入。漫游模式下,用户可在第一人称或第三人称视角中自由探索,场景稳定连贯,无漂移、无断层;编辑模式下,用户可对画面进行实时编辑,利用指令实时调度角色动作或环境变化,画面随之响应,且音视频同步生成。更重要的是,模型支持人类、动物、虚构角色等多种主体,覆盖写实城市街景到二次元幻想世界的多元风格,泛化能力极强。
△在线实时编辑模式下模型表现,视频由HiDream-O1-World生成
这些功能让HiDream-O1-World不再只是视频生成器,而是一个用户可进入、可操控的动态世界。
但真正让HiDream-O1-World从一众世界模型中脱颖而出的,是它在两道行业公认的难题上表现出的突破性能力。
第一道题:时空一致性,长时程“空间记忆大师”
交互式世界模型长期面临一个致命短板:视角移动、场景漫游后,物体位置、结构、遮挡关系错乱,画面“越玩越崩”,无法形成持续世界。譬如一个人刚走过去一条挂着壁画的长廊,再转身,壁画可能消失,或者发生形变。这是因为,靠“像素预测”生成画面的模型,每次交互都要重新绘制整幅画面,几何与外观深度耦合,任何微小偏差都会在长序列中被不断放大。
WBench在对20余个交互式模型进行“CT”式扫描后发现,所有模型在连续交互后表现都会变差,导航能力平均分下降了整整33点。位姿误差逐轮累积,是当前迭代式生成范式的结构性缺陷。
HiDream-O1-World的核心突破之一,在于它能够在长时序交互中记住已探索过的场景结构,即便历经多轮视角切换与导航移动,仍能保持物体尺寸、空间位置及遮挡关系的几何一致性,从根本上规避视角漂移与场景“重置”问题。这就让模型第一次具备了真正的空间导航能力。用户在第一人称视角下转头、环顾、仰视、俯察,响应灵敏顺滑,画面稳定无漂移,做到“人走世界不刷新、回头场景不重构”。
第二道题:物理一致性,从“猜像素”到“懂规律”
当前很多模型仍然在拼渲染,拼画面的精致度,但画面再精美,如果出现物体悬浮、穿墙、碰撞反馈失真,用户瞬间“出戏”。这是当前几乎所有视频生成模型的通病——它们拟合的是像素分布,而非物理规律。
WBench评测中,物理维度是所有模型得分最低的维度之一。区别于普通渲染模型,HiDream-O1-World在物理模拟真实感上带来了实质性突破——在评估画面运动是否符合常识物理的视觉合理性评测中,模型相比行业平均提升13.6%;在更具挑战性的因果保真度评测中,通过对流体、碰撞、形变等物理维度的全面衡量,模型同样实现了12.7%的大幅跃升。HiDream-O1-World以73.3分拿下物理维度行业第一,证明模型具备真正的物理归纳偏置,可自主推演重力、碰撞、流体、形变等客观规律。
仅从展示视频来看,HiDream-O1-World同样存在短板。但行业极其头疼的两道题,它率先撕开了一道口子。而能做到这一切,根源在于它选择了一条不同于谷歌和李飞飞World Labs的技术路线。
全新解题思路:把“几何”和“外观”拆开
HiDream-O1-World之所以能在时空一致性与物理一致性上实现突破,根源在于两层设计:原生全模态UiT架构奠定的统一认知框架,以及几何-外观解耦生成的生成范式革新。
传统多模态模型走的是“拼积木”路线——独立文本编码器理解文字、VAE处理图像、扩散模型生成画面,各模块各自为政。HiDream-O1-World搭载的智象自研UiT(Unified Transformer)架构,则将图像像素、文本Token、视频体素及空间关系等信号全部映射进同一个共享Token空间,直接与同一套Transformer交互。这意味着,当用户发出“向左转”“向前走”的指令时,模型是在同一个认知框架中理解指令的空间含义、预测世界状态、生成视觉结果——“理解”与“生成”从底层便不再分家。
如果UiT架构解决了“用什么框架理解世界”,那么融入几何-外观解耦的生成范式,则解决了“如何生成3D一致的世界”。当前主流的3D交互生成模型,大多依赖隐式的时空表征来推断场景结构。模型拿到一张图像或者一条指令和相机轨迹后,拟合像素分布,直接“一步到位”生成视频。这种与几何无关的建模方式,一方面在较大视角变化下极易出现几何结构不合理、物体形变、跨视角空间不一致等问题,另一方面直接拟合像素分布,不理解物理规律,一旦遇到训练数据中没见过的物理场景,模型就露馅了。
HiDream-O1-World的解决方案是,与其让模型隐式地“猜”完所有空间推理,不如把“几何结构生成”和“外观渲染”拆成两个独立的阶段,即“几何-外观解耦”的两阶段框架。
•第一阶段——先完成几何生成:HiDream-O1-World先预训练了一个 3D 基础模型,用户在输入指令后,3D基础模型先提取多尺度几何特征,并通过一个轻量级的投影模块将其压缩到适合视频扩散模型使用的表示空间。随后,这些几何特征将被作为显式结构条件,用于指导后续的视频生成。
•第二阶段:视频扩散模型生成: 以第一阶段生成的几何表示作为结构条件,在VAE潜空间中进行条件去噪,并最终解码为视频帧。
△HiDream-O1-World将3D基础模型强大的空间结构先验信息与视频扩散模型的高保真生成能力相结合,从而实现3D一致性世界建模
这个设计的核心是几何-外观输出解耦。几何阶段主要关注结构完整、交叉视图一致性、相机轨迹的遵循。外观阶段则主要关注纹理、视觉细节、写实渲染,无需同时承担结构推理的重担。
HiDream-O1-World将3D基础模型的空间结构先验引入生成过程,搭配在推理阶段针对未知场景动态适配几何约束的能力(Test-Time Training 推理在线自适应),一方面实现了模型在长时序交互中始终保持3D几何一致性,另一方面,正是几何结构的约束,为物理一致性提供了底层支撑——一个在3D空间中有明确位置、有体积、有遮挡关系的物体,它的运动天然要遵循重力、碰撞等物理规律,他告诉模型世界是有几何约束的,物体不能凭空出现、不能相互穿透、不能违背空间逻辑。
全新的几何-外观解耦生成范式,让模型在生成新视角时先“想清楚”三维结构再“画出”画面,从根本上解决了传统“一步到位”式生成的结构性缺陷。这套组合拳,正是它区别于谷歌“渲染器”和李飞飞的第三条路线的技术底色。
据悉,HiDream-O1-World解决聚焦空间一致性研究的论文,已正式入选了全球计算机视觉与人工智能领域三大顶级学术会议之一的欧洲计算机视觉国际会议(
通往AGI之路
《中国"世界模型"创业公司研究报告》显示,仅截至2026年6月底,国内以世界模型为核心标签的创业公司就超过30家,涵盖6条技术路线。如果把大厂和海外玩家也算上,这个数字可能还要翻倍。
世界模型的方兴未艾,一方面是大语言模型受制于scaling law的约束,面临着数据枯竭与边际收益递减的难题。但核心推动力,则是世界模型背后广阔的应用空间——世界模型正在重新标注"创造"的门槛。在内容与交互领域,它可以让普通用户一键生成可自由探索的3D世界,让游戏开发者跳过传统3D引擎的繁重流水线,让影视创作者用文字和图像直接"拍摄"复杂场景,让虚拟现实不再依赖人工建模。从互动影游到具身智能仿真,从3D场景生产到微观世界推演,每一个需要"构建一个世界"的场景,都可能被它重写一遍。
路线分歧,不是内耗的起点,而是探索的开始。每一位玩家都带着自己的技术信仰上路。
当游戏规则尚未写定,真正的机会恰恰在于:先行者的脚印,往往就是未来的蓝图。
世界模型的终局远未到来。而通往AGI的竞赛,才刚刚拉开帷幕。















