36氪首发|上科大团队做具身世界模型基础设施,完成千万美元种子轮融资
作者 | 乔钰杰
编辑 | 袁斯来
本文约3200字,建议阅读7分钟
硬氪获悉,具身智能基础设施公司「瞬适科技」(InstAdapt)近日完成千万美元种子轮融资,由协创智慧、云晖资本、浦东创投和吴越天使等机构联合投资,芯湃资本担任融资顾问。本轮资金将主要用于物理AI数据基础设施建设、具身世界模型研发以及核心团队扩充。
瞬适科技由上海科技大学团队孵化,定位于物理AI(Physical AI)时代的具身世界模型基础设施(Embodied World Model Infrastructure)。公司希望解决具身智能产业长期存在的一个核心瓶颈:当机器人面对新的环境、新的任务甚至新的本体时,如何不再从头采数据、从头训练,而是快速获得所需经验,并在部署过程中持续学习。
公司创始人石野博士现任上海科技大学信息科学与技术学院助理教授、博士生导师,也是YesAI Lab可信与通用智能实验室负责人,长期研究扩散模型、生成式强化学习和具身智能。
本体快速增长后,机器人缺的,不只是又一个VLA或者WAM,而是一套能够持续生产经验、支持快速适配与持续改进的系统。进一步走向:谁能够更快地把一个新的真实任务,转化为机器人可以学习的世界和经验。单模型只决定即时动作,经验体系能将有限真实数据转化为可用训练经验,支撑机器人跨任务、场景、本体迁移与部署后持续学习。
近期World Labs收购机器人仿真公司SceniX,也体现了未来世界模型和机器人仿真融合的趋势。“SceniX更像是从simulation向world model扩展,而World Labs则是从world model向robotic simulation延伸。瞬适科技从成立之初,就是希望站在这两条路线的交叉点上,构建世界模型底层基础设施。”石野表示。
瞬适科技围绕物理AI落地和机器人世界模型研发,搭建了一套四层物理AI基础设施。
第一层是机器人数据获取和治理。相比普通第一视角数据采集,瞬适更关注机器人与环境之间真实发生的三维交互关系,尤其是手部操作过程中的空间关系、物体状态和接触变化。公司通过第一视角人类视频、机器人交互数据、三维重建与手—物关系建模,将真实环境中的物体、空间、动作和接触关系快速转化为Robot-ready(机器人可用)数据。
石野向硬氪介绍,当前很多机器人数据虽然包含人体或者机器人的三维信息,但物体本身仍停留在二维层面。这类数据用于训练时,模型可能认为机器人完成了抓取,但在真实三维空间中,物体实际上并没有被正确抓住。瞬适建立了一套从第一视角视频切分、三维空间重建,到手和物体交互关系建模的数据生产流程,目标是把新的真实问题快速转化为机器人可学习、可复用的经验。
第二层是3D物理资产生成与场景重建。通过照片、视频等输入,瞬适将新的真实环境快速重建为可训练、可交互、可编辑的三维任务环境,并进一步引入物理属性和接触关系,形成能够直接服务机器人训练的3D物理资产。一段真实经验可以通过改变物体位置、场景条件和任务参数,扩展为大量可控制的训练场景。由此形成“真实数据 → Robot-ready数据 → 3D物理资产 → 仿真训练 → 后训练 → 真机部署”的Real-to-Sim-to-Real管线。这些可重放、可编辑的3D物理环境不仅用于训练机器人,也为失败复现、反事实实验和后续递归自我改进提供经验生成基础。
(图源/企业)
第三层是统一世界动作模型与机器人策略训练。瞬适探索统一的多模态世界动作模型:同一个模型既生成机器人动作,也预测动作执行后的视觉、状态与接触变化,不仅回答“现在应该做什么”,还需要推演“做了之后会发生什么”,并用对未来结果的预测反过来约束动作生成。
在动作生成方面,团队围绕扩散世界动作模型开展研究,强调轨迹连续性、状态转移可靠性和生成过程的可控性;在接触理解方面,瞬适进一步引入视觉与触觉信息,使模型能够理解抓取稳定性、滑移、卡滞、插接不到位等视觉难以单独判断的状态。对未来后果的预测不仅帮助生成动作,也能够用于诊断失败原因、评估不同动作的反事实结果,并决定下一轮应该生成和学习哪些经验。
第四层是生成式强化学习与世界模型驱动的具身递归自我改进(RSI)。通过“仿真推演→缺口识别→经验生成→策略训练→真机验证→机制更新”闭环,将经验转化为能力,实现低成本适配,并利用各类案例持续发现缺口、更新策略,每轮学习同步优化模型与评价机制,提升新场景下的自适应效率。
(图源/企业)
目前,瞬适科技已经搭建起覆盖数据生产、物理资产生成、模型训练到机器人部署的一整套技术管线,并完成灵巧手操作、精细化任务等场景验证。公司相关技术方案受邀在NVIDIA GTC 2026上进行分享,是现场唯一一家与英伟达联合展示物理AI基础设施方向技术进展的企业。
本轮融资完成后,瞬适科技将继续推进物理AI基础设施建设,重点投入机器人高质量数据体系、世界模型研发以及面向实际场景的商业化落地。
创始人交流节选:
硬氪:公司做视触觉融合的差异化体现在哪里?
石野:触觉真正有价值的时刻,是机器人已经与物体发生接触之后。我们不是用触觉替代视觉,而是把触觉作为关键的补充模态,用来增强对接触状态和交互过程的理解。传统触觉数据多在特定物体上布置传感器,记录预设状态下的信号;而机器人真正需要的是连续操作过程中的三维交互信息。
我们构建了一套三维手—物交互数据体系,记录手部、物体及接触过程中的完整状态,既包含三维空间信息,也包含触觉交互信息,目标是让触觉从孤立传感信号转化为与视觉、动作和三维几何对齐的训练数据,并映射到不同形态的机器人系统。初步验证中,在部分接触丰富的操作任务中引入触觉—视觉世界模型后,成功率提升30%以上。
更重要的是,触觉反馈不仅提高当前任务成功率,也能帮助系统判断机器人为什么失败——是否发生滑移、卡滞或接触不到位。对于新物体、新装配任务或新操作环境,这些信息显著提高了失败诊断和下一轮训练的针对性,加快任务适配。
硬氪:为什么瞬适把“统一世界动作模型+生成式强化学习”看作具身递归自我改进的基础?
石野:统一世界动作模型既生成机器人动作,也推演动作执行后的未来状态。生成式强化学习则把任务奖励、失败案例、仿真经验和真机反馈转化为策略更新信号,使机器人不只是复现已有数据,还能够在交互中继续学习。
但真正的递归自我改进,不只是把同一个策略反复训练,系统还需根据每轮执行结果持续改善世界模型、奖励评价和任务生成机制。例如,世界模型在某类接触状态上预测误差较大,系统就生成更多相关仿真场景;机器人在真机中反复出现某类失败,系统就围绕该能力缺口生成反事实任务;新策略经仿真评估和真机验证后,又产生更高质量经验用于下一轮训练。这套机制先解决机器人如何更快适应新任务,进一步才是长期部署中如何持续进化。我们希望建立受任务目标、安全约束和真实反馈控制的RSI机制,让机器人每完成一轮学习,不仅任务能力更强,下次面对新任务时,发现问题、生成经验和完成适配的效率也随之提高。
硬氪:相比其他做世界模型、机器人数据或仿真后训练基础设施的公司,瞬适最大的差异是什么?
石野:我们不把数据、仿真、模型训练和部署拆成独立产品。瞬适构建的不是单点模型,而是一条从真实数据、3D物理资产、仿真经验、统一世界动作模型、生成式强化学习,到真机部署与反馈回流的持续学习闭环。
我们的出发点一直很明确:世界模型不会只是外挂在策略之外的“仿真器”,更可能的形态是世界模型与动作策略逐渐统一,同一个模型既回答“现在应该怎么做”,也推演“做了之后会发生什么”,再用对未来后果的预测反过来约束动作生成。在此基础上,新环境和新任务被快速转化为Robot-ready数据与3D物理资产,在仿真中扩展为大规模可控交互经验,再通过云端微调和生成式强化学习持续后训练,最终融合世界模型、仿真经验与少量真机数据,适配到具体本体和场景。闭环持续运行,每一轮真机反馈让下一轮仿真更有针对性,每一轮模型更新缩短下次适配所需时间和真实数据量。最终目标是:让机器人面对新环境新任务时快速学会,进入真实部署后持续进化,且下一次适应更快。















