10亿美元对赌引发具身智能重估,物理世界对纯数字叙事的"反向定价"
与大语言模型可以直接采集互联网公开语料不同,具身智能的训练数据无法凭空生成。这种对真实物理数据的饥渴,引发了各路玩家的激烈争夺。
就在短短几天之内,这场争夺战中上演了一场极具戏剧性的路线博弈:一家头部机器人公司宣布要砸下10亿美元“买数据”,而另一家大模型巨头则发布了一纸规范,试图让AI通过标准接口直接“看懂”并操控任何硬件。
8月25日,知名机器人公司Figure宣布其数据平台Index结束隐身,面向全球开放。
玩法简单粗暴,任何人只要戴上第一人称录制设备,就能把叠衣服、做饭、理货等日常动作变成按条计酬的“数据上传”。官方披露的数据显示,该平台目前已覆盖108个国家和地区,累计收进超1600万条片段,向创作者支付了1500万美元。Figure更承诺,未来12个月要在数据与算力上狂砸超过10亿美元,只为喂养其自研的VLA(视觉-语言-动作)模型Helix。
8月27日,Anthropic发布了模型硬件标准(MHS)的研究预览版。
这是一套供AI智能体安全操作物理设备的共享规范,首批开放给科研实验室与先进制造商。设备接入后,会自动生成一份机器可读的参考文件,清晰界定它能测量什么、能调整什么、以及强制执行哪些安全限制。借此,智能体能够直接发现并操作一台它从未见过的设备,将过去以“周、月”计的硬件集成成本,瞬间压缩到以“小时、分钟”计。
两家企业都在试图破解同一个终极问题:智能,究竟该以何种路径进入物理世界?
Figure选择了一条“重资产”的经验路线,把人类动作成规模地买进来,灌进固定的机器人本体。
而Anthropic则选择了一条“轻资产”的协议路线,让任何具备可编程接口的硬件临时成为智能的身体。
这两件事单看都极具颠覆性,但合在一起,却构成了一场对赌,它们正在从底层瓦解彼此巨额投入的商业逻辑。
他们逻辑上的矛盾在于,如果AI真的能通过标准API接口“无师自通”地操控陌生设备,那么Figure花10亿美元买来的海量人类示范数据,可能就会变成废料。
反之,如果物理世界的复杂操作必须依赖真实人类经验的密集喂养,那么Anthropic那纸脱离了物理接触的API规范,就只是停留在实验室里的玩具。
这场对赌引出了本文试图回答的核心命题:当数据采集的无序扩张开始摧毁数据和“经验”的定价权,具身智能产业链上,究竟还剩哪些环节能够建立起长期的商业护城河?
我的底层判断是:数据和经验越采越便宜,而结果的“判决”越来越值钱。
供给侧的三重挤压
Figure用1500万美元买下1600万条数据,单条均价被打穿到1美元以下。
前不久的论文《HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining》,把两类核心数据源的账算得明明白白。一方面,自我视角的人类视频可及规模在“百万小时”量级,采集成本极低;另一方面,公开的真机遥操数据只有“万小时”量级,标签固然精确,但场景受限且昂贵。
这就引出了第一重挤压。
其背后的商业逻辑在于,基于自我视角视频的预训练,展现出了清晰的“规模收益”(Scaling Law);而昂贵的真机数据预训练,反而过早地触及了能力天花板。
这也解释了Figure为何敢把10亿美元重注,砸向1美元一条的廉价数据。因为最便宜的底层数据,恰恰是规模收益尚未见顶的富矿。
第二重挤压,来自世界模型。
今年,世界模型在4条技术路线上尝试突破。无论是JEPA在潜在空间做推理、Genie 3实时生成可交互环境、Marble死磕三维空间一致性,还是DreamZero将感知、预测、行动融为一体。这些路线虽有分歧,但指向的商业终局却完全一致,把视频类数据的生产成本,强行压缩到边际算力的价格。
在商业语境下,“无限数据”意味着供给曲线走平。当一类数据能够被AI批量生成时,它的市场定价就会不可逆地向电费和显卡折旧费收敛。
第三重挤压,来自标准接口的降维打击。
在Anthropic公布的官方演示中,智能体已经能自行调节激光设备,通过相机观察光斑位移来确认因果关系,最后把摸清的操作流程固化成脚本,实现一键复跑。只要给它一份机器可读的参考文件,它就能直接上手一台从未见过的仪器。这意味着,Anthropic划定了一条残酷的边界:在实验室与先进制造等低物理接触、且能用说明书穷尽描述的场景里,一整类硬件的“人类示范数据”需求,可能就此直接归零。
当众包、生成与接口这三股力量同时向内挤压,重新审视整个行业的最佳视角,莫过于那座经典的“机器人数据金字塔”。
按照这张图,具身数据自下而上被分为三大阵营:
最底部的基座是“人类数据”,包含海量互联网视频、自我视角视频、增强型自我视角以及手持设备采集数据。
中段是“合成数据”,即仿真模拟数据。
最顶尖的则是“机器人原生数据”,包含遥操数据和最终的真实部署。
过去,人们习惯把这座金字塔看作“能力坐标”:越往上走,数据越接近机器人可直接执行的形态,获取难度和稀缺性也呈指数级上升。但现在,在供给侧的三重挤压下,金字塔的内在逻辑变了。稀缺梯度,直接等同于价格梯度。
塔基庞大的“人类世界数据”,正被Figure这样的全球众包模式转换为廉价的“大宗商品”;中段的“仿真合成数据”,正被世界模型按电费计价;真正能守住高昂定价的,只剩下金字塔最顶尖的“机器原生数据”(遥操与真实部署)。
大模型对物理世界即将“全面登陆”
MHS最重要的战略意义,其实早已超越了Anthropic本身,它为所有受困于物理边界的大模型公司指明了一条新路。
不妨把两张“具身智能入场券”摆在桌面上做个对比。走传统的“经验路线”,门票是每年10亿美元量级的资本开支、一条重资产的自有本体产线,外加一支庞大的数据运营团队;而走“接口路线”,门票仅仅是一纸规范文本,以及一批硬件生态伙伴。
环顾四周,绝大多数头部模型公司的处境极其相似:手里握着强大的“大脑”,名下却没有一台能量产的“真身”。
一旦“接口路线”跑通,大模型公司“批量登陆”物理世界,将从一种可能性变为默认选项。
支撑这一判断的,是MHS协议的三个核心属性:适配任何具备可编程接口的设备、与底层模型完全解耦,以及承诺开源。
这一幕何其眼熟。
两年前,MCP(Model Context Protocol)开源,迅速成为智能体接入数字世界工具的通用基础设施。
如今,“互通性下移、商业价值上移”的戏码即将在物理世界重演。
标准协议本身不收费,真正的商业收敛将发生在标准之上的“调用层”。未来,设备只有实现了标准协议,才对智能体“可见”;而这种“机器可见性”,正在成为物理世界新一代的准入许可。
实战数据的对比更为直观。
根据Anthropic披露,在量子设备校准场景中,QuEra的四人专家团队耗费数月手写的激光锁定恢复脚本,成功率仅为58%,单次耗时约150秒;而通过MHS接入的智能体,仅凭一整夜的自我迭代,产出的确定性脚本在700次盲测中成功率飙升至99.3%。即便是面对最棘手的扰动,耗时也被强行压缩到了十几秒。
如果将这一逻辑再往深推演一层,我们不妨回到上一节的“数据金字塔”。
金字塔最昂贵的塔尖数据,其核心定义是“观测、动作、结果”三字段齐备的真机交互记录。当MHS接口每接入一台设备,智能体的每一次调用,实际上都在系统日志中原生生成了这三个字段。
不买场景、不造本体,仅仅依靠卡位协议层,就能源源不断地虹吸物理世界的高质量操作记录。这不仅是“数据读取权”的全新形态,更是这场接口之争的“隐秘阳谋”。
目前,MHS的首批测试场景已精准落子于药物发现流程与量子设备校准。丹纳赫、斗山机器人(Doosan)、QIAGEN、Tecan、优傲机器人等行业巨头已着手为自家设备加装MHS支持,Hugging Face与树莓派也赫然名列早期采用者名单。
挤压止步之处与价值重估
无论是众包采集、接口调用还是世界模型,这三股试图“挤压”数据成本的力量,在物理世界都撞上了同一个盲区:力觉与触觉。
在今年8月下旬的北京世界机器人大会上,一个微妙的趋势正在显现,过去待在配套角落的数据采集设备,如今站上了展台的C位。数据手套、头环、多目相机各自圈出了庞大的体验区。其中被围观最密集的是“肌电手环”。它能通过读取肌肉电信号,在人体动作真正发生之前,精准捕捉到发力意图。这正是对“接触溢价”的直观注脚。
与此同时,数据有效性的衡量标准也在发生质变。
正如《Data Scaling Laws in Imitation Learning for Robotic Manipulation》所揭示的,模型的泛化性能与环境数、物体数呈幂律关系,数据的多样性远比示范的绝对时长重要。
这意味着,同一环境下的示范数据一旦超过阈值,边际效用便趋近于零。换言之,在同一间厨房里录制的第1000个小时,数据价值几乎为零;反之,仅仅4名采集员一个下午的高质量、多场景数据,就足以让两项任务在面对陌生环境和物体时,达到约90%的成功率。这就是“合格小时”的逻辑。
既然海量铺数据的“量变”路线走不通,具身智能走向商业化的终极壁垒究竟在哪?答案藏在数据金字塔的塔尖。
当目光聚焦到金字塔顶层的“真机交互层”时,数据字段表里多出了一个决定性的词:结果。
只有真机在真实场景中的操作,才能明确记录下“成了没成”。这个字段改变了塔尖数据的属性,它不再是单纯的“训练燃料”,而是冷酷的“验收权”。
这种“验收权”有多稀缺?
《斯坦福AI Index 2026》给出了一组对照:在受控的仿真基准RLBench上,操作类任务的最优成绩已高达89.4%;但在围绕千项家务活动构建的高保真仿真环境BEHAVIOR-1K中,冠军的完整任务成功率却断崖式下跌至约12%。一旦任务拉长到家务级别的长程操作,成功率便瞬间崩塌。
从实验室的“跑分”到真实世界的“能力验证”,中间隔着一道生死门。而这道门,只能在真实的物理场景、真实的成果里去检验。
得场景者得具身智能,场景是具身智能能力的“判定地”,其最终价值可能将从“数据读取权”向“商业验收权”迁移。
而在这场定价迁移里,AIoT产业握着三份被低估的存量资产。
1. 设备描述(物模型)
AIoT现有的物模型(如OPC UA、Matter等)与大模型需要的设备定义(如Anthropic MHS)高度一致。区别仅在于,过去的物模型写给系统看,现在要写给AI智能体看。AIoT厂商如果把存量物模型“翻译”成智能体能读懂的语言,就能率先进入大模型的调用名单。
2. 闭环数据
具身智能需要“观测、动作、结果”三要素齐备的数据。但当前AIoT的数据往往是割裂的,传感器读数在云端,动作在工单系统,结果在质检日志。单纯的“连接数”不再是资产,把控制日志、工单与结果判定在时间轴上打通,形成合格的闭环数据流,可能将是AIoT数据资产变现的最快路径。
3. 验收场景
场景方(如工厂、园区)把现有的产线或楼宇,改造成具身智能机器人的“标准化考场”,是集成商和场景方的新生意。这高度依赖物联网的计量、感知和数据追溯等基本功。考场出具的“能力验证报告”,还能直接卖给下游的保险公司和合规机构。
写在最后
从底层的数据获取、中层的成本重估,到顶层的场景买单,这三个依次递进的商业逻辑,是具身智能这项技术从“资本叙事”走向“商业结算”的底层契约。
过去三年,整个行业习惯了用算力暴力破解认知,习惯了Scaling Law在数字世界的所向披靡。这种惯性甚至催生出了一种傲慢,以为只要模型参数足够大、投喂的视频足够多,数字世界的成功标尺就可以无损平移到物理世界。
但现实给出的答案却无比冷硬。重力、摩擦力,以及物理世界里一旦失败就不可逆的真实代价,最终逼迫一路狂奔的AI重新坐回牌桌前,老老实实地为每一次“实体接触”、为“高质量的失败”、为“真实的物理后果”支付溢价。
具身智能的下半场,与其说是AI技术向实体经济的继续外溢,不如说是物理世界对纯数字叙事的一次“反向定价”。
本文来自微信公众号“物联网智库”(ID:iot101),作者:彭昭,36氪经授权发布。















