GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

具身研习社·2026年09月16日 17:44
边界和压力。

具身智能局内人开始担心未来会被提前兑现,因为兑现它的公司,可能另有其人。

GPT-6 Astra 出现后,这种情绪在今年外滩大会的讨论中变得格外直接。极佳视界联合创始人兼首席科学家朱政发出提醒,语言模型已经吃掉了多模态,正在蚕食具身智能,人才、算力、资金又全面占优。“狼已经来了,放弃幻想”,在他看来,未来一两年将是关键窗口,今天的具身智能还没有真正的护城河。

担忧有现实来由。OpenAI 发布 Astra 后,出现了大量围绕它控制机器人的演示,具身圈迅速展开了测试与争论。

与此同时,Sam Altman 也已明确表达 OpenAI 将做人形机器人及其他形态机器人的意向。对于那些还在打磨第一代产品的创业公司,上游模型供应者成为直接竞争者的可能性,已经摆到了桌面上。

但在同一场大会上,我们也听到了另一种声音。蚂蚁灵波 CEO 朱兴在媒体采访中反问,OpenAI 或者 Anthropic 今天下场做自动驾驶,能在短时间内颠覆特斯拉吗?自变量机器人创始人兼 CEO 王潜则把答案落在数据、验证与硬件上:这些基础设施,大模型公司进入物理世界时,是否同样需要补齐?

不过,焦虑之外,一些团队已经开始把 Astra 用进研发:有人用它生成仿真场景,有人尝试让它与具身模型共同控制机器人。大模型进入具身,带来的变化比“谁取代谁”更丰富。通用认知能力被吸收,专用模型被替代,一家机器人公司的业务被接管,是三件跨度很大的事。把它们揉成一句“降维打击”,很容易混淆视听。

坦白说,具身智能与通用大模型之间确实存在边界。只是边界会移动,今天隔开双方的难题,也不会自动变成任何一家公司的永久资产。

01 能力可以迁移,物理经验还要积累

这一轮焦虑背后,有一个很犀利的推断:当通用智能足够高,机器人需要的能力便会自然出现。

在外滩大会主论坛“物理智能——分歧与抉择”圆桌上,自变量机器人王潜对此持保留态度。他指出,语言模型的编程能力进步,与大量编程数据、数据基础设施和验证体系的完善密切相关。视频生成取得进展,也没有直接解决机器人动作控制的问题。

跨任务迁移和能力复用,当然是基础模型的重要价值。王潜的提醒在于,一项能力的跃升,往往有对应的学习材料、训练目标和反馈机制。把这些投入从成功故事里删掉,再将结果全部归于通用智能的自然外溢,会让我们误判下一次突破需要付出的代价。历史经验无法证明能力跨越永远不会发生,但足以提醒行业,跨越背后的工作不能被省略。

因此,看到模型控制机械臂,接下来值得追问的是:它调用了怎样的动作接口,底层已有多少控制能力,是否使用机器人数据,换一套硬件、换一种物体后还能做到什么?演示呈现的是系统的结果,要判断模型带来了多大突破,还需要看清系统的组成。

破壳机器人创始人许华哲,在同场圆桌上分享了团队对 Astra 的测试。他将具身任务拆成语义、空间和物理三个层面。在他们当时的测试条件下,Astra 的语义与空间能力已经很强:它能识别桌面物体,抓起细小的筷子,甚至将筷子立起来插入杯子。

到了更复杂的接触任务,困难开始出现。许华哲提到,用筷子挑开东西,以及叠衣服等任务,团队尚未得到理想结果;双手递物测试也只有少数尝试成功。这些观察不能充当统一评测,却提供了一条很具体的分界线:知道东西在哪里、应该送往哪里,与掌握接触之后如何变化,仍有距离。语言和视觉知识可以提供先验,机器人还要在实际交互中处理那些无法仅凭外观确定的变量。

最近一项基于 RoboDojo 十项双手操作任务的研究,为这种关系提供了更具体的观察。在仿真测试中,GPT-6 Astra Direct 直接控制架构的成功率为 26%,平均得分 37.81;π₀.₅与 Astra 结合后,成功率达到 48%,平均得分 62.60。

但值得注意的是,混合架构中,Astra 只对 14.4%的执行控制步作出修正,其余 85.6%直接沿用π0.5的动作。研究披露的轨迹分析显示,Astra 能够修正目标对齐错误,规划推、拨等非抓取操作,并在任务条件尚未满足时调整后续动作;π0.5则提供直接动作参考与物体交互先验。

这组结果呈现的是通用推理与局部操作经验结合的价值。介入步数少,也可能对任务成败产生很大影响;底层动作占比高,同样说明物理技能仍在发挥作用。十项仿真任务还不足以决定技术路线的胜负,48%的成功率也提醒我们,完整系统距离可靠工作仍有提升空间。它支持了一种协作方向,尚不能被解读为大模型已经解决具身智能。

回到外滩大会,蚂蚁灵波科技首席科学家沈宇军提出,机器人必须持续接收传感器输入,即使正在推理、正在执行动作,也要依据新信息随时改变行为。物理世界不会因为模型还在思考,就暂停手中物体的滑落。这给模型提出了持续感知、及时反应以及部署效率上的要求。

其实这些要求同样在推动大模型公司的技术选择。Google DeepMind 今年 7 月发布 Gemini Robotics 2 时,分别提供了具身推理、视觉语言动作和端侧模型,并明确指出多指灵巧操作仍有挑战。巨头正在进入具身,也在为具身配置专门的模型与系统。

能力边界正在被跨越,跨越的方式却未必是单个模型包办一切。专门训练、系统协作与端侧部署,都在参与这个过程。更有意义的竞争指标,是谁能用更少的交互经验、更低的部署成本,把这些能力稳定地交付出来。

02 数据能否成为壁垒,要看谁能持续获得有效反馈

其实说到底,GPT-6 这种大模型本质上还是数据的“力大砖飞”,其本身的竞争力就在于对优质数据的发掘和使用,但这种能力会不会如此轻松直接迁移到具身智能领域呢?

朱兴用自动驾驶打比方,为什么 OpenAI 这么强,不做市场这么大的自动驾驶,吃掉 Tesla?这里不能忽略模型能力与产业能力之间的距离。训练技术领先,并不能省去对场景的理解,也不能直接换来一套成熟的数据管线。在他看来,判断什么是好数据,以及积累数据的 know-how,是更具壁垒性的工作。

这个类比揭示了跨界需要支付的真实成本。当然,一家企业选择进入什么市场,也涉及资源配置、收益预期和战略优先级,商业上的暂未发生无法证明技术上的不可能。所以我们要研究的是,模型优势转化成产业优势,还要补上多少环节。

放到机器人身上,模型只是交付链条中的一环。客户购买的是能够持续完成任务的产品。机械结构与传感器如何配合,设备磨损之后性能是否稳定,现场异常由谁处理,维护成本能否控制,这些都会进入客户的账本。大模型公司可以自建、收购或与伙伴合作,但无论哪种方式,都要为这些工作投入资源。

王潜在圆桌上提出,如果 OpenAI 或 Anthropic 同样需要现实数据、仿真、评测和硬件基础设施,那么它们进入的是同一场具身智能竞争。

只是这个判断会有不少人较真:如果 OpenAI 这种公司烧钱堆数据,谁能比得过?但的确,这也是一个值得品味的观点。面对共同的难题,或许各方并不会自动拥有相同的解题速度。巨头的算力、人才和工具能力,仍可能显著压缩追赶周期。

客观的说,“我们有数据”需要接受更严格的审视。能够在市场上重复采购的数据,未必稀缺;同一场景中大量重复的成功轨迹,也未必能有效覆盖失败。数据规模只有与任务分布、反馈质量及模型增益连在一起,才具有可讨论的竞争价值。

可见的现实是,数据的生产方式正开始受到通用模型的影响。源策未来联合创始人兼 CEO 李天羽分享,其团队已用 GPT-6 通过编程生成仿真场景,将人形机器人置入其中完成指定任务。在他们的快速实测中,生成结果完整、逻辑合理,具有实用性。他认为,批量生成 3D 场景资产,以及借助增强的视觉语言理解能力辅助数据集清洗,能够直接降低前期数据研发成本。

这让数据壁垒面临双重变化:仿真资产构建、数据清洗等环节可能变得更便宜,原有的部分生产成本优势也会随之收窄。场景能被快速生成之后,资产的物理属性是否准确、是否覆盖真正的失败情形、能否改善真机表现,反而更需要具身团队的判断。拥有生产工具与知道该生产什么,仍有距离。

更难复制的积累,可能是一整套持续发现问题的能力:知道机器人在哪些情况下容易失败,能够进入对应场景采集,能从失败中识别真正缺失的信息,再通过训练和评测确认改进。部署带来新问题,新问题推动模型进步,进步又支撑更大范围的部署。这样运转起来的闭环,才可能让先发优势不断累积。

03 范式还在变化,边界也会继续移动

坦白说,今天业内或多或少对 GPT-6 存在的某种恐慌,来自于延承多模态模型的技术范式,由于过于同轨,以至于后面的车开的快了,就会被碾过去。

用沈宇军的话说就是:如果具身模型仍然是基于数字世界的模型做微调,比如 VLA 基于 VLM、WAM 基于 Video Gen,那么数字世界的基模一旦出现能力跃迁,这些具身模型就很容易受到冲击。

所以,现在的具身智能厂商其实都清楚所谓“物理原生”“具身原生”模型的重要性。一方面是打破原有的技术依赖,找到物理 AI 自己的解法,另一方面也是某种程度的“换道”。

最近具身研习社采访了一些不同路径、范式的玩家,比如影身智能、具脑磐石等,这些跳出路径依赖的企业面对这个问题都比较淡然。

当我们把“类脑路线能否更好地抵抗大模型的侵蚀”这个问题抛给具脑磐石 CEO 朱森华时,他首先纠正了其中的措辞:“我觉得不叫抵抗。”

在他看来,神经网络本就包含脑启发的思想,强调类脑智能,是希望进一步寻找克服现有 AI 瓶颈的理论与方法。他将这些挑战概括为“数据荒、泛化弱、增量难、功耗墙”:怎样减少对大量数据的依赖,怎样适应新场景,怎样持续学习,又怎样控制智能运行的能耗。“GPT 除了堆数据,其实什么也没干”“模型变得更强,并不意味着这些问题(四大瓶颈)已经一并解决”。

这个回答把讨论带到了更深一层。未来更强的 AI,是否一定延续今天的模型形态?持续感知、复杂接触、实时动作和有限能耗,都是物理世界向 AI 提出的具体要求。解决它们,可能需要改变模型架构、训练方式乃至软硬件组织。具身智能也在向通用 AI 提出新的研究问题。

再比如影身智能 4D 世界模型也是一类探索。

它尝试把三维空间及其随时间发生的变化纳入表示,为预测和行动提供更明确的空间约束。影身智能创始人兼 CEO 闵伟提醒,仅在语义基座上微调改造得到的具身模型,极易遭遇 GPT‑6 的降维冲击,“因为这是顺手的事儿”。

与此同时,闵伟业强调,未来的 OpenAI 或许更像水电网一样的基础设施的提供者,反而不可能去吃掉所有的应用,这是商业边界决定的。

而且,一款真正的、落地的具身智能产品里,大模型语义能力占比甚至不足一半,剩下的核心价值来自物理规律理解、机械工程和复杂场景交互等复杂系统。“这也是影身智能坚持原生 4D 模型基座,拒绝在 2D 视频、语义模型上简单拼接改造,并优先扎透轻工业柔性等垂直场景跑通商业闭环的底层逻辑”闵伟说。

回到外滩大会现场,沈宇军在圆桌上面对 GPT-6 Astra 给出了一个更具开放性的判断:具身智能甚至可能反过来影响大模型的发展路径。机器人通过传感器持续感受环境,这些现实反馈能够成为更高层模型的新学习材料。物理世界提供的新经验,可能推动 AI 改变自身,而不只是接受既有模型的能力输出。这也与许华哲提出,大模型、具身模型与物理世界应该连接成完整系统以及 RoboDojo 上的 GPT-6 Astra + π₀。₅混合架构的尝试,似乎达成了某种共识。

所以,未来的竞争格局未必以“语言模型公司”和“具身智能公司”为界。一家从语言起家的公司,如果真的想撒开手盯着具身去做,就像Sam Altman要做人形机器人一样,或许也可以逐步补齐物理数据、端侧模型和机器人产品;而一家从机器人起家的公司,也可以借助更强的通用工具,集中资源探索物理学习与新范式,研发成本下降会帮助他跑得更快,甚至在创新的范式下,形成与语言模型、视频模型并行的下一代基座。

04 结语

对未来更强的人工智能,我们无法给具身智能划出一块永远无法被进入的领地。假如某个系统最终具备高效学习物理技能、可靠控制硬件和持续适应现实的能力,今天不少专用模型与开发环节确实可能被吸收。到那时,这个系统本身也已经拥有了具身能力。需要继续追问的,是这些能力由谁建立,谁组织交付,又由谁获得收益。

因此,具身智能有理由拒绝“一次模型发布决定整个行业命运”的判断,同时也有必要告别“物理世界足够复杂,我们便天然安全”的侥幸。数据、硬件、场景经验和新范式,都有成为优势的可能;只有不断转化为更可靠、更经济的产品,转动起飞轮,它们才会逐渐成为护城河。

Astra 带来的压力是真实的,它正在缩短行业证明自身价值的时间。边界仍在,但企业能守住多大的空间,最终取决于它在边界继续移动之前,完成了多少别人难以复制的工作。

本文来自微信公众号“具身研习社”,作者:彭堃方,36氪经授权发布。

+1
5

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

字节正在从“App 工厂”,变成“AI工厂”

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业