凯文・凯利×王鹤:人形机器人走向大小脑协同时代
“如果以模型来看,中美可以说各有长处,正在相向而行。中国产业生态系统更完善,包含模型和数据在内的迭代闭环更快;美国则在纯大模型技术上更加领先,它甚至可以把一个文本模型,也教会它具身的能力。”
9月21日,在36氪与中建智地宸园139联合主办的“顶峰相见——凯文·凯利对话中国科技新势力”沙龙上,银河通用创始人兼CTO王鹤表达了以上观点。
活动现场
谈及具体的技术突破及理念,凯文·凯利也对其给予肯定:“这件事就是你们的使命。”KK还表示,他可以想象中国在包含具身机器人的AI相关领域成为领先者。
具身智能的“AstraTennis 时刻”
AI第一次给全球带来震撼,是在2016年。当年,AlphaGo击败围棋界最顶尖的人类选手,让世人第一次真切感受到人工智能的强大。这也给彼时还是清华大学学生的王鹤带来了极大的震撼。但他也坦言,当时自己仍然没有想象到,仅仅三年后,GPT范式就会出现;再到2022年,ChatGPT能将专精于围棋的智能,迅速推演为掌握任何语言的通用智能。
在8月22日世界人形机器人运动会开幕式上,银河通用推出全球首个面向全自主网球对抗的人形机器人端到端模型——AstraTennis,它用一场精彩的人机网球对决,证明了具身智能可以在充满不确定性的物理真实空间完成感知、博弈与全身动作执行。
对此,美国投资人Andrew Kang曾评价道:“AlphaGo for every sport is coming。”
王鹤坦言,2025年6月团队提出用人形机器人全自主打网球时,他本人也持怀疑态度——网球对击球精度、落点、跑动和平衡要求极高。直到春节前夕,团队在仿真世界中训练成熟,他决定花租一周真实场地验证。“最后研究进展再次刷新了我的认知,它可以打。”
王鹤
他还提到,除了全身运动外,银河通用还突破了人形机器人的灵巧手操作,这也是全球的首次。“不断挑战的背后,是KK先生讲的optimism(乐观主义)在支持着我们。”
谈及人形机器人与具身智能的发展,凯文·凯利还表示,“制造人形机器人将是我们做过的最复杂的改变。它远比航空、比工厂复杂,加上芯片的复杂性、手的复杂性和灵敏度,以及让它运行所需的动力与算力调度,这是我们建造的最复杂的东西。这也是为什么,它是最难做好的机器。”
而全球范围内,具身智能的“突破”还在继续。
今年9月,OpenAI发布旗舰模型GPT-6 Astra ,被官方称为“迄今最智能、对齐程度最高”的模型。
银河通用团队通过测评发现,GPT-6 Astra 在具身任务中展现出强大的推理能力。在其所做的RoboDojo实验中,GPT-6 Astra+π0.5在十任务中平均得分达62.6分,领先第二名近一倍。在另一个RoboLab实验中,GPT-6 Astra Direct在50次实验成功率98%;Astra+π0.5成功率92%。而同一组统计中的π0.5、DreamZero等都不到40%。
“Astra是GPT系列中第一个展现出具身能力的模型。它的具身能力非常强,而且很“灵”——不需要专门训练,直接用语言命令它,它就能执行。比如随机让它用木块和木板搭一座塔。可以看到,GPT-6 Astra 会不断思考每一步该做什么,并决定是调用具身模型π0.5,还是靠自己完成。这样一个完全没训练过的任务,它第一次就能做。诸如此类,所有任务的成功率能超60%,而此前的模型最好也就10%左右,这正是其突破意义所在。”王鹤对其评价道。
GPT-6 Astra真正强的地方,不单会“理解”,还能发现“哪不对”。例如实验中,它发现抓取姿态不理想后,便会改变接近方式;在装箱过程中,它能够发现箱子后面还有遗漏物体......这说明,GPT-6 Astra并非机械执行一条预先生成的轨迹,而是在形成一个“观察—决策—执行—再观察”的闭环。
让机器人实现大小脑协同
“数字智能是一种 knowledge smart,而机器人智能是一种直觉智能。而人类绝大多数的推理和思考,属于大脑里头的慢系统,slow system。人类操作,则属于我们大脑里头的快系统,是系统一, system one。那么这样的快系统,就是需要大量的练习,把这样的能力变成一种与生俱来的一种不经意下意识的反应。而大模型可以用非常复杂的,我们叫思维链,称 of thought,是非常不一样的智能。
对于接下来的方向,王鹤表示,“那么在这条路上,我们也希望一步一步去构建一个像人一样,能够把大脑、小脑和脑桥全部打通,既能够有高层的判断,又能够有低层的仿人、仿生的脑系统,让我们的人形机器人真正拥有智慧。”
在技术路线上,王鹤介绍了具身大模型的两条路径:谷歌的VLA(Vision Language Action)强调每个数据必须有机器人动作输出;OpenAI的World Model更通用,但数据中不一定有机器人。银河通用则率先是将二者融合,提出World Action Model(WAM)——既可预测未来,又可预测动作。这套技术路线如今已被学术界广泛认同。
在通用大脑WAM的加持下,银河通用机器人还在人形机器人运动会上完成30分钟完整家庭家务挑战,覆盖物品归置、垃圾清理、洗衣晾晒折叠全流程,中途还可以响应取快递这类突发指令,最终近乎满分拿下赛事金牌。
王鹤
大脑模型外,银河通用的小脑模型同样值得注意。王鹤说:“过去机器人跳舞,需要提前把人类轨迹放到机器人身上,调好以后再部署。现在我们的通用小脑模型,能够做到人跳一遍舞,机器人就立即把舞跳一遍。这个背的后智能,甚至超越了人类对肢体动作的掌握能力,真的是20亿帧人类动作数据训练出来的通用小脑模型。”
对于这些突破,凯文·凯利表示,“下一个重大突破将是真正让机器人工作起来。我们一直在做的事,将会产生巨大的影响。所以,这正是令人兴奋的地方所在。”
面对未来,王鹤表示:“我们将把我们的机器人本体,大小脑,数据平台以及训练的一套工具链和部署工具,做成四个一的基础设施,开放给全行业。大家就可以用一套非常简便的数据采集流程和后训练流程,教机器人。届时人形机器人作为一种生产力、服务力进入千行百业。”
机器人本质与安全边界——是伙伴,不是替代者
随着智能体的发展,未来的物理世界中,越来越多的机器人会进入社会、进入家庭等人类生活场域,那人类该如何把握人与机器人之间的安全边界?人们热议的“AI 杀手”是否会成为现实?
针对二者的关系,凯文·凯利认为,“当我们为AI赋予躯体——也就是机器人的时候,我们要明白:它们和我们不一样,它们不是人类。而它们不同于人类这一点,并不是缺陷,恰恰是它们最大的优势。在我看来,这类拥有实体躯体的智能载体,是一种低成本的宝贵资源。因为存在不少智力难题,单凭人类自身无法攻克,单靠AI也无法解决,但AI和人类联手就可以,人类和机器人就是这样一种伙伴关系。”
活动现场
对于凯文·凯利的观点,王鹤表示认同:机器人本质是AI,它不是人。所以我对机器人的未来,是比较乐观的,它会成为人的partner,而不会是人的一个替代品或对手。”
那么,未来机器人进入人类日常生活的安全问题又该如何?王鹤以已经落地的药房机器人举例:工厂、药房这类确定性封闭场景,权责相对清晰。银河通用国内落地近百个机器人药房点位,承担夜间取药工作。为规避错发药品风险,团队没有完全依赖大模型通用推理,会额外叠加确定性校验程序,药品必须同时完成文字、图像、条码三重核验,才允许打包出库。过去一年半累计处理近百万盒药品,实现零错发。这类场景中,机器人故障带来损失,责任主体指向厂商。
凯文・凯利认为,在短期内,AI企业必须承担对应责任,也可以配套保险机制等。反过来说,能够存活下来的AI企业,一定是能处理好责任问题的企业。
同时,王鹤也指出,在完全开放的家庭复杂场景中,充满不可预判的干扰因素,风险复杂度成倍上升。“比如人不在家的时候,机器人打翻水,水珠进入插线板短路起火,且它无法自己收拾。它比小猫小狗更可怕,因为它可以插插销,可以动你家里所有东西。未来如果出现了,我特别认同KK先生讲的,我相信到时候我们也许会用一种制度,来对安全进行保障。”















