让机器人的交互界面像手机一样直观,Enigma获7100万美元种子融资
目前,有很多具身智能领域的创业公司,在机器人的智能提升方面努力,他们做的是怎么让机器人更聪明,更会干活。但机器人要进入更广泛的应用场景,并且做更“精细”的活,还需解决一个问题:交互界面。
现有的机器人交互界面,仍未收敛,有遥操,编程(多用于工业机器人),自然语言语音交互,手势交互,GUI App(多用于家用清洁机器人)等。哪一种界面最适合家用的?哪一种最有利于机器人与普通人进行精细协作?一家叫Enigma的初创公司正在探索这个问题的解法。
它的创始人Jonathan Jacobi表示:“Enigma正在开发AI模型,为任何机器人赋予智能;打造交互界面,让操作变得简单易用。让使用机器人像使用笔记本电脑或智能手机一样直观。”
创业不到一年,Enigma完成7100万美元种子轮融资,由Index Ventures和Ribbit Capital领投,Conviction以及来自OpenAI、Anthropic、DeepMind、xAI、Cognition、Factory和Wiz的创始人与核心研究员跟投。
具身模型的智能再强,没有合适的交互界面,也很难实现大众化普及
Enigma由Jonathan Jacobi和Gal Niv联合创立,Jonathan Jacobi少年时期便成为微软史上最年轻的员工,在微软期间曾被Wiz创始人Assaf Rappaport招募;Gal用一年时间修完四年大学课程,17岁时就加入网络安全初创公司。 尽管他们不是AI的科班出身(此前主要是做安全),但他们已经组织了一个强大的团队,成员包括在AI、数学、物理、网络安全和机器人领域拥有多年研究经验的研究员和工程师。
Enigma的两位创始人,来源:Enigma
交互界面有多重要?翻看一下苹果的历史,它的崛起就和它引领的两次交互革命有关;1984年,它推出使用GUI的Macintosh,推动个人电脑进入图形界面时代;2007年,它推出采用多点触控的iPhone,引领了移动互联网革命。
而在此前无论是PC还是手机,其实都具有了雏形,算力(或者说智力)在当时也都不差,但它们能真正普及的关键,还是在于交互界面。
Enigma的联合创始人Jonathan Jacobi显然认为这个道理在具身智能行业也适用,他表示:“无论机器人能力多强,如果操作不够直观,大多数人都不会去使用。如果你要洗碗,却得花15分钟向机器人解释每样东西该放哪,所有人最后都会想‘算了,我自己来吧’。现在所有公司都在这个阶段,哪怕用的是能力最强的模型。
如果调节音量不能直接旋钮,而是必须按固定百分比输入数值,且不知道最终声音是太大还是太小,用户会倍感挫败。”
Enigma为了探索如何构建直观的人机交互界面,针对普通人推出了一项大规模实验:部署100多台自研AI机器人任何人都能在线实时使用。借助Enigma的模型和交互界面,用户可以指挥机器人完成任务并操作物理对象,包括用画笔画画、持剑对打,以及抓取和混合液体烧杯进行简单化学实验等任务。Enigma表示,其机械臂和底层模型均为完全自主研发。
Enigma希望从这个在线实验中收集的数据,优化模型,并且最终找到一种最适合的机器人的人机交互界面。而且从现在的技术栈看,这个交互界面,很可能不是一个独立于模型的“外壳”,而是与它的模型一起训练。也就是说,Enigma的机器人基础模型,很可能是一个基于交互界面优化的端到端模型。
因为公司仍处在早期阶段,Enigma目前尚未发布可供外部使用的模型,交互界面也还在探索中。不过从公司发布的技术博客和创始人此前的论文看,团队对物理AI底层模型的研究已经相当深入。
首先,他们的着眼点之一是世界模型,并研究了一种名为Multiverse的多人世界模型。
现有世界模型大多围绕单个智能体展开,根据历史画面和当前动作预测接下来会发生什么。但现实环境里往往同时存在人、机器人、车辆和其他设备,模型还需要理解其他智能体的行为,以及彼此的动作如何共同改变环境。
Multiverse以游戏《GT赛车4》的双车竞速为实验场景,同时接收两名玩家的视角和动作,并预测双方接下来看到的画面。难点在于维持共享世界的一致性:两辆车的位置、相对运动和碰撞结果,必须在两个视角中相互吻合。
Enigma将双方画面沿颜色通道堆叠,让两个视角从扩散模型的第一层开始共同参与计算;同时通过稀疏时间采样和课程学习,在控制计算量的情况下,将预测范围逐步扩展到最长15秒的多人交互。
Multiverse的研究原型展示了一条新的技术路径:世界模型可以把多个视角、多个动作和一个共享环境放进同一次预测中。对于家用机器人、自动驾驶和工业机器人,这种能力可能是理解协作、避障和多智能体交互的重要基础。
此后,团队继续研究如何让机器人对世界形成直观理解。为此,他们探索一种紧凑的世界表征:信息足够丰富,可以支持不同任务;体量又足够小,能够用于快速规划,并将研究写成技术博客《The Obsessed Encoder》。
团队发现,DINOv3、LeJEPA和LeWM等现代JEPA系统,仍会优先学习视频中的慢变特征或图像里少量、容易预测的信息。实验中,一个只有12比特信息的微弱水印,就能主导1024维潜在空间;在RandGoal机器人任务中,模型也会过度编码单段轨迹内保持不动的目标姿态。训练损失继续下降,规划成功率却仍接近随机水平。
Multiverse与团队对紧凑世界表征的研究,分别从多智能体预测和任务相关信息提取两个方向,探索机器人如何形成对现实环境的理解。从这些研究,可以看出团队的基本思路:模型既要理解多个主体如何共同改变环境,也要在有限的表示空间中保留真正有助于规划和任务执行的信息。
物理AI仍在早期阶段,卷智能后的下一步是找交互界面
AGI若要走向更完整的形态,最终需要进入物理世界。
李飞飞把今天的语言模型比作“黑暗中的文字工匠”;Yann LeCun认为,机器需要形成对世界运行规律的内部模型,才能获得更强的推理与规划能力;Demis Hassabis则直言,“真正通用的AI需要理解物理世界”。这些判断指向同一件事:AGI不能只停留语言和数字空间,还需要理解物理世界、预测其变化,并进一步具备与现实环境交互的能力。
作为物理AI的代表形式之一,具身智能仍处在早期阶段,但行业已经开始沿着智能能力继续向下一层推进,逐步关注精细操作、跨任务通用能力和更自然的人机交互界面。
交互界面决定一项技术能否从能力展示走向真实使用和大众普及。机器人要进入家庭和公共空间,需要让普通用户能够低门槛地布置任务、确认意图、随时纠正,并在必要时接管。
具身智能的交互界面何时收敛,很可能就是行业真正成熟的时间点。当用户能够以稳定、低门槛的方式使用机器人,产品定义、使用习惯和服务生态才会逐步固定,企业也才有条件降低交付成本、复制规模,并进入大规模商业化。
目前,机器人交互还没有形成统一答案。1X仍同时依赖语音、App、VR遥控和人工专家,Google把自然语言、执行中纠正和行为解释放在核心位置,Enigma则尝试让每次交互继续沉淀为训练数据,并用于训练端到端机器人模型。
这个领域的创业机会未必属于某一种单独界面,更可能出现在任务布置、意图确认、过程纠正和必要接管这些尚未解决的环节。谁先让普通人真正把机器人用起来,谁就更接近定义具身智能的规模化入口。
本文来自微信公众号 “阿尔法公社”(ID:alphastartups),作者:发现非凡创业者的,36氪经授权发布。















