90.2%打破OSWorld公开纪录,AI竞赛进入“接管屏幕”下半场
人工智能的竞争拐点,正在以超越想象的速度到来。
如果说过去几年全球大模型狂欢的焦点在于“会聊天、能写作”的对话框形态,那么到了2026年,真正的商业与技术终局已经指向了——能够像人类员工一样直接看屏幕、动鼠标、敲键盘,原生接管软件与系统的“Computer-Use Agent”。
近日,全球 AI 智能体权威评测基准 OSWorld 迎来历史性一刻:由中国企业级 AI 团队实在智能研发的“实在Agent”,以90.2%的任务成功率打破榜单纪录,更一举斩获 OSWorld 总榜与 Agentic Framework 分榜“双冠军”。
这一成绩超越了海外巨头保持的公开最高纪录。在包含 361 个硬核真实场景的考场中,中国团队用一种全新的工程范式,给出了当下全球智能体落地的硬核答卷。
01 为什么各大巨头都在抢争 OSWorld 榜首?
对于关注科技与创投圈的读者来说,OSWorld 并非一个普通的学术数据集,而是当前 AI 领域公认含金量极高的“计算机驾驶执照考试”。
由香港大学、卡内基梅隆大学(CMU)、滑铁卢大学等机构发表于 NeurIPS 的 OSWorld,核心定位是让 AI 在真实的操作系统中,完全模拟人类行为完成跨应用复杂任务。与以往仅限于网页(Web)或特定 API 调用的测试集不同,OSWorld 提供的是完整的真实桌面沙盒环境。
无论是办公自动化(LibreOffice)、代码开发(VS Code)、图像处理(GIMP),还是底层系统运维,OSWorld 的 361 个实战课题完全由机器程序进行闭环客观判定,没有任何人为打分水分。
各大巨头在发布旗舰模型时,无一不将 OSWorld 视为能力的试金石:
● OpenAI 在发布 GPT-5.4 时,曾将 OSWorld 的突破作为“超越人类基线”的核心标尺;
● Google 在推出 Gemini 3.6 Flash 时强调其高分表现;
● Anthropic 也在 Claude 系列演进中将计算机操控能力列为战略高地。
回顾 OSWorld 的进化曲线,2024 年基准发布之初,当时最顶级的智能体得分仅为12.2%;2025 年底,行业首次以 72.6% 突破了人类基线(72.36%)。而如今实在Agent 跑出的 90.2%,标志着智能体从“不可用、演示级”正式跨入“超高可靠性”的新阶段。
02 商业背后的硬核逻辑:为什么是自动化巨头弯道超车?
在 OSWorld 满分 361 分的硬核课题中,实在Agent 最终拿下 325.59 分。
据介绍,实在Agent 在常规办公与编程工具(如 Calc/Writer、VS Code、Thunderbird 等)保持稳健高分的同时,真正拉开行业差距的,是 OSWorld 中公认最考验智能体硬实力的三大“地狱级”场景:
1.跨应用长链路协同(multi_apps:78.81/93 分)这是任务量最大、最易产生累积错误的维度,智能体需要模拟真实办公中最繁琐的跨系统流程。实在Agent 领先第二名近 10 个百分点,展现出卓越的长链路规划与上下文收敛能力。
2.非标 GUI 界面理解与微操(gimp:24.0/26 分,成功率 92.3%)专业图像软件 GIMP 充满浮动面板、非标准工具栏和像素级微操,堪称视觉 AI 的噩梦。Agent 攻下 24 个任务,证明了其对复杂非标 UI 界面的深厚解析积累。
3.底层系统运维(os:24.0/24 分,100% 满分)在修改文件权限、进程管理、命令行等“错一步全盘皆输”的高危任务中实现零失误,反映了底层执行闭环的极高确定性。
一个值得创投圈与科技界深思的问题是:为什么在 Silicon Valley 基础模型巨头环伺的赛道上,率先打通 90% 关卡的是一家深耕企业级 automation 的中国团队?
这背后揭示了智能体技术正在发生的范式转移:
\text{Agent} = \text{Model} + \text{Harness}
业内普遍认同,大模型(Model)是发动机,提供通用智力和原始动力;而Harness(工程套件与运行架构)则是方向盘、变速箱与安全系统。Stanford、清华等机构的研究证明,在相同底座模型前提下,单靠 Harness 工程架构的优化,在 OSWorld 等基准上的性能提升可高达6% ~ 17%。
当通用大模型的智力水平逐渐趋同,Harness 工程化才是决定智能体“能不能真替人类干活”的核心变量。
实在智能之所以能建构起高鲁棒性的 Harness,在于其长达八年在企业级自动化(RPA/Agent)领域的沉淀:
●第一性原理的动作抉择:API 能跑通就跑 API,跑不通就用 GUI——像人类员工一样看屏幕、点击鼠标,把数据拿回来把事办成。这种“多模态”Harness 能力是打磨多年的基本功。
●海量真实业务场景“喂养”:实在智能已累计服务超 6000 家企业客户(90% 为世界 500 强、央国企及行业龙头)。真实企业环境中粗粝的操作数据、报错恢复机制与流程模板,成为了 Harness 工程迭代最宝贵的原材料。
这不是单一参数量的胜利,而是行业 Know-how、海量真实场景数据与 Harness 工程体系三者叠加的必然结果。
03 下半场命题:从“考场驾照”驶向“工业级 99.99%”
OSWorld 榜单登顶,固然是技术演进的重要里程碑,但对于商业化落地而言,这只是 AI 驶入企业生产环境的“第一张驾照”。
从“基准高分”走向“产业大规模落子”,智能体的下半场竞争正聚焦在三个商业维度:
1.从 90.2% 到工业级 99.99% 的可靠性收敛在财务结算、HR 薪酬或供应链下单等真实流程中,哪怕 9.8% 的失败率也可能引发重大业务风险。企业级 Harness 的下一步,必须在自主执行的基础上建立“安全断路器”与人机协同机制——在高风险节点自动触发确认,提供“操作撤销与回滚”能力,将可靠性推向 99.99%。
2.复杂动态环境的抗干扰能力真实的办公环境充满软件弹窗打断、版本更新、网络延迟抖动等非标干扰。智能体的核心落地价值,在于即使界面样式微调、弹窗突然打断,也能像人类员工一样灵活应对、自主纠错。
3.可算账的商业 ROI 与全链路合规通过端侧轻量模型与云端高阶 VLM 的混合调度,实在Agent 正在持续优化 Token 推理成本与响应延迟,让数字劳动力运行成本远低于人力成本。同时,打造符合企业级安全标准的沙盒隔离与全轨迹审计日志,确保每一次点击均可追溯、可归因。
AI 正迅速脱离“只会聊天”的对话框形态,真正接管屏幕、驱动复杂软件系统,演变为能够创造实际经济价值的“数字劳动力”。从技术榜单高分走向生产力场景重塑,谁能率先打通从算法到商业 ROI 的闭环,谁就将掌握下一代企业级应用软件(Enterprise Software)的终极定义权。















