别再只看产出数量了,AI时代的考核要看这三层
企业大举加码 AI,但绝大多数绩效考核仍然沿用旧标准,催生绩效悖论:滥用 AI 刷产出受奖励,校验纠错的员工反而吃亏。本文提出三维评估框架,区分三类指标:人类贡献指标、AI系统与智能体指标、人机协同系统指标,帮助企业重新定义 AI 时代的良好绩效,厘清权责归属。
当工作成果由人类与AI协同产出时,“良好绩效”该如何定义?管理者怎样才能确保追求速度与效率的同时,不会牺牲人的判断力与责任担当?
当下,这些问题变得至关重要。企业大举投入AI,管理者承受巨大压力,需要证明AI投资能够产生回报。兰迪·宾(本文作者之一)与汤姆·达文波特联合开展的“数据与AI领导力”年度调研于今年早些时候发布数据:91%的企业正在加大AI投入,99%的企业将AI投资列为组织最高优先级。然而仅有18%的企业表示,自身AI投资已经实现高度可量化的业务价值。
AI在大量工作流程中提升了处理速度与成果质量,但绝大多数企业尚未重新设计员工绩效评估方式,以适配这一变化。结合最新研究以及我们协助企业落地AI的实践经验,本文提出一套三维绩效评估框架,适用于AI时代的绩效考核,帮助企业区分三类指标:人类贡献指标、AI系统与智能体指标、人机协同系统指标。
人类绩效悖论
目前,企业在评估员工使用AI开展工作时,仍沿用传统的成功衡量标准:生产力、目标完成度、工作效率。这就催生了一个悖论:高度依赖AI的员工看上去生产力极高;而另一部分员工会放慢节奏,校验预设条件、质疑AI输出结果、修正错误,恰恰在创造最大价值的时候,反而显得效率低下。
在这套评估模式下,管理者很可能奖励员工对AI的过度依赖,却惩罚能够规避重大失误的人类判断力;一味追求产出数量,忽视实际业务成效,看不清真正驱动高效工作的核心要素。
我们已经看到,把旧绩效指标套用到全新工作模式,会带来怎样的现实后果。当AI系统在传统指标上的表现优于人类,部分员工会产生防御心态:某AI厂商的调研显示,10%的员工坦言,他们会篡改数据,刻意拉低AI的表现。这一现象并不意外。当管理层将AI主要视作削减人力的工具,员工必然会承受压力,需要在传统关键绩效指标上证明自己比AI更强,因为他们深知自己的岗位岌岌可危。
但指标错配只是问题的一半,甚至可以说是相对容易解决的一半。另一重困境是:传统绩效管理体系本身早已失灵。盖洛普2024年的调研显示,当时企业才刚刚开始适应生成式AI,财富500强企业中,仅有2%的首席人力资源官高度认可本公司的绩效管理体系能够激励员工自我提升;受访员工里,也只有20%认为绩效评估公平、透明。
时至今日,情况并未出现明显好转。德勤今年1月发布报告称,尽管人们对自动化寄予厚望,仍有84%的企业没有围绕AI重新设计岗位、工作流程与职业发展路径;仅有30%的企业针对员工合理运用AI设置绩效激励。大多数企业的人才策略只聚焦员工培训。企业培训员工适应全新工作模式,评估方式却一成不变。这套做法的问题在于,它想当然地认为,让员工把原有工作做得更快,依然是正确的目标。
错误指标叠加失效的绩效管理,正在造成信任缺口。高德纳的数据显示,仅有1/50的AI投资能带来变革性价值,仅有1/5能够产生可衡量投资回报,但企业CEO依旧对AI驱动增长抱有很高期待。反观一线员工,能够真切感受到管理层的口号和实际落地之间的巨大落差。董事会的乐观预期与一线现实之间的鸿沟,正是绩效管理失效的根源。
AI时代,何为良好绩效?
传统绩效指标建立在如下工作特征之上:任务独立、可重复、由个人全权负责。而AI可以自动完成大量这类工作:文稿起草、内容摘要、翻译、样板代码编写、初步分析。一项覆盖750多名知识工作者的大规模实地实验表明,使用OpenAI的GPT‑4之后,员工工作速度提升超25%,任务完成度提升12.2%;在模型能力覆盖范围内,产出方案的质量也显著更高。
但这项研究同样揭示,只看产出量的评估方式潜藏巨大风险。当任务稍稍超出AI能力边界,可以使用AI的受试者输出正确答案的概率,比不使用AI的人低19%。研究者将这一现象命名为“锯齿化技术边界”:AI 在部分任务中表现出众,但面对看似高度相近的相关任务时,却可能骤然失效。倘若考核只看重产出速度,不对结果准确性加以核验,就会促使员工将工作交由 AI 处理,突破其能力边界,寄望于AI不会出现差错。
另有研究证明,传统指标会错判价值的真实来源。一项研究发现,AI辅助平均可以提升约14%的生产力,但收益主要集中在经验不足的员工身上。资深从业者使用AI之后,效率仅有小幅提升,质量还出现轻微下滑。专家创造价值,依靠的是问题诊断、识别极端特殊场景、校验前提假设,以及指导团队何时不能信任工具;而多数管理者并不会主动权衡这一代价。
同时还存在更加隐蔽、长期的风险。对照实验表明,反复接触带有偏见的AI输出,会放大人类在感知、情绪与社会判断中的固有偏见。人们往往意识不到AI对自身的影响,更容易被偏见裹挟。一名看似“用数据说话”的同事,可能正在潜移默化习得模型自带的偏见。而标准绩效体系完全没有机制去发现这类问题。
与之相关的一大隐患是“劣质速成品”泛滥:借助AI快速产出大量低质量工作,充斥冗余内容、各类错误,实际信息价值极低。这类成果会耗费接收方大量时间,还会降低同事对产出者的评价,损害团队凝聚力。只考核产出数量、不考核准确度的企业,不只是错误评判绩效,更是在主动破坏绩效表现。不少管理者已经反馈,难以消化员工产出的海量内容:过去一周完成的工作现在几小时就能做完,但质量把控依旧需要经验丰富、判断力过硬的管理者投入时间。
具备自主执行能力的AI智能体,进一步放大了绩效评估难题。多数企业过去把AI视作员工的工具。虽然仅有11%的企业已经将AI智能体落地投入生产,但智能体融入工作流程后,带来了我们所说的协同绩效难题。当最终成果来自人机混合系统,评估框架必须同时回答三个问题:人类的表现如何?AI系统的表现如何?人机协同配合的整体效果又如何?
基于算法管控相关研究,我们认为AI智能体可以通过近似管理的方式影响人的行为:推荐或限制工作内容、记录评估绩效数据、触发奖励或人员更替决策。如果不对智能体和员工分别设置评估与治理机制,就无法追究任何一方的责任。一旦智能体评估表和员工考核表混为一谈,两份评估都会失去真实性。
全新绩效衡量框架
结合持续开展的研究以及企业合作实践,我们提出三维评估框架,分别衡量人的表现、AI系统与智能体、人机协同产出。每一层设置少量核心指标,高频复盘(按月或按季度),并且直接关联实际管理动作:辅导、人员配置、晋升、工具治理。
一、人类贡献指标
评估人的真实工作表现,需要弱化那些AI可以轻松拉高的产出指标,聚焦AI无法替代的核心能力。绝大多数岗位都需要关注以下三类能力:
1、边界判断力
员工能否可靠识别AI超出能力范围的场景,并且做出恰当处置?
-升级上报准确率:后续复核确认AI输出确实存在缺陷、不完整或是超出可靠能力范围,则判定本次上报“合理”。
-溯源得分:交付物是否完整透明记录数据源、生成时间、使用模型。需预先设定抽样比例,例如每季度抽取全部交付成果的20%复核。
-修正质量指数:员工留下书面说明(输出错误、数据过时、缺少上下文等)的修正,判定为“合理修正”;无依据的不当修正会扣减分数。
2、协同统筹能力
员工能否借助AI工具提升团队整体产出,而非只提高个人效率,也就是赋能他人。
-团队AI渗透率,辅以使用深度分层:偶尔使用(每周<2次)、常规使用(每周2‑4次)、深度融合(日常跨任务使用)。重点关注各层级人员分布情况。
- 流程优化贡献指数,对员工优化工作流程的成果赋予权重:全新搭建流程计1.0分;优化现有流程计0.5分;整理文档并共享额外加0.25分。按季度统计。
-人头产出比,跟踪时间序列数据。相比绝对值,变化趋势更有参考价值:团队规模不变甚至收缩的前提下,该指标上升,代表统筹赋能效果出色。
3、学习迭代速度
面对工具、流程、制度迭代,员工能否快速适应。企业搭建系统化AI能力培养体系,是释放重要信号:掌握AI是职业发展通道,而非岗位威胁。
-工具落地滞后时长:从工具正式发布,到员工首次有记录的有效使用,间隔的工作日。数值越低代表学习速度越快,可以统计个人或者团队均值。
-培训落地转化率:追踪可观察的行为改变,员工完成培训30天内,本人或管理者记录至少一项实际落地应用案例。
-实验尝试率:“实验”定义为有记录的尝试,测试全新用法、提示词策略、工具组合,无论成败。该指标有助于营造包容失败的学习文化。
二、AI系统与智能体指标
仅靠模型准确率、运行时长不足以完成评估,自主智能体尤其如此,建议关注三大维度:
1、目标达成度
AI智能体是否在既定约束范围内完成预设任务?
-任务完成率:输出满足预设验收标准,无需人工修改、重新提交,才算任务成功。针对不同智能体、不同任务类型持续跟踪,识别性能衰减。
-错误率:错误按严重等级划分(严重/中等/轻微),记录根本原因。整体错误率很低但严重错误频发属于重大风险,必须单独上报。
-目标偏移指数:对多步骤执行的智能体尤其关键。识别智能体一味优化可量化代理指标,偏离真实业务目标的情况。
2、可解释性与可追溯性
能否还原AI的决策逻辑,并且留存可核验依据?
-输出溯源率:每一份输出都要关联所用输入数据、模型版本、检索上下文。按既定样本抽样审计,例如每期抽查20%输出。在强监管行业,该指标过低会直接带来合规风险。
-复现得分:抽取部分输出,使用留存参数重新运行。相同输入能够稳定得到相同输出,代表系统可审计。结果偏差超过设定阈值(例如>5%),就启动溯源核查。
-解释充分度得分:由领域专家、合规人员或终端用户组成评审小组,依据统一评分标准,评判智能体输出附带的理由说明是否足够清晰,保证评审标准统一。
3、上报处置质量
当智能体抵达自身处理边界时,能否做出恰当处理。这是自主智能体最重要的维度,决定人工监督能否真正落地。
-极端场景流转准确率:提前按风险类别定义边界场景(高风险决策、全新输入、合规触发项)。只有案例在规定响应时限内升级流转至对应处理层级,方可判定流转正确。
-误上报率:智能体过度上报,会增加运营负担,消耗团队信任。该指标用来平衡上报机制的灵敏度与精准度。
-人工干预支持率:衡量系统架构是否真正支持人工介入,不只是纸面功能。无论发生频次多少,人工干预失败、受阻都属于重大系统故障。
三、人机协同系统指标
评估人机组合产出,是否优于单独人类或单独AI。该维度价值很高,但需要大量数据支撑,资源允许的企业可以使用以下指标:
-AI接管率:统计完全脱离人工介入的工作占比。接管率升高本身不一定是坏事;但同时伴随质量下滑、错误上升,就代表价值创造正在转为价值损耗。
-互补协同指数:统计人类介入真正产生价值的案例占比,例如发现错误、重构问题、补充业务判断。高分代表真正协同,而非单纯盖章放行;低分既可能代表智能体能力极强,也可能代表员工消极应付,两种情况需要完全不同的处理方案。
-价值归因占比:把总产出价值拆分为AI执行贡献,以及人类判断、筛选、修正的贡献。该指标实现难度高,但战略意义重大。随着AI能力迭代,该比例会持续变化;长期追踪,可以看清企业是在培育人的核心能力,还是在逐步弱化人的价值。
重新设计绩效管理体系
企业不需要一次性重构全部流程。挑选一项已经被AI改变的业务流程切入:客户服务、销售方案撰写、制度草拟、软件开发、财务报告,执行下面四步:
1.梳理全流程,标注AI能力边界。把流程拆解为不同任务类型:常规重复类、高度依赖判断类、高风险类、强关系属性类。定位“锯齿化边界”:AI输出看似合理,但经常出错的任务。这是所有工作的前提。
2.先重构指标,再修改考核表单。用少量前置性指标替代产出数量:溯源校验通过率、上报处置质量、返工减少幅度、客户体验变化、团队赋能成效。
3.区分发展辅导谈话与薪酬决策。同一套AI生成数据,既用来辅导员工,又用来核算薪酬,员工就会把评估视作监控。当员工清楚哪些数据被采集、用于哪些决策、如何提出异议,评估才会被视作成长工具。缺少透明度,即便设计精良的指标,也会被理解成监视手段。
4.为流程中的AI明确责任归属。AI嵌入业务流程后,企业必须提前回答三个问题:
- 在给定信息与时间条件下,员工是否有条件识别本次AI错误?
- 系统设计是否给到员工校验的动力与工具?
- AI故障,是发生在已知能力边界之内,还是被部署在原本并不适配的任务上?
可控性、系统设计、治理机制,这三点决定责任该由谁承担。倘若缺少这套清晰的逻辑,“人嵌入AI 决策闭环” 的机制,便只会沦为一句权责无人落实的空话。需要为工具或智能体指定负责人,通常为产品负责人、运营主管、首席数据分析与AI官,对智能体的性能、防护约束、版本更新全权负责,对外发布本文提到的智能体评估表;智能体授权使用范围发生变更,评估表就要同步更新。一旦出现事故,要清晰回答“谁对这套系统行为负责”,而不是只追究交付成果提交人。
AI成功离不开人的价值
企业陷入绩效评估的悖论:奖励产出速度,既无法暴露被忽略的前提假设,无法褒奖发现漏洞的员工,也难以追究 AI 的责任。真正胜出的企业,会重构绩效管理,把看不见的价值显性化:边界判断力、人机协同质量、可追责的业务结果。等到AI智能体已经深度嵌入业务再动手,就如同建筑已经投入使用,才去重建整套责任体系。
即刻行动,改造一项业务流程,落地这套三维评估体系,在事故倒逼企业厘清责任划分之前,就把权责问题梳理到位。
关键词:#AI
兰迪·宾(Randy Bean)、埃里克·施特劳斯(Erik Strauss)、朗迪普·辛格(Randeep Singh)| 文
兰迪·宾是高级顾问、董事、主旨演讲人、主持人、撰稿人,拥有企业创始人兼CEO 从业经历。埃里克·施特劳斯是欧洲高等商学院(ESCP)柏林校区管理控制教授,研究AI对企业决策的影响。朗迪普·辛格是欧洲高等商学院(ESCP)柏林校区管理控制方向博士候选人,研究方向为AI时代人类绩效衡量。曾任职德勤管理咨询分析师,还在戴姆勒卡车、德国电信负责企业战略相关工作。
周强 | 编校
本文来自微信公众号“哈佛商业评论”(ID:hbrchinese),作者:HBR-China,36氪经授权发布。















