Insights·2026-09-15

把AI用错的四种方式

AI引入失败的样子并非无限多。1997年一篇人因工程论文把人与自动化的关系分成四类:使用、过度依赖、弃用、滥用。最后一个最不为人知,在组织里却最常发生。它指的是人的角色没有被设计,而是作为自动化的副产品被留下来的状态。

承接前文自动化的反讽——越自动化,留给人的活越难
AI를 잘못 쓰는 네 가지 방식 가장 비싼 것은 남용이다 — 명령과 단계를 담은 요약 도식

开进河里的汽车

线描插画:一辆汽车在混凝土下水坡道尽头没入水中直到发动机盖,挡风玻璃后只有导航屏幕仍然亮着。

跟着导航开进河里的司机不是都市传说。有多起被报道的案例。

英国里彭有货车司机跟着导航驶入浅滩,遇雨水上涨被困后获救。马萨诸塞州的一处湖泊,有司机径直开进水里,车被淹没。华盛顿州则有人在深夜把船只下水的滑道当成了路。

值得留意的是,他们大多看见了指示牌,也看见了那里有水。看见了,却更信屏幕。

这种失败有名字。而恰恰相反方向的失败也另有名字。把两者放进同一张表,AI引入是在哪里走偏的就理清楚了。

1997年,与自动化相处的四种方式

这是拉贾·帕拉苏拉曼和维克托·赖利整理出的分类。论文标题本身就是那张清单:人与自动化,使用、过度依赖、弃用、滥用。

第一是使用。人把自动化开启或关闭的正常选择。论文也指出了什么在左右这个选择:你多信任这个工具、你此刻有多忙、你觉得这件事风险有多大。

第二是过度依赖,也就是靠得太重。监督失守,判断朝自动化那边倾斜。上面的河流案例就是这一类。

第三是弃用,有而不用。工具买回来却没人打开的状态。

第四是滥用,性质与前三者不同。这不是使用者的行为,而是设计者与管理者的行为:在没有考虑对人的表现会产生什么后果的情况下引入自动化,于是操作者的角色未经设计,被定义为自动化的副产品。

把这四类逐一对照当下,AI引入中遇到的多数问题都会落进这张表里。

过度依赖——可靠性越高越严重

过度依赖里有一处反直觉的地方:自动化几乎不出错时,比它经常出错时更严重。

原因很简单。对一个一百次里对九十九次的工具,每次都去核对会让人觉得是浪费。而在多数情况下那确实是浪费。于是停止核对就固化成看起来合理的选择。

问题在剩下的那一次。核对已经停掉的状态下那一次来临,就没有任何防线了。而那一次通常不是平常的情形,而是罕见的情形。第十期看到的结构在这里原样成立。

跟着导航开进河里的人并不是什么特别的人,原因就在这里。那台机器此前对过几百次。当这份积累压过了路牌的那一刻,事故就发生了。

AI也一样。因为摘要大体准确,你就不再打开原文;而从不再打开的那一刻起,错误的摘要就一路通过了。

弃用——是狼来了造成的

另一侧是弃用:工具在那里,人却不用。

最常见的原因是误报。警报经常虚响,人就会把它关掉或无视。这不是懒惰而是学习——迄今为止的经验教会了他们,这个提示通常什么都不是。

医疗现场是这个问题的教科书。医院病区里响起的警报中,真正需要处置的只是少数,其余是病人翻了身或传感器短暂错位。结果就是警报疲劳:声音变成了背景音,而真正的警报响起时反应变慢。这已经严重到出过正式的安全警示。

这里重要的是原因的位置。弃用的原因不在人的态度,而在阈值设计。所以在问为什么不用之前,要先测虚响的比例。

AI工具上也是同样的形状。头几次拿到错误答案的人,就再也不打开那个工具了。哪怕工具后来变好也不打开。第一印象充当了阈值。

不过弃用并不总是错的

将不使用分为源于第一印象的真正闲置与信度0.7以下的合理判断的对比图。

这里要当心:不要把弃用一律当成需要克服的抵触。

不准确的自动化一旦低于某条线,就不再帮人,反而添乱。汇总多项研究后,有报告把这条界线放在可靠性0.7附近。低于这条线,用工具并不比不用更好。

想想理由也很自然。用一个可靠性低的工具,结果就得全部重新核对,等于在原来的工作上又叠了一层核对。何况旁边有答案检查就会松懈这个性质还要叠加进来。

所以当组织里冒出这个工具为什么没人用这个问题时,答案有两种:一种是因为第一印象而不用的真正弃用,另一种是判断这工具在这件事上确实帮不上忙的合理选择。不加区分只去拉使用率,第一种没被修好,第二种反而变成损失。

滥用——四者中唯一不是使用者行为的一个

第四类是这一期的正题。

滥用是在不考虑会对人的表现产生什么后果的情况下引入自动化。要再强调一次主语变了:过度依赖和弃用是用工具的人的行为,滥用是决定引入的一方的行为。

在AI引入中,这个形状是这样出现的:先定工具,流程之后再去凑。留给人的活不被讨论。审阅没有排时间,异常处理没有负责人,只有出事时的责任对人很明确。

而处在这种状态下的人所显现的症状,正是上一期看到的那些:剩下的活变难了而练习的机会没有,被要求监督却因为不用而钝掉了监督所需的能力。

也就是说,如果第十期讲的是症状,滥用就是那个原因的名字。

四者中滥用代价最高

前三者是看得见的。过度相信就出事故,不用就能看见工具闲着。两者都会落到指标上。

滥用不是。工具运转良好,引入成效的指标也很好看:处理件数上升,耗时下降。而人这一侧在悄悄坏掉。

而且它暴露得晚。通常是在罕见情形来临时,也就是人必须介入的那一刻,才第一次暴露。那时能力已经不在了。

责任的落点也错位了。造成这种状态的是决定引入的一方,而失败发生的位置是做那件事的人。于是事故之后的结论很容易变成个人疏忽,原因则原封不动地留着。

只讲一个术语:信任校准

信任校准是让人赋予工具的信任与工具的实际可靠性相符。

过度依赖是信任高于实际,弃用是低于实际。所以目标既不是提高信任也不是降低信任,而是对齐。

这个说法在实务上有用是有理由的。谈AI引入时,目标通常被设成使用率或接受度,让人多用变成了目的。把信任校准设为目标,问题就变了:这个工具该信到什么程度。

而要对齐需要一个条件:人得知道工具在哪里会错。不知道这一点,信任就会毫无根据地偏高或偏低。所以这一期的实用条目从那里开始。

我们组织在四者中的哪一个——四个问题

整理了检查组织中过度依赖、闲置、滥用与信任校准的四个诊断问题的图示。

是过度依赖吗。最近一个月里,有多少件AI结果原样发出去了?其中有多少件是人真的找出了错处的?如果后者是零,审阅就是走形式。审了却一次都没抓到,多半意味着没看,而不是完美无缺。

是弃用吗。引入的工具里,实际每周至少用一次的有几个?问起不用的理由,是不是听到因为它错过?那就确认那次经验是什么时候的,以及现在是否依然如此。如上一节所见,也可能是正当的弃用。

是滥用吗。引入这个工具时,有没有用文档定义留给人的工作?日程里有没有为审阅分配时间?出现异常时由谁处理有没有定下来?三样都没有,就是滥用。

校准了吗。成员能不能用一句话说出这个工具在哪一类工作上会出错?说不出来,信任就处在毫无根据的高或低。

要记住,四个问题里只有滥用那一条的回答主体不同。其余三条要问使用的人,那一条要问决定引入的人。

那么明天该改变什么

给每个工具附上一行会出错的地方,写在使用说明的最上面。比如这个工具在最新信息上很弱,这个工具经常漏掉表格里的数字。这就是信任校准最便宜的形式。

先动手减少误报。弃用的原因是警报设计而不是人的态度。在问为什么不用之前,先测虚响的比例;比例高就去改阈值,而不是去做培训。

在引入文档里把人的份额单列一节。只写自动化什么而不写留给人什么,剩下的活就会被定义为残余。这一节把滥用和正常引入分开。

记录审阅中抓到的错误件数。这个数字比使用率更能显示引入的健康度。连续为零就是审阅变成形式的信号,那时该动的是审阅流程。

概括起来就是:把目标定成信得有多准,而不是用得有多多。