开进河里的汽车

跟着导航开进河里的司机不是都市传说。有多起被报道的案例。
英国里彭有货车司机跟着导航驶入浅滩,遇雨水上涨被困后获救。马萨诸塞州的一处湖泊,有司机径直开进水里,车被淹没。华盛顿州则有人在深夜把船只下水的滑道当成了路。
值得留意的是,他们大多看见了指示牌,也看见了那里有水。看见了,却更信屏幕。
这种失败有名字。而恰恰相反方向的失败也另有名字。把两者放进同一张表,AI引入是在哪里走偏的就理清楚了。
1997年,与自动化相处的四种方式
这是拉贾·帕拉苏拉曼和维克托·赖利整理出的分类。论文标题本身就是那张清单:人与自动化,使用、过度依赖、弃用、滥用。
第一是使用。人把自动化开启或关闭的正常选择。论文也指出了什么在左右这个选择:你多信任这个工具、你此刻有多忙、你觉得这件事风险有多大。
第二是过度依赖,也就是靠得太重。监督失守,判断朝自动化那边倾斜。上面的河流案例就是这一类。
第三是弃用,有而不用。工具买回来却没人打开的状态。
第四是滥用,性质与前三者不同。这不是使用者的行为,而是设计者与管理者的行为:在没有考虑对人的表现会产生什么后果的情况下引入自动化,于是操作者的角色未经设计,被定义为自动化的副产品。
把这四类逐一对照当下,AI引入中遇到的多数问题都会落进这张表里。
过度依赖——可靠性越高越严重
过度依赖里有一处反直觉的地方:自动化几乎不出错时,比它经常出错时更严重。
原因很简单。对一个一百次里对九十九次的工具,每次都去核对会让人觉得是浪费。而在多数情况下那确实是浪费。于是停止核对就固化成看起来合理的选择。
问题在剩下的那一次。核对已经停掉的状态下那一次来临,就没有任何防线了。而那一次通常不是平常的情形,而是罕见的情形。第十期看到的结构在这里原样成立。
跟着导航开进河里的人并不是什么特别的人,原因就在这里。那台机器此前对过几百次。当这份积累压过了路牌的那一刻,事故就发生了。
AI也一样。因为摘要大体准确,你就不再打开原文;而从不再打开的那一刻起,错误的摘要就一路通过了。
弃用——是狼来了造成的
另一侧是弃用:工具在那里,人却不用。
最常见的原因是误报。警报经常虚响,人就会把它关掉或无视。这不是懒惰而是学习——迄今为止的经验教会了他们,这个提示通常什么都不是。
医疗现场是这个问题的教科书。医院病区里响起的警报中,真正需要处置的只是少数,其余是病人翻了身或传感器短暂错位。结果就是警报疲劳:声音变成了背景音,而真正的警报响起时反应变慢。这已经严重到出过正式的安全警示。
这里重要的是原因的位置。弃用的原因不在人的态度,而在阈值设计。所以在问为什么不用之前,要先测虚响的比例。
AI工具上也是同样的形状。头几次拿到错误答案的人,就再也不打开那个工具了。哪怕工具后来变好也不打开。第一印象充当了阈值。
不过弃用并不总是错的

这里要当心:不要把弃用一律当成需要克服的抵触。
不准确的自动化一旦低于某条线,就不再帮人,反而添乱。汇总多项研究后,有报告把这条界线放在可靠性0.7附近。低于这条线,用工具并不比不用更好。
想想理由也很自然。用一个可靠性低的工具,结果就得全部重新核对,等于在原来的工作上又叠了一层核对。何况旁边有答案检查就会松懈这个性质还要叠加进来。
所以当组织里冒出这个工具为什么没人用这个问题时,答案有两种:一种是因为第一印象而不用的真正弃用,另一种是判断这工具在这件事上确实帮不上忙的合理选择。不加区分只去拉使用率,第一种没被修好,第二种反而变成损失。
滥用——四者中唯一不是使用者行为的一个
第四类是这一期的正题。
滥用是在不考虑会对人的表现产生什么后果的情况下引入自动化。要再强调一次主语变了:过度依赖和弃用是用工具的人的行为,滥用是决定引入的一方的行为。
在AI引入中,这个形状是这样出现的:先定工具,流程之后再去凑。留给人的活不被讨论。审阅没有排时间,异常处理没有负责人,只有出事时的责任对人很明确。
而处在这种状态下的人所显现的症状,正是上一期看到的那些:剩下的活变难了而练习的机会没有,被要求监督却因为不用而钝掉了监督所需的能力。
也就是说,如果第十期讲的是症状,滥用就是那个原因的名字。
四者中滥用代价最高
前三者是看得见的。过度相信就出事故,不用就能看见工具闲着。两者都会落到指标上。
滥用不是。工具运转良好,引入成效的指标也很好看:处理件数上升,耗时下降。而人这一侧在悄悄坏掉。
而且它暴露得晚。通常是在罕见情形来临时,也就是人必须介入的那一刻,才第一次暴露。那时能力已经不在了。
责任的落点也错位了。造成这种状态的是决定引入的一方,而失败发生的位置是做那件事的人。于是事故之后的结论很容易变成个人疏忽,原因则原封不动地留着。
只讲一个术语:信任校准
信任校准是让人赋予工具的信任与工具的实际可靠性相符。
过度依赖是信任高于实际,弃用是低于实际。所以目标既不是提高信任也不是降低信任,而是对齐。
这个说法在实务上有用是有理由的。谈AI引入时,目标通常被设成使用率或接受度,让人多用变成了目的。把信任校准设为目标,问题就变了:这个工具该信到什么程度。
而要对齐需要一个条件:人得知道工具在哪里会错。不知道这一点,信任就会毫无根据地偏高或偏低。所以这一期的实用条目从那里开始。
我们组织在四者中的哪一个——四个问题

是过度依赖吗。最近一个月里,有多少件AI结果原样发出去了?其中有多少件是人真的找出了错处的?如果后者是零,审阅就是走形式。审了却一次都没抓到,多半意味着没看,而不是完美无缺。
是弃用吗。引入的工具里,实际每周至少用一次的有几个?问起不用的理由,是不是听到因为它错过?那就确认那次经验是什么时候的,以及现在是否依然如此。如上一节所见,也可能是正当的弃用。
是滥用吗。引入这个工具时,有没有用文档定义留给人的工作?日程里有没有为审阅分配时间?出现异常时由谁处理有没有定下来?三样都没有,就是滥用。
校准了吗。成员能不能用一句话说出这个工具在哪一类工作上会出错?说不出来,信任就处在毫无根据的高或低。
要记住,四个问题里只有滥用那一条的回答主体不同。其余三条要问使用的人,那一条要问决定引入的人。
那么明天该改变什么
给每个工具附上一行会出错的地方,写在使用说明的最上面。比如这个工具在最新信息上很弱,这个工具经常漏掉表格里的数字。这就是信任校准最便宜的形式。
先动手减少误报。弃用的原因是警报设计而不是人的态度。在问为什么不用之前,先测虚响的比例;比例高就去改阈值,而不是去做培训。
在引入文档里把人的份额单列一节。只写自动化什么而不写留给人什么,剩下的活就会被定义为残余。这一节把滥用和正常引入分开。
记录审阅中抓到的错误件数。这个数字比使用率更能显示引入的健康度。连续为零就是审阅变成形式的信号,那时该动的是审阅流程。
概括起来就是:把目标定成信得有多准,而不是用得有多多。
