驾驶舱里发生的事
客机的自动驾驶在巡航段比人更稳。风稍有变化时把高度和航向细微地保持住,这件事机器做得好得多。所以飞行员在巡航中做的,大体就是盯着仪表。
问题从这里开始。当出现自动驾驶应付不了的情况时,操纵权就交回给人。而自动驾驶应付不了的情况,按定义就是罕见且复杂的情况。
也就是说,一个几个小时什么都没做的人,会在几秒之内被交上系统刚刚放弃的最难的判断。而且毫无预告。
莉桑娜·班布里奇在1983年整理了这个结构。论文题为《自动化的反讽》,正文五页。
第一重反讽——设计者也是人

论文首先指出的反讽在一个意想不到的位置。
推行自动化的理由通常是人靠不住:人会出错、会疲劳、不一致,所以交给机器。可那台机器也是人设计的。
所以自动化系统里的错误不是消失,而是换了位置。一线的失误减少了,取而代之留下的是设计阶段没想到的条件。既然那正是人没能预见的东西,它在正常运行中不太显形,偏偏在罕见情况下爆开。
换到AI上,同一句话依然成立。人有偏见所以交给模型这个论证,在模型是用人造的数据训练出来这一事实面前,只有一半有效。
两重陷阱
正题是留给人的是什么。论文指出的陷阱有两重。
第一,留给人的不是容易的活,而是难的活。自动化先吃掉规则清楚、重复性强的部分,剩下的是例外、判断和模糊的情形。人的份额不是变少,而是在难度只升不降的情况下变少。
第二,练习那件难事的机会消失了,因为日常业务里用不到那项技能。手上的操作也好,读情势的感觉也好,不用就会生锈。于是真正需要的那一刻,本事比引入自动化之前还低。
还叠着第三重。要监督自动化跑得对不对,就得知道它的判断对不对。可知道对不对的能力,恰恰就是自动化替代掉的那项能力。要监督就得会做,而正因为自动化,你不再做了。
所以论文的结论显得反直觉:自动化系统的运营者需要的训练不是更少,而是更多,为的是那罕见却决定性的介入。
监视是人最不擅长的事

自动化之后留给人的代表性工作是监视,而这恰恰是人最不擅长的那一类。
这不是印象,而是很老的测量结果。二战前后英国有一项实验测量雷达监视员的成绩。参与者坐在一个形似时钟的装置前,要抓住指针偶尔跳两格而不是一格的瞬间。信号很稀少。
结果很清楚。开始大约半小时后,漏检率明显上升。不是因为人懒。长时间盯着什么都不发生的画面,这种能力人本来就没有多少。
由此得出的结论很扎人。自动化把最难的判断留给人,同时又让人以自己最不擅长的方式待命。两个条件同时落在同一个人身上。
这真的发生过

2009年大西洋上空的一起航空事故,把这个结构原样呈现了出来。
测速仪表结冰给出了无效读数,自动驾驶随即自行退出。操纵权在那一瞬交回给人。夜间、巡航高度、部分仪表不可信,以及几秒钟。
调查中指出的一点是:这种组合是机组在训练中和实务中都几乎没有遇到过的。在巡航高度手动飞行本身就很罕见——正因为自动驾驶运转良好。
班布里奇二十六年前写下的结构原封未动。机器放弃的那一刻正是最难的一刻,而为那一刻所做的练习在平日不会发生。
举这个例子不是要责怪航空业。航空是研究这个问题最久、也做出最多对策的领域。要点在于即便如此它依然留存。
自动化偏差——旁边有答案,人就看得少
还有一点。旁边摆着自动给出的建议,人的检查行为本身就会改变。
研究者把这种倾向称为自动化偏差,它表现为两个方向。一个是漏看:系统没有提示的问题,人也察觉不到;本该自己核对的地方,因为系统没出声就跳过去了。
另一个是跟着走:系统给出错误建议时,人会照做。独自一人时不会做的判断,因为屏幕上摆着一个答案就做了。
关键在于这不是本事不够。旁边有一个像样的答案时,人会自动降低检查强度。人会朝省力的方向倾斜,而由于那在多数情况下是合理的,它就固定下来了。
这与第九期的结论在此相遇。面对写得流畅的产出,人的检查会变弱。而AI的产出几乎总是流畅的。
四十年后,同样的结构进了办公室
这篇论文如今被重读,是因为AI的引入是完全相同的形状。
把起草交给AI,人的份额变成审阅。可审阅并不比起草容易。在别人写的像模像样的文字里找出错处,比对着白纸写更难。写的人知道自己在哪里含糊过去,读的人拿到的却是抹掉了那些痕迹的文本。
而且自己起草的次数越少,对什么地方不对的感觉就越钝。第二重陷阱原样运转。
代码也一样。把编写交出去,剩下的就是读和判断,而那比编写更难。把能跑的代码和看起来能跑的代码分开,只有写过的人做得到。
监视的问题也照旧。多数情况下AI的产出没问题。于是审阅变成盯着一块什么都不发生的屏幕,正是那种半小时后开始漏看的工作。
这不是在说所以别自动化
班布里奇的论文不是反自动化论。要点是:设计自动化的时候,必须把留给人的那一份也一起设计。
放着不管,人的那一份就不是被设计出来的,而是作为残余留下的——自动化没吃掉的部分就成了人的活。这样定下来的份额,从来没有人审视过它的难度。
现实中,在AI引入方案里很难找到对人这一侧的设计。要自动化什么写得很详细,而剩下的人在什么条件下做什么,只用审阅与批准这样一行带过。那一行装着这一期讲的全部陷阱。
给这种状态起的名字,会在下一期出现。
只讲一个术语:自动化的反讽
自动化的反讽是指:随着自动化推进,留给人的工作难度在上升,而练习那份工作的机会在减少。
这里用反讽这个词是准确的,因为意图与结果相反。为了减轻人的负担而做的事,只把最难的部分留给了人;为了减少失误而做的事,抬高了决定性时刻失误的概率。
这一期的标签是设计原理,理由也相同。这个理论不是任何AI算法的祖先,它规定的是该如何引入AI。航空与医疗用几十年时间做出的对策,可以直接作为参考材料。
那么明天该改变什么
把工作交给AI时,一并定下自己要持续练习的部分。全部交出去只做审阅,半年后连审阅的本事也一起下降。每周得有一件从头自己做的事。这不是偏好,而是应对折旧。
不要把审阅当成比起草更容易的事来排计划。排期和人力时如果掺进了AI写初稿所以审阅很快这个假设,那份计划已经错了。省下来的是写的时间,不是判断的时间。
把审阅项目预先做成清单。通读一遍再找哪里怪,这种方式在流畅的文字面前会失败。事先定好核对点——数值、日期、引用、条件、异常处理——再逐项扫过。这与第六期列出的核查清单是同一个东西。
随机抽几件从头再做一遍。这是维持监视类工作成绩的已知办法。全量审阅无法持续,选定样本深挖则可以持续。而那个样本同时就是维持本事的练习量。
很少用到的技能要排进日程去练。航空业使用模拟机的理由就是这个。不把不用AI从头做一遍放进日历,就没有人会做。
概括起来就是:决定交出什么的时候,也一并决定留下什么。
