川に入っていった車たち

カーナビに従って川に入ってしまった運転者の話は都市伝説ではない。報じられた事例がいくつもある。
英国リポンでは、トラックの運転者が案内に従って浅瀬に入り、雨で増水した川に取り残されて救助された。マサチューセッツのある湖では運転者がそのまま水に入り、車が水没した。ワシントン州では夜中に道だと思って入った先が、船を水に下ろすスロープだった。
注目すべきは、彼らの多くが標識を見ていたことだ。水があることも見ていた。見ていて、それでも画面のほうを信じた。
この失敗には名前がある。そしてちょうど逆方向の失敗にも別の名前がある。二つを同じ表に置くと、AI導入がどこで狂うのかが整理される。
1997年、自動化との四つの関わり方
ラジャ・パラスラマンとビクター・ライリーが整理した分類である。論文の題がそのまま一覧だ。人と自動化、使用、過信、不使用、濫用。
第一に使用。人が自動化を入れたり切ったりする正常な選択である。何がその選択を左右するかも論文は挙げている。その道具をどれだけ信じるか、いまどれだけ忙しいか、この仕事の危険をどれほどと感じるか。
第二に過信。頼りすぎることだ。監視が抜け、判断が自動化のほうへ傾く。先の川の事例がこれである。
第三に不使用。あるのに使わないことだ。道具を買っておいて誰も立ち上げない状態である。
第四に濫用。前の三つとは性質が違う。これは利用者の行動ではなく設計者と管理者の行動だ。人の遂行にどんな結果が生じるかを考えずに自動化を導入することであり、そのとき運転者の役割は設計されないまま自動化の副産物として定義される。
この四つを一つずつ現状に当ててみると、AI導入で起きる問題のほとんどがこの表の中に入ってくる。
過信 — 信頼性が高いほど悪化する
過信には直観に反する箇所が一つある。自動化がよく誤るときよりも、ほとんど誤らないときのほうが悪化するのだ。
理由は単純である。百回のうち九十九回正しい道具を毎回確かめるのは無駄に感じられる。実際、たいていの場合それは無駄だ。だから確認をやめることが合理的な選択のように固まる。
問題は残りの一回だ。確認をやめた状態でその一回が来ると、防衛線が何もない。しかもその一回はたいてい平凡な状況ではなくまれな状況である。第10回で見た構造がここでもそのままだ。
カーナビに従って川に入った人々が変わった人々ではない理由がこれだ。その機械はそれまで何百回も正しかった。その蓄積が標識より重くなった瞬間に事故が起きる。
AIでも同じだ。要約がたいてい正確だから原文を開かなくなり、開かなくなった時点から誤った要約がそのまま通ってしまう。
不使用 — 狼少年が作る
反対側が不使用だ。道具があるのに人が使わない。
最もよくある原因が誤報である。警報がしばしば空振りすれば、人はその警報を切るか無視するようになる。これは怠慢ではなく学習だ。これまでの経験が、この通知はたいてい何でもないと教えたからである。
医療現場がこの問題の教科書だ。病棟で鳴る警報のうち実際に処置が要るものは少数で、残りは患者が寝返りを打ったかセンサーが一瞬ずれたかである。その結果が警報疲労だ。音が背景音になり、いざ本物の警報が鳴ったときの反応が遅れる。これは正式な安全警告が出るほどの事案である。
ここで重要なのは原因の位置だ。不使用の原因は人の態度ではなく閾値の設計にある。なぜ使わないのかと尋ねる前に空振り率を先に測るべき理由がこれだ。
AIの道具でも同じ形が出る。最初の数回で誤った答えを受け取った人は、その道具を二度と開かない。その後で道具がよくなっても開かない。第一印象が閾値の役を果たしたのだ。
ただし不使用が常に誤りとは限らない

ここで用心すべきことがある。不使用を一律に克服すべき抵抗と見てはいけない。
不正確な自動化はある線を下回ると人の助けにならず、むしろ邪魔になる。複数の研究をまとめた結果、その境目が信頼性0.7あたりだという報告がある。それ以下では道具を使ったほうが使わないより優れているとは言えない。
理由を考えれば当然だ。信頼性の低い道具を使えば結果を全部確かめ直さねばならない。それでは元の仕事に確認作業が上乗せされただけである。しかも横に答えがあると検査が緩むという性質まで重なる。
だから組織でこの道具はなぜ使われないのかという問いが出たとき、答えは二つある。一つは第一印象のせいで使わない本当の不使用であり、もう一つはこの仕事でその道具が実際に役に立たないという妥当な判断だ。二つを分けずに利用率だけ上げれば、前者は直らず後者は損になる。
濫用 — 四つのうち唯一、利用者の行動ではない
四つめが今回の本題だ。
濫用とは、人の遂行にどんな結果が生じるかを考えずに自動化を導入することである。主語が変わる点をもう一度押さえておきたい。過信と不使用は道具を使う人の行動であり、濫用は導入を決めた側の行動だ。
AI導入でこの形はこう現れる。道具を先に決めて手順は後から合わせる。人に残る仕事は議論されない。確認には時間が割かれず、例外処理には担当がおらず、失敗したときの責任だけが人に明確である。
そしてこの状態に置かれた人に現れる症状が、まさに前回見たものだ。残る仕事は難しくなったのに練習の機会はなく、監視せよと言われるのに監視する能力は使わないので鈍っている。
つまり第10回が症状を扱ったのなら、濫用はその原因の名前である。
四つのうち濫用が最も高くつく
前の三つは目に見える。信じすぎれば事故が起き、使わなければ道具が遊んでいるのが見える。どちらも指標に乗る。
濫用はそうではない。道具はよく回り、導入成果の指標もよく出る。処理件数が増え所要時間が減る。ところが人の側が静かに壊れていく。
しかも露見するのが遅い。たいていはまれな状況が来たとき、つまり人が介入せねばならないその瞬間に初めて露見する。そのときにはもうその能力がない。
そのうえ責任の所在がずれる。その状態を作ったのは導入を決めた側なのに、失敗が起きる場所はその仕事をしていた人だ。だから事故のあとに出る結論が個人の不注意になりやすく、そうなると原因はそのまま残る。
用語は一つだけ、信頼較正
信頼較正とは、道具の実際の信頼性と人が与える信頼を一致させることである。
過信は信頼が実際より高い状態、不使用は低い状態だ。だから目標は信頼を上げることでも下げることでもなく、合わせることである。
この言い方が実務で有用な理由がある。AI導入を語るとき、目標はたいてい利用率や受容度として立てられる。もっと使わせることが目的になるのだ。信頼較正を目標に据えると問いが変わる。この道具はどこまで信じるべきか。
そして合わせるには条件が一つ要る。道具がどこで誤るかを人が知っていることだ。これを知らなければ信頼は根拠なく高いか低いままにとどまる。だから今回の実用項目はそこから始まる。
自分の組織は四つのどこか — 四つの問い

過信か。この一か月でAIの結果をそのまま出した件は何件か。そのうち人が実際に誤りを見つけた件は何件か。後者が0なら確認は形式だ。確認したのに一度も引っかからなかったというのは、完璧だったのではなく見ていなかった可能性が高い。
不使用か。導入した道具のうち実際に週一回以上使われているものはいくつか。使わない理由を尋ねると、誤ったことがあるからという答えが出るか。ならばその経験がいつのもので、いまもそうなのかを確かめる。前節で見たとおり正当な不使用かもしれない。
濫用か。この道具を導入するとき、人に残る仕事を文書で定義したか。確認に割り当てた時間が日程にあるか。例外が出たとき誰が処理するか決まっているか。三つともなければ濫用だ。
較正されているか。構成員がこの道具はどんな種類の仕事で誤るかを一文で言えるか。言えなければ信頼は根拠なく高いか低い状態である。
四つの問いのうち濫用の項目だけ答える主体が違う点を覚えておきたい。残る三つは使う人に尋ね、その一つは導入を決めた人に尋ねる。
では明日から何を変えるか
道具ごとに誤る場所を一行付ける。使い方の文書のいちばん上に書く。この道具は最新の情報に弱い、この道具は表の中の数字をよく落とす、といった一行だ。これが信頼較正の最も安い形である。
誤報を減らす側に先に手をつける。不使用の原因は人の態度ではなく警報の設計だ。なぜ使わないのかと尋ねる前に空振り率を測る。そしてその率が高ければ研修ではなく閾値を直す。
導入の文書に人の取り分を一節として入れる。何が自動化されるかだけ書いて何が人に残るかを書かなければ、残る仕事は残余として定義される。その一節が濫用と正常な導入を分ける。
確認で捕まった誤りの件数を記録する。利用率よりこの数字のほうが導入の健康を示す。0が続けば確認が形式になった合図であり、そのときは確認の手順に手を入れる時期だ。
まとめるとこうだ。どれだけ使うかではなく、どれだけ正しく信じるかを目標に据える。
