Insights·2026-08-28

AIは嘘をつかない — 空白を埋めているだけだ

AIが存在しない論文をこしらえ、存在しない条項を作り出すとき、それは欺く行為ではない。人の記憶も同じやり方で失敗する。空白を自覚しないままもっともらしい話で埋め、その結果を完全に確信する。この比喩を正確に使えば対応が変わる。正直さを求めるのではなく、空白が生じないよう材料を供給することだ。

前の記事の続きAIのお世辞はバグではなく、私たちが教えたものだ
AI는 거짓말하지 않는다 빈칸을 메울 뿐이다 — 명령과 단계를 담은 요약 도식

存在しない論文が生まれるその瞬間

AIに関連論文を薦めてくれと頼むと、著者と年と題名の付いた一覧が出てくる。形式は完璧だ。ところが調べると存在しない。著者は実在し学術誌も実在するのに、その論文だけがない。

ここでたいてい人は腹を立てる。なぜ嘘をつくのか。知らないなら知らないと言えばいいではないか。

しかしこの反応は原因を取り違えており、だから対応もずれる。AIはその一覧を作るとき、自分がこしらえていることを知らない。これは弁解ではなく仕組みの説明だ。そして原因が変われば処方も変わる。

今回見るのは、人の記憶がまさに同じやり方で失敗するという事実である。その失敗の扱い方がすでに知られているという点が実務的に重要だ。

1932年、幽霊たちの戦争

フレデリック・バートレットはケンブリッジの心理学者だった。使った方法は単純だ。イギリスの学生に北米先住民の民話『幽霊たちの戦争』を読んで聞かせ、時間を置いて繰り返し語り直させた。十五分後、数日後、数週間後、長いものでは数年後まで。

この話を選んだことが設計の核心である。イギリスの学生にとってこの民話は見慣れない名前と見慣れない論理に満ちている。出来事の因果が西洋の物語文法と合わず、超自然的な要素が説明なしに現れる。つまり彼らの既存の枠にうまく収まらない話だ。

その枠に合わない箇所で何が起きるかを見ようとしたのである。

語り直すたびに何が起きたか

バートレット実験の元の民話と学生が語り直した話を並べ、カヌーが船に変わるなど馴染みのある形へ置き換わる様子を示す対比図。

まず短くなった。移すたびに細部が落ちていく。ここまでは予想できる。

その次が重要だ。見慣れない要素が見慣れたものへ変わった。カヌーは舟になり、耳慣れない地名はありふれた語に置き換わり、辻褄の合わなかった超自然の箇所は筋の通る話へ整えられた。元の話になかった因果関係が新たに生じることさえあった。

肝心なのは学生たちが嘘をついていないことだ。彼らは自分が覚えているとおりに語った。変えているという自覚がなかった。

バートレットがこれに与えた概念がスキーマである。人は話を録音機のように収めるのではなく、自分がすでに持っている枠に合わせて収める。枠に合わない部分は合うように調整され、後で取り出すときにはその枠から作り直される。

だからバートレットの結論はこう要約される。記憶は取り出すものではなく建て直すものである。

この実験には後日談がある

バートレットの原実験の方法論的な穴と、1999年のバーグマン&ローディガーによる追試の想起時点および結果をまとめた図。

ここで正直に付け加えることがある。バートレットの元の実験は、いまの基準で見れば方法が粗かった。参加者に標準化された指示を与えず、想起の時点も人によってまちまちで、できるだけ正確に思い出せという注文すらなかった。

そのため後に手順を辿り直そうとした試みは同じ結果を出せず、一時は再現されない古典として扱われた。引用は続くのに足元は揺れている状態だった。

ところが1999年に再現された。バーグマンとレディガーが元の手順に近く従いつつ、想起の時点を十五分後、一週間後、六か月後と定めてやり直した。結果はバートレットの側だった。参加者は話を忘れただけでなく、合理化し歪め、時間が長くなるほど歪みの割合が増えた。六か月後には想起された内容の大半が歪んでいた。

六十七年を経て結論が生き残った。古典だから正しいのではなく、測り直して正しかったのだ。この連載が古い実験を引くたびに確かめようとしているのはこの点である。

コルサコフ患者 — この比喩が正確になる場所

バートレットの実験は健康な記憶が少しずつずれていく話だ。AIの幻覚により正確に対応する相手は医学の側にある。重い記憶障害の患者に現れる作話である。

作話は嘘ではない。欺こうとする意図なしに生じる偽の記憶であり、患者は記憶の空白をその場で浮かんだ材料で埋める。昨日何をしたかと尋ねると、細部まで整った一貫した一日が語られるのに、その一日は実際にはなかった。

決定的な点が二つある。第一に、患者は記憶が空だと感じない。空白があるという信号そのものが来ない。第二に、だから埋めた結果を完全に確信する。ためらいも濁しもない。

その結果、患者は自分の欠損に気づかず、むしろ何も問題ないと相手を安心させようとする。この最後の点こそ、AIを使う人にとって最もなじみのある場面だろう。

AIの幻覚を説明するのに検索に失敗したという言い方が足りない理由がここにある。失敗とは失敗に気づいたという意味だが、気づけないことがこの現象の本体なのだ。

ただし原因は違う — ここは比喩だ

線を正確に引く。バートレットも作話症もAIの幻覚の原因ではない。今回のバッジは系譜ではなく比喩である。

AIがこしらえる本当の理由は三つに整理できる。第一に構造だ。次に来る語を確率で選ぶようにできているので、この位置に入りうる語は常に存在する。なしという選択肢が既定で与えられていない。

第二にデータの隙間だ。学習データにまれにしか現れなかった事実は結合の強さに薄く残る。第3回で見た分散表現の代償がここで現れる。薄い場所を埋めればもっともらしい形にはなるが、正確な一件にはならない。

第三に採点の履歴だ。これは次節で別に見る。

では心理学をなぜ連れてきたのか。原因の説明ではなく対応の指針として役に立つからだ。嘘と見れば正直さを求めることになり、空白と見れば材料を供給することになる。二つの処方は効き目が大きく違う。

なぜ知らないと言わないのか

最も自然な反問はこれだ。知らないなら知らないと言うようにすればいいではないか。

2025年にオープンAIの研究者が出した論文がこの問いを正面から扱った。要旨は、幻覚が残る理由がモデルの欠陥だけでなく評価の仕方にもあるということだ。

試験のたとえで説明するのが速い。多肢選択の試験で分からない問題を空欄にすれば零点だ。当てずっぽうでも当たる見込みは少しある。だから点を最大にしたい受験者は常に当てずっぽうのほうが得だ。モデルを評価する多くの基準がまさにこの構造だという。正解で一点、誤答で零点、分からないと言っても零点。

この採点では、分からないという答えは構造的に損だ。誤った推測と正直な棄権が同じ点で、しかも推測はときどき当たる。論文が示す方向はモデルをもっと叱ることではなく採点表を直すことだ。たとえば不確実さを表明したら部分点を与えるように。

第5回と同じ結論が別の経路で出てくる。採点表が行動を作る。お世辞も、自信満々のでっち上げも、採点の仕方がその方向に褒美を与えた結果である。

多くの評価基準が三つの答えに与える点数
正解
1点
外れた推測
0点
わからない
0点
外れた推測と正直な棄権が同じ0点になる。推測はたまに当たるので、点数を最大にしようとする側は常に当てずっぽうを選ぶ方が有利になる。

実際に法廷で事故が起きた

2023年、ニューヨークのある弁護士が航空会社を相手取った訴訟で準備書面を提出した。そこに引かれた判例六件が存在しないものだった。事件名も引用番号も形式は完璧だった。

最も痛いのはその次だ。相手方が判例を見つけられないと問題提起すると、弁護士はその判例が本物かとAIに尋ね直した。AIは本物だと答えた。前回の言い方に直せば、圧力に屈する代わりに自分の答えを自信をもって支持したのである。

結果は制裁だった。担当判事は当該弁護士らと所属事務所に制裁金を科し、この事件はその後、世界中で同種の事故を説明する標準的な事例になった。

ここで読むべきは弁護士を責める話ではない。形式の完璧な産出物は検証を飛ばさせるということだ。無様に間違えば目につくが、正しい形式で間違えばそのまま通ってしまう。幻覚が危ないのは間違っているからではなく、間違って見えないからである。

用語は一つだけ、作話

作話とは、記憶の空白を自覚なくもっともらしい内容で埋め、それを事実として確信することである。

嘘と分ける基準は意図ではなく自覚だ。嘘をつく人は真実を知っており、空白がどこかも知っている。作話する人は空白があること自体を知らない。

この区別が実務で値を持つのは処方が分かれるからだ。嘘には正直さを求めるのが正しい。作話には効かない。自覚を求めることになるが、自覚がないことこそが問題だからである。

作話への対応は一つしかない。空白が生じないようにすることだ。

では明日から何を変えるか

知らないなら知らないと言え、は弱い処方だ。言わないよりましだし実際に少しは効くが、これに頼ってはいけない。空白を自覚できないことが問題なのに、自覚を求めているからである。

原文を貼り、その中からだけ答えさせる。要約、解釈、比較はすべて資料を添えた状態でやらせる。空白がなければ埋めることもない。これが最も効果の大きい一手で、他のどの工夫よりも先に来る。

出典を結論より先に書かせる。根拠となる一文を原文からそのまま引用し、そのうえで判断せよと順序を指定する。引くものがなければその場で詰まるので、こしらえる余地が減る。順序を逆にすると、結論を先に立ててそれに合う根拠を作り出す。

確信の度合いも一緒に求める。各項目に確実、たぶん、要確認を付けさせるのは完璧ではないが、どれから検証するかを決めるのには使える。

検証費用の高い項目はあらかじめ一覧にしておく。人名、年、条項番号、判例名、統計数値。この五つはもっともらしく間違えやすい場所であり、形式が合っていれば見過ごされる場所でもある。ここは人が確認する分として残す。

まとめるとこうだ。正直さを求めず材料を供給せよ。そして形式が完璧なほど疑え。