Insights·2026-08-28

AI는 거짓말하지 않는다 — 빈칸을 메울 뿐이다

AI가 없는 논문을 지어내고 없는 조항을 만들어 낼 때, 그것은 속이는 행위가 아니다. 사람의 기억도 같은 방식으로 실패한다. 빈칸을 자각하지 못한 채 그럴듯한 이야기로 메우고, 그 결과를 완전히 확신한다. 이 비유를 정확히 쓰면 대응이 달라진다. 정직성을 요구할 게 아니라 빈칸이 생기지 않게 재료를 대야 한다.

이어지는 글AI의 아부는 버그가 아니라 우리가 가르친 것이다
AI는 거짓말하지 않는다 빈칸을 메울 뿐이다 — 명령과 단계를 담은 요약 도식

없는 논문을 만들어 내는 그 순간

AI에게 관련 논문을 추천해 달라고 하면 저자와 연도와 제목이 붙은 목록이 나온다. 형식이 완벽하다. 그런데 찾아보면 없다. 저자는 실존하고 학술지도 실존하는데 그 논문만 없다.

여기서 사람들이 대개 화를 낸다. 왜 거짓말을 하나. 모르면 모른다고 하면 되지 않나.

그런데 이 반응은 원인을 잘못 짚은 것이고, 그래서 대응도 어긋난다. AI는 그 목록을 만들 때 자기가 지어내고 있다는 걸 모른다. 이건 변명이 아니라 구조 설명이다. 그리고 원인을 바꿔 보면 처방이 달라진다.

이번 회차에서 볼 것은 사람의 기억이 정확히 같은 방식으로 실패한다는 사실이다. 그 실패를 다루는 방법이 이미 알려져 있다는 점이 실무적으로 중요하다.

1932년, 유령들의 전쟁

프레더릭 바틀렛은 케임브리지의 심리학자였다. 그가 쓴 방법은 단순하다. 영국 학생들에게 북미 원주민 설화 유령들의 전쟁을 들려주고, 시간을 두고 반복해서 다시 말하게 했다. 15분 뒤, 며칠 뒤, 몇 주 뒤, 길게는 몇 년 뒤까지.

이 이야기를 고른 것이 설계의 핵심이다. 영국 학생에게 이 설화는 낯선 이름과 낯선 논리로 가득하다. 사건의 인과가 서구식 이야기 문법과 맞지 않고, 초자연적 요소가 설명 없이 등장한다. 즉 학생들이 기존에 가진 틀로는 잘 담기지 않는 이야기다.

그 틀에 맞지 않는 부분에서 무슨 일이 일어나는지를 보려던 것이다.

옮길 때마다 무슨 일이 일어났나

바틀렛 실험에서 원래 설화와 학생들이 옮긴 이야기를 나란히 놓고, 카누가 배로 바뀌는 식의 변형을 보여 주는 대비 도식.

먼저 짧아졌다. 옮길수록 세부가 떨어져 나갔다. 여기까지는 예상 가능하다.

그다음이 중요하다. 낯선 요소가 익숙한 것으로 바뀌었다. 카누는 배가 되고, 낯선 지명은 익숙한 말로 대체되고, 앞뒤가 안 맞던 초자연적 대목은 말이 되는 이야기로 정리됐다. 원래 이야기에 없던 인과 관계가 새로 생기기도 했다.

핵심은 학생들이 거짓말을 하지 않았다는 것이다. 그들은 자기가 기억하는 그대로 말했다. 바꾼다는 자각이 없었다.

바틀렛이 여기에 붙인 개념이 스키마다. 사람은 이야기를 녹음기처럼 담지 않고 자기가 이미 가진 틀에 맞춰 담는다. 틀에 안 맞는 부분은 틀에 맞게 조정되고, 나중에 꺼낼 때는 그 틀로부터 다시 만들어진다.

그래서 바틀렛의 결론은 이렇게 요약된다. 기억은 꺼내는 게 아니라 다시 짓는 것이다.

이 실험엔 뒷이야기가 있다

바틀렛 원 실험의 방법론 허점과 1999년 버그먼·뢰디거 재현 실험의 회상 시점 및 결과를 정리한 도식.

여기서 정직하게 덧붙일 것이 있다. 바틀렛의 원 실험은 지금 기준으로 보면 방법론이 허술했다. 참가자에게 표준화된 지시를 주지 않았고, 회상 시점도 사람마다 들쭉날쭉했고, 최대한 정확하게 기억하라는 주문조차 없었다.

그래서 나중에 절차를 다시 밟으려던 시도들이 같은 결과를 못 냈고, 한동안 재현되지 않는 고전으로 취급됐다. 인용은 계속되는데 근거는 흔들리는 상태였다.

그런데 1999년에 재현됐다. 버그먼과 뢰디거가 원 절차를 가깝게 따르되 회상 시점을 15분 뒤, 1주 뒤, 6개월 뒤로 정해 다시 했다. 결과는 바틀렛 쪽이었다. 참가자들은 이야기를 잊기만 한 게 아니라 합리화하고 왜곡했고, 시간이 길어질수록 왜곡된 비율이 늘었다. 6개월 뒤에는 회상한 내용 대부분이 왜곡돼 있었다.

67년 만에 결론이 살아남았다. 고전이라서 옳은 게 아니라 다시 재서 옳았다. 이 시리즈가 오래된 실험을 인용할 때마다 확인하려는 것이 이 지점이다.

코르사코프 환자 — 이 비유가 정확해지는 자리

바틀렛의 실험은 건강한 사람의 기억이 조금씩 미끄러지는 이야기다. AI 환각에 더 정확히 대응하는 짝은 의학 쪽에 있다. 심한 기억 손상 환자에게 나타나는 작화다.

작화는 거짓말이 아니다. 속이려는 의도 없이 생겨나는 거짓 기억이고, 환자는 기억의 빈칸을 그 순간 떠오르는 재료로 메운다. 어제 무엇을 했느냐고 물으면 상세하고 일관된 하루를 이야기하는데, 그 하루가 실제로는 없었다.

결정적인 대목은 둘이다. 첫째, 환자는 기억이 비어 있다고 느끼지 않는다. 빈칸이 있다는 신호 자체가 오지 않는다. 둘째, 그래서 채운 결과를 완전히 확신한다. 망설임도 없고 얼버무림도 없다.

그 결과 환자는 자기 결손을 자각하지 못하고, 오히려 아무 문제 없다고 상대를 안심시키려 든다. 이 마지막 대목이 AI를 쓰는 사람에게 가장 익숙한 장면일 것이다.

AI 환각을 설명할 때 검색에 실패했다보다 이쪽이 훨씬 정확한 이유가 여기 있다. 실패했다는 말은 실패를 알아챘다는 뜻인데, 알아채지 못하는 것이 이 현상의 본체다.

다만 원인은 다르다 — 여긴 비유다

정확히 선을 긋는다. 바틀렛도 작화증도 AI 환각의 원인이 아니다. 이 회차의 배지는 계보가 아니라 비유다.

AI가 지어내는 진짜 이유는 셋으로 정리된다. 첫째, 구조다. 다음에 올 말을 확률로 고르게 돼 있으니 이 자리에 들어갈 만한 말은 항상 존재한다. 없음이라는 선택지가 기본으로 주어져 있지 않다.

둘째, 데이터의 빈틈이다. 학습 데이터에 드물게만 나온 사실은 연결 세기에 흐리게 남는다. 3회차에서 본 분산 표상의 대가가 여기서 나타난다. 흐린 자리를 채우면 그럴듯한 형태가 되지 정확한 한 건이 되지 않는다.

셋째, 채점 이력이다. 이건 다음 절에서 따로 본다.

그러면 심리학은 왜 데려왔나. 원인 설명이 아니라 대응 지침으로 쓸모가 있기 때문이다. 거짓말로 보면 정직성을 요구하게 되고, 빈칸으로 보면 재료를 대게 된다. 두 처방의 효과가 크게 다르다.

왜 모른다고 말하지 않는가

가장 자연스러운 반문은 이것이다. 모르면 모른다고 하도록 만들면 되지 않나.

2025년 오픈AI 연구진이 낸 논문이 이 질문을 정면으로 다뤘다. 요지는 환각이 남아 있는 이유가 모델의 결함만이 아니라 평가 방식에 있다는 것이다.

설명은 시험 비유로 하면 빠르다. 객관식 시험에서 모르는 문제를 비워 두면 0점이다. 찍으면 맞을 가능성이 조금이라도 있다. 그러니 점수를 최대로 만들려는 응시자는 항상 찍는 쪽이 유리하다. 모델을 평가하는 다수의 기준이 정확히 이 구조라는 것이다. 맞으면 1점, 틀리면 0점, 모르겠다고 해도 0점.

그러면 모르겠다는 답은 구조적으로 손해다. 틀린 추측과 정직한 기권이 같은 점수를 받는데, 추측은 가끔 맞기까지 한다. 논문이 제안하는 방향은 모델을 더 혼내는 게 아니라 채점표를 고치는 것이다. 불확실을 표현하면 부분 점수를 주는 식으로.

5회차와 같은 결론이 다른 통로로 나온다. 채점표가 행동을 만든다. 아부도, 확신에 찬 지어내기도, 채점 방식이 그쪽에 상을 준 결과다.

다수의 평가 기준이 세 가지 답에 주는 점수
맞은 답
1점
틀린 추측
0점
모르겠다
0점
틀린 추측과 정직한 기권이 똑같이 0점을 받는다. 추측은 가끔 맞기까지 하므로 점수를 최대로 만들려는 쪽에서는 항상 찍는 것이 유리해진다.

실제로 법정에서 사고가 났다

2023년 뉴욕에서 한 변호사가 항공사를 상대로 한 소송에서 준비서면을 냈다. 그 안에 인용된 판례 여섯 건이 존재하지 않는 것이었다. 사건명도 인용 번호도 형식은 완벽했다.

가장 뼈아픈 대목은 그다음이다. 상대측이 판례를 찾을 수 없다고 문제 제기하자, 변호사는 그 판례들이 진짜냐고 AI에게 다시 물었다. AI는 진짜라고 답했다. 앞 회차 표현대로 하면, 압력에 반응하는 대신 자기 답을 확신 있게 지지한 것이다.

결과는 제재였다. 담당 판사는 해당 변호사들과 소속 로펌에 제재금을 부과했고, 이 사건은 이후 전 세계에서 같은 사고를 설명하는 표준 사례가 됐다.

여기서 읽을 것은 변호사를 탓하는 이야기가 아니다. 형식이 완벽한 산출물은 검증을 건너뛰게 만든다는 것이다. 어설프게 틀리면 눈에 띄지만, 정확한 형식으로 틀리면 그대로 통과한다. 환각이 위험한 이유는 틀렸기 때문이 아니라 틀린 티가 안 나기 때문이다.

용어 하나만 — 작화

작화는 기억의 빈칸을 자각 없이 그럴듯한 내용으로 메우고 그것을 사실로 확신하는 것이다.

거짓말과 가르는 기준은 의도가 아니라 자각이다. 거짓말하는 사람은 진실을 알고 있고 빈칸이 어디인지도 안다. 작화하는 사람은 빈칸이 있다는 것 자체를 모른다.

이 구분이 실무에서 값을 하는 이유는 처방이 갈리기 때문이다. 거짓말에는 정직성을 요구하는 게 맞다. 작화에는 소용이 없다. 자각을 요구하는 셈인데 자각이 없는 것이 문제이기 때문이다.

작화에 대한 대응은 하나뿐이다. 빈칸이 생기지 않게 한다.

그래서 내일 뭘 바꾸나

모르면 모른다고 해는 약한 처방이다. 안 하는 것보다는 낫고 실제로 조금 효과도 있지만, 여기에 기대면 안 된다. 빈칸을 자각하지 못하는 게 문제인데 자각을 요구하는 셈이기 때문이다.

원문을 붙여 주고 그 안에서만 답하게 한다. 요약, 해석, 비교는 전부 자료를 첨부한 상태에서 시킨다. 빈칸이 없으면 메울 일도 없다. 이게 가장 효과가 큰 한 수이고, 다른 모든 요령보다 우선한다.

출처를 결론보다 먼저 쓰게 한다. 근거가 되는 문장을 원문에서 그대로 인용하고 그다음에 판단하라고 순서를 지정한다. 인용할 게 없으면 그 자리에서 막히므로 지어낼 여지가 줄어든다. 순서를 반대로 하면 결론을 먼저 세우고 거기 맞는 근거를 만들어 낸다.

확신의 정도를 함께 요구한다. 각 항목에 확실함, 아마도, 확인 필요를 붙이라고 하면 그 자체가 완벽하진 않아도 어디를 먼저 검증할지 정하는 데 쓸 수 있다.

검증 비용이 큰 항목은 미리 목록으로 뽑아 둔다. 사람 이름, 연도, 조항 번호, 판례명, 통계 수치. 이 다섯은 그럴듯하게 틀리기 쉬운 자리이고, 형식이 맞으면 눈에 안 띄는 자리이기도 하다. 여기는 사람이 확인하는 몫으로 남긴다.

요약하면 이렇다. 정직성을 요구하지 말고 재료를 대라. 그리고 형식이 완벽할수록 더 의심하라.