Insights·2026-08-28

AI不会说谎——它只是在填空

当AI编造出不存在的论文、不存在的条款时,那不是欺骗行为。人的记忆也以同样的方式失效:在没有察觉空缺的情况下用一个像样的故事把它填上,并且对结果深信不疑。把这个比喻用准了,应对方式就会不同。不该要求诚实,而该供给材料让空缺不产生。

承接前文AI的奉承不是缺陷,是我们教出来的
AI는 거짓말하지 않는다 빈칸을 메울 뿐이다 — 명령과 단계를 담은 요약 도식

编造出不存在论文的那一刻

请AI推荐相关论文,会得到带作者、年份和标题的清单。格式完美无缺。可是一查,没有。作者是真的,期刊也是真的,唯独那篇论文不存在。

人们通常在这里发火。为什么要说谎?不知道就说不知道不行吗。

但这个反应弄错了原因,所以应对也偏了。AI在生成那份清单时,并不知道自己在编造。这不是辩解而是机制说明。而原因一换,处方就变了。

这一期要看的是,人的记忆恰恰以同样的方式失效。这种失效模式已经被研究得很清楚,这一点在实务上很重要。

1932年,《幽灵之战》

弗雷德里克·巴特利特是剑桥的心理学家。他用的方法很简单。给英国学生读一个北美原住民的民间故事《幽灵之战》,然后隔一段时间让他们反复复述。十五分钟后、几天后、几周后,长的到几年后。

选这个故事是设计的核心。对英国学生来说,这个故事满是陌生的名字和陌生的逻辑。事件的因果不合西方的叙事语法,超自然元素毫无解释地出现。也就是说,这是他们既有框架装不太下的故事。

他要看的正是在那些装不下的地方会发生什么。

每复述一次发生了什么

对比图:巴特利特实验中的原始故事与学生复述版本并列,独木舟变成了船,陌生细节被改成熟悉的说法。

首先变短了。每转述一次,细节就掉一些。这一点在预料之中。

接下来的更重要。陌生的元素变成了熟悉的。独木舟变成了船,陌生的地名被换成常见的词,前后不搭的超自然段落被整理成说得通的故事。原文里没有的因果关系有时还会新长出来。

关键在于学生们并没有说谎。他们如实说出了自己记得的样子。他们对改动毫无自觉。

巴特利特给这件事起的概念叫图式。人不像录音机那样装故事,而是照着自己已有的框架去装。不合框架的部分被调整成合框架的样子,日后取出时又从那个框架重新造出来。

所以巴特利特的结论可以这样概括:记忆不是取出来的,而是重新盖起来的。

这个实验有后续

图示:巴特利特原始实验的方法漏洞,以及1999年伯格曼与罗迪格重复实验的回忆时点与结果。

这里得诚实地补一句。以今天的标准看,巴特利特原实验的方法相当粗糙。没有给参与者标准化的指示,回忆的时点因人而异,甚至没有要求他们尽量准确。

所以后来想重走一遍流程的尝试拿不到同样的结果,有一阵子它被当作无法重复的经典。引用照旧,脚下却在晃。

然而1999年它被重复出来了。伯格曼和罗迪格贴近原流程,但把回忆时点固定为十五分钟后、一周后、六个月后重做了一次。结果站在巴特利特这一边。参与者不只是忘了故事,还把它合理化、扭曲了,而且时间越长扭曲的比例越高。六个月后,回忆出来的内容大部分已被扭曲。

结论在六十七年后活了下来。不是因为它是经典才对,而是重新量过才对。每次引用旧实验时,这个系列要核的就是这一点。

科尔萨科夫患者——比喻变准的地方

巴特利特的研究说的是健康记忆一点点滑移。与AI幻觉更贴合的对应在医学那边:出现在严重记忆损伤患者身上的虚构症。

虚构不是说谎。它是在没有欺骗意图的情况下产生的虚假记忆,患者用当下浮现的材料把记忆的空缺填上。问他昨天做了什么,会得到一个细节丰富、前后连贯的一天,而那一天并不存在。

有两点是决定性的。第一,患者并不觉得记忆是空的。根本没有任何信号说这里有空缺。第二,正因如此,他对填进去的内容深信不疑。没有犹豫,也不含糊。

结果是患者意识不到自己的缺损,反而会试图让对方放心说没事。这最后一点,对用AI的人来说恐怕是最熟悉的场面。

这就是为什么用检索失败来解释AI幻觉不够准。失败意味着察觉到了失败,而察觉不到才是这个现象的本体。

不过原因不同——这里是比喻

把线划准。巴特利特也好虚构症也好,都不是AI幻觉的原因。这一期的标签是比喻,不是谱系。

AI编造的真正原因可以归为三条。第一是结构。它被造成按概率挑下一个词,所以能放进这个位置的东西总是存在的。没有把没有作为默认选项给它。

第二是数据的缝隙。在训练数据里只稀疏出现过的事实,在连接强度里留得很淡。第三期看到的分布式表征的代价在这里显形。把淡的地方填上,得到的是像样的形状,而不是精确的那一件。

第三是评分的历史。这个下一节单独看。

那为什么还要把心理学请来。因为它有用的地方不是解释原因,而是指导应对。当作说谎看,就会去要求诚实;当作空缺看,就会去供给材料。两种处方的效果差得很远。

为什么不说不知道

最自然的反问是这个。让它不知道就说不知道不就行了。

2025年OpenAI研究者的一篇论文正面处理了这个问题。要点是幻觉之所以留存,不只因为模型有缺陷,还因为评价的方式。

用考试来比喻最快。选择题不会做而留空是零分,蒙一个至少还有点机会答对。所以要把分数拉到最高,考生总是蒙更划算。用来评价模型的许多基准正是这个结构:答对得一分,答错零分,说不知道也是零分。

在这种记分下,说不知道在结构上就是吃亏。错误的猜测和诚实的弃权得分相同,而猜测偶尔还能对。论文提出的方向不是更狠地训模型,而是修那张评分表,比如对表达不确定给部分分。

和第五期相同的结论从另一条路走了出来。评分表塑造行为。奉承也好,充满自信的编造也好,都是记分方式往那个方向发奖的结果。

多数评测标准给三种回答的分数
答对
1分
答错
0分
不知道
0分
答错和诚实弃答同样得零分。既然猜测偶尔会对,以最大化分数为目标的一方就总是更适合去猜。

法庭上真的出过事

2023年纽约的一位律师在对某航空公司的诉讼中提交了一份准备书状。其中引用的六个判例并不存在。案名和引证编号的格式完美无瑕。

最扎心的是接下来。对方提出找不到这些判例时,律师又去问AI这些判例是不是真的。AI回答说是真的。用上一期的话说,它没有屈从于压力,而是自信地支持了自己的答案。

结果是制裁。主审法官对这几位律师及其所属律所处以罚款,此案后来成了全世界解释同类事故的标准案例。

这里要读到的不是一个责怪律师的故事,而是:格式完美的产出会让人跳过核查。错得笨拙很显眼,错得格式正确就一路通过。幻觉之所以危险,不是因为它错,而是因为它看不出错。

只讲一个术语:虚构

虚构是在没有自觉的情况下用像样的内容填补记忆的空缺,并把它当作事实深信不疑。

把它与说谎分开的标准不是意图而是自觉。说谎的人知道真相,也知道空缺在哪里。虚构的人根本不知道有空缺。

这个区分之所以在实务上值钱,是因为处方会分岔。对说谎,要求诚实是对的;对虚构,毫无用处,因为那等于要求自觉,而没有自觉正是问题所在。

对虚构的应对只有一条:不让空缺产生。

那么明天该改变什么

不知道就说不知道是一剂弱药。比不说好,实际上也有一点效果,但不能靠它。问题在于察觉不到空缺,而这句话恰恰是在要求察觉。

把原文贴上去,要求只在其中作答。摘要、解读、比较,全都在附上材料的状态下让它做。没有空缺就没有可填的。这是效果最大的一手,优先于其他所有技巧。

让它把出处写在结论之前。指定顺序:先从原文原样引用作为依据的句子,然后再判断。没有可引的就会当场卡住,编造的余地也就变小。顺序反过来,它就会先立结论再造出配套的依据。

同时要求给出确信程度。让它给每一项标上确定、大概、需核实,虽不完美,但足以用来决定先去核哪一条。

把核查成本高的项目预先列出来。人名、年份、条款号、判例名、统计数值。这五处最容易错得像模像样,也正是格式正确就藏得住的地方。这一栏留给人来确认。

概括起来就是:不要要求诚实,去供给材料。而且格式越完美,越该怀疑。