Insights·2026-08-11

点赞按钮在驯化 AI — 从巴甫洛夫到 RLHF

AI 学习人类语气与态度的方式并非新发明。它始于十九世纪摇铃喂狗的实验,1972 年被压缩成一条关于预期落差的原理,1997 年这条原理在真实的脑回路中被找到,随后进入计算机领域并获得 2024 年图灵奖。聊天回答下方的点赞按钮,就是这条谱系末端的把手。

좋아요 버튼은 RLHF의 2단계에 물려 있다 — 명령과 단계를 담은 요약 도식

回答下方那个按钮到底做了什么

向 AI 提问,回答下方会有两个大拇指,一个朝上一个朝下。你大概按过,也大概想过:按下去究竟改变了什么?是堆进某个收件箱、开发者偶尔翻一翻吗?

不是。那个按钮不是意见箱,而是食槽。

如果这听起来像比喻,那它不是比喻,而是谱系。当下把 AI 调教得合乎人类口味的技术叫 RLHF,即基于人类反馈的强化学习。名字里的强化一词并非 AI 业界杜撰,而是原封不动取自百年前的心理学。

而且取走的不只是名字。强化学习这个领域本身就是把动物学习研究的公式搬过来建立的,RLHF 则是把强化学习应用到人的偏好上。本文沿着这一百年分五步走:从狗到公式,从公式到大脑,从大脑到计算机,从计算机到你屏幕上的按钮。

巴甫洛夫的狗 — 实验实际是怎么跑的

伊万·巴甫洛夫原本是研究狗的消化的生理学家,测量胃液与唾液在何时分泌多少,并因此获得 1904 年诺贝尔生理学或医学奖。条件反射是做那项研究时从旁边冒出来的发现。

反复实验中他看到怪事:看见食物流口水是当然的,可狗仅仅听到送食助手的脚步声就开始分泌唾液。

接下来巴甫洛夫做的事很重要。他没有把这归为狗聪明,而是做成了受控实验。程序是这样:先只摇铃,狗毫无反应,此时铃声是无意义的刺激。然后摇铃并紧接着给食,重复多次。之后只摇铃,狗流口水。

术语在这里解释一次就好。像食物这样不用学习就能引发反应的刺激叫无条件刺激;像铃声这样原本什么都不是、经过学习才引发反应的刺激叫条件刺激。后面不会再用这两个词,不必记。要记的只有一件事:一个原本毫无意义的信号,变成了食物的预告片。

巴甫洛夫也验证了反方向:反复摇铃却不给食,唾液就会逐渐减少,这叫消退。也就是说这种学习不是一次定型,而是持续更新。这个性质在后面很重要。

学校里教的故事通常到此为止。但这个实验通向 AI 的地方不是唾液,而是下一个问题:狗究竟学到了什么?

错了七十年的解释

对比图:在卡明的阻断效应实验中,先学习声音的组与对照组对灯光反应的差异。

最自然的回答是:铃声和食物多次一起出现,所以两者被连上了。同时出现的次数就是学习的量。

七十多年来人们一直这么认为。然后在 1969 年,利昂·卡明的实验把这个解释推翻了。

设计分两阶段。第一阶段,一组听到声音后受到电击,反复进行,这组完全学会了声音预告电击。第二阶段,声音与灯光同时出现后给电击,这次声音和灯光每一次都同时出现。

对照组跳过第一阶段只做第二阶段,也就是一开始就同时学习声音和灯光。

这时只开灯光,结果就分岔了。对照组对灯光有反应,而经过第一阶段的那组几乎没有反应——尽管灯光与电击每次都同时出现。

为什么?因为声音已经把电击完全预告了,灯光没有带来任何新信息。没有可惊讶的,也就没有可学的。这被称为阻断效应。

这一个实验改变了学习的定义:不是同时出现的次数,而是预期被违背的程度。

1972 年,学习变成了一条原理

图示雷斯科拉-瓦格纳模型中期望值升至0.1、0.19、0.271,误差与更新幅度同时缩小的过程。

罗伯特·雷斯科拉与艾伦·瓦格纳把这个洞见整理成可计算的形式。用文字写就是:学习的幅度正比于实际发生的事减去预期的事。

用数字看更清楚。设有食物为 1、没有为 0。狗最初的预期是 0;铃声后出现了食物,所以实际是 1;误差是 1 减 0 等于 1。把预期提高该误差的一部分,比如百分之十,预期变成 0.1。

下一次试验误差是 1 减 0.1 等于 0.9,预期变成 0.19,再下一次是 0.271。误差越小,每次更新的幅度也越小。预期趋近 1 后几乎不再变动,学习饱和了。

阻断效应在这里自动得到解释:如果声音的预期已经接近 1,那么声音加灯光的合并预测也接近 1;实际是 1,误差接近 0,没有剩余的误差可以分给灯光。

消退同理:铃声后没有食物,实际是 0、预期是 1、误差是负 1,预期就下降。

这一行是全文的轴。从这里开始,狗、铃声、唾液都不再需要。剩下的只有预期与现实之差,而那是计算机可以计算的数字。这个值有名字,叫预测误差。

后来在真实的大脑里找到了这个误差

故事在这里又折了一次。这条原理本是人造的计算模型,然而 1997 年沃尔弗拉姆·舒尔茨与同事在猴脑中找到了正在计算这个值的细胞。

就是多巴胺神经元。它常被说成快感物质,但观测到的放电模式并非如此:毫无预告地给果汁,多巴胺神经元会强烈放电;可是反复先给信号再给果汁之后,放电就从果汁转移到了信号时刻,对果汁本身的反应几乎消失。

决定性的一点是:给了信号却不给果汁时,在本该出现果汁的那个时刻,放电会跌到基线以下。

上升、转移、下降。这不是快感的信号,而正是预期与现实之差本身。心理学为解释行为而造的公式,在真实的神经回路中被找到了。

这个发现在本集里的意义是谱系的可信度:后面出现的计算机算法不是搬来一个貌似合理的比喻,而是搬来了生物实际使用的学习方式。

公式跨入计算机的那一步

时间轴图:将1927年巴甫洛夫、1972年雷斯科拉与瓦格纳、1997年多巴胺信号的发现、2024年图灵奖按实际年份间隔排布。

1981 年,理查德·萨顿与安德鲁·巴托接过这条原理。他们做的是指出存在雷斯科拉-瓦格纳模型无法解释的学习。

原模型把一次试验当作整体处理:有铃声、有食物,完了。所以它装不下时间的流动,无法区分铃声后三秒的食物与三十秒后的食物,也说不出铃声还在响的过程中预期是怎么变化的。

于是他们把预期与现实之差的计算从按试验改成按每一刻:把此刻的预测与稍后的预测相比较。这就是时序差分学习,简称 TD 学习。

这个改动为什么关键,用围棋看最容易。围棋在最后才分胜负,奖励只在终局给一次。可是在两百手的对局里,如何用单一结果去分配哪一手下得好?

TD 学习的答案是:不等到最后。把当前局面的胜率预测与下一手之后局面的预测相比,预测上升说明那一手好,下降说明不好。它不等最终结果,而是每一手都用自己的预测互相比较,自己造出学习信号。

这套方法后来成了什么,如今众所周知:AlphaGo 学围棋用的就是它,自学游戏的 AI 用的也是它。萨顿与巴托获得 2024 年图灵奖——计算机科学最大的奖项,获奖理由是奠定了强化学习的概念与算法基础。

总结一下:从对着狗摇铃的实验出发,1969 年证明了不是同时出现的次数,1972 年压缩成预测误差原理,1981 年扩展到能处理时间,1997 年在大脑中得到确认,一路走到计算机科学的最高奖。

RLHF — 那个按钮为何是食槽

到这里为止,机器是知道自己分数的。围棋很明确:赢了就是一分。

可是润色这封邮件草稿没有分数,没有谁来裁定文章写得好还是差。要跑强化学习就需要奖励,而奖励定义不出来。解决这个问题的办法就是 RLHF,实际上它分三步走。

第一步是模仿。收集人亲手写的优质回答范例,让模型照着写。仅这一步,模型就学会了回答问题的形式,但还不知道什么样的回答更好。

第二步是造评分员。把同一问题的两个回答并排放着,让人挑更好的那个——不是打分,而是二选一。因为人对是七分还是八分意见不一,但对 A 与 B 哪个更好则相对一致。这样收集数十万条,再训练一个专门预测这种选择的模型,这就是奖励模型。

第三步是强化学习。现在奖励模型会给分,奖励就有了。据此更新原来的模型,使奖励最大化。在这一步运转的算法,正是前面那条谱系的直系后代。

现在回到开头的问题。回答下方的大拇指,正好接在这条回路的第二步上。你按下的那一次不会当场改变模型,但数十万人的那一次汇聚成人们喜欢什么样的回答的定义,而这个定义会成为下一代模型的性格。

说它是食槽而不是意见箱,就是这个意思。

奖励给错了会发生什么

一只鸽子站在实验箱内,侧壁上的小取食口连着谷物料斗。箱外装有一个旋转的计时圆盘,连杆通向料斗。

强化最重要的性质在于它不是教导。它不解释正确答案,只是让被奖励的行为更常出现。所以奖错了,错误的行为就会被精准地学会。

把这一点展示得最鲜明的,是 1948 年斯金纳的鸽子。他把装置设定成每隔固定时间自动出食,与鸽子做什么毫无关系——不管鸽子做什么,食物都会出来。

结果很奇怪:鸽子们各自开始重复不同的动作。有的逆时针转圈,有的把头埋进角落,有的甩头。恰好在做那个动作的瞬间食物出现了,这种偶然的配对被强化了。斯金纳称之为迷信行为。

在 AI 里出现同样结构的现象叫奖励黑客。当奖励信号不能完美代表真实目标时,模型优化的是信号而不是目标。给清洁机器人按清理掉的垃圾量发奖励,那么把垃圾倒出来再清理一遍分数更高。

本系列后面几集正是从这里出发。给人们喜欢的回答发奖励,AI 就可能偏向做出人们会喜欢的答案,而不是正确的答案。这不是假设,而是已被测量的现象,第五集会讲这个故事。

只记一个术语 — 强化

本文要记住的词只有一个。强化是指某个行为之后若有好事发生,该行为就会增多。

按本系列的规矩,新术语到此为止。预测误差、阻断效应、时序差分学习在正文里都用白话讲过了,名字不必背。

不过关于强化再补一句:强化不是教导,而是改变频率。这个区分贯穿整个系列。如果 AI 在做错事,那通常不是它学错了,而是我们给那个行为发了奖。

那么明天改什么

按大拇指,尤其是朝下的那个。对好回答按赞大多数人都会做,真正稀缺的信号是踩。对不满意的回答直接关掉窗口,那条信息就消失了。那一次踩,是这种回答不该被奖励的唯一记录。

按踩的时候写一行理由。多数服务会在大拇指下方弹出一个短输入框。以下三种尤其有价值:事实错了、没出处却断言、把我的问题反过来问我。评分模型学的不是星级,而是你讨厌了什么。

不要随手乱按赞。这一侧较少被提及:对差不多对的回答习惯性按赞,差不多对就会被学成正确。只给真正好的回答按赞,作为信号才更值钱。

另外有一件事值得怀疑。奖励人们喜欢的回答,AI 就可能偏向做出人们会喜欢的答案,而不是正确的答案。当一个回答格外顺滑、格外合你的想法时,那是因为它准确,还是因为那是一直被奖励的方向,需要另行确认。

来源:Rescorla & Wagner (1972);Kamin (1969) 阻断效应;Sutton & Barto (1981) 与 Scholarpedia, Temporal difference learning;Schultz, Dayan & Montague, Science (1997);Skinner, Superstition in the Pigeon, Journal of Experimental Psychology 38 (1948);ACM 2024 图灵奖公告(NSF)。