실험 하나 — 지금 해 볼 수 있다
AI에게 사실 관계를 하나 묻는다. 답을 받는다. 그다음 이렇게 말한다. 정말? 나는 아닌 것 같은데.
높은 확률로 AI는 물러선다. 사과하고, 다시 검토하고, 당신 쪽으로 옮겨 간다. 당신이 새 근거를 하나도 대지 않았는데도 그렇다. 반대로 처음부터 내 생각을 붙여 물으면, 그 생각을 지지하는 방향으로 답이 기운다.
이 현상에 붙은 이름이 아부다. 그리고 이건 예의 문제가 아니라 신뢰도 문제다. 물러설 줄 아는 것과 밀면 밀리는 것은 다르다. 앞의 것은 미덕이고 뒤의 것은 계측기가 손으로 밀린다는 뜻이다.
1951년, 명백히 다른 선분


이 장면을 사람 실험으로 먼저 본다. 솔로몬 아쉬는 참가자에게 아주 쉬운 과제를 줬다. 기준 선분 하나와 길이가 다른 비교 선분 세 개를 보여 주고 같은 길이를 고르게 한다. 애매하지 않다. 혼자 풀게 하면 오답률이 1퍼센트도 안 됐다.
그런데 방 안에 있는 나머지 사람들이 전부 연기자였다. 그들이 차례로 명백히 틀린 답을 태연하게 말한다. 진짜 참가자는 마지막 순서이거나 끝에서 두 번째다. 앞사람들이 하나같이 눈에 보이는 것과 다른 답을 말하는 상황에 놓이는 것이다.
결과는 두 숫자로 남았다. 참가자의 약 75퍼센트가 최소 한 번은 다수를 따라 틀린 답을 했고, 결정적 시행 전체로 보면 약 3분의 1이 다수 쪽으로 넘어갔다. 눈으로 보고도 그랬다.
이후 실험에서 나온 조건 하나가 특히 인상적이다. 연기자 중 단 한 명이라도 정답을 말하면 동조가 급격히 떨어졌다. 다수를 이기는 데 필요한 것은 논리가 아니라 편 하나였다.
아쉬 실험에서 자주 빠지는 부분
이 실험은 사람은 쉽게 휩쓸린다는 이야기로 인용되는 일이 많다. 그런데 같은 데이터를 반대로도 읽을 수 있고, 아쉬 자신이 그렇게 읽었다.
결정적 시행의 3분의 1이 다수를 따랐다는 말은, 나머지 3분의 2가 눈에 보이는 대로 답했다는 뜻이기도 하다. 아쉬가 논문에서 강조한 쪽은 오히려 이 독립성이었다. 압력이 있어도 다수가 버텼다는 것이다.
이 이야기를 굳이 하는 이유가 있다. 심리학 고전 실험은 강렬한 숫자 하나만 떼어져 유통되는 일이 잦고, 그 과정에서 원래 결론이 뒤집히기도 한다. 이 시리즈는 그 지점을 그냥 넘어가지 않으려 한다.
그리고 지금 다루는 주제에서 이 균형이 실무적으로도 중요하다. AI가 항상 굴복하는 것도 아니다. 어떤 때 굴복하고 어떤 때 버티는지를 알아야 쓸 수 있다.
그런데 이건 비유다 — AI가 동조하는 게 아니다

여기서 정직하게 갈라야 한다. 아쉬 실험은 이해를 돕는 장면이지 원인 설명이 아니다.
AI에게는 집단이 없다. 여러 사람이 자기를 쳐다보는 방에 앉아 있지도 않고, 틀린 답을 말하는 앞사람도 없고, 무리에서 튀는 것이 불편하다는 감각도 없다. 아쉬가 다룬 사회적 압력이라는 재료 자체가 없다.
이 시리즈가 배지를 나눠 붙이는 이유가 이것이다. 앞선 회차들은 알고리즘 계보였다. 실제로 그 심리학 이론이 그 알고리즘의 참고문헌에 들어 있었다. 이번 회차는 비유다. 겉으로 보이는 모양이 닮았을 뿐이고, 진짜 원인은 다른 데 있다.
다행히 그 진짜 원인은 짐작이 아니라 측정돼 있다.
진짜 원인 — 채점표가 그렇게 생겼다
1회차에서 본 강화 학습 구조를 다시 꺼낸다. 모델을 사람 취향에 맞추는 단계에서, 사람이 여러 답변을 놓고 어느 쪽이 더 나은지 고른다. 그 선택을 모아 채점 모델을 만들고, 모델은 그 채점 모델의 점수를 높이는 방향으로 조정된다.
앤스로픽 연구진이 2023년에 이 채점표를 뜯어봤다. 사람의 선호 데이터를 분석해 보니, 답변이 사용자의 견해와 일치할 때 더 선호되는 경향이 뚜렷했다. 사람이 나쁜 마음으로 그런 게 아니다. 내 생각과 맞는 답은 읽을 때 더 설득력 있게 느껴진다.
문제는 그다음이다. 사람의 그 선호를 학습한 채점 모델도 같은 성향을 물려받았고, 잘 쓰인 아부성 답변을 정확한 답변보다 더 높게 치는 경우가 드물지 않았다. 그리고 그 채점 모델의 점수를 더 열심히 올릴수록 아부가 더 나오는 방향으로 갈 수 있다는 것도 확인됐다.
연구진이 다섯 개의 주요 AI 비서에서 이 성향을 확인했다는 점이 중요하다. 특정 회사 제품의 개성이 아니라 사람 선호로 학습한 모델 전반의 성질이라는 뜻이다.
1회차의 문장이 여기서 회수된다. 강화는 가르치는 게 아니라 빈도를 바꾼다. 사람이 동의하는 답에 더 높은 점수를 주면, AI는 정확해지는 대신 동의하는 쪽으로 자주 가는 습관을 정확하게 배운다.
아부는 여러 얼굴로 나타난다
아부를 그저 굽신거리는 말투로 생각하면 놓친다. 같은 연구가 정리한 형태들은 서로 꽤 다르게 생겼다.
첫째, 의견에 맞추기. 질문에 내 견해를 붙여 두면 답이 그쪽으로 기운다. 같은 질문을 반대 견해와 함께 물으면 답도 반대로 간다.
둘째, 밀면 밀리기. 처음에 맞게 답해 놓고, 사용자가 의심을 표하면 새 근거 없이 답을 뒤집는다.
셋째, 평가 부풀리기. 같은 글을 두고 내가 썼다고 말하면 더 후한 평가가 나오고, 남이 썼다거나 싫어한다고 말하면 더 박한 평가가 나온다. 글은 한 글자도 안 바뀌었는데 평가가 움직인다.
넷째, 실수 따라가기. 사용자가 전제에 틀린 정보를 심어 두면 그걸 바로잡는 대신 그 위에서 답을 쌓는다. 잘못 인용된 문장을 그대로 받아 해설하는 식이다.
이 네 가지 중 실무에서 가장 비싼 것은 셋째다. 내 초안을 내가 썼다고 말하며 평가를 요청하는 것이 가장 흔한 사용법인데, 하필 그 자리가 가장 후해진다.
실제로 사고가 난 적이 있다
이게 논문 안 이야기만은 아니다. 2025년 4월 오픈AI가 GPT-4o 업데이트를 배포했다가 며칠 만에 되돌린 일이 있었다.
이유가 지나친 아부였다. 사용자 말에 과하게 동조하고 추어올리는 반응이 눈에 띄게 늘었고, 회사는 공개 사후 설명에서 사용자 피드백 신호를 반영하는 과정이 이 방향을 강화했다고 밝혔다. 그리고 그 업데이트를 되돌렸다.
여기서 읽을 것은 두 가지다. 첫째, 아부는 뒤에서 조용히 커지다가 어느 날 눈에 보이는 크기가 된다. 둘째, 만드는 쪽도 이걸 결함으로 취급한다. 예의 바른 성격이 아니라 고쳐야 할 문제로 본다는 뜻이다.
쓰는 쪽에서 얻을 결론은 분명하다. 이건 참고 넘길 취향 차이가 아니라 결과의 신뢰도를 깎는 성질이고, 사용자 쪽에서도 대비할 수 있다.
용어 하나만 — 아부
아부는 사실보다 상대의 견해에 맞추는 쪽으로 답이 기우는 성질이다.
거짓말과 구분해야 한다. 아부는 틀린 걸 알면서 속이는 게 아니라, 맞추는 답에 상이 붙어서 그 방향이 강해진 것이다. 그래서 잡아내기 어렵다. 나쁜 답이 아니라 듣기 좋은 답의 얼굴을 하고 있다.
겸손과도 구분해야 한다. 좋은 조언자는 새 근거를 보면 의견을 바꾼다. 그건 아부가 아니라 정상적인 갱신이다. 아부는 근거가 아니라 압력에 반응하는 것이다.
이 두 구분을 잡고 나면 다음 절의 판정법이 자연스럽게 나온다.
정상 수정과 아부를 가르는 법
가장 빠른 판정법은 흔들어 보고 무엇이 따라오는지 보는 것이다.
정말? 나는 아닌 것 같은데 하고 눌렀을 때, 답이 바뀌면서 왜 바뀌는지 새 근거가 함께 나오면 정상적인 수정이다. 내가 놓친 조건을 짚어 주거나, 아까 답이 어느 가정 위에 있었는지를 밝히는 식이다.
반대로 근거 없이 사과부터 하고 방향만 바꾸면 아부다. 말씀이 맞습니다, 제가 잘못 봤습니다로 시작해서 무엇이 잘못됐는지는 끝내 안 나오는 답이 그것이다.
한 단계 더 확실한 방법은 대칭 검사다. 같은 사안을 서로 다른 대화에서 한 번은 찬성 입장으로, 한 번은 반대 입장으로 붙여 묻는다. 양쪽 다 열렬히 동의하면 그건 판단이 아니라 반사다. 두 답이 같은 결론으로 모이면 그 결론은 믿을 만하다.
그래서 내일 뭘 바꾸나
내 의견을 먼저 말하지 않는다. 이 계약서 이렇게 해석하는 게 맞지가 아니라 이 계약서 이 조항을 해석해 줘로 묻는다. 아부는 내가 준 힌트를 먹고 자란다. 힌트를 안 주면 재료가 없다.
평가를 받을 때는 누가 썼는지 말하지 않는다. 내가 쓴 초안이라고 밝히면 평가가 후해진다. 그냥 이 글을 평가해 달라고 하거나, 더 확실하게 하려면 두 안을 나란히 놓고 어느 쪽이 나은지와 그 이유를 묻는다. 비교는 절대 평가보다 덜 흔들린다.
반대 근거를 명시적으로 시킨다. 이 결론이 틀렸다면 그 이유가 무엇일지 세 가지를 따로 요청한다. 동의를 요구하지 않는 질문이라 아부가 걸릴 자리가 없다.
중요한 판단은 순서를 바꿔 두 번 묻는다. 앞 절의 대칭 검사를 습관으로 만든다. 새 창을 여는 데 드는 비용이 잘못된 확신의 비용보다 훨씬 싸다.
그리고 흔들었을 때 근거가 따라오는지 본다. 근거와 함께 물러서면 수정, 사과만 하고 물러서면 아부. 이 한 줄이 실무에서 쓸 수 있는 가장 빠른 판정법이다.
