Insights·2026-08-21

AI에게 메모장을 달아준 사람들 — 배들리의 작업기억

신경망은 배운 것을 연결 세기에 녹여 넣는다. 그래서 새것을 배우면 옛것이 지워진다. 이 문제를 푼 방법은 모델을 키우는 것이 아니라 계산하는 부분과 적어 두는 부분을 나누는 것이었다. 그 설계도는 1974년 심리학자들이 그린 작업기억 모형이고, 2014년 신경망 논문이 그 모형을 직접 인용하며 외부 메모장을 붙였다.

이어지는 글신경망을 만든 건 공학자가 아니라 심리학자였다
기억은 모델 안이 아니라 밖에 작업기억이 그린 설계도 — 명령과 단계를 담은 요약 도식

전화번호를 외우는 그 몇 초

누가 불러 주는 전화번호를 받아 적을 종이를 찾는 동안, 당신은 그 번호를 속으로 되뇐다. 적고 나면 몇 초 만에 사라진다.

그 몇 초 동안 번호는 어디에 있었나. 장기 기억은 아니다. 곧 사라졌으니까. 그렇다고 아무 데도 없던 것도 아니다. 되뇌는 동안은 분명히 붙잡고 있었다. 그리고 되뇌기를 멈추는 순간 사라진다.

심리학이 이 자리에 붙인 이름이 작업기억이다. 이 개념은 나중에 AI 구조로 그대로 건너간다. 이번 회차는 그 이동 경로를 따라간다.

1974년, 기억을 부품으로 나누다

그전까지 단기 기억은 하나의 저장고로 여겨졌다. 정보가 잠깐 머무는 방이 하나 있고, 거기 담을 수 있는 양이 정해져 있다는 그림이다.

앨런 배들리와 그레이엄 히치는 1974년에 다른 그림을 내놨다. 단기 기억은 방 하나가 아니라 역할이 다른 부품들의 조합이라는 것이다.

음운 루프는 말소리를 속으로 되뇌는 자리다. 전화번호를 붙잡고 있는 그것이 여기다. 시공간 잡기장은 모양과 위치를 잠시 붙잡는 자리다. 가구 배치를 머릿속에 그려 볼 때, 낯선 건물에서 방향을 떠올릴 때 쓴다. 중앙집행기는 이 둘을 부리는 관리자다. 무엇에 주의를 줄지, 무엇을 꺼내 올지, 무엇을 버릴지 정한다.

부품 이름을 외울 필요는 없다. 기억할 것은 하나다. 관리자와 저장고가 분리돼 있다. 생각하는 부분과 적어 두는 부분이 따로 있다. 이 그림이 이번 회차의 설계도다.

그 부품이 실재한다는 증거

단어 길이 효과와 조음 억제 실험을 좌우로 비교해, 작업기억의 한계가 저장 공간이 아니라 유지 비용임을 보여 주는 그림.

모형을 나눠 놓기만 하면 누구나 할 수 있다. 배들리 쪽이 설득력을 얻은 이유는 그렇게 나눠야만 설명되는 현상을 보였기 때문이다.

가장 유명한 것이 단어 길이 효과다. 짧은 단어 목록과 긴 단어 목록을 같은 개수만큼 들려주고 외우게 하면, 짧은 단어 쪽을 더 많이 기억한다. 개수는 같은데 결과가 다르다. 음운 루프가 붙잡는 양이 항목 수가 아니라 소리 내는 데 걸리는 시간으로 결정되기 때문이다. 대략 2초 안에 발음할 수 있는 만큼이 한계라는 결과가 나왔다.

더 결정적인 실험이 있다. 외우는 동안 입으로 아무 의미 없는 소리를 계속 내게 하면 단어 길이 효과가 사라진다. 입이 다른 일로 차 있으니 속으로 되뇔 수가 없고, 되뇌기가 막히자 길이가 상관없어진 것이다. 되뇌는 통로가 실제로 존재한다는 뜻이다.

여기서 나오는 결론이 이 회차 전체를 지탱한다. 작업기억의 한계는 저장 공간의 크기가 아니라 유지 비용이다. 계속 붙잡고 있으려면 계속 힘을 써야 하고, 그 힘을 다른 데 쓰면 놓친다.

작업대는 생각보다 훨씬 좁다

밀러의 7±2, 이후 연구의 네 덩어리 추정, 전화번호 청킹 사례로 작업기억의 단위가 정보량이 아니라 덩어리 수임을 보여 주는 그림.

그 작업대가 얼마나 좁은지에 대해서는 유명한 숫자가 하나 있다. 조지 밀러가 1956년에 쓴 논문 제목의 마법의 수 7 플러스마이너스 2다. 사람이 한 번에 붙잡는 항목이 대략 일곱 개라는 이야기로 널리 퍼졌다.

그런데 이 숫자는 지금 그대로 쓰이지 않는다. 이후 연구들은 되뇌기나 묶기를 막고 순수하게 재면 한계가 그보다 훨씬 낮다고 봤고, 대략 네 덩어리 정도라는 추정이 널리 인용된다. 밀러 자신도 논문에서 이 수를 마법이라고 부른 것은 반쯤 농담이었다.

중요한 건 숫자가 아니라 단위다. 한계는 정보량이 아니라 덩어리 수다. 010-1234-5678은 숫자 열한 개지만 우리는 세 덩어리로 붙잡는다. 이렇게 묶어서 한 칸에 넣는 것을 청킹이라고 부른다. 낯선 분야 이야기가 유독 머리에 안 들어오는 이유가 이것이다. 아는 게 없으면 묶을 수가 없어서 항목 하나하나가 칸을 하나씩 차지한다.

그래서 작업기억을 늘리는 현실적인 방법은 둘뿐이다. 잘 묶거나, 밖에 적어 두거나. 사람은 종이와 화이트보드로 후자를 해 왔다. 신경망도 결국 같은 길을 갔다.

신경망이 겪던 문제 — 새것을 배우면 옛것이 지워진다

앞 회차에서 봤듯 신경망은 배운 것을 연결 세기에 녹여 넣는다. 어디에도 항목으로 저장되지 않고 전체에 흩어진다. 이 방식에는 고약한 부작용이 있다.

1989년 마이클 매클로스키와 닐 코언이 그 부작용을 깔끔하게 보여 줬다. 신경망에 한 자리 덧셈 중 1을 더하는 문제들을 가르쳐 잘하게 만든 다음, 이어서 2를 더하는 문제들을 가르쳤다. 그러자 방금 배운 2 더하기는 잘하는데 앞서 배운 1 더하기 성능이 무너졌다. 지우라고 한 적이 없는데 지워진 것이다.

이유는 구조에 있다. 새 과제를 학습할 때 고치는 연결이 옛 과제가 쓰던 바로 그 연결이기 때문이다. 항목별로 자리가 따로 있으면 덮어쓸 일이 없지만, 전체에 흩어져 있으면 겹친다. 이 현상을 재앙적 망각이라고 부른다.

사람으로 치면 새로 만난 사람 이름을 외울 때마다 옛 친구 이름이 지워지는 셈이다. 모델을 키운다고 해결되지 않는다. 용량 문제가 아니라 저장 방식의 성질이기 때문이다.

2014년, 신경망에 메모장을 달다

계산하는 컨트롤러와 표처럼 생긴 메모리를 읽기·쓰기 헤드가 잇고, 읽은 값이 컨트롤러로 되돌아오는 신경 튜링 기계의 구조 도식.

알렉스 그레이브스와 동료들이 2014년에 내놓은 신경 튜링 기계의 해법은 배들리의 그림 그대로다. 계산하는 신경망과 값을 적어 두는 메모리를 분리했다.

구조는 이렇다. 컨트롤러라 부르는 신경망이 관리자 역할을 한다. 그 옆에 표처럼 생긴 메모리가 따로 있고, 컨트롤러는 읽기 헤드와 쓰기 헤드를 통해 그 표의 특정 줄에 값을 적거나 읽어 온다. 어느 줄을 볼지는 두 가지 방식으로 정한다. 내용으로 찾거나, 지금 보던 자리에서 몇 칸 옮기거나.

이 설계의 핵심은 어디에 쓰고 어디서 읽을지까지 학습된다는 점이다. 사람이 규칙을 정해 주는 게 아니라, 정답을 맞히는 과정에서 메모장 사용법 자체가 함께 학습된다. 그래서 이 기계는 훈련에서 본 것보다 긴 수열도 그대로 복사해 냈다. 규칙을 익힌 것이지 사례를 외운 게 아니라는 뜻이다.

이 논문이 인지과학을 은유로만 끌어온 게 아니라는 증거는 참고문헌에 있다. 배들리와 히치의 1974년 작업기억, 그리고 중앙집행기 개념을 직접 인용한다. 다만 도표를 그대로 회로로 옮긴 것은 아니다. 관리자와 저장고를 나눈다는 발상을 가져와 신경망으로 다시 설계했다.

그 계보가 지금 어디에 있나

신경 튜링 기계 자체는 지금 쓰이지 않는다. 하지만 그 발상은 지금 우리가 매일 쓰는 도구에 그대로 들어 있다.

대화창에 붙는 컨텍스트 창이 가장 가까운 자리다. 모델의 가중치는 그대로 두고 그 순간의 작업대에 필요한 것만 올려 두는 구조다. 대화를 문서로 저장해 뒀다가 관련된 대목만 찾아 붙여 주는 방식도 같은 발상이다. 검색해서 붙인다는 뜻의 이름으로 부르지만, 하는 일은 밖에 적어 둔 것을 필요할 때 작업대에 올리는 것이다.

에이전트가 작업 메모를 파일에 적어 두는 것, 프로젝트 규칙을 별도 파일로 두고 매번 읽게 하는 것, 대화 이력을 요약해 다음 대화 앞에 붙이는 것도 전부 같은 계열이다.

공통점은 하나다. 기억을 모델 안에 밀어 넣지 않고 밖에 적어 둔다. 배들리가 그린 관리자와 저장고의 분리가 40년을 건너 그대로 서 있다.

용어 하나만 — 작업기억

작업기억은 지금 하고 있는 일에 필요한 정보를 잠시 붙잡아 두고 다루는 능력이다.

단기 기억과 자주 혼동되는데, 강조점이 다르다. 단기 기억은 얼마나 오래 붙잡느냐를 본다. 작업기억은 붙잡고 있는 동안 그것으로 무엇을 하느냐를 본다. 창고가 아니라 작업대다.

그래서 작업기억이 좋다는 말은 많이 담는다는 뜻이 아니라 잘 관리한다는 뜻에 가깝다. 무엇을 올려 두고 무엇을 치울지, 언제 밖에 적고 언제 다시 가져올지를 정하는 쪽이 실제 성능을 가른다.

AI를 쓸 때도 같다. 컨텍스트 창이 넓다는 것과 그 창을 잘 쓴다는 것은 다른 문제다.

긴 대화에서 실제로 일어나는 일

대화가 길어지면 답이 나빠지는 경험은 대부분 해 봤을 것이다. 처음엔 잘 알아듣던 모델이 어느 순간부터 앞서 정한 것을 무시하기 시작한다.

여기엔 잰 근거가 있다. 긴 입력을 주고 정답 근거를 앞쪽, 중간, 뒤쪽에 각각 심어 두고 정확도를 비교한 연구가 있는데, 앞과 뒤에 있을 때가 가장 잘 찾고 중간에 있을 때 성능이 눈에 띄게 떨어졌다. 창 안에 들어 있다고 해서 다 똑같이 쓰이는 게 아니라는 뜻이다.

여기에 하나가 더 겹친다. 대화가 길어질수록 초반에 했던 지시는 그 뒤의 수많은 말에 파묻힌다. 창에서 밀려나기 전에 이미 묻힌다. 사람이 회의 세 시간째에 첫머리 합의를 잊는 것과 구조가 같다.

그러니 답이 갑자기 나빠지는 것을 모델이 멍청해졌다고 읽으면 대응을 틀린다. 작업대가 어질러진 것이고, 대응은 더 설명하는 게 아니라 정리하는 것이다.

그래서 내일 뭘 바꾸나

중요한 건 대화에 맡기지 말고 파일에 적는다. 프로젝트 규칙, 용어, 금지사항, 말투는 대화 위쪽에 한 번 말하고 끝낼 게 아니라 파일이나 메모리 기능에 넣는다. 지난 회차 표현대로 하면, 연결 세기에 맡기지 말고 메모장에 적는 것이다.

대화가 헤매기 시작하면 새로 연다. 다만 그냥 열지 말고 넘길 것을 챙긴다. 지금까지 정한 것을 다섯 줄로 요약해 달라고 한 다음, 그 다섯 줄을 새 대화 첫머리에 붙인다. 이게 사람이 하는 되뇌기의 자리다. 붙잡고 있느라 힘을 쓰지 말고 적어서 넘긴다.

긴 자료를 붙일 때는 지시를 자료 뒤에도 한 번 더 쓴다. 자료를 붙이고 위에만 질문을 두면 그 질문이 중간에 파묻힌다. 자료 앞뒤로 같은 지시를 감싸 두면 위치 문제를 상당 부분 피한다.

한 대화에 한 가지 일만 시킨다. 코드 고치던 창에서 이메일 초안을 부탁하면 작업대에 두 종류가 섞이고, 그다음 코드 답이 이상해진다. 사람이 멀티태스킹에서 손해 보는 것과 같은 자리다.

요약하면 이렇다. 작업대는 넓히는 게 아니라 치우는 것이다. 그리고 치우기 전에 적어 둔다.