Insights·2026-09-15

AI를 잘못 쓰는 네 가지 방식

AI 도입이 실패하는 모양은 무한하지 않다. 1997년 인간요인공학 논문이 자동화를 쓰는 방식을 넷으로 갈랐다. 정상 사용, 과의존, 방치, 그리고 남용. 마지막 하나가 가장 덜 알려졌고 조직에서 가장 자주 일어난다. 사람의 역할이 설계되지 않고 자동화의 부산물로 남는 상태를 가리킨다.

이어지는 글자동화의 아이러니 — 자동화할수록 사람 몫은 어려워진다
AI를 잘못 쓰는 네 가지 방식 가장 비싼 것은 남용이다 — 명령과 단계를 담은 요약 도식

강에 들어간 자동차들

콘크리트 진수로 끝에서 보닛까지 물에 잠긴 자동차를 그린 선화 삽화. 앞유리 너머로 내비게이션 화면만 켜져 있다.

내비게이션을 따라가다 강에 빠진 운전자 이야기는 도시전설이 아니다. 보도된 사례가 여럿이다.

영국 리폰에서는 트럭 운전자가 안내를 따라 얕은 여울로 들어갔다가 비로 불어난 강에 갇혀 구조됐다. 매사추세츠의 한 호수에서는 운전자가 그대로 물로 들어가 차가 잠겼다. 워싱턴주에서는 한밤중에 길인 줄 알고 들어간 곳이 배를 물에 내리는 진수로였다.

여기서 눈여겨볼 점은 이들이 대체로 표지판을 봤다는 것이다. 물이 있다는 것도 봤다. 봤는데 화면을 더 믿었다.

이 실패에는 이름이 있다. 그리고 정확히 반대 방향의 실패에도 이름이 따로 있다. 둘을 같은 표에 놓고 보면 AI 도입이 어디서 어긋나는지가 정리된다.

1997년, 자동화를 쓰는 네 가지 방식

라자 파라수라만과 빅터 라일리가 정리한 분류다. 논문 제목이 그대로 목록이다. 사람과 자동화, 사용과 과의존과 방치와 남용.

첫째, 사용. 사람이 자동화를 켜고 끄는 정상적인 선택이다. 무엇이 이 선택을 좌우하는지도 논문이 짚는다. 그 도구를 얼마나 믿는가, 지금 내가 얼마나 바쁜가, 이 일의 위험이 얼마나 크다고 느끼는가.

둘째, 과의존. 지나치게 기대는 것이다. 감시를 놓치고 판단이 자동화 쪽으로 기운다. 앞의 강 사례가 이것이다.

셋째, 방치. 있는데 안 쓰는 것이다. 도구를 사 놓고 아무도 켜지 않는 상태다.

넷째, 남용. 앞의 셋과 성격이 다르다. 이건 사용자의 행동이 아니라 설계자와 관리자의 행동이다. 사람의 수행에 어떤 결과가 생길지 고려하지 않고 자동화를 도입하는 것이고, 그때 운영자의 역할은 설계되지 않은 채 자동화의 부산물로 정의된다.

이 넷을 하나씩 지금 상황에 대 보면, AI 도입에서 겪는 문제 대부분이 이 표 안에 들어온다.

과의존 — 신뢰성이 높을수록 심해진다

과의존에서 반직관적인 대목이 하나 있다. 자동화가 자주 틀릴 때보다 거의 안 틀릴 때 더 심해진다는 것이다.

이유는 단순하다. 백 번 중 아흔아홉 번 맞는 도구를 매번 확인하는 것은 낭비처럼 느껴진다. 실제로 대부분의 경우에는 낭비가 맞다. 그래서 확인을 그만두는 것이 합리적인 선택처럼 굳는다.

문제는 남은 한 번이다. 확인을 그만둔 상태에서 그 한 번이 오면, 그때는 아무 방어선이 없다. 그리고 그 한 번은 대체로 평범한 상황이 아니라 드문 상황이다. 10회차에서 본 그 구조가 여기서도 그대로다.

내비게이션을 따라 강에 들어간 사람들이 유별난 사람들이 아닌 이유가 이것이다. 그 기계는 그동안 수백 번 맞았다. 그 축적이 표지판보다 무거워진 순간에 사고가 난다.

AI에서도 같다. 요약이 대체로 정확하니 원문을 안 열게 되고, 안 열게 된 다음부터는 틀린 요약이 그대로 통과한다.

방치 — 늑대 소년이 만든다

반대편이 방치다. 도구가 있는데 사람이 안 쓴다.

가장 흔한 원인이 오경보다. 경보가 자주 헛울리면 사람은 그 경보를 끄거나 무시하게 된다. 이건 게으름이 아니라 학습이다. 지금까지의 경험이 이 알림은 대개 아무것도 아니라고 가르쳤기 때문이다.

의료 현장이 이 문제의 교과서다. 병원 병동에서 울리는 알람 중 실제로 조치가 필요한 것은 소수이고, 나머지는 환자가 몸을 뒤척였거나 센서가 잠깐 어긋난 것이다. 그 결과가 알람 피로다. 소리가 배경음이 되고, 정작 진짜 알람이 울릴 때 반응이 늦는다. 이건 안전 문제로 공식 경고까지 나온 사안이다.

여기서 중요한 것은 원인의 위치다. 방치의 원인은 사람의 태도가 아니라 임계값 설계에 있다. 왜 안 쓰냐고 묻기 전에 헛울림 비율을 먼저 재야 하는 이유다.

AI 도구에서도 같은 모양이 나온다. 처음 몇 번 틀린 답을 받은 사람은 그 도구를 다시 열지 않는다. 그 뒤로 도구가 좋아져도 열지 않는다. 첫인상이 임계값 역할을 한 것이다.

그런데 방치가 항상 틀린 건 아니다

안 쓰는 이유를 첫인상 탓의 진짜 방치와 신뢰도 0.7 아래에서의 정당한 판단으로 가른 비교 도식.

여기서 조심할 것이 있다. 방치를 무조건 극복해야 할 저항으로 보면 안 된다.

부정확한 자동화는 어느 선 아래로 내려가면 사람에게 도움이 되지 않고 오히려 방해가 된다. 여러 연구를 모아 본 결과 그 경계가 신뢰도 0.7 근처라는 보고가 있다. 그 아래에서는 도구를 쓴 쪽이 안 쓴 쪽보다 나을 게 없다는 것이다.

이유를 생각해 보면 당연하다. 신뢰도가 낮은 도구를 쓰면 결과를 전부 다시 확인해야 한다. 그러면 원래 일에 확인 작업이 얹히기만 한 셈이다. 게다가 옆에 답이 있으면 검사가 느슨해지는 성질까지 겹친다.

그러니 조직에서 이 도구 왜 안 쓰냐는 질문이 나올 때 답이 둘이다. 하나는 첫인상 때문에 안 쓰는 진짜 방치이고, 다른 하나는 이 일에서 그 도구가 실제로 도움이 안 되는 정당한 판단이다. 둘을 가르지 않고 사용률만 올리면 첫 번째는 안 고쳐지고 두 번째는 손해가 된다.

남용 — 넷 중 유일하게 사용자의 행동이 아니다

네 번째가 이 회차의 본론이다.

남용은 사람의 수행에 어떤 결과가 생길지 고려하지 않은 채 자동화를 도입하는 것이다. 주어가 다르다는 점을 다시 짚어야 한다. 과의존과 방치는 도구를 쓰는 사람의 행동이고, 남용은 도입을 결정한 쪽의 행동이다.

AI 도입에서 이 모양은 이렇게 나타난다. 도구를 먼저 정하고 프로세스는 나중에 맞춘다. 사람에게 남는 일은 논의되지 않는다. 검토는 시간이 안 잡히고, 예외 처리는 담당이 없고, 잘못됐을 때 책임만 사람에게 명확하다.

그리고 이 상태에 놓인 사람에게 나타나는 증상이 바로 앞 회차에서 본 것들이다. 남는 일은 어려워졌는데 연습할 기회는 없고, 감시하라고 하는데 감시할 능력은 쓰지 않아 무뎌졌다.

즉 10회차가 증상을 다뤘다면 남용은 그 원인의 이름이다.

넷 중 남용이 가장 비싸다

앞의 셋은 눈에 보인다. 지나치게 믿으면 사고가 나고, 안 쓰면 도구가 놀고 있는 것이 보인다. 둘 다 지표로 잡힌다.

남용은 그렇지 않다. 도구는 잘 돌아가고 도입 성과 지표도 좋게 나온다. 처리 건수가 늘고 소요 시간이 줄어든다. 그런데 사람 쪽이 조용히 망가진다.

그리고 그것이 드러나는 시점이 늦다. 대개는 드문 상황이 왔을 때, 즉 사람이 개입해야 하는 그 순간에 처음 드러난다. 그때는 이미 그 능력이 없다.

게다가 책임 소재가 어긋난다. 그 상태를 만든 것은 도입을 결정한 쪽인데, 실패가 일어나는 자리는 그 일을 하던 사람이다. 그래서 사고 뒤에 나오는 결론이 개인의 부주의가 되기 쉽고, 그러면 원인은 그대로 남는다.

용어 하나만 — 신뢰 보정

신뢰 보정은 도구의 실제 신뢰도와 사람이 부여하는 신뢰가 일치하도록 맞추는 것이다.

과의존은 신뢰가 실제보다 높은 상태이고, 방치는 낮은 상태다. 그래서 목표는 신뢰를 높이는 것도 낮추는 것도 아니라 맞추는 것이다.

이 표현이 실무에서 유용한 이유가 있다. AI 도입을 이야기할 때 대개 목표가 사용률이나 수용도로 잡힌다. 더 많이 쓰게 만드는 것이 목표가 되는 것이다. 신뢰 보정을 목표로 잡으면 질문이 달라진다. 이 도구를 어디까지 믿어야 하는가.

그리고 맞추려면 조건이 하나 필요하다. 도구가 어디서 틀리는지를 사람이 알아야 한다. 이걸 모르면 신뢰는 근거 없이 높거나 낮은 상태로 머문다. 그래서 이 회차의 실용 항목이 거기서 시작한다.

우리 조직은 넷 중 어디인가 — 질문 네 개

과의존·방치·남용·신뢰 보정 네 가지를 조직에서 확인하는 진단 질문 네 개를 정리한 도식.

과의존인가. 최근 한 달간 AI 결과를 그대로 내보낸 건이 몇 건인가. 그중 사람이 실제로 틀린 곳을 찾아낸 건은 몇 건인가. 후자가 0이면 검토가 형식이다. 검토했는데 한 번도 안 걸렸다는 것은 완벽했다는 뜻이 아니라 안 봤다는 뜻일 가능성이 높다.

방치인가. 도입한 도구 중 실제로 주 1회 이상 쓰이는 건 몇 개인가. 안 쓰는 이유를 물으면 틀린 적이 있어서가 나오는가. 그렇다면 그 경험이 언제 것인지, 그리고 지금도 그런지를 확인한다. 앞 절에서 본 대로 정당한 방치일 수도 있다.

남용인가. 이 도구를 도입할 때 사람에게 남는 일을 문서로 정의했는가. 검토에 배정된 시간이 일정에 있는가. 예외가 났을 때 누가 처리하는지 정해져 있는가. 셋 다 없으면 남용이다.

보정돼 있는가. 구성원이 이 도구는 어떤 종류의 일에서 틀린다를 한 문장으로 말할 수 있는가. 못 하면 신뢰가 근거 없이 높거나 낮은 상태다.

네 질문 중 남용 항목만 답하는 주체가 다르다는 점을 기억할 것. 나머지 셋은 쓰는 사람에게 물어야 하고, 그 하나는 도입을 결정한 사람에게 물어야 한다.

그래서 내일 뭘 바꾸나

도구별로 틀리는 자리 한 줄을 붙인다. 사용법 문서 맨 위에 쓴다. 이 도구는 최신 정보에서 약하다, 이 도구는 표 안의 숫자를 자주 흘린다 같은 한 줄이다. 이게 신뢰 보정의 가장 값싼 형태다.

오경보를 줄이는 쪽에 먼저 손을 댄다. 방치의 원인은 사람의 태도가 아니라 경보 설계다. 왜 안 쓰냐고 묻기 전에 헛울림 비율을 먼저 잰다. 그리고 그 비율이 높으면 교육이 아니라 임계값을 고친다.

도입 문서에 사람 몫을 한 절로 넣는다. 무엇이 자동화되는가만 쓰고 무엇이 사람에게 남는가를 안 쓰면, 남는 일은 잔여물로 정의된다. 그 한 절이 남용과 정상 도입을 가른다.

검토에서 잡힌 오류 건수를 기록한다. 사용률보다 이 숫자가 도입의 건강을 더 잘 보여 준다. 0이 이어지면 검토가 형식이 됐다는 신호이고, 그때는 검토 절차를 손볼 시점이다.

요약하면 이렇다. 얼마나 쓰는가가 아니라 얼마나 맞게 믿는가를 목표로 잡는다.