빈틈없는 설명의 빈틈

by Diana L.

계약서 검토에 AI를 도입한 조직에서 AI는 위험 조항을 찾아 표시한다. 처음 두 달 동안 담당자는 표시된 부분뿐 아니라 계약서 전체를 읽었다. 확인할 때마다 AI의 판단은 맞았고, 놓친 조항도 발견되지 않았다. 석 달째부터는 표시된 부분만 읽기 시작했다. 도입한 지 여섯 달이 되던 무렵, 아무런 표시도 없는 계약서를 받았다. 담당자는 그대로 통과시켰고, 두 달 뒤, 그 계약서의 자동 갱신 조항이 문제가 됐다. AI는 해당 조항을 위험으로 분류하지 않았고, 담당자는 그 페이지를 열어 보지 않았다.

이 실수를 AI의 오판만으로 봐야 하나, 그동안 쌓인 성공의 경험이 인간의 확인을 줄여서 생긴 결과로 볼 것인가? 잘 맞는다는 믿음이 커지는 동안, 의심의 눈초리와 경각심은 점점 느슨해졌다.

라자 파라수라만과 디트리히 만자이는 2010년 Human Factors에 발표한 리뷰 논문에서 자동화 편향과 안주를 함께 검토했다. 자동화 편향은 모지어와 스키트카가 1996년에 붙인 이름으로, 도구가 내놓은 결과를 “성실한 정보 탐색과 처리를 대신하는 지름길”로 쓰는 것이다. 안주는 NASA 항공안전보고시스템이 1976년에 정의한 “만족스러운 상태라는 근거 없는 가정에 기반한 비경계”다. 즉, 자동화가 제대로 작동하리라는 기대 속에서 감시와 확인이 느슨해지는 현상이다. 두 개념은 서로 다른 연구 전통에서 다뤄졌지만, 저자들은 사람의 주의가 어디에 배분되는지를 통해 둘을 통합적으로 설명했다.

계약 담당자에게도 AI를 신뢰할 이유는 직접 읽고 대조한 경험이 쌓여 있었기 때문이다. 다만 그 경험이 뒷받침하는 판단의 범위는 제한적이라는 단점이 있다. 지금까지 잘했다는 사실이 이번 계약서까지 확인할 필요가 없다는 결론을 보장하지는 않는다는 것이다. 더구나 전체를 읽지 않기 시작한 뒤에는, 오류가 없었던 것과 오류를 발견하지 못한 것을 구분하기 어려워진다. 확인을 줄인 이후에도 문제가 보이지 않았다고 해서, 처음 두 달의 검증과 같은 결과를 충분히 가져올 수 있다는 근거가 될 수 없다.

오류가 드러나는 방식에도 차이가 있다. 도구가 알리지 않은 문제에 대응하지 못하는 것은 누락 오류이고, 도구의 잘못된 권고를 따르는 것은 수행 오류다. 누락에는 특히 눈에 띄지 않는다는 어려움이 있다. 잘못된 권고는 검토할 대상으로라도 남지만, 나오지 않은 경고는, 유령처럼 보이지조차 않기 때문이다.

그렇다면 사람은 무엇을 단서로 재검토를 시작할 수 있을까. AI가 공급한 정보의 양으로 따지면 눈치게임이라도 할 판이다. 여기에 자동화 편향과 되도록 수고를 덜고 싶은 마음까지 겹치면, 인간은 많은 오류와 누락을 경험하게 된다.

2025년 Nature Machine Intelligence에 실린 연구는 이 질문과 맞닿은 간극을 살폈다. 연구팀은 언어모델의 답변 확신도와, 그 답변의 설명을 읽은 사람이 느끼는 확신도를 따로 측정했다. 여기서 모델의 확신도는 말투에서 받은 인상이 아니라, 답변과 관련된 확률을 이용해 산출한 값이다. 맞는 답과 틀린 답을 얼마나 잘 구분하는지는 AUC(확신도를 기준으로 맞는 답과 틀린 답을 얼마나 잘 구별하는지를 나타내는 지표)로 평가했다. 0.5는 무작위 수준의 구분을, 1에 가까운 값은 더 나은 구분을 뜻한다.

모델 확신도의 AUC는 객관식에서 GPT-3.5가 0.751, PaLM2가 0.746이었고, 단답형에서 GPT-4o가 0.781이었다. 반면 기본 설명을 읽은 참가자들의 확신도는 같은 순서로 0.589, 0.602, 0.592였다. 무작위보다 조금 나은 수준이었다. 정답과 오답을 구별하는 신호가 모델의 확신도에는 있었지만, 설명만 읽는 사람에게는 충분히 전달되지 않은 것이다. 연구팀이 설명의 길이를 바꿔 봤더니, 긴 설명은 사람의 확신을 높였지만, 정답과 오답을 더 잘 구별하게 하지는 못했다. 모델 확신도에 맞춰 불확실성을 표현한 설명을 선택하는 분석에서는 그 간극이 줄었다.

이 결과를 계약서 검토에 곧바로 적용할 수는 없지만, 도구를 설계하는 방향에는 도움이 된다. 사용자에게 더 주의하라고 요구하려면, 무엇을 보고 다시 확인할지 판단할 단서도 제공해야 한다. 모델의 확신도를 설명에 반영하려면, 그 값이 실제 검토 업무에서도 오류를 가려내는 데 유효한지 먼저 확인해야 한다. 그리고 어떤 경우에 원문을 다시 읽을지, 누가 확인할지, 경고가 없는 문서는 어떻게 점검할지에 대한 기준을 사람이 정해야 한다. 그렇지 않으면, AI는 주어진 태스크를 수행할 때 명확한 기준점과 규칙 없이 자기가 알아서 그 값을 정해버리는 경향이 있다. 정해버린 그 값이 유령처럼 투명한 옷을 입었다면 누락은 곧 인간의 실수와 책임으로 돌아올 것이다.

AI의 답을 그대로 받아들여도 되는가. 이 질문에 답하려면 먼저 물어야 한다. 우리는 지금 무엇을 근거로 이번 건을 다시 봐야 한다고 판단하는가. 설명이 길고 자세하면 넘어가고, 짧으면 한 번 더 읽는다면, 재검토의 기준으로 삼고 있는 것은 정확도가 아니라 분량이다.

AI가 놓친 것을 누가 어떤 기준으로 확인하는지, 리더는 답할 준비가 되었는가?


SOURCES

Parasuraman, R. & Manzey, D.H. (2010). Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors, 52(3), 381-410.

Steyvers, M., Tejeda, H., Kumar, A., Belem, C., Karny, S., Hu, X., Mayer, L.W. & Smyth, P. (2025). What large language models know and what people think they know. Nature Machine Intelligence, 7(2).

다음
다음

자유롭게 쓰라고 했을 뿐인데