가려진 것들
by Diana L.
프로젝트 관리 도구를 바꾸려던 두 팀이 같은 시기에 업체를 골랐다. A팀은 세 곳을 비교한 뒤 선정 기준을 문서로 남기고, 계약 해지 조항도 법무팀에 확인했다. B팀은 대표가 예전에 함께 일해 본 업체와 일주일 만에 계약했다. 여섯 달 뒤, A팀이 고른 업체는 인수합병으로 서비스를 종료했고, 반면 B팀이 고른 업체의 서비스는 문제없이 돌아가고 있었다. 분기 회의에서 사람들은 입을 모았다. “우리도 B팀처럼 빠르게 움직여야 한다.”
두 팀 중 어느 쪽이 좋은 결정을 내렸을까. 여섯 달 뒤의 결과를 빼고 보아도 답은 같을까.
조너선 배런과 존 허시는 1988년 이 질문을 실험으로 옮겼다. 참가자 20명이 15개의 의료 사례를 읽고 의사의 결정을 평가했다. 그중 55세 남성이 심장 질환으로 가슴 통증을 겪다가 일을 그만둔 사례가 있다. 우회로 수술을 받으면 통증이 사라지고 기대 수명이 65세에서 70세로 늘어날 수 있고, 이 수술로 인해 사망할 확률이 8%지만, 의사는 수술하기로 결정했다. 참가자 절반은 “수술은 성공했다”로 끝나는 사례를 읽었고, 나머지 절반은 “수술은 실패했고 환자는 사망했다”로 끝나는 사례를 읽었다. 그 마지막 문장을 빼면 두 사례는 완전히 같다. 참가자들은 의사의 결정을 3점인 ‘명백히 옳다’부터 -3점인 ‘틀렸고 변명의 여지가 없다’까지 평가했다.
성공 버전의 평균은 0.85, 실패 버전은 -0.05였다. 15개 사례 전체에서 결과가 좋을 때의 평가가 평균 0.70점 높았다. 조너선 배런과 존 허시는 이 현상을 결과 편향(outcome bias)이라고 이름을 붙였다. 즉, “결정이 내려진 뒤에야 알 수 있는 정보는 그 결정이 좋은 결정이었는지와 무관하다.” 결과 편향이라고 하면 대개 한 방향만 떠올린다. 나쁜 결과가 좋은 결정에 대한 평가를 깎는 경우가 흔히 이야기되지만, 정작 조직에 실제로 더 위험한 쪽은 반대편이다.
2008년 로빈 딜런과 캐서린 틴슬리가 《Management Science》에 발표한 연구는 바로 그 반대편을 살폈다. 실험은 무인 우주선 프로젝트의 관리자 ‘크리스’에 관한 시나리오로 시작한다. 크리스는 인력 이탈과 일정 압박 때문에 계측기에 대한 동료 검토를 생략한다. 막바지에 발견된, 발생 가능성이 낮은 설계 결함도 조사하지 않는다. 참가자들은 세 가지 버전 중 하나만 읽었다. 성공 버전에서는 발사 후 아무 문제가 없었다. 실패 버전에서는 설계 결함이 터져 임무가 끝났다. 세 번째는 니어미스(우연이 실패를 막아준 성공) 버전이다. 똑같이 결함이 터졌지만, 우주선이 우연한 각도로 정렬된 덕분에 임무는 살아남았다.
세 버전에서 크리스가 내린 결정은 완전히 같았다. 이를 평가한 참가자는 NASA 관리자 71명, MBA 학생 63명, 학부생 158명이었다. 7점 척도로 평가한 결과, 니어미스 버전의 크리스는 성공 버전의 크리스와 통계적으로 구분되지 않았다. 결정 능력에 대한 평가는 성공 4.62점, 니어미스 4.46점, 실패 3.82점이었다. 더 큰 프로젝트를 맡길 의향은 각각 3.94점, 3.75점, 2.83점이었고, 리더십 평가는 5.29점, 4.91점, 4.38점이었다. 모든 항목에서 성공과 니어미스의 차이는 유의하지 않았지만, 니어미스와 실패의 차이는 유의했다. 가장 불편한 숫자는 따로 있다. 결과에 얼마나 놀랐는지 물었을 때, 니어미스 조건의 평균이 5.22점으로 가장 높았다. 성공 조건의 3.45점보다도, 실패 조건의 3.75점보다도 높았다. 참가자들은 그 결과가 운에 따른 것임을 알고 있었음에도 성공한 경우와 똑같이 평가한 것이다.
운이었다고 알아차리는 것만으로는 평가가 달라지지 않았다. 그렇다면 이런 경험은 다음 결정에 어떤 영향을 미칠까.
같은 논문의 두 번째 실험은 이 질문으로 이어진다. 참가자들은 화성 무인 로버의 운영을 6일째부터 맡는다. 이날은 심한 먼지폭풍이 예보돼 있고, 폭풍 속에서 주행하면 바퀴에 치명적인 고장이 날 확률이 40%다. 그렇다고 세워 두는 것도 배터리에 한계가 있기 때문에 손해다. 참가자 절반은 로버가 이미 1일·2일·4일에 심한 폭풍을 뚫고 주행했지만 무사했다는 정보를 받았다. 나머지 절반(통제 조건)은 5일까지 날씨가 온화했다고 들었다. 고장 확률 40%는 두 집단에 똑같이 주어졌는데 폭풍 속 주행을 선택한 비율은 크게 달랐다. 니어미스 조건에서는 24명 중 18명, 75%가 주행을 택했다. 통제 조건에서는 23명 중 3명, 13%만 같은 선택을 했다. 세 번째 실험에서 참가자 71명으로 다시 확인했을 때도 69% 대 37%로 같은 방향의 결과가 나왔다. 여기서 자연스러운 의심이 하나 생긴다. “저 사람들이 속으로 ‘세 번이나 무사했으니 실제론 40%보다 낮겠지’라고 고쳐 잡은 것은 아닐까?” 그래서 연구팀은 제시된 수치와 체감 위험을 따로 분석했다. 참가자들은 40%를 낮춰 잡지 않았고, 확률을 다시 물었을 때 두 집단 모두 37% 안팎을 답했다. 제시된 수치는 그대로였고, 체감 위험만 낮아진 것이다.
로빈 딜런과 캐서린 틴슬리가 논문에서 실험 외에 제시한 실제 사례도 있다. 컬럼비아호다. 연료탱크의 같은 자리에서 단열재가 떨어져 나가는 일은 앞선 비행에서 최소 30번 있었다. 그때마다 임무는 무사히 끝났고, 그렇게 쌓인 30번의 경험은 경고가 아니라 시스템이 견딜 수 있다는 증거로 받아들여졌다. 두 사람은 2011년 HBR에 쓴 공저 글에서 “성공에는 토를 달 수 없다”는 말이 있지만, 사실 달 수 있고, 달아야 한다고 썼다. 미 육군은 오래전부터 이 문제를 제도 안에서 다뤄 왔다. 훈련 교범 TC 25-20은 사후 검토, 즉 AAR(After Action Review)을 성과 기준에 초점을 맞춘 토의로 정의한다. 무엇이 일어났고 왜 일어났는지, 무엇을 유지하고 무엇을 고쳐야 하는지를 참여자들이 스스로 찾아가기 위함이다.
여기서 눈에 띄는 점은 두 가지다. 우선 평가가 아니라 토의라는 것이고, 다음은 점수를 매기기보다 무슨 일이 있었는지 복원하는 데 초점을 두고, 훈련이 잘 끝났을 때도 똑같이 검토한다는 점이다. 결과가 좋다는 이유로 회고를 건너뛰면 운과 실력을 구분할 기회도 사라진다. 크리스의 니어미스가 회고 안건이 되지 않는 이유도, 임무가 성공으로 기록됐기 때문이다.
AI를 결정에 반영하면 이 문제가 한 겹 더해진다. 정민 최와 멜로디 차오는 2,794명이 참여한 여섯 건의 실험에서, 자신에게 불리한 결정이 내려졌을 때 사람들이 사람보다 AI의 결정을 더 공정하게 느끼고 덜 반발한다는 것을 보였다. 즉, “AI는 감정이 없으니 공정했겠지”라고 여긴다는 것이다. 반면, AI가 사람의 결정을 학습하기 때문에 사람의 편향까지 따라 배울 수 있다는 설명을 미리 읽힌 참가자들에서는, AI가 더 공정하다는 인식이 약해진 것으로 나왔다.
인간의 편향을 수도 없이 많은 연구에서 다뤄왔지만, 여전히 인간이 벗어나기 어려운 매우 자연스러운 인지 현상이다. 그래서 결과를 이야기하기 전에 결정 시점으로 복귀하는 것이 더없이 중요해진다. 성패와 무관하게 그때 무엇을 알고 있었는지, 무엇을 알 수 없었는지, 무엇을 알 수 있었는데도 확인하지 않았는지 차례로 짚어 보는 것이다.
결과가 나쁜 날의 문책과 결과가 좋은 날의 침묵으로 남는다면, 결과물에 대한 편향에 이어 잘 끝났다는 이유로 돌아보지 않은 결정 방식이 다음 분기에는 표준이 될 수 있다.
SOURCES
Baron, J. & Hershey, J.C. (1988). Outcome bias in decision evaluation. Journal of Personality and Social Psychology, 54(4), 569-579.
Dillon, R.L. & Tinsley, C.H. (2008). How Near-Misses Influence Decision Making Under Risk: A Missed Opportunity for Learning. Management Science, 54(8), 1425-1440.
Morrison, J.E. & Meliza, L.L. (1999). Foundations of the After Action Review Process. U.S. Army Research Institute for the Behavioral and Social Sciences, Special Report 42.
Choi, J. & Chao, M.M. (2026). For Me or Against Me? Reactions to AI (vs. Human) Decisions That Are Favorable or Unfavorable to the Self and the Role of Fairness Perception. Personality and Social Psychology Bulletin, 52(3), 671-691.
Tinsley, C.H., Dillon, R.L. & Madsen, P.M. (2011). How to Avoid Catastrophe. Harvard Business Review, April 2011.