팀 의사결정과 다양성의 역설
by Diana L.
신제품 가격을 정하는 회의에 영업, 재무, 개발, 고객지원 등 여러 부서에서 여섯 명이 모였다. 회의에 앞서 각자 적어낸 가격은 차이가 꽤 컸다. 토론이 시작되자 근거를 가장 잘 정리해온 사람의 숫자 쪽으로 의견이 조금씩 기울었다. 반대하는 사람도 있지만, 반론을 펴려면 근거를 대야 했고, 그 근거는 대개 앞사람이 이미 깔아놓은 틀 안에서 나왔다. 두 시간 뒤, 여섯 명이 제시한 가격은 거의 비슷해졌다. 대표는 충분히 논의했다고 느꼈다. 처음에 가격이 왜 그렇게 달랐는지는 아무도 더 이상 묻지 않았다.
토론을 거치면서 집단의 의견이 한쪽으로 더 치우치는 현상은 집단 극화(group polarization)라는 이름으로 알려져 있다. 1969년 모스코비시와 자발로니가 이름을 붙인 개념이다. 그런데 그 과정에서 일어나는 또 다른 변화는 상대적으로 덜 주목받는다. 집단의 입장이 강해지는 동안, 내부의 의견 차이도 줄어든다는 점이다.
2007년 콜로라도에서 이를 측정한 실험이 있다.
캐스 선스타인 연구팀은 무작위 전화 걸기로 볼더와 콜로라도스프링스에서 유권자 63명을 모집했다. 2004년 대선에서 볼더는 케리에게, 콜로라도스프링스는 부시에게 각각 67%의 표를 준 지역이다. 연구팀은 생각이 비슷한 사람들을 5~7명씩 열 개 조로 나누고, 지구온난화 조약, 소수자 우대 정책, 동성 시민결합을 주제로 토론하게 했다.
예상대로 진보 성향의 참가자들은 더 진보적으로, 보수 성향의 참가자들은 더 보수적으로 변했다. 눈여겨볼 것은 집단 내부의 변화다. 조 안에서 의견이 얼마나 흩어져 있는지를 나타내는 표준편차의 중앙값은 토론 전 1.17에서 토론 후 0.69로 떨어졌다. 서른 번의 조별 토론 중 스물아홉 번에서 의견 차이가 줄었다.
미국 시민 63명이 정치 사안을 논의한 결과를 기업의 가격 결정에 그대로 적용할 수는 없다. 특히 이 실험은 성향이 비슷한 사람들을 모아 진행했다. 다만 회의를 돌아보게 하는 질문은 남는다. 토론 끝에 의견이 모였을 때, 우리는 서로의 근거를 충분히 검토한 것일까, 아니면 같은 틀에 익숙해진 것일까. 다양한 사람을 회의에 초대하는 것만으로는 그들이 가져온 서로 다른 관점까지 충분히 검토된다고 보장할 수 없다.
AI를 활용할 때도 비슷한 문제가 생길 수 있다.
2024년 Science Advances에 실린 실험에서 연구팀은 작가 293명에게 짧은 이야기를 쓰게 했다. 일부에게는 챗GPT가 만든 시작 아이디어를 제공했다. 평가자 600명의 평가에서 AI 아이디어를 받은 이야기들은 더 새롭고, 더 쓸모 있고, 더 재미있다는 평가를 받았다. 효과는 원래 창의성이 낮았던 작가들에게서 가장 컸다. 개인의 결과물은 분명 나아졌다.
하지만 이야기들을 모아놓고 보면 서로 더 비슷해져 있었다. 연구에서는 이 현상을 사회적 딜레마라고 부른다. 각자의 작품은 좋아졌지만, 전체 작품의 다양성은 줄어든 것이다.
아이디어의 증폭기로 AI를 지금까지 사용해온 인간으로서는 어이없는 현실이긴 하다. 그래서 AI는 활용 방식에 따라서 다양성과 놓친 관점을 찾는 데 도움이 될 수 있다는 주장을 더 강하게 뒷받침한다. 같은 질문으로 적정 가격을 구하는 데서 그치지 않고, 서로 다른 전제에서 가격을 검토하게 하는 것이다. 고객의 지불 의향을 기준으로 볼 때와 개발비 회수를 우선할 때, 경쟁사의 대응을 고려할 때의 논리는 다를 수 있다. 각자가 제안한 가격에 대해 “이 가격이 틀렸다면 어떤 이유 때문일까”를 따로 검토해오는 방법도 있다. 그렇게 하면 회의는 여섯 개의 숫자를 비교하는 데서 출발해, 그 숫자 뒤에 있는 가정과 근거를 살피는 거버넌스로 이어질 수 있다.
물론 다른 답이 나왔다고 해서 모두 의미 있는 대안은 아니다. 무엇을 검토할 가치가 있는 차이로 볼지, 어떤 반론이 해소되지 않았을 때 결정을 미룰지는 사람이 정해야 한다.
두 연구가 다룬 대상은 다르다. 하나는 정치 토론이고, 다른 하나는 소설 쓰기다. 정치 토론에서 의견이 모였다는 것이 더 나은 판단에 도달했다는 뜻은 아니며, 이야기들이 비슷해졌다는 것이 개별 작품의 질이 떨어졌다는 뜻도 아니다. 다만 두 연구 모두, 토론에 참여하거나 AI의 도움을 받는 과정에서 전체의 다양성이 줄어들 수 있음을 보여준다.
조직은 지금 이 두 가지를 동시에 하고 있다. 여러 사람을 모아 토론하게 하고, 그들에게 같은 AI를 제공한다. 모두 더 나은 결정을 위한 조치다. 그러나 회의가 매끄럽게 끝나고 각자의 자료가 좋아졌다는 사실만으로, 조직이 더 넓게 검토했다고 말할 수는 없다. 오히려 비슷한 근거를 더 설득력 있게 반복하고 있을 가능성도 있다.
결정을 내리려면 선택지를 좁혀야 한다. 모든 의견을 끝까지 남겨두는건 무의미 하니까. 중요한 것은 무엇을 근거로 좁혔는가다. 검토 끝에 제외한 의견과 토론의 흐름에 밀려 사라진 의견은 구분되어야 한다. “충분히 논의했다”는 느낌만으로는 그 차이를 알 수 없다.
회의 시작 때의 여섯 개 숫자에는 각 부서가 현장에서 얻은 정보와 서로 다른 우려가 담겨 있었을 수 있다. 두 시간 뒤 하나의 가격을 선택하더라도, 처음의 차이가 어디에서 비롯됐고 어떤 근거로 정리됐는지는 남아 있어야 한다. 그래야 결정이 예상과 어긋났을 때, 무엇을 놓쳤는지 되짚어볼 수 있다.
머리가 뽀개지기 시작했는가?
그 부담이 AI 시대에 기업을 이끄는 사람이 진 책임의 무게다. AI 모델이 하루가 멀다 하고 갱신되는 것만큼이나, 리더의 판단력도 새로운 패러다임을 선제적으로 읽어내야 하는 역량으로 업그레이드되어야 하지 않는가?
SOURCES
Schkade, D., Sunstein, C.R. & Hastie, R. (2007). What Happened on Deliberation Day? California Law Review, 95, 915-940.
Doshi, A.R. & Hauser, O.P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10(28), eadn5290.
Moscovici, S. & Zavalloni, M. (1969). The group as a polarizer of attitudes. Journal of Personality and Social Psychology, 12(2), 125-135.