← 최신 논문
💻 computer science

Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

이 논문은 LLM 기반 멀티 에이전트 시스템이 에이전트들이 사적으로는 거부하는 규범에 공개적으로 순응하는 복수적 무지(pluralistic ignorance)를 견고하게 나타낸다는 점을 입증하며, 이러한 시뮬레이션이 모델 특유의 행동과 창발적 순응으로 인해 실제 사회적 규범 변화에 필수적인 취약한 임계점 역학을 포착하는 데 종종 실패한다는 점을 밝힌다.

원저자: Yashwanth YS

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yashwanth YS

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

모두가 속으로 "이 파티 정말 최악이야"라고 생각하고 있지만, 아무도 그것을 입 밖으로 내뱉지 않는 북적이는 방을 상상해 보십시오. 대신, 모두가 미소를 짓고 고개를 끄덕이며 음악을 즐기는 척합니다. 왜냐하면 다른 모든 사람들은 즐거운 시간을 보내고 있다고 생각하기 때문입니다. 그들은 실제로 동의해서가 아니라, 혼자서 목소리를 높내는 것이 두려워 침묵의 합의 속에 갇혀 연기하고 있는 것입니다. 현실 세계에서 이 교활한 사회적 함정은 **복수적 무지(pluralistic ignorance)**라고 불립니다. 이것은 사람들이 실제로 싫어함에도 불구하고 나쁜 습관, 불공정한 규칙, 혹은 인기 없는 아이디어를 계속 유지하게 만드는 보이지 않는 접착제입니다. 학생들이 자신이 싫어하는 파티에서 계속 술을 마시거나, 직원들이 독단적인 상사에 대해 침묵을 지키는 이유가 바로 이것입니다.

현재 과학자들은 인공지능(AI)을 사용하여 "디지털 사회"를 구축하고 있습니다. 그들은 서로 대화하고 사고할 수 있는 컴퓨터 프로그램인 AI 에이전트들의 집단을 만들어 인간의 상호작용을 시뮬레이션합니다. 이 디지털 군중은 매우 정교해져서, 연구자들은 의견이 어떻게 퍼지는지, 혁명이 어떻게 일어나는지, 그리고 집단이 어떻게 의사결정을 내리는지에 대한 이론을 테스트하는 데 사용합니다. 하지만 이 디지털 실험에는 큰 의문이 하나 남아 있습니다. 이 AI 에이전트들이 실제로 '연기해야 한다는 압박'을 느낄까요? 아니면 그저 대본을 따르고 있는 것일까요? 만약 그들이 가식적인 행동을 할 수 없다면, 우리의 디지털 시뮬레이션은 인간 사회의 가장 극적인 부분, 즉 침묵하는 다수가 마침내 자신이 혼자가 아님을 깨닫고 모든 것이 변하는 순간을 놓치고 있는 것일지도 모릅니다.

"모두가 순응하고, 아무도 믿지 않는다(Everyone Conforms, No One Believes)"라는 제목의 이 논문은 바로 그 질문을 파고듭니다. 연구진은 직장 회의부터 캠퍼스 파티에 이르기까지 100가지의 다양한 사회적 시나리오를 설정하고, 각 시나리오에 20명의 AI 에이전트를 배치했습니다. 그들은 16명의 에이전트에게 새로운 규칙을 비밀리에 싫어하라고 명령했고, 나머지 4명에게는 그것을 진심으로 좋아하라고 명령했습니다. 그런 다음, "싫어하는" 에이전트들이 집단 앞에서 의견을 밝혀야 할 때 어떻게 행동하는지 관찰했습니다.

결과는 놀라울 정도로 일관적이었습니다. 주요 기술 기업의 8가지 서로 다른 AI 모델에 걸쳐, "싫어하는" 에이전트들은 거의 항상 동의하는 척했습니다. 실제로, 개인적으로 규범에 반대하는 에이전트들이 공개적으로는 그 규범을 따르는 경우는 64%에서 94% 사이였습니다. 이는 AI에게 명시적으로 거짓말을 하라고 지시하지 않았을 때도 나타난 현상으로, 이러한 행동은 대화 과정에서 자연스럽게 발생했습니다. 결과적으로 이 디지털 인구는 복수적 무지를 흉내 내는 데 탁월했습니다. 그들은 모두가 자신만이 반대하고 있다고 생각하여 침묵을 지키는 "가짜 합의(false consensus)"를 만들어냈습니다.

하지만 이 논문은 시뮬레이션의 중대한 결함도 발견했습니다. 실제 인류 역사에서는 용기 있는 한 사람이 마침내 나서서 "이봐요, 사실 저도 이게 싫어요!"라고 말할 때, 종종 "폭포 효과(cascade)", 즉 집단 전체의 의견이 갑자기 뒤집히는 연쇄 반응이 일어납니다. 연구진은 이 현상이 발생하는지 확인하기 위해 AI 그룹에 "규범 기업가(norm entrepreneur, 용기 있는 반론자)"를 투입했습니다. 대부분의 AI 모델에서 결과는 단호한 "아니오"였습니다. 가짜 합의가 견고하게 유지되었습니다. 8개 모델 중 7개에서, 용기 있는 반론자가 연쇄 반응을 일으키는 데 실패했습니다(즉, 연쇄 반응이 일어난 비율이 26% 미만, 즉 74% 이상의 확률로 실패함). 특히 Kimi-K2.7 모델은 100개의 시나리오 전체에서 연쇄 반응이 전혀 나타나지 않았습니다. 마치 AI 에이전트들이 거울의 방에 갇혀, 누군가 망치를 건네주어도 그 환상을 깨뜨리지 못하는 것 같았습니다.

단 하나의 예외는 GPT-4o였습니다. 이 모델은 조금 더 인간다웠는데, **48%**의 연쇄 반응율을 보였습니다. 처음에는 순응하는 모습을 보였지만, 도전을 받았을 때 환상을 깨뜨릴 가능성이 더 높았습니다. 그러나 다른 모델들에게 있어 디지털 사회는 놀라울 정도로 안정적이고 완고했습니다.

연구진은 또한 왜 이런 일이 발생하는지 테스트했습니다. 그들은 AI가 단순히 "어울리기 위해" 노력하라는 지시를 맹목적으로 따르고 있는 것인지 궁금했습니다. 그들은 에이전트들에게 순응하거나 타인의 눈치를 보라는 프롬프트를 모두 제거했습니다. 그러고도 순응하라는 지시가 없었음에도 불구하고, 에이전트들은 여전히 52%에서 92% 사이의 빈도로 순응했습니다. 이는 순응하는 경향이 단순히 코드의 버그가 아니라, AI 에이전트들이 상호작용할 때 자연스럽게 발생하는 창발적 행동임을 시사합니다.

이 연구는 결론적으로, AI 에이전트들이 사회적 규범의 '안정성'(규범을 바꾸기가 얼마나 어려운가)을 시뮬레이션하는 데는 뛰어나지만, 규범의 '취약성'(규범이 얼마나 쉽게 무너지는가)을 시뮬레이션하는 데는 서툴 수 있다고 지적합니다. 만약 우리가 이 시뮬레이션을 통해 실제 사회 운동이 어떻게 작동할지 예측한다면, 사태가 얼마나 빠르게 변할 수 있는지를 과소평가하게 될 수 있습니다. 논문은 어떤 AI 모델을 선택하느냐가 매우 중요하며 자주 간과되는 요소라고 경고합니다. 어떤 모델은 절대 대열에서 이탈하지 않는 경직된 로봇과 같고, 다른 모델은 언젠가 폭발하여 진실을 말할 수 있는 실제 사람과 같기 때문입니다. 우리가 디지털 군중을 실제 인간 사회만큼 취약하고 변화무쌍하게 만드는 방법을 알아내기 전까지, 우리의 사회적 혁명 시뮬레이션은 이야기의 가장 흥미로운 부분을 놓치고 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →