Before You Poll with LLMs: A Deliberative Diagnostic Framework
이 논문은 현재의 최첨단 LLM들이 숙의 과정에서 인간의 신념 업데이트를 모방하는 데 실패하며, 대신 '시그니처 자기 아첨(signature self-sycophancy)'이라 명명된 현상에 의해 유도되는 의견 역전, 오버슈팅 또는 경직성과 같은 고유하고 정체성 특유의 왜곡을 보인다는 것을 밝히기 위해 숙의적 여론조사 진단 프레임워크(Deliberative Polling Diagnostic Framework)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
정부, 기업, 연구자들이 대중의 의견을 이해하기 위해 실제 사람들을 대상으로 설문 조사를 하는 데 수개월의 시간과 수백만 달러를 더 이상 소비할 필요가 없는 세상을 상상해 보십시오. 대신, 그들은 컴퓨터 프로그램에 수천 명의 서로 다른 시민을 시뮬레이션하도록 요청하고, 그 디지털 페르소나들에게 새로운 논거를 제시한 뒤, 그들의 생각이 어떻게 변하는지 관찰할 수 있습니다. '실리콘 샘플링(silicon sampling)'이라 불리는 이 관행은 빠르고 저렴하며 확장 가능하기 때문에 급격히 성장했습니다. 이러한 인공 에이전트들이 인간의 추론을 충분히 모방하여 새로운 정보에 대해 사람들이 어떻게 반응할지 예측할 수 있기를 기대하는 것입니다. 그러나 결정적인 질문이 해결되지 않은 채 남아 있습니다. 과연 이 컴퓨터 프로그램들이 실제로 인간처럼 생각하고 자신의 신념을 업데이트하는 것일까요, 아니면 단순히 방대한 데이터 라이브러리에서 미리 작성된 의견을 검색하는 것일까요? 만약 후자라면, 사람들의 마음이 어떻게 변할지 테스트하기 위해 이들을 사용하는 것은 위험할 정도로 잘못된 결론으로 이어질 수 있습니다.
라호르 경영대학교(Lahore University of Management Sciences)의 연구진은 인공지능을 테스트하는 새로운 방법을 개발하여 이 질문에 답하고자 했습니다. 그들은 '숙의(deliberation)'라고 불리는 특정 인간 행동, 즉 균형 잡힌 논거를 들은 후 마음을 바꾸는 과정에 집중했습니다. 현실 세계에서 반대되는 정치적 입장에 있는 사람들이 서로에 대해 공정한 정보를 들을 때, 그들은 대개 적대감이 줄어들고 더 개방적인 태도를 갖게 됩니다. 연구진은 컴퓨터 모델이 이러한 특정한 변화를 재현할 수 있는지 확인하고 싶었습니다. 그들은 '아메리카 인 원 룸(America in One Room)'이라는 유명한 실제 사건의 데이터를 가져와 기준점으로 삼았습니다. 이 사건에는 526명의 실제 유권자가 모여 정치에 대해 토론했습니다. 연구진은 가장 발전된 다섯 가지 컴퓨터 모델에게 동일한 유권자를 시뮬레이션하도록 하고, 브리핑 전후에 동일한 정보와 질문을 던졌습니다.
결과는 놀라운 진실을 드러냈습니다. 어떤 컴퓨터 모델도 실제 인간처럼 행동하지 않았습니다. 모델들은 자신의 신념을 현실적인 방식으로 업데이트하는 대신, 모두 실패했으며 각기 독특하고 기이한 방식으로 실패했습니다. 가장 강력한 모델 중 하나인 GPT-5.1은 인간이 하는 것과 정반대로 행동했습니다. 상대 정당에 대한 균형 잡힌 정보가 제시되었을 때, 실제 유권자들은 더 우호적으로 변하고 적대감이 줄어들었습니다. 그러나 컴퓨터 페르소나들은 마치 새로운 정보가 자신들을 더 화나게 만든 것처럼, 훨씬 더 적대적으로 변했습니다. 이는 연구진이 '역전(reversal)'이라고 부르는 현상으로, 모델이 완전히 잘못된 방향으로 움직이는 것을 의미합니다.
다른 모델들은 방향이 역전되지는 않았지만, 너무 멀리 갔습니다. 제미나이(Gemini), 클로드(Claude), 라마(Llama)와 같은 모델들은 논거를 들은 후 적대감이 줄어드는 등 올바른 방향으로 움직이기는 했으나, 인간보다 5배에서 7배나 더 많이 마음을 바꿨습니다. 마치 아주 작은 자극에도 의견이 요동치며 지나치게 설득되기 쉬운 상태인 것처럼 과하게 반응했습니다. 네 번째 모델인 딥시크(DeepSeek)는 전혀 변화를 거부하며, 제공된 정보와 상관없이 의견의 변화가 거의 나타나지 않는 경직성을 보였습니다. 이러한 경직성은 새로운 논거가 아무런 영향도 미치지 못하는 것처럼 행동했음을 의미합니다.
연구진은 왜 이러한 실패가 발생하는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 문제가 무작위로 발생하는 것이 아니라, 특히 정치적 정체성에 관한 질문에 의해 유발된다는 것을 발견했습니다. 정책 세부 사항에 대한 질문에는 모델들이 상당히 잘 수행했습니다. 하지만 질문이 한 정당이 상대 정당을 어떻게 바라보는지에 대한 내용을 담고 있을 때 모델들은 무너졌습니다. 컴퓨터 페르소나들은 논리적으로 새로운 사실을 추론하기보다는 스테레오타입(고정관념)을 연기하는 것처럼 보였습니다. 연구진은 이 행동을 '자기 아첨(self-sycophancy)'이라고 명명했습니다. 이는 모델이 새로운 사실을 통해 추론하는 대신, 특정 유형의 사람이 믿어야 한다고 생각하는 내부적인 아이디어에 동조하는 일종의 아첨 행위입니다. 예를 들어, 모델에게 공화당원처럼 행동하라고 지시하면, 모델은 공화당원이라면 상대 정당을 미워해야 한다고 가정하고, 증거가 그렇지 않음을 시사하더라도 그 가정을 고수했습니다.
이러한 행동은 컴퓨터가 인간 사용자를 기쁘게 하려는 편향과는 구별됩니다. 여기서 컴퓨터는 자신의 내부 스크립트를 기쁘게 하고 있는 것입니다. 연구는 이 실패가 선택적이고 대칭적이라는 것을 보여주었습니다. 즉, 동일한 모델이 질문에 따라 상대 정당에 대해서는 적대적으로 행동하고, 자기 쪽 정당에 대해서는 지나치게 우호적으로 행동할 수 있다는 것입니다. 이는 모델들이 사고 과정을 시뮬레이션하는 것이 아니라, 정치적 라벨과 관련된 캐시된(저장된) 사전 패키지 형태의 태도를 검색하고 있음을 시사합니다. 연구진은 프롬프트에서 정치적 라벨을 교체하여 이를 테스트했고, 모델의 반응이 즉각적으로 변하는 것을 확인했습니다. 이는 모델이 논리가 아닌 라벨에 반응하고 있음을 확증하는 것이었습니다.
이러한 연구 결과의 함의는 사회를 이해하기 위해 컴퓨터 시뮬레이션에 의존하는 모든 이들에게 매우 중요합니다. 만약 모델이 방향을 역전시킨다면, 공공 토론이 사람들을 더 화나게 만들 것이라고 정책 입안자를 설득할 수도 있는데, 실제로는 토론이 사람들을 더 차분하게 만들 수 있습니다. 만약 모델이 과잉 반응한다면, 교육 캠페인의 효과를 과장하여 자원을 낭비하게 만들 수 있습니다. 만약 모델이 경직되어 있다면, 어떤 정보도 사람의 마음을 바꿀 수 없다고 암시하여 공적 토론의 개념 자체를 약화시킬 수 있습니다. 연구진은 컴퓨터 모델이 어떻게 마음을 바꾸는지 시뮬레이션하는 것을 신뢰하기 전에, 모델이 실제로 새로운 정보를 통해 추론할 수 있는지 아니면 단순히 스테레오타입을 읊고 있는 것인지에 대한 진단 테스트를 먼저 실시해야 한다고 결론짓습니다. 이러한 점검 없이 실리콘 샘플링의 속도와 규모에 의존한다면, 우리는 인간 본성을 이해하고 있다고 믿게 되겠지만, 사실은 우리 자신의 편향이 투영된 왜곡된 그림자를 보고 있는 것뿐일 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.