Large Language Models as Implicit Sociological Models: Reconstructing Voting Behaviour from Sociodemographic Profiles
본 논문은 거대 언어 모델을 사회인구학적 프로필로부터 집단적 투표 행태를 재구성하기 위한 암묵적 사회학적 도구로 취급하는 방법론적 프레칭워크를 제안하며, 이들이 실제 선거 결과와 정치 구조를 정확하게 복제할 수 있는 능력과 더불어 계산 사회과학을 위한 탐색적 도구로서의 유용성을 입증하고 있음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
정치학자들은 사람들이 어떻게 투표하는지를 연구하는 데 있어 오랫동안 단순한 진리에 의존해 왔습니다. 바로 '당신이 누구인가'가 종종 '당신이 어떻게 투표하는가'를 예측한다는 사실입니다. 개인의 연령, 교육 수준, 소득, 거주지는 정치적 선택과 강력하게 상관관계가 있는 인구통계학적 프로필을 형성합니다. 수십 년 동안 연구자들은 설문조사를 통해 이러한 연결 고리를 지도화해 왔으며, 수천 명의 사람들에게 그들의 삶과 투표에 대해 질문함으로써 선거를 형성하는 패턴을 찾아냈습니다. 그러나 디지털 시대에 들어 새로운 질문이 등장했습니다. 인터넷에 존재하는 방대한 인간의 글들을 학습한 컴퓨터 프로그램이, 단 한 명에게도 질문을 던지지 않고 이미 이러한 패턴을 알고 있을 수도 있을까요? 현대 챗봇의 기반이 되는 강력한 인공지능 시스템인 대규모 언어 모델(LLM)은 수십억 개의 문서를 읽음으로써 구축됩니다. 이 과정에서 모델들은 인간 문화의 통계적 규칙성, 즉 개인의 배경과 정치적 성향 사이의 암묵적인 연결 고리를 흡수합니다. 이는 매혹적인 가능성을 제기합니다. 이 모델들이 사회의 압축된 거울로서, 인구통계학적 특성이 어떻게 투표로 이어지는지에 대한 숨겨진 지도를 단순히 그 많은 글을 읽었다는 이유만으로 보유할 수 있을까요?
체코의 연구진은 2021년 체코 총선을 실험실로 삼아 이 아이디어를 테스트하기 위해 나섰습니다. 그들은 인공지능에게 선거 승자를 예측하거나 특정 개인이 왜 특정 정당을 선택했는지 설명하라고 요구하지 않았습니다. 대신, 그들은 모델을 일종의 사회학적 도구, 즉 밑바닥에서부터 국가의 집단적 행동을 재구성하는 방법으로 취급했습니다. 연구진은 연령, 성별, 교육, 소득, 심지어 정치에 대한 관심도까지 포함된 상세한 프로필을 가진 약 4,000명의 체코 시민이 포함된 실제 설문조사 데이터를 가져왔습니다. 그들은 이러한 묘사들을 하나씩 네 가지 버전의 대규모 언어 모델에 입력했습니다. 각 개인에 대해 모델은 다음과 같은 간단한 질문을 받았습니다. "이 구체적인 삶의 이야기를 고려할 때, 당신은 누구에게 투표하겠습니까?" 모델은 단순히 하나의 정당을 선택하는 데 그치지 않고, 모든 주요 정당에 대한 투표 확률과 투표를 하지 않을 확률을 함께 계산했습니다.
연구진은 그다음 이 수천 개의 개별적인 추측을 하나의 국가적 그림으로 결합했습니다. 그들은 모든 확률을 하나의 부분적인 투표로 취급하는 방식을 사용하여, 최종 결과가 단 하나의 강제된 선택이 아닌 수많은 작은 불확실성의 합에서 나타나도록 했습니다. 이 시뮬레이션된 선거를 실제 공식 결과와 비교했을 때, 일치도는 놀라울 정도로 높았습니다. 모델들은 평균 약 2.5 퍼센트 포인트의 오차 내에서 최종 득표율을 재현해 냈는데, 이는 전문 기관이 실시하는 고품질의 선거 전 여론조사와 맞먹는 정확도였습니다. 더 중요한 것은, 이 시뮬레이션이 단순히 숫자만 맞춘 것이 아니라 체코 정치의 숨겨진 구조를 포착했다는 점입니다. 모델들은 특정 정당들이 자연스럽게 결집하여 실제 국가 내에서 관찰되는 동맹과 경쟁 관계를 반영하는 두 개의 뚜렷한 정치 블록을 형성한다는 것을 정확히 식별했습니다. 또한 인공지능이 별도의 학습 없이도 한 연합의 투표자가 다른 연합으로 이동하는 방식 등을 이해하고 있음을 보여줌으로써, 특정 연합의 투표자는 다른 쪽으로 이동하기도 하지만 반대 진영의 투표자는 경계를 잘 넘지 않는다는 구체적인 투표 흐름을 재현해 냈습니다.
연구는 모델의 크기가 중요함을 드러냈습니다. 더 크고 유능한 버전의 인공지능일수록 다양한 유형의 유권자를 더 잘 구별해 냈으며, 젊고 교육 수준이 높은 사람이 투표하는 방식과 나이가 많고 교육 수준이 낮은 사람이 투표하는 방식 사이의 미묘한 차이를 포착해 냈습니다. 반면 작은 모델들은 모든 사람에 대해 평균적인 값을 추측하는 경향이 있어 인구통계학적 지형의 미묘한 차이를 놓쳤습니다. 그럼에도 불구하고 작은 모델들조차 정치적 지도의 대략적인 윤곽은 복구해 냈습니다. 연구진은 모델이 구체적인 개인의 세부 정보를 제공받기 전에 무엇을 알고 있었는지도 확인했습니다. 그들은 모델이 이미 선거 결과에 대한 강력하고 내재된 지식을 가지고 있었다는 것을 발견했는데, 이는 아마도 모델이 학습한 텍스트에서 해당 결과가 매우 빈번하게 논의되었기 때문일 것입니다. 그러나 이 실험의 진정한 가치는 이러한 사전 지식에 있는 것이 아니라, 그 지식을 분해하는 능력에 있었습니다. 개인의 프로필을 입력함으로써 연구진은 모델이 그 지식을 어떻게 다양한 지역과 사회 집단에 배분하는지 볼 수 있었고, 이를 통해 정적인 사실을 역동적이고 구조적인 사회 지도로 전환할 수 있었습니다.
결정적으로, 저자들은 이것이 미래를 예측하거나 인간의 설문조사를 대체하기 위한 도구가 아님을 강조합니다. 모델은 사람들이 왜 그렇게 투표하는지 이해하지 못합니다. 그들은 인간의 의사결정에 대한 인과적 이해를 가지고 있지 않습니다. 그들은 단지 자신들이 학습한 텍사트에서 본 패턴을 반영할 뿐입니다. 만약 인터넷에 교육과 특정 정당을 연결하는 기사들이 가득하다면, 모델은 그 연결 고리를 학습합니다. 이 연구의 가치는 모델이 인간 문화로부터 무엇을 흡수했는지 조사할 수 있게 해주는 진단 도구로서의 능력에 있습니다. 이는 이 시스템들이 주로 영어 데이터로 학습되었음에도 불구하고, 비영어권 다당제 민주주의의 사회학적 규칙성을 내면화했음을 보여줍니다. 연구진은 결론적으로, 이 모델들이 현실의 완벽한 거울은 아닐지라도 사회의 정치적 행동이라는 골격을 재구성할 만큼 강력하며, 우리가 누구인지와 어떻게 투표하는지 사이의 숨겨진 연결 고리를 탐구하는 새로운 방법을 제공한다고 밝혔습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.