Building Social World Models with Large Language Models
이 논문은 명시적인 주석 없이도 사건에 따른 사회적 신념의 진화를 예측하기 위해 거대 언어 모델을 활용하는 프레임워크인 Social World Model(SWM)을 소개하며, Kalshi 및 Polymarket과 같은 실제 예측 시장에서 유래한 새로운 벤치마크에서 최첨단 성능을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 사람들의 집단적인 반응을 예측하려고 한다고 상상해 보십시오. 사람들은 흥분할까요, 겁을 먹을까요, 아니면 무관심할까요? 보통 이것은 예측하기가 매우 어렵습니다. 인간의 신념은 복잡하고 감정적이며, 항상 명확한 이유가 드러나지 않는 방식으로 변하기 때문입니다.
이 논문은 **사회적 세계 모델(Social World Model, SWM)**이라는 새로운 도구를 소개합니다. 이것을 인공지능(구체적으로는 거대언어모델, LLM)에 의해 구동되는 **"여론을 위한 수정구슬"**이라고 생각하십시오.
논문은 이 내용을 다음과 같은 쉬운 비유를 사용하여 설명합니다.
1. 문제점: 여론이라는 "블랙박스"
저자들은 여론을 추적하는 것이 온도계 없이 날씨를 예측하려는 것과 같다고 말합니다.
- 데이터의 공백: 보통 우리는 사람들이 무엇을 믿는지에 대한 명확한 수치를 가지고 있지 않습니다. 설문조사는 느리고, 소셜 미디어는 봇, 트롤, 에코 체임버(반향실 효과)로 가득 차 노이즈가 많습니다.
- 미스터리: 설령 신념의 변화(예: "사람들이 갑자기 특정 암호화폐가 오를 것이라고 믿게 됨")를 목격하더라도, 우리는 종종 어떤 구체적인 뉴스 기사가 그것을 유발했는지 알지 못합니다. 정치인의 연설 때문이었을까요? 과학적 발견 때문이었을까요? 아니면 단순한 루머 때문이었을까요?
- 도전 과제: 전통적인 컴퓨터 모델은 수학(예: 과거 수치를 바탕으로 주가를 예측하는 것)에는 능숙하지만, 숫자 뒤에 숨겨진 이야기를 이해하는 데는 서툽니다. 그들은 뉴스를 "읽고" 특정 헤드라인이 어떻게 사람의 마음을 바꾸는지 이해하지 못합니다.
2. 해결책: "사회적 세계 모델(Social World Model)"
저자들은 공공의 신념을 밀고 당길 수 있는 물리적인 객체처럼 취급하는 시스템을 구축했습니다.
- "상태(State)" (신념): 온도계가 무언가에 대한 믿음의 정도(예: "트럼프가 선거에서 승리할 것인가?")를 측정한다고 상상해 보십시오. 온도계 위의 숫자가 바로 "상태"입니다.
- "사건(Event)" (밀기): 뉴스 기사는 그 온도계를 미는 손과 같습니다.
- 목표: 모델은 다음과 같은 규칙을 학습하고자 합니다: 만약 현재의 신념(상태 A)이 있고 이 특정 뉴스(사건)가 발생한다면, 내일의 신념(상태 B)은 무엇이 될 것인가?
3. AI 학습 방법 ("사후 확신" 기법)
이 부분이 논문에서 가장 영리한 부분입니다. 보통 컴퓨터를 가르치려면 "이 뉴스 기사가 저 신념의 변화를 일으켰다"라고 말해주는 교사가 필요합니다. 하지만 저자들에게는 모든 사건에 대해 대응할 수 있는 인간 교사가 없었습니다.
대신, 그들은 "사후 확신(Hindsight)" 전략을 사용했습니다:
- 설정: 그들은 예측 시장(Polymarket이나 Kalshi 같은 곳)의 데이터를 사용했습니다. 이곳은 사람들이 결과에 실제 돈을 거는 곳입니다. 베팅 가격은 대중이 무엇을 믿고 있는지에 대한 완벽하고 실시간적인 척도가 됩니다.
- 교사 ("사후 확률/Posterior"): 그들은 아주 똑똑한 AI(고정된 LLM)를 사용하여 사건이 일어난 후에 과거를 살펴보게 했습니다. 이 AI는 마치 범죄 현장을 조사하는 형사처럼 행동합니다. 신념의 변화를 보고 이렇게 묻습니다. "어제의 어떤 뉴스 기사가 이 변화를 가장 잘 설명하는가?"
- 학생 ("세계 모델"): 메인 모델( "학생")은 미래를 예측하려고 노력합니다. 이 모델은 "형사 AI"가 무엇이라고 답했을지 추측하도록 훈련됩니다.
- 비유: 학생이 시험을 치르고 있다고 상상해 보십시오. 학생은 아직 정답을 모릅니다. 하지만 시험이 끝난 후, 천재 튜터가 와서 "네가 이 문제를 맞힌 이유는 이 특정 사실을 기억했기 때문이야"라고 알려줍니다. 그러면 학생은 그 사실과 정답을 연관 짓는 법을 배우며, 다음번에는 스스로 추측할 수 있게 됩니다.
4. 연구 결과
팀은 수천 개의 실제 베팅 시장을 사용하여 그들의 모델을 다른 방법들과 비교 테스트했습니다.
- 전문가를 넘어서다: 그들의 모델(SWM)은 과거의 숫자만을 보는 표준 시계열 모델보다, 그리고 현재 사용 가능한 가장 진보된 AI 모델들(예: GPT-5.5)보다도 신념 변화의 방향(상승 또는 하락)을 더 잘 예측했습니다.
- "왜"가 중요하다: 모델은 뉴스 기사와 신념 변화를 명확하게 연결할 수 있을 때 가장 잘 작동합니다.
- 성공 사례: 명확한 사건(예: 평화 협정 발표)이 발생했을 때, 모델은 신념이 상승할 것이라고 정확히 예측했습니다.
- 실패 사례: 알고리즘 매매나 모호한 루머와 같이 복잡하고 숨겨진 이유로 시장이 움직일 때, 모델은 명확한 "원인"을 뉴스에서 찾을 수 없었기에 어려움을 겪었습니다.
5. 두 가지 작동 모드
논문은 이 도구를 사용하는 두 가지 방법을 설명합니다.
- 예측 (기상 캐스터 모드): 모델은 오늘의 모든 뉴스를 살펴보고, 어떤 뉴스가 가장 중요한지 추측한 뒤, 내일 대중이 무엇을 믿을지 예측합니다.
- 시뮬레이션 ("만약에" 머신 모드): 당신은 모델에게 물을 수 있습니다. "만약 이 특정 가짜 뉴스 기사가 사실이라면 공공의 의견은 어떻게 변할까?" 모델은 뉴스가 실제로 존재하지 않더라도 그 반응을 시뮬레이션합니다.
요약
이 논문은 실제 돈이 걸린 베팅 데이터(신념을 측정하는 매우 정직한 척도)와 뉴스를 읽고 이해할 수 있는 AI를 결합함으로써, 사회의 마음이 어떻게 변하는지를 예측할 수 있는 시스템을 만들었다고 주장합니다. 이 모델은 단순히 숫자를 추측하는 것이 아니라, 특정 이야기가 여론의 흐름을 어떻게 움직이는지에 대한 "규칙"을 학습합니다.
중요 참고 사항: 논문은 이것이 집단적 신념을 이해하고 예측하기 위한 도구임을 명시하고 있습니다. 정책 입안자들이 반응을 예측하는 데 유용할 수 있지만, 악의적으로 활용될 경우 여론을 조작하는 데 쓰일 수 있음을 경고합니다. 저자들은 이 모델이 미래를 100% 확실하게 예측할 수 있다거나, 모든 사회 과학 문제를 해결할 수 있다고 주장하는 것이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.