← 최신 논문
💬 NLP

SocietyBench: Forecasting Counterfactual Social-World Evolution

이 논문은 실제 사건의 타임라인을 구조화된 예측 작업으로 익명화함으로써 대규모 언어 모델이 반사실적 사회 세계의 진화를 예측하는 능력을 평가하는 새로운 벤치마크인 SocietyBench를 소개하며, 이를 통해 최첨단 모델들조차 다양한 사건에 걸쳐 확률 보정(probability calibration)과 시간적 정확도 모두에서 어려움을 겪고 있음을 밝힌다.

원저자: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 세상을 이해하는 법을 가르치고 있다고 상상해 보십시오. 오랫동안 과학자들은 로봇에게 "이 고장 난 코드를 고쳐라", "이 웹사이트를 탐색하라", 또는 "이 수학 문제를 풀어라"와 같은 잡무를 주며 이 로봇들을 테스트해 왔습니다. 이것은 마치 로봇이 그저 차선을 유지하며 목적지에 도달하기만 하면 되는 운전 면허 시험과 같습니다. 하지만 이러한 테스트들은 인간다움의 거대한 부분을 놓치고 있습니다. 바로 현실 세계의 무질서하고 예측 불가능한 드라마입니다. 로봇은 갑작스러운 스캔들, 변화하는 정치적 루머, 혹은 시장 폭락을 어떻게 다룰 수 있을까요? 로봇이 오늘의 뉴스를 보고 내일의 헤드라인이 무엇이 될지 추측할 수 있을까요? 이것이 바로 사회적 예측(social forecasting)의 영역입니다. 이것은 지도를 따라가는 것이 아니라, 가십, 분노, 그리고 놀라움에 따라 바람의 방향이 바뀌는 인간 행동의 날씨를 예측하는 일입니다.

여기에 인공지능이 단순히 학습 데이터에서 암기한 사실을 읊는 것을 넘어, 실제로 현실 세계의 사회적 사건의 미래를 예측할 수 있는지 확인하기 위해 설계된 새로운 "최종 시험"인 SocietyBench가 등장했습니다. 이 연구를 진행한 연구진은 만약 AI에게 이미 일어난 유명한 사건에 대해 묻는다면, AI가 방대한 과거 인터넷 텍스트 라이브러리에서 답을 기억해 내는 "암기된 데이터에 의존"할 수도 있다는 점을 깨달았습니다. 이를 막기 위해 그들은 영리한 속임수를 사용했습니다. 실제 뉴스 기사를 가져온 뒤, 모든 이름(예를 들어 "일론 머스크"를 "인물 X"로, "테슬라"를 "기업 Y"로 바꾸는 것)을 교체하고 날짜를 변경했습니다. 이는 실제 이야기와 똑같이 보이고 느껴지지만, AI가 이전에 본 적 없는 스크립트인 "반사실적(counterfactual)" 세계를 만들어냈습니다. 이제 AI는 기억력이 아닌 자신의 두뇌를 사용하여 이야기가 어떻게 전개될지 파악해야 합니다.

이 실험의 결과는 AI 업계에 일종의 현실 자각 타임을 선사했습니다. 연구진은 금융 시장 폭락부터 지정학적 갈등에 이르기까지 다섯 가지 유형의 사건에 대해 현재 사용 가능한 가장 진보된 여섯 가지 AI 모델을 테스트했습니다. 가장 높은 점수를 받은 가장 똑똑한 모델조차 겨우 75.0점 만점에 75.0점을 기록했을 뿐입니다. 이 점수가 좋아 보일 수도 있지만, 기억하십시오. "사소한 기준점(trivial anchor, 즉 무작위로 찍거나 모든 것에 "50% 확률"이라고 답했을 때 얻는 점수)"은 50입니다. 즉, 최고의 AI도 무작위 추측과 완벽한 예측 사이의 딱 중간 정도에 위치해 있을 뿐입니다.

여기 핵심적인 문제가 있습니다. AI 모델들은 일관성을 유지하는 데 형편없다는 것입니다. 어떤 모델은 어떤 일이 일어날 확률을 맞히는 데는 뛰어나지만(예: "비가 올 확률이 70%이다"라고 말하는 것), 그것이 언제 일어날지를 맞히는 데는 서툽니다. 다른 모델은 그 반대입니다. 이는 마치 비가 올지 안 올지는 항상 맞히지만, 비가 화요일에 올지 금요일에 올지는 항상 틀리는 기상 예보자와 같습니다. 연구진은 단일 사건에 대해 가장 뛰어난 모델과 가장 낮은 모델의 점수 차이가 무려 21.4점에 달할 수 있다는 것을 발견했습니다. 이는 단순히 하나의 이야기로 AI를 테스트하고 끝내서는 안 되며, 진짜 그림을 얻으려면 반드시 많은 이야기를 테스트해야 한다는 것을 증명합니다.

가장 놀라운 발견 중 하나는 "AI 에이전트"에 관한 것이었습니다. 이들은 여러 AI 봇들이 서로 대화하거나, 토론하거나, 함께 계획을 세우며 더 똑똑한 답을 얻고자 하는 데모 설정입니다. 연구진은 이 팀들을 작동시키는 세 가지 다른 방법을 시도했지만, 그중 어느 것도 결과를 개선하지 못했습니다. 사실, 봇들의 팀은 그 기반이 된 단일하고 외로운 AI 봇보다 성능이 더 떨어지는 경우가 많았습니다. 사회적 혼돈을 예측하는 데 있어서는 방에 더 많은 목소리를 추가하는 것이 대화를 더 똑똑하게 만드는 것이 아니라, 그저 더 소란스럽게 만들 뿐이라는 사실이 드러났습니다.

결국, SocietyBench는 우리 AI 모델들이 명령을 따르고 버그를 수정하는 데는 매우 능숙해지고 있지만, 인간 사회의 복잡하고 소용돌이치는 역학을 이해하는 데는 여전히 고군분투하고 있음을 보여줍니다. AI는 미래를 단순히 암기할 수 없습니다. 그들은 미래를 통해 실제로 추론해 나가야 합니다. 그리고 현재로서는, 가장 뛰어난 모델들조차 진정한 예언자가 되기에는 아직 갈 길이 멉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →