← 최신 논문
💬 NLP

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

이 논문은 예측 시장을 공개된 정보의 시간적 차단이 이루어진 고정된 스냅샷에 대해 재현함으로써, 모델이 사후적 회상이 아닌 진정한 선견지명에 따라 평가받도록 보장하여 LLM 예측에서의 데이터 누수를 방지하는 엄격한 평가 프레임워크인 "Hindcast"를 소개한다.

원저자: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 얼마나 미스터리를 잘 해결하는지 테스트하려고 한다고 상상해 보세요. 당신은 그에게 사건 파일을 건네주며 "누가 쿠키를 훔쳤는가?"라고 묻습니다. 만약 탐정이 단순히 파일을 열어 맨 밑에 적힌 답을 읽기만 한다면, 그는 자신의 탐정 기술을 보여주는 것이 아니라 단지 읽기 능력을 보여주는 것뿐입니다. 이것이 과학자들이 AI 모델의 미래 예측 능력을 테스트할 때 직면하는 까다로운 문제입니다.

AI가 정말 똑똑한지 확인하기 위해, 연구자들은 보통 "2022년 월드컵에서 누가 우승했는가?"와 같이 이미 일어난 일을 예측하도록 AI에게 요청합니다. 문제는 오늘날의 AI 모델들이 결승전이 끝난 후 작성된 기사를 포함하여 인터넷 전체를 학습했다는 점입니다. 따라서 AI가 "아르헨티나가 우승했다"라고 말할 때, 그것은 AI가 사전에 단서들을 파악해낸 결과가 아니라, 학습 데이터에 있는 최종 점수를 기억해낸 것일 수 있습니다. 이는 마치 정답지를 몰래 암기한 채 역사 시험을 치르는 학생과 같습니다. 이를 해결하기 위해 과학자들은 AI가 '정답지'(실제로 일어난 일)를 보고 부정행위를 하지 못하게 하면서도, AI의 '통찰력'(무엇이 일어날지 추측하는 능력)을 테스트할 수 있는 방법을 찾아야 합니다.

여기서 새로운 연구인 HINDCAST가 등장합니다. 연구자들은 AI가 미래를 예측할 수 있는지, 즉 다음에 어떤 일이 일어날지에 대한 지식이 전혀 없는 상태에서 과거에 머물러 있게 했을 때도 가능한지를 알고 싶었습니다. 그들은 예측 시장(결과에 돈을 거는 곳)과 얼어붙은 인터넷 아카이브를 사용하여 시간 여행 시뮬레이션을 설정했습니다. 그들은 AI가 속임수를 쓰지 못하게 막았을 때, AI가 오래된 뉴스를 읽음으로써 더 나은 예측을 할 수 있다는 것을 발견했습니다. 단, 그 뉴스가 실제로 유용한 사실들을 담고 있을 때만 그러했습니다. 만 만약 오래된 뉴스가 그저 사람들의 추측과 의견을 외치는 것에 불과했다면, 그것을 읽는 것은 오히려 AI의 예측력을 떨어뜨렸습니다.

시간 여행 테스트

연구진은 HINDCAST('forecast'의 반대인 'hindcast'를 활용한 이름)라고 불리는 시스템을 구축했습니다. 시간 여행 장치를 상상해 보세요. 이 장치는 예를 들어 큰 스포츠 토너먼트가 시작되기 한 달 전의 특정 시점을 고정합니다. 이 고정된 순간에 AI는 뉴스 기사와 포럼 게시물을 검색할 수 있지만, 반드시 그 날짜 이전에 작성된 것들만 볼 수 있습니다. AI는 설령 오늘날의 도서관에 그 이후의 자료들이 놓여 있다 하더라도, 그 시점 이후에 작성된 것은 아무것도 볼 수 없습니다.

AI를 테스트하기 위해 연구진은 Polymarket이라는 실제 세계의 베팅 시장을 사용했습니다. 이곳은 사람들이 어떤 사건이 일어날지(예: "팀 X가 승리할 것인가?")에 대해 내기를 하는 디지털 카지노와 같습니다. 이 시장들은 이미 종료되었기 때문에, 연구진은 실제 정답을 알고 있습니다. 또한 연구진은 그 고정된 과거 시점에 사람들이 생각했던 확률인 '시장 가격'이 얼마였는지도 알고 있습니다.

설정 방식은 다음과 같습니다:

  1. 시간 고정: 시장이 종료되기 전의 과거 날짜(t0t_0)를 선택합니다.
  2. 도서관 잠금: AI는 해당 날짜 이전에 작성된 Reddit(유명한 인터넷 포럼)의 스냅샷만을 검색할 수 있습니다.
  3. 예측: AI는 사용 가능한 게시물들을 읽고 결과를 추측합니다.
  4. 채점: AI는 두 가지 기준으로 평가받습니다: 실제 최종 결과에 얼마나 근접했는지, 그리고 그 정확한 순간에 인간 베터들이 생각했던 바와 얼마나 근접했는지.

대발견: 사실 vs 선동

연구팀은 9개의 서로 다른 AI 모델을 테스트하여, 이 "얼어붙은 도서관"을 제공하는 것이 AI가 자신의 기억만으로 추측하는 것보다 예측에 도움이 되는지 확인했습니다.

좋은 소식: 대부분의 AI 모델에 있어, 과거의 게시물을 읽는 것은 도움이 되었습니다. 실제로 9개 모델 중 8개 모델에서 AI는 아카이브를 읽을 수 있을 때 오류율이 낮아졌습니다. 가장 큰 개선은 Qwen3-32B라는 모델에서 나타났는데, 이 모델은 오류율을 23% 줄였습니다. 이는 과거에 실제 사실들이 존재할 때, AI가 그 사실들을 이용해 더 똑똑한 추측을 할 수 있음을 시사합니다.

나쁜 소식 (그리고 주의점): 도움 여부는 보편적이지 않았습니다. 그것은 전적으로 AI가 무엇을 읽느냐에 달려 있었습니다.

  • 효과가 있었던 경우: 스포츠, 시상식, 트레이딩 같은 주제에서는 이벤트 전의 인터넷 게시물들이 구체적인 사실들(예: "팀의 스타 플레이어가 부상을 입었다" 또는 "금값이 상승하고 있다")로 가득 차 있었습니다. 이 경우, AI는 사실을 읽고 승자를 더 잘 예측했습니다.
  • 실패한 경우: 엔터테인먼트(예: 어떤 노래가 1위를 할지 맞히기)나 정치 같은 주제에서는 인터넷이 시끄러운 의견, 팬들의 열광, 그리고 추측으로 가득 차 있었습니다. AI가 이 게시물들을 읽었을 때, AI는 혼란에 빠졌습니다. AI는 그 "열기(hype)"를 사실이라고 믿기 시작했습니다. 예를 들어, 팬들이 어떤 노래가 1위를 할 것이라고 소리 높여 외치면, AI는 그 노래에 베팅했습니다. 비록 대부분의 노래가 실제로 정상에 오르지 못하더라도 말입니다. 이런 경우, 아카이브를 읽는 것은 AI가 자신의 논리에 따라 스스로 판단했을 때보다 오히려 예측력을 악화시켰습니다.

"과잉 독해" 문제

연구는 흥미로운 패턴을 발견했습니다. 베팅 시장이 열려 있는 시간이 길어질수록, AI가 소음(noise)에 의해 혼란을 겪을 가능성이 커졌습니다. 만약 베팅 시장이 오랫동안 열려 있었다면, 인터넷은 끝없는 잡담과 상충하는 의견들로 가득 찼을 것입니다. AI는 도움이 되고자 노력하다가 이 모든 것을 읽게 되었고, 결국 과도하게 생각하기 시작하여 견고한 사실 대신 시끄러운 의견들에 기반해 잘못된 추측을 하게 되었습니다.

특히 R1-Distill-Qwen-7B라는 모델은 읽기가 허용되었을 때 전반적으로 성능이 저하되었습니다. 연구진은 모델이 길고 혼란스러운 추론 체계들을 읽는 데 너무 매몰되어, 실제 증거를 잊어버렸기 때문이라고 생각합니다. 이는 마치 학생이 어떤 주제에 대한 너무 많은 의견을 읽다가 단순한 사실들을 잊어버리고 결국 틀린 추측을 하게 되는 것과 같습니다.

이것이 미래에 갖는 의미

HINDCAST의 핵심 결론은 AI의 미래 예측 능력은 사건이 발생하기 전 AI가 찾을 수 있는 정보의 질에 달려 있다는 것입니다. 만약 인터넷이 사실들로 가득 차 있다면, AI는 훌륭한 예언가가 될 수 있습니다. 하지만 인터넷이 소문과 선동으로 가득 차 있다면, AI는 진실 대신 가장 큰 목소리를 믿어버리는 확신에 찬 바보가 될 수도 있습니다.

또한 연구진은 이 "시간 여행" 테스트 방식이 강력한 도구임을 보여주었습니다. 도서관이 고정되어 있기 때문에, 새로운 AI 모델들이 속임수를 쓰지 못하게 하면서 동일한 오래된 질문들에 대해 테스트할 수 있습니다. 이는 우리가 AI가 더 똑똑해짐에 따라 테스트를 계속 발전시켜, 우리가 측정하는 것이 단순히 기억력이 아니라 정말로 어떻게 생각하는지인지 확인할 수 있음을 의미합니다.

요약하자면, HINDCAST는 사실의 도서관을 주는 것이 AI가 미래를 보는 데 도움을 주지만, 소문의 도서관을 주는 것은 AI를 눈멀게 할 수 있다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →