WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
본 논문은 2026년 FIFA 월드컵 기간 동안 6개의 최첨단 거대 언어 모델에 대한 데이터 누출 없는 평가를 제시하며, 이 모델들이 경기 결과에 대해 북메이커 수준의 정확도를 달행하는 한편, 우세한 팀에 대한 과도한 의존, 모델 간 차별성 부족, 그리고 무승부 및 특정 점수대를 과소 예측하는 경향과 같은 공통된 한계를 보인다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아직 일어나지 않은 사건을 해결하려는 탐정이라고 상상해 보십시오. 인공지능의 세계에서 우리는 종-종 "똑똑한" 컴퓨터 프로그램들을 테스트할 때, "2022년 월드컵 우승자는 누구인가?"와 같이 이미 일어난 일들에 대해 질문을 던집니다. 문제는 이 프로그램들이 실제로 문제를 해결한 것이 아니라, 인터넷에서 답을 단순히 암기했을 수도 있다는 점입니다. 진정으로 뇌가 똑똑한지 테스트하려면, 아직 존재하지 않는 것을 예측하도록 요구해야 합니다. 즉, 미래를 예측하는 것입니다. 이것은 "예측(forecasting)"이라는 영역의 최전선이며, 여기서 우리는 기계가 아직 아무도 모르는 답을 향해 추론해 나갈 수 있는지 확인합니다.
WORLDCUP ARENA라는 제목의 이 논문은 그 아이디어를 가져와 거대하고 실시간적인 실험을 수행합니다. 연구진은 컴퓨터에게 이미 끝난 경기의 승자를 맞히라고 하는 대신, 2026년 FIFA 월드컵이라는 라이브 토너먼트를 설정했습니다. 그들은 세계에서 가장 진보된 6개의 AI 모델을 스포츠 분석가로 초대했습니다. 단 한 경기가 시작되기도 전 매일, 이 AI들은 팀, 날씨, 심판, 그리고 최신 뉴스를 살펴보고 나서 7가지의 서로 다른 예측(누가 이길 것인지, 총 몇 골이 터질 것인지, 정확한 스코어 등)을 해야 했습니다. 핵심은 경기가 아직 열리지 않았다는 점입니다. 답은 세상 어디에도 존재하지 않았습니다. 이는 AI가 스코어를 검색할 수 없었음을 의미하며, 반드시 스스로 '생각'해야만 했다는 뜻입니다.
연구진은 이 초지능형 컴퓨터들이 확률을 극복할 수 있을지, 아니면 그저 대세를 따를 뿐인지 알고 싶었습니다. 연구 결과, 이 AI들은 인상적이긴 했지만 마법 같은 존재는 아니었습니다. 평균적으로 이들은 경기 결과의 약 **63.9%**를 맞혔습니다. 이는 좋은 수치처럼 들리지만, 사실상 북메이커(배당률 책정업자)가 승리할 것이라고 예상한 팀에 무작정 돈을 거는 것과 거의 동일한 수준입니다. 실제로 AI들은 매우 신중하여, 무승부가 자주 발생함에도 불구하고 무승부를 거의 예측하지 않았으며, 계속해서 똑같이 지루한 스코어인 (2-1)만을 반복해서 예측했습니다.
가장 놀라운 부분은 다음과 같습니다: 6개의 서로 다른 AI 모델은 거의 동일한 사고방식을 보였습니다. 이들은 **76%**의 확률로 서로 의견이 일치했습니다. 만약 이들에게 승자를 투표하게 한다면, "다수결" 방식은 단일 AI 중 가장 뛰어난 모델보다 더 나은 성과를 내지 못했습니다. 결론적으로, 2026년의 가장 진보된 "사고" 모델들은 모두 동일한 전략을 따르고 있는 것으로 보입니다. 즉, 큰 그림을 보는 데는 능숙하지만(예: 어느 국가가 전체 토너먼트에서 우승할지 예측하는 것), 단일 경기의 작고 복잡한 세부 사항을 파악하는 데는 어려움을 겪고 있습니다. 이 논문은 현재의 이 AI 시스템들이 서로 확연히 다르지 않으며, 모두 인간 전문가가 계산기를 들고 예측하는 것보다 더 나은 방식으로 미래를 "보는" 법을 깨우치지 못한 채, 단지 인간의 베팅 패턴을 매우 정교하게 흉내 내고 있을 뿐이라고 결론짓습니다.
실험: 마음들의 라이브 토너리먼트
연구진은 "정보 유출이 없는(leakage-free)" 아레나를 구축했습니다. 일반적인 테스트에서는 과학자들이 AI가 훈련 데이터에서 답을 "유출"했을 가능성을 걱정해야 합니다. 하지만 여기서는 경기가 2026년에 실시간으로 진행되고 있었기 때문에, 질문이 던져지는 시점에 답은 말 그대로 존재하지 않았습니다. 설정은 엄격했습니다:
- 참가자: 6개의 프런티어 AI 모델 (Claude, GPT, Gemini, Kimi, GLM, Seed).
- 규칙: 각 모델은 자신의 "확장된 사고(extended thinking)" 모드(사용 가능한 가장 깊은 수준의 추론)를 사용해야 했으며, 자체 내장된 웹 검색 도구를 사용하여 최신 뉴스, 부상 보고서, 배당률 등을 읽어야 했습니다.
- 과제: 토너먼트의 104개 경기 각각에 대해, AI는 승리 팀, 정확한 스코어, 총 득점 등 7가지 시장(market)에 대한 "예측 카드"를 작성해야 했습니다.
- 데이터: AI들에게는 매일 업데이트되는 팀별 "도시에(dossier)"가 제공되었으며, 이는 작은 요약본에서 시작하여 토너너먼트가 끝날 때쯤에는 100만 자 이상의 방대한 파일로 늘어났습니다.
발견한 내용: "무리(Herd)"의 정신
결과는 이 AI들이 어떻게 생각하는지에 대한 명확하고 약간은 우스꽝스러운 그림을 보여주었습니다.
1. 수정구슬이 아닌, 대중을 따르다
AI들은 북메이커보다 더 똑똑하게 예측하지 못했습니다. 그들은 단순히 북메이커가 선호하는 팀의 손을 85.6%에서 90.4% 사이의 확률로 들어주었습니다. 이들의 평균 정확도는 **63.9%**였는데, 이는 기계적으로 우세한 팀을 선택했을 때의 정확도(64.4%)와 통계적으로 차이가 없었습니다. 그들은 새로운 통찰력을 발견한 것이 아니라, 시장의 목소리를 그대로 반영했을 뿐입니다.
2. "무승부 맹점(Draw Blindness)"
AI들은 무승부를 예측하는 데 형편없었습니다. 토너먼트 중 27경기가 무승부로 끝났지만, 모델들이 예측한 무승부는 8~14건에 불과했습니다. 그들은 무승부가 빈번하게 발생함에도 불구하고, 무승부를 예측하는 것을 거의 고려조차 하지 않을 정도로 무승부를 두려워했습니다.
3. "2-1" 집착
정확한 스코어를 맞힐 때, 모델들은 틀에 박힌 모습을 보였습니다. 모든 스코어 예측의 **28.0%**가 단 하나의 결과인 2-1에 집중되었습니다. 그들은 다양한 가능한 스코어들을 무시하고, 하나의 "전형적인" 결과에 예측을 몰아넣었습니다.
4. 거시적 강점 vs 미시적 약점
모델들은 "거시적으로는 강하지만 미시적으로는 약했습니다."
- 거시적(Macro): 토너먼트 우승자와 그룹 순위를 예측하는 데는 뛰어난 성과를 보였습니다.
- 미시적(Micro): 가장 접전이 벌어진 경기들에서 무너졌습니다. 라운드 오브 32(팀들이 막상막하인 단계)에서는 **86.5%**의 정확도를 보였습니다. 하지만 정보가 가장 풍부하고 팀들이 팽팽하게 맞선 준결승전(Semi-Finals)에서는 정확도가 **8.3%**로 급락했습니다. 정보를 더 많이 알수록, 오히려 치열한 경기에서 승자를 맞히는 능력은 떨어졌습니다.
5. "무리(Herd)" 효과
6개의 모델은 서로 **76.0%**의 확률로 일치하는 의견을 보였습니다. 모델들이 모두 너무 비슷하게 생각했기 때문에, 이들에게 투표를 시키는 것은 아무런 도움이 되지 않았습니다. "다수결"은 단일 AI의 성능을 높여주지 못했습니다. 그들은 모두 같은 루프에 갇혀 있었습니다.
리더보드: 팽팽한 경쟁
최종 점수는 매우 근소한 차이를 보였으며, 이는 현재 세대의 AI가 뚜렷하게 차별화되지 않음을 보여줍니다.
- Claude가 978점으로 1위를 차지했습니다.
- GLM이 813점으로 꼴찌를 기록했습니다.
- 1위와 꼴찌의 차이는 단 84점(약 10.3%)이었습니다.
연구진이 우승자가 정말로 더 나은지 확인하기 위해 "부트스트랩 구간(bootstrap intervals)"이라는 통계 테스트를 실행했을 때, 결과는 불확실했습니다. Claude는 시뮬레이션 재실행의 **53.6%**에서 승리했지만, 상위 모델 간의 차이는 종종 오차 범위 내에 있었습니다. 예를 들어, 1위와 2위의 차이는 매우 작아서, 토너먼트를 다시 진행했다면 순위가 뒤바뀔 수도 있는 수준이었습니다.
시사점
이 연구는 오늘날 가장 진보된 AI 모델들이 정보를 수집하고 추론하는 데는 강력한 도구이지만, 과거의 패턴에서 벗어나 진정으로 미래를 예측하는 법은 아직 배우지 못했음을 시사합니다. AI는 우리가 알고 있는 것을 요약하는 데는 탁ual하지만, 답이 아직 존재하지 않는 진정한 불확실한 사건에 직면했을 때, 안전한 길을 택하고, 대중을 따르며, 가장 "평균적인" 결과를 추측하는 경향이 있습니다.
논문은 현재의 프런티어 시스템들이 서로 확연히 다르지 않다고 결론짓습니다. 그들은 모두 동일한 강점(거시적 사고)과 동일한 약점(무승부에 대한 두려움, 평균적인 스코어에 대한 집착)을 공유하고 있습니다. AI 예측의 "마법"은, 여전히 매우 정교한 버전의 베팅 배당률 따라하기에 불과한 듯합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.