WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
本文对 2026 年国际足联世界杯期间六款前沿大语言模型进行了无泄露评估,结果显示,尽管这些模型在比赛结果预测方面达到了博彩公司的准确度水平,但它们也表现出共同的局限性,例如过度依赖热门球队、模型间缺乏差异性,以及存在低估平局和特定比分的倾向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但犯罪尚未发生。在人工智能的世界里,我们经常通过询问已经发生过的事情来测试“聪明”的计算机程序,比如“谁赢得了2022年世界杯?”。问题在于,这些程序可能只是从互联网上记住了答案,而不是真正通过逻辑推导出来的。要真正测试一个大脑是否聪明,你需要让它预测未来——那是尚未存在且无法通过谷歌搜索获得的东西。这就是“预测”(forecasting)的前沿领域,在这里我们观察机器是否能通过推理得出无人知晓的答案。
这篇题为**《世俱联竞技场》(WORLDCUP ARENA)**的论文采用了这样一个思路,并进行了一场大规模的实时实验。研究人员不再要求计算机去猜测多年前结束的比赛胜者,而是设置了一场实时的锦标赛:2026年国际足联世界杯。他们邀请了六个世界上最先进的人工智能模型来担任体育分析师。在每一场比赛开球之前,这些AI都必须观察球队、天气、裁判以及最新的新闻,然后针对每场比赛做出七种不同的预测(例如谁会获胜、会进多少球以及精确的比分)。关键在于:比赛尚未进行。答案在世界上并不存在。这意味着AI无法获取比分,它们必须真正地进行思考。
研究人员想要看看这些超级聪明的计算机能否战胜概率,还是仅仅会随大流。他们发现,虽然这些AI令人印象深刻,但它们并非拥有魔力。平均而言,它们猜对比赛结果的概率约为63.9%。这听起来不错,但几乎与盲目押注博彩公司看好的胜出者完全一致。事实上,这些AI表现得非常谨慎,它们很少预测平局,尽管平局经常发生,而且它们总是反复猜测同一个乏味的得分(2比1)。
最令人惊讶的部分是:这六个不同的AI模型在思维方式上几乎是完全相同的。它们的意见一致率达到了76%。如果你让它们投票决定胜者,“多数票”的结果并不比表现最好的单个AI更好。事实证明,即使是2026年最先进的“思考型”模型,也都在遵循同样的剧本:它们非常擅长观察大局(比如预测哪个国家会赢得整个锦标赛),但在处理单场比赛中微小且混乱的细节时却显得力不从心。该论文的结论是,目前这些AI系统彼此之间并没有显著差异;它们都非常擅长模仿人类的投注模式,但还没有学会如何比人类专家使用计算器时更有效地“预见”未来。
实验:思想的实时锦标赛
研究人员建立了一个“无泄露”的竞技场。在常规测试中,科学家们必须担心AI可能会从其训练数据中“泄露”答案。但在本实验中,由于比赛是在2026年实时进行的,当问题被提出时,答案在现实中根本不存在。实验设置非常严谨:
- 选手: 六个前沿AI模型(Claude, GPT, Gemini, Kimi, GLM, 和 Seed)。
- 规则: 每个模型都必须使用其“扩展思维”模式(即可用的最深层推理能力)及其内置的网络搜索工具,来阅读最新的新闻、伤病报告和赔率。
- 任务: 对于锦标赛中的每一场(共104场)比赛,AI都必须填写一张“预测卡”,包含七个市场:胜者、精确比分、总进球数等。
- 数据: AI每天都会收到一份关于每支球队的“档案”,这份档案从一份简短的摘要逐渐增长到比赛结束时超过100万个字符的海量文件。
研究发现:“羊群”心态
研究结果清晰地描绘了这些AI是如何思考的,甚至带有一点幽默感。
1. 它们追随人群,而非水晶球
AI并没有比博彩公司更聪明。它们仅仅是在85.6%到90.4%的时间里选择了博彩公司看好的球队。它们63.9%的平均准确率在统计学上与机械地支持热门球队(准确率为64.4%)没有区别。它们并没有发现新的洞察,而是在回声式地重复市场观点。
2. “平局盲区”
AI在预测平局方面表现糟糕。在锦标赛中,共有27场比赛以平局结束,而模型仅预测了8到14场平局。它们对平局充满了恐惧,以至于几乎从未考虑过平局,尽管这在足球比赛中非常常见。
3. 对“2–1”的痴迷
在猜测精确比分时,模型陷入了窠臼。它们将所有比分预测中的**28.0%**都放在了一个单一结果上:2–1。它们忽略了比分的多样性,并将预测过度挤压在一个“典型”结果上。
4. 大局观 vs. 微观细节
模型呈现出“宏观强、微观弱”的特点。
- 宏观: 它们在预测锦标赛冠军和小组排名方面表现出色。
- 微观: 在最接近的比赛中,它们的表现溃不成军。在32强赛(此时球队实力相当)中,它们的准确率高达86.5%。但在半决赛中(此时档案信息最为丰富,且球队实力旗鼓相当),它们的准确率骤降至8.3%。关于球队的信息越丰富,它们在挑选势均力敌的比赛胜者时表现就越差。
5. “羊群效应”
六个模型之间的意见一致率高达76.0%。因为它们的思考方式高度趋同,所以通过投票来寻求答案并无益处。“多数决议”并没有提升准确率。它们都困在同一个循环中。
排行榜:激烈的竞争
最终得分非常接近,这表明当前这一代AI之间并没有显著的差异化。
- Claude 以897分位居第一。
- GLM 以813分垫底。
- 第一名与最后一名之间的差距仅为84分(约10.3%)。
当研究人员运行统计测试(称为“自助间隔法/bootstrap intervals”)来观察获胜者是否真的更优时,结果并不稳定。在模拟重演中,Claude在**53.6%**的情况下胜出,但顶尖模型之间的差异往往处于误差范围内。例如,第一名与第二名之间的差距如此之小,以至于如果重新进行一次锦标赛,排名可能会发生翻转。
总结
这项研究表明,虽然当今最先进的AI模型是强大的信息收集和推理工具,但它们尚未学会如何摆脱过去的模式来真正预测未来。它们非常擅长总结已知信息,但当面对一个答案尚不存在的真正不确定事件时,它们往往倾向于保守,追随大众,并猜测最“平均”的结果。
论文结论指出,当前这一代前沿系统之间并不存在显著差异。它们拥有共同的优势(大局观思维)和共同的弱点(对平局的恐惧、对平均比分的痴迷)。AI预测的“魔力”,似乎仍然只是一种非常高级的、对投注赔率的跟随。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。