← 最新论文
💬 NLP

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

本文介绍了“Hindcast”,这是一个严谨的评估框架,通过将预测市场回放至基于公开信息的冻结时间切片快照中,来防止大语言模型在预测中的数据泄露,从而确保模型是基于真正的预见力而非事后回忆进行评分。

原作者: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一名侦探解决谜题的能力。你给他们一份卷宗,并问道:“谁偷了饼干?”如果这位侦探只是打开卷宗,读出写在最底部的答案,那么他们并不是在展示侦探技巧,而是在展示阅读能力。这就是科学家在测试人工智能(AI)模型预测未来能力时面临的棘手问题。

为了看清一个AI是否真的聪明,研究人员通常会让它预测已经发生的事情,比如“谁赢得了2022年世界杯?”问题在于,今天的AI模型已经在整个互联网上进行了训练,其中包含了比赛结束后撰写的文章。因此,当AI说“阿根廷赢了”时,这可能并不是因为它提前发现了线索,而是因为它记住了训练数据中的最终比分。这就像一个参加历史考试的学生,偷偷背下了答案解析。为了解决这个问题,科学家需要一种方法来测试AI的“预见性”(猜测将会发生什么),同时又不让它通过查看“答案解析”(实际发生了什么)来作弊。

这就是一项名为 HINDCAST 的新研究。研究人员想要看看,如果我们强迫AI站在过去,在对接下来会发生什么一无所知的情况下,它是否真的能够预测未来。他们利用预测市场(人们对结果进行投注的地方)和一个冻结的互联网存档,建立了一个时间旅行模拟系统。他们发现,当你阻止AI作弊时,它确实可以通过阅读旧闻来提高预测水平,但前提是这些新闻确实包含有用的事实。如果旧闻仅仅是人们的猜测和意见喧嚣,那么阅读这些内容实际上会让AI对真相的预测变得更差。

时间旅行测试

研究人员构建了一个他们称之为 HINDCAST(“forecast/预测”的变体,意为“回溯”)的系统。想象一台时间机器,它将历史中的某个特定时刻冻结,比如大型体育赛事开始前的一个月。在这个冻结的时刻,AI被允许查阅一个新闻文章和论坛帖子组成的图书馆,但只能查阅在那个日期之前撰写的资料。它无法看到那个时刻之后写的任何东西,即使这些东西今天就躺在图书馆里。

为了测试AI,研究人员使用了现实世界的博彩市场——Polymarket。这些类似于数字赌场,人们在上面投注某事是否会发生(例如“球队X会赢吗?”)。因为这些市场已经结算完毕,研究人员知道真实的答案。他们也知道在那个冻结的过去时刻,当时的“市场价格”是多少,这代表了当时人类群体认为的概率。

设置过程如下:

  1. 冻结时间: 选择一个市场结算前的过去日期(t0t_0)。
  2. 锁定图书馆: AI只能搜索在那个日期之前生成的Reddit(一个流行的互联网论坛)的快照。
  3. 进行预测: AI阅读可用的帖子并猜测结果。
  4. 评分: AI根据两点进行评分:一是它与实际最终结果的接近程度,二是它与那一刻人类投注者想法的接近程度。

重大发现:事实 vs 炒作

团队测试了九种不同的AI模型,以观察提供这个“冻结图书馆”是否能帮助它们比仅凭记忆进行猜测做得更好。

好消息: 对于大多数AI模型来说,阅读旧帖子确实有所帮助。事实上,在九个模型中的八个中,当AI能够阅读存档时,它的错误率降低了。提升最显著的是一个名为 Qwen3-32B 的模型,它将错误率降低了23%。这表明,当过去存在真实事实时,AI可以利用这些事实做出更明智的猜测。

坏消息(以及陷阱): 这种帮助并非普遍适用。它完全取决于AI正在阅读的内容。

  • 有效场景:体育奖项交易等主题中,事件发生前的互联网帖子充满了具体的细节(例如,“球队明星球员受伤了”或“黄金价格正在上涨”)。在这些情况下,AI阅读了事实,从而提高了对获胜者的预测准确度。
  • 失效场景:娱乐(如猜测哪首歌会成为冠军)或政治等主题中,互联网充满了响亮的观点、粉丝的炒作和推测。当AI阅读这些帖子时,它会感到困惑。它开始把“炒作”当成事实。例如,如果粉丝们都在高喊某首新歌会夺冠,AI就会押注于此,尽管大多数歌曲实际上都无法登上榜首。在这些情况下,阅读存档反而让AI的表现比它仅仅依靠自身逻辑判断时还要糟糕。

“过度阅读”问题

研究发现了一个有趣的模式:一个市场开放的时间越长,AI就越容易被噪音干扰。如果一个博彩市场持续开放很长时间,互联网就会充斥着无尽的闲聊和相互矛盾的观点。AI试图表现得很有用,于是阅读了所有这些内容,并开始过度思考,最终基于响亮的意见而非坚实的事实做出了错误的猜测。

其中一个特定的模型 R1-Distill-Qwen-7B,在被允许阅读时整体表现反而变差了。研究人员认为,这是因为该模型陷入了阅读冗长且混乱的推理链条中,以至于忘记了实际的证据。这就像一个学生阅读了太多关于某个话题的不同观点,结果反而忘记了简单的基本事实,最终猜错了。

这对未来意味着什么

HINDCAST的核心结论是:一个AI预测未来的能力,仅取决于它在事件发生之前能找到的信息质量。如果互联网充满了事实,AI可以成为出色的预测者;如果互联网充满了噪音和炒作,AI可能只会变成一个自信的傻瓜,听信最响亮的声音而非真相。

研究人员还展示了这种“时间旅行”测试法是一个强大的工具。由于图书馆是冻结的,你可以用同样的老问题来测试新的AI模型,而不必担心它们作弊。这意味着随着AI变得越来越聪明,我们可以不断改进我们的测试,确保我们衡量的是它们的思考能力,而不仅仅是它们的记忆能力。

简而言之,HINDCAST证明了:虽然给予AI一个事实图书馆有助于它洞察未来,但给予它一个谣言图书馆,可能会让它变得盲目。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →