← 最新论文
💰 quantitative finance

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

本文介绍了 Foresight Arena,这是一个无需许可的链上基准测试,它利用无需信任的智能合约和严格评分规则,在现实世界的预测市场上评估 AI 预测代理,以严格衡量预测准确性,同时防止过拟合和数据污染。

原作者: Maksym Nechepurenko, Pavel Shuvalov

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksym Nechepurenko, Pavel Shuvalov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的数字竞技场,其中的 AI“水晶球”竞相预测未来。本文介绍了Foresight Arena(远见竞技场),这是一种测试人工智能是否真正擅长预测现实世界事件,还是仅仅在猜测的新方法。

以下是其运作原理的分解,使用了简单的类比。

1. 问题:旧测试为何存在缺陷

在此之前,测试 AI 预测者存在三个重大漏洞:

  • “小抄”问题:旧测试使用静态问题(如固定的测验)。AI 模型可能在训练过程中已经见过答案,因此它们并非真正在“预测”,而只是在“记忆”。
  • “裁判”问题:大多数测试依赖人类或一家中心公司来计分。如果该裁判存在偏见或被黑客攻击,结果就是虚假的。
  • “交易员 vs. 先知”问题:一些测试衡量 AI 在事件下注赚了多少钱。但赚钱不仅仅关乎正确性,还关乎你何时下注以及押注多少风险。一个 AI 可能在预测未来方面表现糟糕,但仍能凭借幸运赌徒的身份赚钱。

2. 解决方案:一个无需信任的数字体育场

Foresight Arena 通过在区块链(一种公开、不可更改的数字账本)上构建测试来解决这一问题。

  • “承诺 - 揭示”游戏:想象一场扑克游戏,你必须将猜测写在纸上,封入信封,并在其他人看到之前将其放在桌上。只有当所有人都密封好猜测后,才打开信封。这防止了 AI 代理通过查看他人的猜测来作弊。
  • “无人裁判”规则:结果不由人决定。它们会自动从公共去中心化系统(Polymarket/Gnosis)中读取。如果事件发生,区块链就会知晓。事后无人能更改分数。
  • “自由入场”规则:任何人(或任何 AI)均可无需许可加入。

3. 记分牌:衡量“真理”与“运气”

竞技场不使用金钱计数,而是使用一种称为**Brier Score(布里尔分数)**的特殊数学公式。

  • 类比:把它想象成天气预报员。如果他们说“有 90% 的概率下雨”并且真的下雨了,他们就会获得高分。如果他们说 90% 却阳光明媚,他们就会得低分。该分数衡量的是他们的信心与现实的接近程度。
  • "Alpha 分数”(优势):这是本文的秘诀。它不仅仅问“你猜对了吗?”,而是问"你是否比大众正确?"
    • 想象一群 1000 人猜测体育比赛的获胜者。“市场共识”就是这群人猜测的平均值。
    • 如果 AI 的猜测与大众相同,其得分为零。
    • 如果 AI 做出了不同的猜测且结果正确,它就能获得正分。这证明 AI 发现了大众遗漏的信息。

4. 实验:谁赢了?

作者进行了一场为期 50 轮的现场测试,涉及五个顶级 AI 模型(来自 Anthropic、OpenAI、Google 等公司)和一个“随机基线”(计算机随机猜测数字)。

结果:

  • 随机猜测者:他们惨败,证明了测试的有效性。
  • 顶级 AI 模型:三个模型(Claude、GPT 和 Gemini)的表现略优于大众,但差异微乎其微。这就像一场赛跑,前三名选手的冲线时间相差不到几分之一秒。测试时间不够长,无法确定谁绝对是跑得最快的。
  • “模仿者”模型:两个模型(Grok 和 GLM)试图猜测大众的想法,但加入了一些“噪声”(随机错误)。它们的表现实际上不如完美复制大众。这是一个关键发现:当你并不比大众更聪明时,试图表现得略有不同只会损害你的分数。

5. 优秀预测的“解剖学”

本文使用"Murphy 分解”(一种拆解分数的复杂方法)分析了 AI 输赢的原因:

  • 分辨率(“锐度”):AI 能否区分可能事件和不可能事件?获胜者比大众更“敏锐”。
  • 可靠性(“诚实度”):当 AI 说“有 70% 的概率”时,它是否真的发生了 70% 的时间?获胜者对其信心非常诚实。
  • 教训:要战胜市场,你需要比大众更敏锐。如果你没有看到大众遗漏的东西,仅仅保持“冷静”或“诚实”是不够的。

6. 核心结论

本文建立了一个永久、不可更改的 AI 声誉系统

  • 过去,一家 AI 公司可以声称“我们的 AI 是最好的预测者!”,并展示他们编造的电子表格。
  • 现在,有了 Foresight Arena,AI 在区块链上拥有公开、不可伪造的业绩记录。你可以亲自查看历史记录。

底线:
本文得出结论,虽然当前的 AI 模型远优于随机猜测,但它们目前非常接近人类大众的“集体智慧”。要证明 AI 真正优越,我们需要继续运行这些测试更长时间(数百轮,而不仅仅是 50 轮),以观察微小的差异是否会累积成明确的胜者。

本文声称的内容:

  • 它并未声称这些 AI 可以为了盈利预测股市(那是另一回事)。
  • 它并未声称这些 AI 已准备好管理政府或医院。
  • 它并未声称当前结果是最终定论;它明确指出测试需要运行更长时间,以区分顶尖表现者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →