想象一个巨大的数字竞技场,其中的 AI“水晶球”竞相预测未来。本文介绍了Foresight Arena(远见竞技场),这是一种测试人工智能是否真正擅长预测现实世界事件,还是仅仅在猜测的新方法。
以下是其运作原理的分解,使用了简单的类比。
1. 问题:旧测试为何存在缺陷
在此之前,测试 AI 预测者存在三个重大漏洞:
- “小抄”问题:旧测试使用静态问题(如固定的测验)。AI 模型可能在训练过程中已经见过答案,因此它们并非真正在“预测”,而只是在“记忆”。
- “裁判”问题:大多数测试依赖人类或一家中心公司来计分。如果该裁判存在偏见或被黑客攻击,结果就是虚假的。
- “交易员 vs. 先知”问题:一些测试衡量 AI 在事件下注赚了多少钱。但赚钱不仅仅关乎正确性,还关乎你何时下注以及押注多少风险。一个 AI 可能在预测未来方面表现糟糕,但仍能凭借幸运赌徒的身份赚钱。
2. 解决方案:一个无需信任的数字体育场
Foresight Arena 通过在区块链(一种公开、不可更改的数字账本)上构建测试来解决这一问题。
- “承诺 - 揭示”游戏:想象一场扑克游戏,你必须将猜测写在纸上,封入信封,并在其他人看到之前将其放在桌上。只有当所有人都密封好猜测后,才打开信封。这防止了 AI 代理通过查看他人的猜测来作弊。
- “无人裁判”规则:结果不由人决定。它们会自动从公共去中心化系统(Polymarket/Gnosis)中读取。如果事件发生,区块链就会知晓。事后无人能更改分数。
- “自由入场”规则:任何人(或任何 AI)均可无需许可加入。
3. 记分牌:衡量“真理”与“运气”
竞技场不使用金钱计数,而是使用一种称为**Brier Score(布里尔分数)**的特殊数学公式。
- 类比:把它想象成天气预报员。如果他们说“有 90% 的概率下雨”并且真的下雨了,他们就会获得高分。如果他们说 90% 却阳光明媚,他们就会得低分。该分数衡量的是他们的信心与现实的接近程度。
- "Alpha 分数”(优势):这是本文的秘诀。它不仅仅问“你猜对了吗?”,而是问"你是否比大众更正确?"
- 想象一群 1000 人猜测体育比赛的获胜者。“市场共识”就是这群人猜测的平均值。
- 如果 AI 的猜测与大众相同,其得分为零。
- 如果 AI 做出了不同的猜测且结果正确,它就能获得正分。这证明 AI 发现了大众遗漏的信息。
4. 实验:谁赢了?
作者进行了一场为期 50 轮的现场测试,涉及五个顶级 AI 模型(来自 Anthropic、OpenAI、Google 等公司)和一个“随机基线”(计算机随机猜测数字)。
结果:
- 随机猜测者:他们惨败,证明了测试的有效性。
- 顶级 AI 模型:三个模型(Claude、GPT 和 Gemini)的表现略优于大众,但差异微乎其微。这就像一场赛跑,前三名选手的冲线时间相差不到几分之一秒。测试时间不够长,无法确定谁绝对是跑得最快的。
- “模仿者”模型:两个模型(Grok 和 GLM)试图猜测大众的想法,但加入了一些“噪声”(随机错误)。它们的表现实际上不如完美复制大众。这是一个关键发现:当你并不比大众更聪明时,试图表现得略有不同只会损害你的分数。
5. 优秀预测的“解剖学”
本文使用"Murphy 分解”(一种拆解分数的复杂方法)分析了 AI 输赢的原因:
- 分辨率(“锐度”):AI 能否区分可能事件和不可能事件?获胜者比大众更“敏锐”。
- 可靠性(“诚实度”):当 AI 说“有 70% 的概率”时,它是否真的发生了 70% 的时间?获胜者对其信心非常诚实。
- 教训:要战胜市场,你需要比大众更敏锐。如果你没有看到大众遗漏的东西,仅仅保持“冷静”或“诚实”是不够的。
6. 核心结论
本文建立了一个永久、不可更改的 AI 声誉系统。
- 过去,一家 AI 公司可以声称“我们的 AI 是最好的预测者!”,并展示他们编造的电子表格。
- 现在,有了 Foresight Arena,AI 在区块链上拥有公开、不可伪造的业绩记录。你可以亲自查看历史记录。
底线:
本文得出结论,虽然当前的 AI 模型远优于随机猜测,但它们目前非常接近人类大众的“集体智慧”。要证明 AI 真正优越,我们需要继续运行这些测试更长时间(数百轮,而不仅仅是 50 轮),以观察微小的差异是否会累积成明确的胜者。
本文未声称的内容:
- 它并未声称这些 AI 可以为了盈利预测股市(那是另一回事)。
- 它并未声称这些 AI 已准备好管理政府或医院。
- 它并未声称当前结果是最终定论;它明确指出测试需要运行更长时间,以区分顶尖表现者。
以下是论文《Foresight Arena:一个用于评估 AI 预测代理的链上基准》的详细技术总结。
1. 问题陈述
该论文指出了当前评估 AI 预测能力的方法中存在的三个根本性局限:
- 数据集污染:静态基准(固定的问题/结果)容易受到训练数据泄露的影响,模型之所以显得准确,仅仅是因为在预训练期间记住了测试集。
- 中心化信任:现有框架依赖中央机构来记录预测并计算分数,这带来了事后操纵或选择性报告的风险,从而破坏了商业信任。
- 不恰当的指标:通过交易盈亏(PnL)来评估代理,将预测准确性与交易策略(仓位大小、时机和风险偏好)混为一谈。一个代理可能尽管预测准确却亏损,或者尽管预测糟糕却因运气或激进下注而盈利。
作者认为,严格的评估需要一个抗过拟合、去中心化(无需信任)且基于激励相容评分规则的环境。
2. 方法论与系统设计
Foresight Arena 是一个部署在 Polygon PoS 上的实时、无许可、链上基准,它基于源自 Polymarket 的真实世界二元预测市场来评估 AI 代理。
核心架构
- 承诺 - 揭示协议:代理在截止日期前提交其预测的加密哈希(承诺阶段),以防止观察竞争对手的动向。随后(揭示阶段)再揭示实际概率和盐值。这确保了预测的独立性。
- 无需信任的结果判定:结果通过 Gnosis 条件代币框架(CTF)(Polymarket 使用的同一预言机)自动判定。没有人策展人可以操纵结果判定。
- 无 Gas 参与:代理通过中继器使用 EIP-712 签名的消息进行交互,允许在不持有原生代币(POL)的情况下参与。
- 持久声誉:分数累积在 ERC-8004 声誉注册表上,为每个代理创建防篡改、可验证的跟踪记录。
评分框架
该系统使用两个主要指标:
- Brier 分数:一种严格的评分规则(S=(p−x)2),用于衡量概率预测的准确性。只有当代理报告其真实信念时,该分数才会被严格最小化。
- Alpha 分数(α):一种衡量代理相对于市场共识优势的新颖指标。
- 公式:α=Bbase−Bagent,其中 Bbase 是市场中间价格的 Brier 分数。
- 正的 α 表示代理的表现优于市场的集体智慧。
统计分析
作者对评分规则提供了正式的数学处理:
- Murphy 分解:他们将 Brier 分数分解为不确定性(UNC)、可靠性(REL)和分辨率(RES)。
- 证明 α 是分辨率增益(比市场更好的区分能力)和可靠性差距(比市场更好的校准能力)之和。
- 功效分析:他们推导了 Alpha 方差的闭式表达式,并计算了检测特定优势(α∗)所需的样本量。
- 发现:检测 α∗=0.02 的真实优势需要约 350 次预测(50 轮,每轮 7 个市场)。检测 α∗=0.01 则需要约 4 倍于此的数量。
3. 主要贡献
- 链上可验证性:首个将所有预测、承诺和分数记录在公共区块链上的基准,允许任何第三方在不信任组织者的情况下独立重放并验证代理的历史记录。
- 无需信任的结果判定:通过使用 Gnosis CTF 进行结果判定,消除了中心化仲裁者。
- 形式化的 Alpha 分数分析:对 Alpha 作为严格评分规则的严谨统计证明,以及关于可靠检测预测技能所需的方差和样本量要求的推导。
- Murphy 分解洞察:证明了“战胜市场”在数学上不同于“被校准”,从而能够诊断特定的失败模式(例如:带噪声的市场跟踪与真正的校准错误)。
- 无许可基础设施:一个开源、无 Gas 的系统,允许任何以太坊兼容地址参与并建立持久的链上凭证。
4. 实验结果
作者进行了一项涉及五个前沿大语言模型(LLM)代理和一个随机基线的50 轮实时评估。
- 评估的代理:
claude-opus-4-5、gpt-5-2、gemini-3-pro、grok-4-1、glm-4-7 以及一个随机基线。
- 整体表现:
- 随机基线:表现显著差于所有 LLM(αˉ≈−0.14),证实 LLM 拥有真正的预测能力。
- 顶级梯队:
claude-opus-4-5、gpt-5-2 和 gemini-3-pro 实现了微小的正 Alpha 分数(+0.003 至 +0.005)。虽然为正,但在 50 轮的范围内不具有统计显著性(这与功效分析预测的显著性需要 α∗≥0.02 一致)。
- 表现不佳者:
grok-4-1 和 glm-4-7 实现了负 Alpha 分数。Murphy 分解显示,它们遭受的是低分辨率(它们跟踪市场价格但增加了噪声),而不仅仅是校准错误。
- 领域专业化:
- 加密货币:LLM 在此领域表现出最强的优势,这可能是由于它们能够比市场中间价格更快地整合突发新闻。
- 地缘政治:所有代理的表现均不如市场,表明 LLM 在处理低频、高模糊性的政治事件方面存在困难。
- 体育/经济:结果参差不齐,特定模型显示出领域优势。
5. 意义与影响
- 将预测与交易解耦:通过使用严格的评分规则而非 PnL,Foresight Arena 将模型对世界的知识与其交易策略分离开来。这揭示了基于 PnL 的评估会遗漏的失败模式(如“带噪声的市场跟踪”)。
- 可验证的 AI 凭证:该系统提出了一种新的 AI 评估标准:链上凭证。这些是不可篡改的、累积的性能记录,无法被伪造,对于自主代理的商业许可和部署至关重要。
- 统计诚实性:论文强调,当前短期的评估(例如 50 轮)缺乏区分顶级前沿模型的能力。它确立了长期、连续的评估对于可靠地排名 AI 预测能力是必要的。
- 设计指导:分析表明,为了使代理能够战胜市场,必须优先考虑新鲜信息(分辨率)和受控的果断性,而不是简单地复述市场价格或过度自信。
总之,Foresight Arena 提供了首个稳健、去中心化且统计严谨的框架,用于衡量 AI 预测能力,超越了静态数据集和基于利润的指标,转向一个基于加密验证和信息论的系统。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。