← 最新论文
🤖 AI

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

本文提出了名为 BLF 的贝叶斯语言预测代理系统,该系统通过结合半结构化语言信念状态、层次化多次试验聚合以及层次化校准技术,在 ForecastBench 基准测试中超越了包括 GPT-5 在内的所有顶尖公开方法,实现了二元预测的最先进性能。

原作者: Kevin Murphy

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Kevin Murphy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 BLF (Bayesian Linguistic Forecaster,贝叶斯语言预测器) 的人工智能系统。你可以把它想象成一个超级预测员,它的任务不是写诗或画画,而是回答“是”或“否”的问题,并给出一个准确的概率(比如:“下个月某国会发生政变吗?概率是 30% 还是 70%?”)。

在最新的预测比赛(ForecastBench)中,这个系统打败了所有其他顶尖的 AI 和人类专家,成为了目前的“冠军”。

为了让你轻松理解它是怎么做到的,我们可以把它比作一个**“超级侦探团队”**,通过三个核心绝招来破案:

1. 绝招一:写“侦探笔记”,而不是“堆砌文件”

(Linguistic Belief State / 语言信念状态)

  • 普通 AI 的做法:就像是一个只会死记硬背的实习生。你让它去查资料,它就把所有查到的网页、文章全部复制粘贴到一个巨大的文件夹里。随着资料越来越多,文件夹变得像一座山,它反而看不清重点,甚至忘了最开始的问题是什么。
  • BLF 的做法:它像一位经验丰富的老侦探。
    • 每查到一个新线索,它不会把整篇新闻贴上去,而是在笔记本上写下一句总结:“这条新闻说某国经济在衰退,这增加了政变的可能性。”
    • 同时,它会更新自己的猜测概率:“刚才看到经济衰退,我把政变概率从 30% 调到了 45%。”
    • 比喻:普通 AI 是在堆砌砖块(原始数据),而 BLF 是在盖房子(构建结构化的信念)。它把零散的信息提炼成“证据摘要”,并不断修正自己的“心里有数”(概率)。这让它在面对海量信息时,依然能保持清醒的头脑。

2. 绝招二:召开“专家圆桌会议”,而不是“一人独断”

(Hierarchical Multi-trial Aggregation / 分层多轮聚合)

  • 普通 AI 的做法:就像让一个侦探去破案。如果这个侦探今天心情不好,或者恰好查错了方向,整个预测就错了。大模型有时候会有“随机性”,同一个人问两次,答案可能不一样。
  • BLF 的做法:它会让5 个独立的侦探(也就是 5 次独立的运行)同时去查同一个案子。
    • 这 5 个侦探可能会得出不同的结论(有的说 40%,有的说 60%)。
    • BLF 不会简单地把它们加起来除以 5,而是用一种聪明的数学方法(对数空间平均)来综合大家的意见。
    • 比喻:这就像投票。如果 5 个人里有 4 个都觉得“大概率会发生”,只有 1 个觉得“不可能”,BLF 会倾向于那 4 个人的共识,但也会给那个“异类”一点权重,防止大家盲目跟风。这种方法大大减少了“运气不好”导致的错误。

3. 绝招三:给不同领域的专家“量身定做”校准器

(Hierarchical Calibration / 分层校准)

  • 普通 AI 的做法:就像给所有学生用同一把尺子打分。不管你是学数学的(通常很准)还是学艺术的(通常很发散),都用同样的标准去调整分数。这会导致对某些领域预测太保守,对另一些领域又太激进。
  • BLF 的做法:它知道不同来源的问题难度和规律不一样。
    • 如果是股市问题,它知道股价像过山车,很难预测,所以它会调整策略,不让预测变得太绝对。
    • 如果是维基百科上的事实(比如“某游泳运动员是否破纪录”),它知道这类问题要么发生要么不发生,规律很死,它会调整策略,敢于给出接近 0% 或 100% 的极端预测。
    • 比喻:这就像给不同运动员穿不同尺码的鞋子。给短跑选手穿跑鞋,给游泳选手穿泳衣。BLF 为每一类问题(股市、政治、天气等)都定制了专门的“校准器”,确保它的预测既准确又“诚实”(不会瞎吹牛)。

4. 它的“超能力”来源:工具与防作弊

BLF 不仅仅靠大脑(大模型),它还有一双**“手”**(工具):

  • 联网搜索:它能实时上网查最新新闻,而不是只靠训练时的旧知识。
  • 查数据:它能直接读取股票、天气、经济指标的原始数据。
  • 防作弊(时间锁):这是最关键的一点。在测试时,BLF 被严格限制不能看到“未来”。就像考试时,它只能看截止到“昨天”的报纸,绝对不能偷看明天的答案。论文里提到,他们设计了四层防御机制,确保它没有“偷看答案”,作弊率低于 1.5%。

总结:它为什么赢了?

想象一下,预测未来就像在大雾中开车:

  • 普通 AI 可能只是盯着挡风玻璃(死记硬背),或者只靠一个司机的直觉(单次运行)。
  • BLF 则是一个由 5 个老司机组成的车队,他们:
    1. 手里拿着精炼的地图笔记(结构化信念),而不是满车的废纸;
    2. 互相商量路线(多轮聚合),避免一个人开错;
    3. 根据路况(股市、天气、政治)自动切换驾驶模式(分层校准);
    4. 严格遵守交通规则(时间防作弊),绝不看未来的路况。

正是这种**“结构化思考 + 集体智慧 + 个性化调整 + 严格自律”**的组合,让 BLF 在预测未来这件事上,做到了目前人类和 AI 能达到的最高水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →