← 最新论文
💬 NLP

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

该论文介绍了 OptimismBench,这是一个利用正向/反向成功与失败对来检测大语言模型是否存在系统性方向偏差的新型框架,揭示了大多数模型都表现出一种由后训练对齐而非模型架构或语言驱动的“乐观倾斜”。

原作者: Seonglae Cho, Adriano Koshiyama

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Seonglae Cho, Adriano Koshiyama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正向一群非常聪明、博学的朋友询问关于抛硬币结果、创业公司成功与否,或是明天是否会下雨的预测。你问他们:“这件事成功的概率是多少?”然后,分别又问:“这件事失败的概率是多少?”在一个完美的世界里,如果你的朋友说成功的概率是 70%,那么他也应该说失败的概率是 30%。这两个数字应该正好相加等于 100%。这是概率论的基本逻辑:如果你有一个完整的派,你吃掉的那一块加上留下的那一块,必须等于整个派。

然而,人类在这方面表现得很糟糕。我们有一种被称为“乐观偏差”的“认知缺陷”,即我们倾向于认为好事更容易发生在自己身上,而坏事发生的可能性则较低。我们还有“前景理论”,它表明我们感受到的损失痛苦远比获得的快乐要强烈得多,这使得我们在权衡风险与回报时会产生不均衡的权重。长期以来,科学家们一直在思考:这些人类的怪癖是否也感染了人工智能?如果我们要求一个语言模型预测未来,它是否也有属于自己的那种“抱有美好愿景”的倾向,从而扭曲了它的数学计算?这一点至关重要,因为我们正开始使用这些 AI 模型来辅助做出重大决策,从投资资金到规划医疗方案。如果 AI 在暗中偏向乐观,它可能会导致我们采取一些并非本意的危险冒险。

这正是 OptimismBench 这篇论文所研究的内容。研究人员构建了一个特殊的测试场,以观察大语言模型(LLMs)是否存在系统性的“倾斜”概率判断。他们不仅仅是让模型进行猜测;他们使用了一个巧妙的技巧,叫做“倒置对”(inverted pairs)。对于每一个场景,他们都会向模型提两个问题:“成功的概率是多少?”以及“失败的概率是多少?”如果模型是完全符合逻辑的,这两个答案之和应该始终等于 100%。但如果模型存在偏差,这两个数字就不会相加等于 100%。

结果非常清晰。在测试的来自 8 家主要公司的 16 个不同 AI 模型中,有 14 个表现出持续的乐观倾向。它们高估了成功的概率,并低估了失败的概率。这就像是在询问一群朋友对天气的预测,即使乌云密布,几乎所有人仍坚持认为天气会是晴朗的。唯一表现出“悲观”(认为坏事发生的可能性高于应有水平)的模型来自一家特定的公司——Anthropic,而且仅限于他们规模最大、最先进的模型。有趣的是,他们的较小、较轻量级的模型实际上也是乐观的,和其他模型一样。

该研究还深入探讨了为什么会发生这种情况。他们发现,这种偏差不仅仅是一个随机的故障或模型产生的混乱;它是这些模型训练过程中一种深层的特征。当研究人员将这些模型的“原始”版本(在经过微调成为得力的助手之前)与它们的“聊天机器人”版本进行比较时,他们发现训练过程本身改变了偏差的方向。对于某些模型家族,训练使它们变得更乐观;对于另一些模型家族,训练则使它们变得更悲观。这表明,AI 偏差的“个性”是由教导它们如何与人类交流的具体“配方”决定的。

研究人员还检查了这种偏差是否仅仅是提问方式带来的小把戏,或者是否可以通过简单地告诉 AI,“嘿,不要太乐观了!”来修复。他们尝试了更改温度设置(temperature settings)、从不同的视角提问(例如使用“你”对比“你的朋友”),甚至在 AI 的指令中添加了警告标签。这些表面层面的修复手段都没有奏效。这种偏差依然顽固存在,证明了它是模型内部逻辑的一个基本组成部分,而非暂时的混乱。

或许最令人震惊的发现是,模型本身的重要性远大于语言。研究人员在 10 种不同的语言中测试了这些模型。他们发现,两个不同模型之间的偏差差异,几乎是同一个模型在不同语言间偏差差异的 5 倍之多。换句话说,一个 AI 是乐观还是悲观,取决于你使用的是哪一个 AI,而不是取决于它是在说英语、中文还是西班牙语。

简而言之,这篇论文揭示了我们的 AI 工具并非中立的计算器。它们携带了一种隐藏的“方向性偏差”,这种偏差会扭曲我们对风险和回报的感知。虽然大多数模型都倾向于对未来持乐观的晴朗态度,但这并不是一条普遍规律——这在很大程度上取决于谁制造了该模型,以及他们是如何训练它的。作者警告说,如果我们利用这些模型来辅助决策,我们需要意识到它们的“直觉”可能是系统性偏斜的,我们不能假设它们能清晰地看待世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →