← 最新论文
🤖 machine learning

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

本文介绍了 F-ICL,这是一个利用源自图灵完备机器的精确贝叶斯最优标准构建的基准测试,旨在揭示尽管大型语言模型具有高准确率,但它们未能进行真正的算法推理,而是依赖于低阶统计特性,并表现出显著偏离理论最优值的非单调更新行为。

原作者: Hector Zenil, Luan Ozelim

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Hector Zenil, Luan Ozelim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人解谜题。你给它展示了几个例子:“如果我把红色的方块放在这里,蓝色的方块就会出现在那里。”然后你问它预测接下来会发生什么。有时机器人答对了,但它真的在思考谜题的规则吗?还是仅仅根据单词通常如何组合在一起进行猜测?这就是现代“大语言模型”(LLM)——即我们今天使用的超智能 AI 聊天机器人——背后的巨大谜团。科学家称之为“上下文学习”(in-context learning)——即仅通过阅读提示词中的几个例子就能学习新任务的能力。问题在于,我们并没有一个完美的尺子来衡量机器人是在进行真正的推理,还是仅仅在进行模式匹配。通常,我们只能将一个机器人与另一个机器人或人类进行比较,但我们并不知道那个“上帝视角”下的完美答案应该是怎样的。

为了解决这个问题,这篇论文的作者构建了一个特殊的、微小的、且受到完美控制的宇宙。他们创建了一个名为 F-ICL 的基准测试。把它想象成一个巨大的、详尽的图书馆,收录了所有可能解决特定类型二进制谜题(仅使用 0 和 1)的简单计算机程序的每一个可能版本。因为他们列出了这 15 亿个微型程序中的每一个,所以他们可以计算出任何谜题的数学完美答案。这个完美答案被称为“贝叶斯最优”(Bayes-optimal)解。它是金标准:即在给定证据的情况下,机器所能做出的绝对最好的猜测。现在,他们终于可以将真实的 AI 模型与这个金标准进行对比,看看它到底偏离了多少。这就像是拥有一张城市的完美地图,然后检查 GPS 应用是在引导你走最短路线,还是仅仅根据昨天看到的交通模式在瞎猜。

巨大的推理鸿沟

研究人员选取了 105 个不同的 AI 模型组成的庞大面板——从开源项目到顶级科技实验室最先进的“前沿”系统——并将它们投入到 F-ICL 测试中。他们想看看这些模型是否能够像完美的贝叶斯推理者一样,随着新证据的出现而逻辑地更新其信念。

这里有一个令人惊讶的转折:这些模型擅长给出正确答案,但在像完美机器那样进行推理方面却表现糟糕。

尽管有些模型给出正确答案的频率高达 92%,但它们的内部“猜测分布”(即它们权衡不同可能性的方式)通常比简单的随机猜测者还要差。事实上,46 个模型中有 45 个的表现甚至不如一个“按键参考”(keystroke reference)。想象一只猴子在键盘上随机敲击;这只随机敲击的猴子产生的概率分布,实际上比大多数先进的 AI 模型都更接近数学上的真实情况。这些模型不仅仅是稍有偏差,它们对底层逻辑的判断是充满自信地错误。

“过度承诺”故障

其中一个最有趣且最具启发性的发现是,当你只给它们一个例子时,模型的行为表现如何。一个完美的推理者会随着新线索的增加而变得稍微聪明一点。但这些 AI 模型通常在看到第一个例子后会变得更糟,然后才开始好转。

这就像如果你给一名侦探展示了一个关于犯罪的单一线索,侦探没有仔细思考,而是立即大喊:“我知道凶手是谁了!”并锁定了一个错误的嫌疑人。只有当你向他们展示了更多线索后,他们才会慢慢退一步,重新审视证据。研究发现,81 次模型运行中有 69 次犯了这种错误,即过快地做出结论。它们在“过度承诺”于看到的第一个数据点,而不是等待看到全貌。

规模无法解决逻辑问题

你可能会认为,更大的、更聪明的模型会解决这个问题。论文测试了具有数十亿参数(即 AI 的“大脑容量”)的模型,从微小的 8 亿参数到庞大的 6750 亿参数。结果如何?更大的模型在获得正确答案方面做得更好,但在推理方面却没有变得更好。

模型行为与完美数学标准之间的差距保持不变,无论模型有多庞大。无论模型拥有 10 亿个参数还是 6000 亿个参数,它在匹配完美的“贝叶斯最优”逻辑方面依然面临同样的困难。这就像你给一个学生提供了一个越来越大的图书馆(更多的数据),但他们仍然没学会如何使用地图;他们只是变得更擅长背诵书名了。

“安全性”与“训练”陷阱

论文还研究了当模型经过“后训练”(post-trained)——即人类对其进行微调以使其更具帮助性、遵循指令或更具“安全性”时——会发生什么。令人惊讶的是,这种训练反而使推理鸿沟扩大了

当模型被调整为更具“指令遵循能力”或更具“思考能力”时,它们实际上反而远离了完美的逻辑标准。似乎教导模型变得礼貌或遵循特定的聊天格式,是在教它忽略问题的原始逻辑结构。这就像教一名棋手在比赛结束后总是说“好局”;他们可能会变得更有礼貌,但他们可能会忘记真正的游戏规则。

前沿领域正在停滞

研究人员还观察了过去两年发布的、来自最大科技公司的最新、最昂贵的模型。他们发现,对完美逻辑标准的忠实度完全没有提高。 最新的模型与旧模型一样,在面对完美推理者时仍存在同样的差距。事实上,他们测试的最旧的模型(来自 2024 年 5 月)实际上是最忠实于逻辑标准的,而最新的模型反而稍逊一筹。

“终止”难题

模型得分如此之低的一个具体原因是它们如何处理句子的结尾。完美的数学模型准确知道一个 0 和 1 的序列何时应该停止。然而,AI 模型在这方面表现得很差。它们经常在不该结束的时候猜测序列已经结束,或者在应该停止时继续运行。这种特定的错误占据了它们近 90% 的错误。这就像模型非常擅长写故事,但却不知道何时该在结尾处打上句号。

结论

论文得出结论,虽然这些 AI 模型在模式补全(即根据之前见过的内容找到最可能的下一个词)方面表现得极其出色,但它们尚未进行真正的算法推理。它们并没有建立起关于规则的心理模型;它们只是在缝合模式。

作者发布了他们的基准测试 F-ICL,作为一个开放工具,以便其他科学家可以持续进行测试。他们发现,目前的模型正困在“模式匹配”区域,处于随机猜测和完美逻辑推理之间,但更接近于随机猜测。在这些模型能够缩小这一差距之前,它们可能擅长写文章或编写代码片段,但它们还没有实现我们所希望的那种真正的“思考”。缩小这个差距并不仅仅是通过扩大模型规模或延长训练时间来完成的;这似乎需要一种处理信息方式的根本性变革。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →