← 最新论文
🤖 machine learning

What does a Bayes-filtered transformer believe? A predictive Monte Carlo approach

本文介绍了预测蒙特卡罗(Predictive Monte Carlo, PMC),这是一种新颖的可解释性方法,它仅通过下一标记生成来直接逼近贝叶斯滤波变换器所学习到的关于潜在任务的隐式先验和后验分布,从而克服了脆弱的预测空间比较所带来的局限性。

原作者: Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名侦探,正试图弄清楚一个神秘、超智能机器人的想法。你无法窥视它的脑回路,也无法阅读它的日记;你只能观察它玩一场“猜下一个词”的游戏。每当你给机器人一个句子,它都能以惊人的准确度预测下一个词。但这个谜题在于:这个机器人只是在背诵训练期间见过的一张巨大的答案清单,还是它真的学习了宇宙的隐藏规则,从而能对新情况做出聪明的推断?这个问题处于机器学习领域的核心,特别是研究 AI 模型如何从语境中学习。为了理解这一点,我们需要了解“先验”(peroirs,即机器人看到任何线索之前的初始猜测)和“后验”(posteriors,即看到证据后其猜测的变化)。科学家们长期以来一直在思考,这些机器人是在进行真正的贝叶斯推理(一种根据新数据更新信念的高级方式),还是仅仅在模仿这种数学形式的外表而没有实际理解。

这篇论文介绍了一个巧妙的新技巧,可以窥视幕后的真相。研究人员使用“贝叶斯过滤 Transformer”(一种基于隐藏规则生成的序列进行训练的 AI 类型),开发了一种称为“预测蒙特卡洛”(Predictive Monte Carlo, PMC)的方法。把这个 AI 想象成一位品尝过数百万种汤的厨师。如果你问这位厨师这道菜的配方,他可能会说“这尝起来像鸡肉”。但如果你根据你给他的某种特定食材,要求他烹饪出一批新的汤,然后通过品尝这批新汤来弄清楚他真正认为的配方是什么,你就能得到更清晰的图景。作者使用这种“烹饪”方法从 AI 中生成了数千个虚构的未来序列。通过分析这些虚构的未来,他们可以重建 AI 对世界的隐藏“信念”。

这项研究在三种不同类型的谜题上进行了测试:从瓮中抽取彩色球的游戏、线性回归任务(寻找穿过散点的一条线)以及像棋盘游戏一样在状态间移动的游戏。在每种情况下,他们都在混合了不同“任务”(不同的配方)的数据集上训练了 AI,并使用 PMC 来观察 AI 实际相信什么。他们发现 AI 的内部信念发生了迷人的变化。当 AI 仅在少数几种任务类型上进行训练时,它表现得像一个记忆者,僵化地固守于它见过的特定例子。但随着训练任务多样性的增加,它会转向成为一个“泛化者”,学习适用于一切事物的更广泛规则。有趣的是,论文显示这种转变并非平滑发生;在某些点上,AI 会短暂地表现得像个天才泛化者,然后又回落到记忆者模式。至关重要的是,作者证明了仅仅观察 AI 的最终预测(即“猜下一个词”的部分)是不够的,两种不同的内部信念系统可以产生完全相同的预测,使得 AI 的真实本质在你不使用 PMC 去观察其进行真实思考的“潜空间”(latent space)时,依然是不可见的。

侦探的新工具

那么,这个新工具 PMC 究竟是如何工作的呢?想象一下 AI 是一个接受过特定规则训练的占卜师。你给占卜师一个提示,比如“天空是蓝色的,因为……”然后他们开始预测接下来的词。通常,你只需取他们的第一个预测并继续下一步。但有了 PMC,你不会止步于此。你会要求占 卜师继续下去,基于这个开头生成一个完整的故事。你这样做数百次,创造出数百个不同的可能故事。

一旦你拥有了这些长篇的虚构故事,你就可以观察其中的模式。如果 AI 是在一个“蓝色”总是紧跟“天空”之后的世界中训练的,那么这些故事也会反映这一点。但更重要的是,通过分析这些生成的完整故事,你可以逆向工程出 AI 认为的“游戏规则”是什么。这就像如果你观察一名魔术师从帽子里变出一只兔子,你不仅是看那只兔子,而是观察他们从一千个不同的帽子里变出一千只不同的兔子,从而弄清楚那个帽子到底是如何被动了手脚。这使得研究人员能够绘制出 AI 的“先验”(你在给出提示前它相信什么)和“后验”(你在看到提示后它相信什么)。

重大转变:记忆者 vs. 泛化者

研究人员使用这种方法测试了 AI 领域的一个重大问题:模型是在学习记忆特定案例,还是在学习泛化规则?他们设计了三个不同“家族”的任务实验。

首先,他们观察了球与瓮(Balls-and-Urns)。想象一个装有红球和蓝球的瓮。AI 的任务是猜下一个球是什么。这里的“任务”是瓮中红球和蓝球的具体比例。如果 AI 仅在几种特定的瓮组合上进行训练,它就会变成一个记忆者。它会学习:“哦,这个特定的瓮有 80% 的红球,所以我猜是红色。”但如果 AI 在具有不同混合比例的海量多样化瓮组合上进行训练,它就会变成一个泛化者。它学会了规则:“球的混合是随机的,所以我应该观察历史记录来预测下一个。”

论文发现了一个这种转变的“阈值”。当 AI 训练的任务数量较少时,它表现得像个记忆者。但随着任务数量的增长,AI 会突然切换到泛化者的模式。这证实了一个被称为**任务多样性阈值(Task-Diversity Threshold)**的现象。

但更有趣的地方在于,研究人员还观察到了瞬态泛化(Transient Generalization)。这就像观察一名正在学习新学科的学生。起初,他们可能会尝试理解大局(泛化),但随后他们可能会感到困惑,并开始通过记忆特定事实来应对考试。论文显示,在训练过程中,在任务多样性处于中等水平时,AI 实际上是开始表现得像个泛化者,但随着训练的持续,它又会漂移回记忆者模式。这是在陷入更僵化的习惯之前,一段短暂的才华横溢的阶段。

为什么只看答案是不够的

本文最重要的发现之一是,你不能仅通过观察 AI 的答案来判断它在做什么。作者使用了一个极佳的比喻:想象两张不同的城市地图。一张是详细、准确的街道绘图;另一张是仅显示主干道的草图。如果你询问两张地图前往某家咖啡馆的路线,它们可能会给出完全相同的指令。如果你只看指令(预测),你无法分辨哪张才是真实的地图。

在 AI 的世界里,不同的内部“信念”(后验)可以导致完全相同的预测。论文指出,以往仅将 AI 的预测与“金标准”进行比较的研究是脆弱的,因为它们无法区分一个真正理解规则的模型和一个仅仅恰好猜对了的模型。通过使用 PMC 观察“潜空间”(即隐藏的信念系统),研究人员可以看到 AI 的内部地图确实正在从记忆者的草图转变为泛化者的详细地图,然后又转回去了。

预言的局限性

作者谨慎地指出,这种方法并不是解决一切问题的万能钥匙。PMC 的有效性依赖于某些数学条件的满足,而这些条件在处理现实世界的大规模 AI 模型时很难被证明。在实验中,他们使用了合成任务(如球与瓮和简单的数学问题),在这些任务中他们已知“地面真值”(ground truth)。他们发现 PMC 在那里表现得非常出色,成功恢复了 AI 隐藏的信念。

然而,他们也承认,对于现实世界中使用的巨型 AI 模型(例如那些写文章或与你聊天的模型),我们尚不知道其数学逻辑是否能完美成立。AI 的内部逻辑可能如此复杂,以至于我们的“预言”方法可能会遗漏一些细微之处。但即便存在这些局限性,这篇论文仍提供了一种调查 AI 的强大新方法。它表明,通过生成并分析 AI 自身的“假设场景”,我们终于可以开始理解这些模型究竟在想什么,而不仅仅是它们在说什么。

最后,这篇论文不仅仅是在告诉我们 AI 是如何学习的,它还为我们提供了一个观察学习过程本身的全新视角。它表明 AI 不仅仅是一个静态的事实数据库,而是一个在记忆与理解之间不断切换的动态系统,而且只要我们知道如何提出正确的问题,我们就能追踪这些转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →