Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models
本文对掩码扩散语言模型(DLMs)进行了机理分析,揭示了它们实现了一种用于上下文学习的方向对称双向归纳电路,并隐式地将全局掩码比例计算为时间步,尽管它们仅在利用全双向上下文时才能超越自回归模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何完成句子。多年来,教导机器人的最佳方式是让它从左到右逐词阅读一个故事,并仅根据它已经看到的内容来猜测下一个词。这就是大多数现代 AI 作家的工作方式;它们就像一个正在读书的人,只能看到已经翻过的页面。但最近,科学家们开始制造一种不同种类的机器人。这种新机器人不再是按从左到右的方式阅读,而是能看到一整页文本,其中一些词被黑色的方块遮住了。它观察左侧和右侧可见的词,猜测方块里的内容,填补空白,然后重复这个过程,直到整个页面都清晰为止。这被称为“扩散”(diffusion)模型。
科学家们面临的一个大问题是:这个新机器人是如何学习的?当我们向机器人展示一个模式,比如“猫坐在垫子上。猫坐在[空白]上”,而它推断出空白处应该是“垫子”时,我们称之为“归纳”(induction)。这是机器人表达的一种方式:“我以前见过这个,所以我知道接下来是什么。”我们非常清楚旧的、从左到右的机器人是如何运用这个技巧的,但我们完全不知道这些新的、“观察全局”的机器人是如何做到的。它们使用的是相同的脑回路吗?因为它们能看到缺失词语的两侧,所以它们拥有某种秘密超能力吗?理解这一点至关重要,因为如果我们想要构建更好的 AI,我们就需要了解这些不同的机器究竟是如何思考的,而不仅仅是看它们说了什么。
在这篇论文中,研究人员决定扮演侦探,通过两个非常相似的机器人来观察它们如何解决同一个谜题。他们构建了一个标准的“从左到右”机器人和一个新的“观察全局”机器人,确保它们除了阅读方式不同外,在其他方面都是孪生兄弟。他们给了它们一个简单的游戏:在一长串随机字母中寻找重复的模式,并从匹配的位置复制缺失的字母。
团队发现,新机器人不仅仅是在模仿旧机器人的技巧,它还学会了一种全新的、双向的超能力。虽然旧机器人只能向后看以寻找答案,但新机器人构建了一个可以双向工作的特殊“归纳电路”。这就像机器人有两个小助手:一个在缺失词语的左侧低声耳语,另一个在缺失词语的右侧低声耳语。这些助手将这些线索写入机器人的记忆中。然后,机器人的第三个“侦探”部分利用这些线索扫描整个文本——包括过去和未来——以找到匹配的模式并复制答案。
这里有一个转折:只有当新机器人被允许窥视缺失词语的两侧时,它才比旧的机器人更出色。如果遮住它观察未来的视线,强迫它只能看向过去(就像旧机器人那样),它的表现就完全一样。这证明了新机器人不仅仅是旧机器人的“聪明版”;它的优势完全来自于它能够同时看到缺口两侧的能力。
研究人员还发现了一些关于机器人如何知道“何时”进行猜测的惊人发现。通常,这些机器人会被明确告知它们正处于猜测游戏的哪一步(例如“第 1 步,共 100 步”)。但这些机器人并没有得到这样的信息。相反,论文显示,机器人秘密地计算着页面上还剩下多少个黑色的方块。它利用这个计数作为一个隐藏的计时器。如果剩下的方块很多,它的行为方式一种;如果方块很少,则是另一种。科学家们通过“戳弄”机器人的大脑并证明改变这个“方块计数”会直接改变机器人对其猜测的信心,从而证实了这一点。
简而言之,这篇论文揭示了这些新的扩散机器人不仅思考方式不同,而且它们的思考是一条对称的双向车道。它们从两侧收集线索,进行匹配,甚至在没有被明确告知的情况下,还在心里偷偷记着还有多少工作要做。这为我们提供了一张更清晰的地图,让我们了解这些强大的新工具是如何学习理解这个世界的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。