Can Interpretation Predict Behavior on Unseen Data?
本文证明了在分布内训练期间观察到的注意力模式可以成功预测 Transformer 模型的分布外行为,从而建立了一种新的可解释性目标,即即使在缺乏因果机制联系的情况下,通过观测分析也能预判分布偏移下的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一个神秘且超级聪明的机器人是如何思考的。长期以来,科学家们认为,要真正“了解”这个机器人,你必须去戳它、扭转它的电线,或者关闭它的特定部分来观察哪里会损坏。这就像机械师拆解汽车发动机来了解其工作原理:如果你拔掉火花塞,汽车停止了运行,你就知道火花塞是必不可少的。在人工智能领域,这被称为“因果解释”(causal interpretation)。但问题在于:这些机器人非常复杂,仅仅通过“戳弄”往往会得到令人困惑的答案,或者机器人可能会直接启用一个你不知道的备用方案。因此,一个新的问题出现了:我们能否仅仅通过观察机器人在正常工作时的表现,而不去拆解它,就能理解它?具体来说,我们能否通过观察它处理一个曾经见过的任务时的表现,来推测它在面对一个全新的、奇怪的任务时会如何表现?这就是这篇论文所解决的大型谜题——从“通过破坏来学习”转向“通过观察模式来预测”。
这项研究背后的研究人员决定通过玩一场游戏,利用数百个微型 AI 机器人(称为 Transformer)来观察是否可以通过观察它们在执行一个简单的、熟悉的任务时的“思想”,来预测它们的未来行为。他们教给这些机器人一个涉及括号的游戏,比如 (( )) 或 ()()。棘手的部分在于,训练游戏具有歧义性:机器人可以通过仅仅计算括号的总数(一个简单的、扁平的规则)来获胜,也可以通过检查括号是否像树一样完美嵌套(一个复杂的、层级化的规则)来获胜。这两种规则在训练数据上都能完美运行。
随后,研究人员抛出了一个变数。他们给了机器人一组新的括号,这些括号虽然总数正确,但由于排列混乱而破坏了“树”规则。这就是“未见数据”。一些机器人坚持使用简单的计数规则,并在新测试中失败了。另一些机器人则掌握了树规则并顺利通过。核心问题是:研究人员能否在机器人仍在玩旧的、简单的游戏时,通过观察其内部的“注意力”(即机器人关注句子的哪些部分),来预测它在新的、困难的游戏中会使用哪种规则?
答案是一个令人惊讶的“可以”。团队发现,通过仅仅观察机器人在简单的训练过程中如何聚焦于括号,他们就能高精度地预测机器人会在新的、棘手的数据上成功还是失败。这就像观察一名学生解决数学练习册上的问题:如果你看到他们在处理简单题目时使用了一种特定的、巧妙的捷径,你就可以猜到他们在面对难题时也会使用同样的巧妙逻辑,即使你还没见过那份试卷。
然而,这篇论文也发现了一些挑战我们对机器“理解”常识的内容。通常情况下,如果我们看到一个机器人使用大脑的特定部分来解决问题,我们会假设那个部分是解决问题的“原因”。但在本研究中,研究人员发现,有时他们看到的“线索”(一种特定的注意力模式)实际上并不是驱动成功的“引擎”。在某些情况下,机器人使用的模式实际上会损害其性能,但因为该模式与那些聪明的机器人高度相关,研究人员仍然利用它做出了正确的预测。这就像看到一匹赛马身上带着一个幸运符,幸运符并没有让马跑得更快,但如果你看到了那个幸运符,你仍然可以正确地猜到这匹马会赢。
作者明确反对“必须通过破坏机器(因果干预)才能理解它”的观点。他们证明了虽然破坏机器是学习的一种方式,但它并非唯一方式,而且有时会产生误导。在他们的模拟实验中,他们发现移除这些“幸运符”模式有时反而会让机器人的表现变得更好,这证明了该模式并不是成功的真正原因,尽管它是一个完美的预测指标。
那么,研究的结论是什么?这篇论文建议用一种新的方式来评判 AI:与其仅仅问“我们是否找到了确切的原因?”,不如问“我们能否预测接下来的发生?”如果我们能够通过观察 AI 在熟悉数据上的内部模式,来准确猜测它将如何处理未知情况,那么这就是一种强大的理解形式,即便我们并不完全理解其背后的机械化“为什么”。研究人员在 270 个不同的模型上进行了这些实验,并发现这种基于预测的方法具有一致的有效性,为我们在部署 AI 之前识别其可能失败的情况提供了一种新工具。他们并不声称解决了 AI 意识之谜,也没有绘制出每个神经连接的完美地图,但他们证明了:观察数据的“舞步”,就能告诉我们舞者下一步的动作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。