Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments
本文介绍了 CHIVE,这是一个通过使用反事实实验来评估并改进大语言模型(LLM)解释方法,以检测解释是否能准确预测模型在相关输入上的行为,从而揭示了当前的解释性技术并不具备预测优势,并证明了在 CHIVE 生成的数据上进行训练可以增强泛化能力的智能体流水线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
为了理解这项研究的内容,请想象你正试图理解一个人为什么做出某个特定的选择。如果你询问他们,他们可能会给你一个理由,但那个理由可能只是一个猜测、一种合理化解释,或者干脆是错误的。在人工智能领域,研究人员面临着类似的挑战,对象是大语言模型。这些系统是强大的工具,可以编写代码、讲述故事和解决问题,但它们也是“黑盒”。我们可以看到它们说了什么,但无法轻易看到产生这些词汇的内部齿轮是如何转动的。科学家们长期以来一直试图构建工具来窥视这些齿轮,希望能找到模型行为的真实原因。目标是了解一个模型是在诚实地解释自己的推理,还是在隐藏不同的动机。问题在于:我们如何知道一个解释是否真的好?如果一位研究人员说:“模型犯错是因为它被某个特定的词搞混了,”我们如何测试这是否属实?
Anthropic 的一个研究团队决定通过超越简单的猜测,进入“如果……会怎样”的领域来测试这一点。他们并没有仅仅要求模型解释自己,而是构建了一个能够主动改变模型环境以观察解释是否成立的系统。他们将这个过程称为反事实调查(counterfactual investigation)。其运作方式如下:如果你认为模型犯错是因为某个特定的词,你就改变那个词,看看错误是否消失。如果改变那个词后错误消失了,那么你的解释很可能是正确的。如果错误依然存在,那么你的解释就是错误的。这种方法将模糊的理论转化为了可测试的事实。研究人员想要看看目前科学家用来观察 AI 模型内部情况的工具,是否真的能帮助预测这些变化,以及它们是否能教会模型更好地理解自身行为。
为了实现这一点,研究人员创建了一个名为 CHIVE 的全新自动化流水线。这个系统就像一个不知疲倦的调查员。它首先从真实的对话中向目标 AI 模型提出数千个问题,寻找模型表现出异常或奇怪行为的时刻。一旦它找到了奇怪的行为,系统并不会就此停止。它会发起一系列实验。它获取原始问题,并对其进行微小的、特定的编辑——比如改变一个名字、删除一个句子或替换一个词——然后再次向模型提出新问题。它会进行数十次这样的尝试,以观察在原始问题与编辑后的问题下,这种奇怪行为发生的频率。如果改变某个特定的词导致奇怪行为消失,系统就会将其记录为该词是诱因的证据。这个过程生成了数千个高质量的示例,其中行为的原因是已知且通过实验本身得到验证的。
研究人员利用这组庞大的已验证示例来测试两个主要观点。首先,他们想看看科学家用来解释 AI 模型的现有工具是否真的有帮助。这些工具旨在读取模型的内部活动,类似于医生阅读脑部扫描图一样,以寻找答案背后的“思想”。研究人员将这些工具交给一个聪明的计算机智能体,并要求它预测特定的提示词变化是否会改变模型的行为。他们预期这些工具会给智能体带来显著优势,帮助它看到那些仅凭阅读对话文本所无法发现的隐藏原因。令人惊讶的是,这些工具完全没有帮助。无论智能体是拥有这些内部读取工具,还是仅拥有对话文本,其表现都一样出色,甚至在拥有工具时表现更差。这些工具未能揭示特定输入与结果行为之间的联系,让智能体依然处于迷茫之中,就像之前一样。
其次,研究人员询问是否可以利用他们收集的数据,教模型预测自身的行为。他们将目标模型在他们进行的数千次实验数据上进行训练。训练任务很简单:向模型展示一段对话和一个提议的改动,然后要求它猜测该改动是否会阻止那种奇怪行为的发生。这里的实验结果要乐观得多。接受过此类训练的模型在预测这些变化的发生方面变得显著更好。它们学会了识别自身行为中的模式,而这些模式是它们之前并未察觉到的。即使当研究人员在模型从未见过的全新问题类型和场景上进行测试时,这种进步依然有效。模型学到了一种通用的技能,即理解其行为是如何受输入影响的。
研究还探讨了模型仅仅是在死记硬背答案,还是已经获得了更深层的、内在的自我理解。为了测试这一点,研究人员用关于自身行为的数据训练了一个模型,用关于另一个模型行为的数据训练了另一个模型。如果第一个模型拥有对其自身内部状态的特殊、私有的访问权限,它的表现应该优于第二个模型。然而,两个模型的表现同样出色。这表明模型并没有访问某种关于自身的隐藏、特权知识。相反,它们是在通过观察数据来识别因果关系的模式,就像学生通过学习案例来学习学科知识一样。
研究结果为该领域现状提供了一个清晰的图景。目前的 AI 模型内部观察工具在简单的受控测试中表现出色,但在应用于现实世界复杂对话时,似乎并不奏效。它们无法提供解释“模型为何这样做”的那个“顿悟时刻”。另一方面,研究表明,可以通过训练使模型更好地预测其对环境变化的反应。这表明,理解 AI 行为的路径可能不在于制造更好的显微镜去观察机器内部,而在于训练机器去识别其自身行为的模式。研究人员已经发布了所有的实验数据和代码,为他人继续这项工作提供了新的基础,确保未来对 AI 行为的解释是基于当世界发生变化时实际发生了什么,而不仅仅是基于我们认为可能正在发生的情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。