← 最新论文
💬 NLP

Automated Attribution Graph Interpretation via Probe Prompting

本文介绍了“探针提示”(probe prompting),这是一种透明的基于规则的流水线,它通过跨提示激活特征(Cross-Prompt Activation Signatures)将归因图中的特征分组为概念对齐的超节点,成功验证了其在不同事实领域中的因果控制行为,且计算开销极低。

原作者: Giuseppe Birardi, Gonçalo Paulo

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Giuseppe Birardi, Gonçalo Paulo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一座繁忙、巨大的城市,数以百万计的工人(神经元)在其中传递笔记来回答一个问题。我们确切知道这些笔记是如何传递的(数学原理),但这座城市如此庞大,笔记也如此复杂,以至于人类无法通过观察地图来断言:“啊,这群特定的工人负责了‘德克萨斯州首府是奥斯汀’这个事实。”

本论文介绍了一种新的城市测绘方法,称为探针提示(Probe Prompting)。以下是其工作原理,使用简单的类比进行说明:

1. 问题:规模过大的城市难以阅读

此前,研究人员试图通过观察“归因图(attribution graphs)”来理解模型。你可以将它们想象成展示哪些工人影响了最终答案的蓝图。

  • 问题所在: 即便是对于像“德克萨斯州的首府是什么?”这样简单的问题,蓝图也会有数千条线和节点。这就像是通过逐个查看每一个字母来阅读一部小说。追踪仅仅一条路径就需要数小时,而对数千个问题进行这样的操作是不可能的。
  • 旧方法: 一些研究人员尝试让 AI 为这些工人贴标签(例如“这个关于‘德克萨斯州’”)。但通常,AI 只是根据该工人“通常”在做什么来进行猜测,而不是根据它在那个特定时刻“实际”做了什么。

2. 解决方案: “探针”侦探

作者创建了一个透明的、基于规则的系统,称为探针提示(Probe Prompting)。他们不是在猜测,而是把模型当作一个侦探游戏中的嫌疑人。

  • 设置: 他们取一个特定的问题(例如,“德克萨斯州的首府是……”)并生成一组几乎完全相同但更换了细节的“探针”问题(例如,“佛罗里达州的首府是……”、“纽约州的首府是……”)。
  • 测试: 他们观察特定工人(特征)对这些探针的反应。
    • 类比: 想象你有一名建筑物的保安。为了了解他的行为,你不能只观察他一次。你会问他:“当一个叫‘约翰’的人进来时,你会做什么?”然后问:“那‘玛丽’呢?”接着问:“那‘鲍勃’呢?”
    • 如果他只在“约翰”进来时做出反应,那么他就是一个**“约翰探测器”**。
    • 如果他对任何名字都有反应,那么他就是一个**“姓名探测器”**。
    • 如果他在听到“是”或“的”时做出反应,那么他就是一个**“语法助手”**。

3. 对工人的分组:“超节点(Supernodes)”

根据这些反应,系统将数千个独立的工人分组为超节点

  • 神奇之处: 与其观察 5,000 个独立的工人,系统会说:“好吧,这 50 个工人表现得都像‘德克萨斯州探测器’,所以让我们把他们看作一个大团队:德克萨斯团队。”
  • 结果: 庞大且混乱的城市地图现在被压缩成了一个简单的、可读的图表,其中只有几个命名的团队(例如:德克萨斯团队、奥斯汀团队、“首府”团队)。

4. 证明:“交换”实验

我们如何知道这些标签是真实的,而不仅仅是幸运的猜测?作者进行了因果交换(Causal Swap)

  • 实验: 他们拿出一个关于达拉斯的问题(原本答案应该是奥斯汀),并尝试强迫模型回答明尼苏达(其答案应为圣保罗)。
  • 方法: 他们“调低”了被标记为**“达拉斯团队”的工人的音量,并“调高”了被标记为“明尼苏达团队”**的工人的音量。
  • 结果:
    • 当他们使用探针提示标签时,模型成功将答案从达拉斯改为明尼苏达的概率约为 73%
    • 当他们使用随机对照组(忽略标签,随机挑选工人进行交换)时,模型几乎从未正确改变答案。
    • 当他们使用影响力对照组(无论其具体功能如何,只挑选“声音最大”的工人)时,模型同样未能正确改变答案。

5. 用通俗语言总结核心发现

  • 它有效: 该系统成功识别了哪些工人实际上控制着特定的事实。通过分组,他们让模型的“大脑”变得可读。
  • 少即是多: 有时,试图控制句子的每一个部分(城市名称、州名和首府)反而会干扰模型。如果只调整与答案相关的特定部分(州名和首府),效果会更好。
  • 它是透明的: 不同于某些被称为“黑盒”的 AI 方法,该系统使用清晰、人类可读的规则。如果研究人员想要检查工作,他们可以看到为什么一个工人会被归入某个特定的团队。

总结

本论文提出了一种工具,能将语言模型混乱、不可读的大脑地图转化为清晰、带标签的图表。它通过测试模型的各个部分对略微不同的问题的反应,将相似的部分进行分组,并通过在受控实验中成功交换答案,证明了这些分组确实控制着模型的行为。

本论文并未声称:

  • 它并未声称适用于每种 AI 任务(如编写代码或进行对话);它专门针对事实性问题(如首都、书籍作者和公司创始人)进行了测试。
  • 它并未声称可以修复模型或使其变得更聪明;它只是帮助人类理解模型是如何运作的。
  • 它并未声称适用于所有语言或所有模型规模;测试是在一个特定的英文模型(Gemma-2-2B)上进行的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →