← 最新论文
💬 NLP

ADAG: Automatically Describing Attribution Graphs

该论文提出了 ADAG,一种全自动化的端到端管道,通过引入归因轮廓、特征聚类算法及大语言模型解释器 - 模拟器机制,无需人工干预即可生成可解释的归因图描述,并成功应用于识别 Llama 3.1 模型中的有害建议越狱机制。

原作者: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ADAG 的新系统,它的目标是自动解读大型语言模型(LLM)的“大脑”是如何工作的

为了让你更容易理解,我们可以把语言模型想象成一个超级复杂的、由数亿个微型开关(神经元)组成的巨大工厂。当这个工厂生产出一个回答(比如“达拉斯属于哪个州?”)时,并不是所有开关都参与了工作,只有少数几个关键的开关在起作用。

以前的研究者想要搞清楚是哪些开关在起作用,以及它们是如何配合的,就像是在没有说明书的情况下,靠人工拿着放大镜一个个检查电路。这既慢又容易出错,而且非常依赖研究者的个人直觉。

ADAG 就是为了解决这个问题而生的“全自动电路侦探”。

以下是它的核心工作原理,用生活中的比喻来解释:

1. 核心任务:给“电路”画地图

想象一下,语言模型在处理问题时,内部会形成一张复杂的关系网(归因图)

  • 以前的做法:研究者手动挑出几个重要的开关,然后写报告说:“这个开关好像跟‘城市’有关,那个开关跟‘州’有关。”这需要大量的人工分析。
  • ADAG 的做法:它自动扫描整个工厂,找出所有真正参与工作的开关,并画出它们之间的连接图。

2. ADAG 的四个步骤(它的“侦探流程”)

第一步:追踪线索(电路追踪)

ADAG 首先会像侦探一样,顺着“电流”(梯度)去追踪。它会问:“在这个问题的回答中,哪些开关贡献了最大的能量?”

  • 比喻:就像在破案时,警察通过监控录像和指纹,找出哪些人真正进入了案发现场,而不是那些只是路过的人。

第二步:绘制“行为画像”(归因画像)

这是 ADAG 最聪明的地方。它不只是看开关“亮不亮”,而是看它怎么亮的。

  • 它记录每个开关输入了什么(比如看到了“达拉斯”这个词)。
  • 它记录每个开关输出了什么(比如它让模型更倾向于输出“德克萨斯州”)。
  • 比喻:以前我们只知道“张三进了房间”。现在 ADAG 能画出张三的行为档案:他进门时手里拿着什么(输入),他进门后做了什么动作(输出),以及他对房间里其他人产生了什么影响。

第三步:自动分组(聚类)

工厂里有成千上万个开关,一个个看太累了。ADAG 会把那些行为模式很像的开关自动归为一类,组成一个“超级小组”(Supernode)。

  • 比喻:就像在一个大派对上,ADAG 自动把“都在聊足球的人”、“都在聊美食的人”和“都在玩手机的人”分别聚成三个小圈子。它不需要人告诉它谁跟谁是一伙的,它自己通过数据分析就能看出来。
  • 创新点:以前的分组靠人工,容易分错;ADAG 用数学算法自动分,确保分在同一组的人真的是一类人。

第四步:请 AI 当翻译(自动描述)

这是最精彩的一步。有了“超级小组”后,ADAG 会请另一个 AI(大语言模型)来当翻译官

  • 解释器(Explainer):它会看着这些小组的“行为档案”,尝试用人类能听懂的话给它们起名字。比如:“这个组专门负责识别美国城市名”。
  • 模拟器(Simulator):它会扮演“考官”,测试这个起名叫得对不对。它会问:“如果我把‘达拉斯’这个词去掉,这个组还会活跃吗?”如果 AI 的预测和实际情况一致,说明名字起对了。
  • 比喻:就像你给一群奇怪的机器人起外号。你先猜它们叫“足球迷”,然后让另一个机器人去测试:“如果我不聊足球,它们还会兴奋吗?”如果测试通过,这个名字就被确认了。

3. ADAG 的实战成果

论文里展示了两个例子,证明 ADAG 很厉害:

  • 例子一:地理题(达拉斯在哪?)
    ADAG 自动找到了负责回答“达拉斯属于德克萨斯州”的电路。它发现有些小组专门负责识别“城市名”,有些负责识别“州名”,还有些负责把两者联系起来。更酷的是,它甚至能发现一些抑制性的小组(比如“不要回答其他州的州名”),并给它们起了准确的名字。

    • 结果:完全不需要人工干预,ADAG 自己就画出了和人类专家一样清晰的电路图。
  • 例子二:医疗建议的“越狱”(Pills Jailbreak)
    研究人员发现,有一种特殊的提示词(Prompt)能让模型给出有害的医疗建议(比如“把剩下的药全吃了”)。ADAG 被用来分析为什么这个提示词能骗过模型。

    • 发现:ADAG 自动找到了两个关键的“超级小组”:
      1. 一个小组看到"ridiculous"(荒谬的)这个词就会被激活,它负责降低模型的安全防御。
      2. 另一个小组看到"pills"(药丸)就会被激活,它负责绕过安全拦截。
    • 验证:研究者通过“关掉”这些小组(就像拔掉插头),发现模型立刻就不给有害建议了。这证明了 ADAG 真的找到了问题的根源。

总结:为什么这很重要?

想象一下,如果我们要确保一个自动驾驶汽车是安全的,我们不能只靠司机(人类)去猜它为什么刹车。我们需要知道它内部的传感器和逻辑电路到底是怎么工作的。

  • 过去:靠人工慢慢拆解,效率低,难以规模化。
  • 现在(ADAG):这是一个全自动的“电路翻译机”。它能快速、自动地把语言模型内部黑盒子的运作逻辑,翻译成人类能看懂的“说明书”。

一句话总结:ADAG 就像是一个不知疲倦的AI 翻译官,它自动把语言模型内部成千上万个神经元的复杂互动,整理成清晰、可理解的“功能小组”,让我们能真正看懂 AI 在想什么,从而更好地控制它、确保它的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →