Understanding Verbatim Memorization in LLMs Through Circuit Discovery
本文利用机械解释性与 Transformer 电路发现技术,揭示了大型语言模型中负责启动与维持逐字记忆的神经子图各不相同,其中启动过程具有上下文依赖性,而预防机制则在不同领域间表现出鲁棒的迁移性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型语言模型(LLM)视为一座巨大的、高度组织化的图书馆,其中存储着有史以来写过的每一本书。有时,当你向图书管理员提问时,他们不仅仅是总结故事,而是逐字逐句地背诵书中的一段话。这被称为记忆(Memorization)。
你分享的这篇论文就像是一群侦探,试图弄清楚图书管理员究竟是如何决定开始背诵那本书的,以及他们是如何持续背诵下去的。他们并没有仅仅靠猜测,而是使用了一种叫做“电路发现”(circuit discovery)的特殊工具,来绘制出处理这项任务的图书管理员大脑内部特定的电信号通路图。
以下是他们研究结果的拆解,使用了简单的类比:
1. 两个不同的工作: “启动开关”与“跑步机”
研究人员意识到,记忆一个句子不仅仅是一个大动作。它实际上是两个截然不同的步骤,就像开启一台机器然后让它持续运转一样。
- “启动开关”(记忆决策): 这是模型观察你的提示词并决定:“嘿,我知道这个精确的句子!让我们把它复制出来吧。”的时刻。
- “跑步机”(分支比较): 一旦模型开始复制,这就是一个机制,让它在沿着同一条路径运行的过程中保持稳定,而不被分心。
2. 侦探工作:寻找微小的电路
为了找到这些机制,研究人员创建了一个“找不同”的游戏。他们给了模型两个非常相似的提示词:
- 干净提示词(Clean Prompt): 一个距离触发记忆响应仅一步之遥的句子。
- 损坏提示词(Corrupted Prompt): 一个看起来很相似但会导致模型走向完全不同的、非记忆性答案的句子。
通过在这些提示词之间交换“大脑活动”(激活值),他们可以观察到哪些微小的导线(电路)负责了这个切换过程。他们发现了两个令人惊讶的事实:
- “启动开关”是一个主控制器: 负责开始记忆的微小导线组功能强大,足以维持记忆的进行。如果你干扰了“启动开关”,模型就会完全停止记忆。
- “跑步机”是一条单行道: 负责在模型已经进入记忆路径后(一旦开始后)保持其路径运行的导线,本身无法独立启动这个过程。它们就像一台跑步机,只有当有人已经在上面跑动时才能工作;它们自己无法启动引擎。
3. “通用停止按钮”对比“特定上下文启动按钮”
研究人员测试了这些电路是否适用于不同类型的文本(如代码、电子邮件或网页),而不仅仅是维基百科。
- “通用停止按钮”: 那些阻止记忆(停止模型背诵)的电路在任何地方都有效。无论文本是关于 GitHub 代码还是 Enron 电子邮件,都可以应用相同的“刹车”来阻止模型背诵。
- “特定上下文启动按钮”: 导致记忆的电路则非常挑剔。触发模型在电子邮件中记忆一个句子的机制,并不一定会触发它在代码文件中记忆另一个句子。这种“启动”机制在很大程度上取决于特定的文本类型。
4. 核心结论:破坏触发器比破坏记忆更容易
最有趣的结论是关于如何控制这种行为。
研究人员发现,破坏“启动开关”(防止模型决定进行记忆)要比强迫模型记忆新内容容易得多。
他们将其比作一个带有安保系统的房子:
- 存储的信息(图书馆里的书)很难更改或擦除。
- 然而,触发器(开启图书馆大门的钥匙)是非常脆弱的。如果你破坏了钥匙,即使书还在里面,图书馆也会保持锁闭状态。
总结来说: 这篇论文表明,如果我们想要阻止人工智能泄露隐私信息或受版权保护的文本,我们不应该尝试删除记忆(这很难)。相反,我们应该专注于寻找并禁用那些决定何时开始背诵的特定“触发电路”,因为这些才是跨越不同文本类型的薄弱环节。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。