← 最新论文
🤖 AI

Inference Time Causal Probing in LLMs

本文提出了隐藏状态驱动边界干预(HDMI),这是一种无需探针、基于梯度的方法,它利用模型的原生输出直接引导大语言模型的隐藏状态,以实现比现有依赖分类器的方法更可靠因果干预,同时引入了一种用于文本编辑的前瞻变体。

原作者: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

全局概览:修复“黑箱”

想象大型语言模型(LLM)就像厨房里一位超级聪明但略显神秘的厨师。这位厨师能写出精彩的故事,但如果你问:“你为什么在这汤里加了盐?”厨师可能无法给出清晰的解释。他们只是“知道”这样味道才对。

科学家们想要理解这位厨师是如何做决定的。具体来说,他们想知道:厨师真的是利用“复数”(如“猫们”)这个概念来决定动词用"run",还是这仅仅是一种巧合?

为了验证这一点,研究人员使用了一种称为因果探测(Causal Probing)的技术。这就像是一个“如果……会怎样”的实验。他们想要说:“好吧,让我们假设主语是复数而不是单数。厨师会把动词从'runs'改成'run'吗?”

旧方法的缺陷:“翻译官”问题

以前,为了进行这个实验,研究人员不得不雇佣一位翻译官(称为“探测头”)。

  1. 他们会训练这位翻译官阅读厨师的秘密笔记(隐藏状态),并猜测主语是单数还是复数。
  2. 然后,他们会利用翻译官的反馈来微调厨师的笔记,以改变其含义。

缺陷:这位翻译官可能无法完美地理解厨师的语言。翻译官可能拥有自己的一套关于“复数”长什么样的规则,这与厨师实际的思考方式并不匹配。这就像试图用另一品牌汽车的说明书来修理发动机。你可能按对了按钮,但因为不了解发动机的真实布局,却弄坏了其他部件。

新解决方案:HDMI(“直接微调”)

作者提出了一种名为HDMI(隐藏状态驱动边际干预,Hidden-state Driven Margin Intervention)的新方法。

类比:与其雇佣翻译官,HDMI 直接与厨师的大脑对话。

  • 目标:厨师即将说出"runs"(单数)。你希望他们说"run"(复数)。
  • 旧方法:请翻译官找到“复数”按钮并按下它。
  • HDMI 方法:HDMI 观察厨师的最终决策过程(输出)。它计算出使"run"这个词略微更有可能、"runs"略微更不可能所需的精确数学“微调”。它是通过查看这两个词之间的差异(即边际,margin)来实现的。

为什么它更好

  • 无需翻译官:它不需要训练一个单独的 AI 来理解这个概念。它利用模型自身的大脑来 figuring out 如何改变输出。
  • 精准性:因为它利用了模型自身的“几何结构”(即它如何自然地排列词汇),所以它与模型实际的思考方式完美契合。
  • 高效性:这是一个简单快速的计算,就像在方向盘上轻敲一下,而不是绕远路。

“前瞻”升级:LA-HDMI

该论文还介绍了一种名为LA-HDMI(前瞻 HDMI,Lookahead HDMI)的高级版本,用于文本编辑

场景:想象你在写一个故事:“那只猫正在睡觉(The cat was sleeping)。”你想把它改成“那些猫正在睡觉(The cats were sleeping)。”

  • 问题:如果你只是把"was"改成"were",句子可能会断裂,因为前面的词("The")或后面的词可能也需要改变,以保持语法的流畅。
  • LA-HDMI 解决方案:这种方法不仅关注当前的词,还会向前看。它在做出改变的同时,模拟句子的后续几步。
    • 它看到,如果将"was"改为"were",它需要将"The"改为"The"(无需更改),但如果名词发生变化,可能需要调整名词前的冠词。
    • 它在单词甚至被写出之前,就温和地引导模型的隐藏思维,确保整个句子保持流畅自然,而不仅仅是你修改的那个词。

这就像 GPS 不仅告诉你“现在左转”,还会计算前方的整条路线,以免你稍后陷入死胡同。

效果如何?(结果)

作者在两个旨在测试语法和逻辑的主要“健身房”(数据集)上测试了该方法:

  1. LGD 一致性:检查主语和动词是否匹配(例如,"he is"与"they are")。
  2. CausalGym:一套复杂的语法谜题。

成绩单
他们测量了两项指标:

  • 完整性:我们是否成功改变了含义?(例如,"runs"是否变成了"run"?)
  • 选择性:我们是否意外破坏了其他内容?(例如,我们是否错误地改变了时态或整个句子的含义?)

结论
HDMI 的得分始终高于旧方法。它在改变它本应改变的内容的同时,不会搞乱句子的其余部分。它在不同类型的 AI 模型(如 Llama 和 Pythia)上表现良好,证明它是一个稳健的工具。

总结

  • 旧方法:使用单独的工具来猜测如何改变 AI 的想法(往往不准确)。
  • HDMI:利用 AI 自身的输出来计算改变其想法的完美微调(准确且高效)。
  • LA-HDMI:结合“水晶球”使用 HDMI 来流畅地编辑文本,确保整个句子自然流畅,而不仅仅是被编辑的那个词。

该论文得出结论,这种“直接微调”方法是理解和控制 AI 模型如何思考和写作的一种更可靠的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →