← 最新论文
💻 computer science

Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning

本文提出了一种通过在语言模型激活中定位低维方向来对连续变量进行因果干预的方法,该方法证明了引导动词偏见会因果性地改变下游句法偏好,同时揭示出尽管引导向量编码了与上下文学习相关的误差信号,但这些信号并未被因果性地用于下游生成。

原作者: Zhenghao Herbert Zhou, R. Thomas McCoy, Robert Frank

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenghao Herbert Zhou, R. Thomas McCoy, Robert Frank

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)比作一位非常精密、高科技的厨师。这位厨师几乎读过所有现存的食谱,但当被要求烹饪一道新菜时,他们并不只是机械地遵循静态食谱。相反,他们会查看你刚刚递给他们的食材(即“上下文”),并即时调整烹饪风格。这种无需重新训练即可从少量示例中学习的能力,被称为上下文学习(In-Context Learning)

本文是对这位厨师在执行此类操作时“大脑”运作机制的科学探究。具体而言,研究人员希望看看是否可以通过“微调”厨师的内部思维来改变其烹饪方式,重点关注一种特定的语言习惯,即动词偏向(Verb Bias)

以下是他们研究发现的简要解析,使用了简单的类比:

1. 问题:使用“分级”食材烹饪

大多数先前的研究试图改变厨师对简单“开/关”事物的看法,例如“这是名词还是动词?”(离散特征)。但语言更像是一个调光开关,而非电灯开关。事物是分级的

例如,以动词“给”(give)为例。在英语中,你可以说:

  • “我给了一本书”(双宾语结构)
  • “我给了一本书给她"(介词与格结构)

有些人(或某些动词)强烈偏好其中一种形式。例如“给”相对平衡,但“解释”则强烈偏好“向她解释”。这种偏好并非硬性规则,而是一个滑动标尺。研究人员想知道:我们能否在模型的“大脑”中找到控制这个滑动标尺的具体“旋钮”,并转动该旋钮来改变模型的想法?

2. 工具:“导向向量”(遥控器)

为了研究这一点,研究人员使用了一种称为导向向量(Steering Vector)的工具。你可以将其想象为厨师大脑的遥控器

  • 如何制作: 他们向模型展示了一系列使用特定结构的句子(例如,“我给了她一本书”)。他们观察模型在处理这些句子时的内部“思维”(激活状态),并将这些状态取平均值。
  • 作用: 当他们在执行新任务时将这个“遥控器”信号添加到模型的“大脑”中时,模型开始表现得就像刚刚见过那些示例一样。它开始偏好相同的句子结构。这证明了该遥控器成功捕捉到了句子结构的“习惯”。

3. 实验 1:遥控器有效吗?

测试: 他们从“双宾语”句子中提取了遥控器(导向向量),并将其注入到一个新句子中。
结果: 模型立即将其偏好转向“双宾语”结构。
类比: 这就像递给厨师一个写着“烹饪意大利菜”的遥控器,突然之间,即使他们原本打算做寿司,也开始伸手去拿意大利面。遥控器起作用了。

4. 实验 2:调节“动词偏向”旋钮

这是本文最大的突破。他们希望看看是否能控制偏好的强度,而不仅仅是方向。

  • 设置: 他们确定了模型“大脑”中对应于动词偏向(即一个动词在多大程度上偏好一种结构而非另一种)的特定“方向”。
  • 干预: 他们使用一种数学技巧来“反事实地编辑”这一方向。
    • 情景 A: 他们选取一个天然偏好结构 A 的动词,并强制模型认为它强烈偏好结构 B。
    • 情景 B: 他们选取一个中性的动词,并强制其变得极端。
  • 结果: 当他们转动这个“动词偏向”旋钮时,模型的行为正如预测的那样发生了变化。如果他们让模型认为某个动词强烈偏好“双宾语”结构,模型就会更频繁地使用该结构,即使该动词天然并不喜欢它。
  • 结论: 他们证明,模型不仅仅是“记住”了结构;它实际上持有一个连续的、可调节的值,表示一个动词对某种结构的偏好程度,并且他们可以物理地转动这个刻度盘。

5. 实验 3:缺失的“惊讶”因素

在人类学习中,当我们感到惊讶时,学习效果最好。如果你预期某个动词以某种方式使用,却看到它以另一种方式使用,你的大脑会说:“哇,这出乎意料!”并更强烈地更新其规则。这被称为逆频率效应(Inverse Frequency Effect)

研究人员想知道:模型的“遥控器”(导向向量)是否捕捉到了这种“惊讶”信号?

  • 测试: 他们尝试在遥控器中编辑“惊讶信号”。他们问道:“如果我们让模型认为句子比实际更令人惊讶,它是否会学得更多?”
  • 结果:
    • 好消息: “惊讶”信息确实存在于遥控器中。他们可以在数学上将其隔离出来,并调大或调小。
    • 坏消息: 仅仅注入这个遥控器并没有让模型以“由惊讶驱动”的方式学习。模型并没有根据惊讶程度自动更新其行为。
  • 类比: 想象遥控器上有一个“惊讶”按钮。你可以按下按钮并看到灯亮起(信息确实存在)。但是,当你按下它时,厨师并没有真正改变烹饪风格以变得更加适应。厨师只是遵循了指令,但并没有从惊讶中“学习”。

研究结果总结

  1. 我们可以控制连续变量: 我们可以找到 AI 大脑中像动词偏好这样的“调光开关”,并通过调大或调小它们来改变行为。
  2. 导向向量强大但有限: “遥控器”(导向向量)非常擅长捕捉任务的状态(例如,“我目前正在思考双宾语句子”)。它成功改变了模型的即时偏好。
  3. 但它遗漏了“学习”部分: 遥控器捕捉到了学习的结果(新的偏好),但似乎并未捕捉到学习的过程(基于错误的更新)。这就像遥控器可以将恒温器设定为 70 度,但它无法解释炉子是如何计算出需要加热才能达到这一温度的。

简而言之: 研究人员构建了一种工具,用于微调 AI“大脑”内部的“滑动标尺”。他们证明可以转动这些标尺来改变 AI 的说话方式。然而,他们也发现,该工具捕捉到了 AI 的习惯,但并未捕捉到允许 AI 适应惊讶的完整学习机制

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →