← 最新论文
💻 computer science

Contextual Linear Activation Steering of Language Models

本文介绍了上下文线性激活引导(CLAS),这是一种根据输入上下文动态调整引导强度的方法,其在多个基准测试和模型系列上以有限的标注数据实现了超越标准线性激活引导的表现,并达到或超过了 ReFT 和 LoRA 的性能。

原作者: Brandon Hsu, Daniel Beaglehole, Adityanarayanan Radhakrishnan, Mikhail Belkin

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Brandon Hsu, Daniel Beaglehole, Adityanarayanan Radhakrishnan, Mikhail Belkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)如同一支庞大且才华横溢的管弦乐队。每当它演奏一个音符(生成一个词)时,都是在遵循由训练过程写就的复杂乐谱。有时,你希望乐队演奏出某种特定风格——比如数学问题的“爵士乐”版本,或新闻文章的“悲伤”版本。

旧方法:固定音量旋钮
此前,研究人员使用一种称为**线性激活导向(Linear Activation Steering, LAS)**的技术。这就像为整支乐队配备了一个单一的、固定的音量旋钮。如果你想让音乐听起来更“爵士化”,只需将旋钮按固定幅度调大。

  • 问题所在:这个旋钮是“上下文盲”的。无论乐队正在演奏轻柔的摇篮曲还是喧闹的摇滚乐,它都以相同的方式调大音量。
    • 如果歌曲本身已经很大声,调大旋钮会让声音震耳欲聋(过度导向)。
    • 如果歌曲很安静,同样的调节幅度可能不足以让人听出爵士风味(导向不足)。
    • 为了找到最佳设置,你必须手动测试该旋钮数千次,这既缓慢又昂贵。

新方法:智能指挥家(CLAS)
本文介绍了上下文线性激活导向(Contextual Linear Activation Steering, CLAS)。CLAS 不再使用单一且愚钝的音量旋钮,而是赋予乐队一位智能指挥家,他能实时聆听音乐。

以下是其工作原理,辅以简单类比:

1. “感知”向量(指挥家的耳朵)

在旧方法中,导向强度是一个固定数值(如同静态音量设置)。而在 CLAS 中,系统学习一个**“感知向量”**。

  • 类比:想象指挥家拥有特殊的耳朵,能聆听当前演奏的音符以及房间的氛围。
  • 工作原理:系统观察模型当前的状态(即“上下文”),并询问:“这一特定时刻需要多少导向?”
  • 结果:如果模型本身已略显“爵士乐手”特质,指挥家便施加微小的推动;如果模型表现得像“古典乐手”,指挥家则施加强劲的推力。导向强度每秒都在动态变化。

2. “导向”向量(乐谱)

本文仍使用相同的“方向”来引导模型(即“爵士”方向)。

  • 类比:这就是告诉乐队演奏什么的乐谱。本文使用一种名为**递归特征机(Recursive Feature Machine, RFM)**的方法来寻找这一方向。
  • 创新点:本文不仅找到了方向,还根据当前发生的情况,计算出应沿该方向施加多大的推力。

3. 训练过程(排练)

他们如何训练这位指挥家?

  • 旧方法(LAS):你必须生成数千首乐曲,聆听它们,并手动猜测哪个音量旋钮设置效果最佳。这就像反复转动收音机调谐旋钮,直到消除杂音。
  • 新方法(CLAS):你给指挥家提供一小组示例(提示及其期望答案)。指挥家学会自动调整音量以最小化误差,就像学生通过聆听老师指导来学习演奏乐器一样。这种方法速度快得多,且所需数据更少。

他们发现了什么?

研究人员在四个不同的模型上,针对 11 项不同任务(如解决数学问题、翻译语言或编写代码)测试了这位“智能指挥家”。

  • 性能更优:CLAS 始终优于旧的“固定旋钮”方法。它更准确,且在上下文变化时不会破坏模型。
  • 超越重量级选手:它达到甚至超越了更复杂的方法(如LoRAReFT,这些方法如同为每首新歌重写整支乐队的乐谱)的表现。CLAS 仅需对模型进行更少的修改即可实现这一点。
  • 速度:由于无需进行数千次猜测与测试,CLAS 的部署速度显著更快。
  • 可解释性:模型学习的“方向”依然清晰且可理解(不同于某些黑盒方法)。你仍然可以看到模型正倾向于何种概念。

核心结论

CLAS 就像是从手动固定音量的收音机升级为智能自适应音响系统。它不仅仅是将模型推向某个方向,而是根据模型当前的行为,施加恰到好处的推力。这使得它成为一种强大、快速且可靠的方法,用于教导 AI 模型掌握新行为,而无需海量数据或昂贵的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →