← 最新论文
💬 NLP

Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features

本文介绍了控制强化学习(CRL),这是一个通过训练策略在词元层面动态选择并放大可解释的稀疏自编码器特征以引导大语言模型输出的框架,从而提供逐词干预日志,并在各类基准测试中为模型行为提供新的机制性见解。

原作者: Seonglae Cho, Zekun Wu, Adriano Koshiyama

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Seonglae Cho, Zekun Wu, Adriano Koshiyama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(就像驱动本次对话的模型)是一个庞大而复杂的管弦乐团。在这个乐团内部,成千上万名乐手(神经元)同时演奏。有时,他们演奏出美妙的交响乐;但其他时候,他们会感到困惑,演奏出错误的音符,从而导致幻觉或糟糕的回答。

长期以来,科学家们一直试图通过聆听音乐并猜测哪些乐器在演奏来理解这个乐团。他们发现了“稀疏自编码器”(SAE),它就像一个超级强大的音响工程师。SAE 能够将音乐分解为独立的、有名称的音轨:“数学音轨”、“安全音轨”、“语法音轨”等等。

问题:
知道哪些音轨正在播放是不够的。仅仅因为“数学音轨”处于激活状态,并不意味着调高它的音量就能解决数学问题。有时,调高某个音轨反而会使情况恶化。以往的方法只能告诉你什么正在播放,却无法告诉你如果改变音量会发生什么

解决方案:控制强化学习(CRL)
这篇论文介绍了一种名为控制强化学习(CRL)的新方法。可以将 CRL 想象为聘请了一位聪明的指挥家,他在演出期间直接站在乐团旁边。

以下是其逐步工作原理:

1. 指挥家的工作(策略)

在模型即将说出每一个词(token)时,这位指挥家都会观察乐团当前的状态。指挥家手中有一个遥控器,上面有为 SAE 识别出的每一个“音轨”(特征)设置的按钮。

  • 决策: 指挥家决定:“现在,我们需要调高‘逻辑推理’音轨”,或者“让我们降低‘情感偏见’音轨”。
  • 行动: 指挥家立即针对仅仅那一个词调整该特定音轨的音量。

2. 通过实践学习(强化学习)

指挥家起初并不知道规则。他们通过玩游戏来学习:

  • 如果乐团演奏出正确的答案,指挥家就会获得“奖励”(积分)。
  • 如果乐团演奏出错误的答案,指挥家则得不到积分。
  • 随着时间的推移,指挥家学会了在何时提升哪些音轨,以获得最佳结果。

3. “自适应掩码”(防止坏习惯)

一位聪明的指挥家可能会变得懒惰,只是对每个问题都反复调高同一个“数学音轨”。为了阻止这种情况,论文使用了一种称为自适应特征掩码的技巧。

  • 想象指挥家有一条规则:“除非你先尝试了其他乐器,否则你不能连续两次使用同一种乐器。”
  • 这迫使指挥家探索乐团的不同部分,发现解决问题的新方法,而不是依赖单一的技巧。

4. “日志簿”(可解释性)

这是该论文最大的突破。由于指挥家为每一个词都做出了具体的选择,我们获得了一份整个演出的详细日志簿

  • 我们可以回顾并说:“啊,在第 5 个词时,指挥家调高了‘安全’音轨,这阻止了模型说出粗鲁的话。”
  • 我们可以确切地看到模型成功或失败的原因。这就像拥有了指挥家对每一个演奏音符的内心独白记录。

他们发现了什么?

通过在名为 Gemma 2 的模型上使用这种方法,研究人员发现了一些有趣的现象:

  • 早期层与晚期层: 乐团有不同的声部。“早期”声部(层)处理语法和结构(如标点和句子流畅度)。“晚期”声部处理深层含义和逻辑。论文发现,要解决数学问题,通常需要调整承载逻辑的“晚期”声部,而不仅仅是形成词语的“早期”声部。
  • “分支点”: 有时,两个非常相似的问题需要完全不同的指挥家动作才能获得正确答案。该系统可以精确定位正确与错误答案之间路径分叉的确切时刻。
  • 安全与偏见: 系统学到,纠正“偏见”(不公平)和纠正“安全”(拒绝有害请求)需要不同的策略。对于某些任务,指挥家需要非常具体;而对于其他任务,它需要探索许多不同的音轨。

结果

该论文在多种挑战中测试了这种方法:

  • 数学(GSM8K): 指挥家通过提升正确的逻辑音轨,帮助模型解决了更多的数学问题。
  • 安全(HarmBench): 模型在拒绝做有害事情方面表现得更好,而不会过度谨慎。
  • 知识(MMLU): 模型对常识性问题的回答更加准确。

总结:
这篇论文不仅告诉我们 AI 在想什么;它还提供了一种工具,可以实时引导AI 的思维,逐词进行。它将一个“黑盒”变成了一个透明的机器,我们可以确切地看到为了获得正确答案,内部哪些开关被切换了。这就像赋予人类一个遥控器,来引导 AI 的内部思维,确保它走在正确的道路上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →