← 最新论文
💬 NLP

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

本文介绍了 REAL,这是一个通过在隐藏激活上训练矢量量化自编码器,以区分对齐响应与违规响应,从而识别行为相关 Transformer 模块的框架,进而实现在各种大语言模型和任务中进行更精确且更有效的推理时干预。

原作者: Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的、超级聪明的机器人大脑(大型语言模型),它被训练用来写故事、回答问题以及与你聊天。有时,你想引导这个机器人变得更诚实,或者避免它胡编乱造,但你又不想重建它的大脑或改变它的电路。这被称为“推理时转向”(inference-time steering)——即在船已经航行时尝试操纵舵柄。

问题在于?旧的转向方式有点像在瞎猜该按哪个按钮。研究人员使用简单的线索或随机猜测来寻找大脑中负责特定行为的正确部分,这往往会导致机器人变得困惑或行为怪异。

于是有了 REAL(通过读取 Transformer 激活实现精准定位)。把 REAL 想象成一个高科技侦探,它不靠猜测;它实际上是在倾听机器人内部的思想,以找到负责特定行为的具体齿轮。

这位侦探是如何工作的呢:
对于机器人大脑中的每一个微小齿轮(称为“注意力头”或“层”),REAL 都会设置一个特殊的翻译器。这个翻译器使用一个“向量量化自编码器”(一个高级分类器的术语)将机器人的思想组织成两堆:“好的、诚实的思想”和“坏的、撒谎的思想”。它使用一个共享的字典(码本)来对这些思想进行分类。

随后,REAL 会问一个简单的问题:“这个特定的齿轮在分辨真实答案与虚假答案方面表现得有多好?”如果一个齿轮非常擅长识别这种差异,REAL 就会给它高分。如果它感到困惑,分数就会很低。这个分数告诉研究人员究竟该调整哪些齿轮,以及要多大力度去推动它们。

研究人员在八个不同的机器人大脑(来自 Llama 和 Qwen 系列)以及九个不同的挑战课程(范围从让机器人说真话到处理事实冲突的棘手问题)上测试了这位侦探。

结果显示?REAL 改变了游戏规则。在试图让机器人更加诚实时,与之前的最佳方法(称为 ITI)相比,REAL 使其性能平均提升了 20%,在某些测试中甚至出现了高达 81.5% 的巨大飞跃。此外,REAL 挑选的那些齿轮由于太擅长识别真相,以至于在无需任何额外训练的情况下,在机器人未曾见过的全新场景中也能表现出色。

简而言之,与其盲目猜测应该调整机器人大脑的哪个部分,REAL 通过倾听内部的嘈杂声,将好的思想与坏的思想进行分类,并直接指向那个需要拨动的开关。这是一种更聪明、更精准的方式,用以引导这些强大的 AI 心智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →