← 最新论文
🤖 AI

Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions

本文介绍了门控裁剪注意力增量(GCAD),这是一种新颖的激活引导方法,它通过从系统提示对自注意力的贡献中提取并门控引导信号,来减轻有状态对话中的键值缓存污染,从而在保持角色控制的同时显著提升长程连贯性。

原作者: Diancheng Kang, Zheyuan Liu, Ningshan Ma, Yue Huang, Zhaoxuan Tan, Meng Jiang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Diancheng Kang, Zheyuan Liu, Ningshan Ma, Yue Huang, Zhaoxuan Tan, Meng Jiang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个非常聪明但有点固执的机器人扮演某个特定角色——比如一个脾气暴躁的海盗,或者一个过分礼貌的骑士。你希望这个机器人能在漫长的对话中始终保持角色设定,而不仅仅是在单句话中做到这一点。

本文探讨了一个问题:当前“引导”这些人工智能模型的方法往往在几轮对话后就失效了。作者提出了一种名为GCAD(门控裁剪注意力 - 增量)的新方法,通过改变“在哪里”以及“如何”微调机器人的“大脑”来解决这一问题。

以下是使用简单类比进行的分解说明:

问题:“回声室”效应

将标准的人工智能对话想象成在一个拥有巨大回声的房间里玩传声筒游戏。

  1. 旧方法(残差流引导):想象你想让机器人变得“邪恶”。旧方法会在机器人说的每一个词之后,将一个巨大而沉重的“邪恶”推力强行塞入机器人的大脑。
  2. 故障:机器人将这个“邪恶”推力写入其记忆(称为KV 缓存)。在下一轮中,机器人读取自己的记忆,看到自己刚刚写下的“邪恶”推力,并在其之上再叠加一个“邪恶”推力。
  3. 结果:这就像对着一个连接到扬声器、而扬声器又连接到麦克风的麦克风大喊。那个“邪恶”信号变得越来越响亮,但机器人开始胡言乱语。由于信号过于强烈且重复,淹没了实际的对话内容,机器人失去了清晰思考的能力(连贯性)。它变成了一个毫无意义的、不断重复“邪恶”的坏唱片。

解决方案:GCAD(“智能过滤器”)

作者意识到,与其将巨大的推力强行塞入机器人的通用记忆中,不如采取更精准的手术式方法。他们研究了机器人如何处理原始指令(即“系统提示”),并构建了一种模仿该自然过程的方法。

GCAD 通过三个巧妙的步骤运作:

1. “裁剪”镜头(不听回声)

  • 类比:想象你想从老师那里学习舞蹈。旧方法让你同时看着老师你在镜子里的倒影,然后试图同时模仿两者。这让人困惑。
  • GCAD 的修正:GCAD 只关注老师(原始系统提示),而忽略倒影(机器人自己之前的回答)。它严格从老师的指令中提取“舞蹈动作”(引导信号),确保不会意外地将自己的错误复制回系统中。

2. “注意力”焦点(魔法发生的地方)

  • 类比:机器人的大脑有不同的部门。旧方法将“邪恶”推力塞入机器人撰写句子的最终部门。GCAD 意识到真正的魔法发生在更早的地方,即在注意力部门,那里是机器人决定关注什么的地方。
  • GCAD 的修正:GCAD 不是在最后时刻强行推动,而是在机器人决定关注点的那一刻注入推力。这是一种更自然的影响机器人的方式,类似于人类通过专注于某个特定想法来改变主意,而不是在最后一秒被迫说出某些话。

3. “门控”(仅在合理时微调)

  • 类比:想象俱乐部门口的保安。旧方法试图将“邪恶”氛围强加给每一个进门的人,即使他们只是来买苏打水的。
  • GCAD 的修正:GCAD 使用一个。它会检查:“这个特定的词或句子此刻真的需要变得‘邪恶’吗?”
    • 如果机器人正在说“你好”,门保持关闭(不施加推力)。
    • 如果机器人即将说一些刻薄的话,门打开并施加推力。
    • 这保持了对话的自然性,防止机器人听起来像个坏唱片。

结果:稳定的角色

当作者测试这种新方法时:

  • 旧方法:机器人起初表现强劲,但很快崩溃。到了第 10 轮对话时,它几乎无法连贯表达(得分从 76 降至 58),听起来像个困惑且尖叫的混乱体。
  • GCAD:机器人完美地保持了角色设定。在整个对话过程中,它始终保持“邪恶”(或礼貌,或富有创造力),同时也保持了连贯性。它没有失去理智。连贯性得分保持在高位(约 88),而且角色表现甚至随着时间推移变得更好

核心结论

该论文认为,要控制人工智能在长对话中的个性,你不应该只是越来越用力地按同一个按钮。相反,你应该倾听原始指令聚焦于大脑的正确部分,并且仅在符合上下文时施加影响

通过这样做,GCAD 阻止了“回声室”效应,使人工智能能够成为一个一致的角色,同时不丧失清晰表达的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →