← 最新论文
🤖 machine learning

High-Dimensional Random Projection for Activation Steering in Language Models

本文介绍了 HiDRA,这是一种无需训练的激活引导方法,它利用高维随机投影来捕获非线性特征子空间中的判别信号,从而在不产生显著计算开销的情况下,在控制大语言模型行为方面超越了现有的线性均值差方法。

原作者: Minh-Hieu Pham, Bach Do, Laziz Abdullaev, Tan Minh Nguyen, Khoat Than

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Minh-Hieu Pham, Bach Do, Laziz Abdullaev, Tan Minh Nguyen, Khoat Than

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一支正在演奏交响乐的庞大且复杂的管弦乐团。“激活值”(activations)就是乐手们在任何给定时刻所演奏的单个音符。研究人员发现,如果你想让乐团演奏特定的音乐风格(比如更诚实,或者相反地,更具叛逆性),你不需要重新训练整个乐团。相反,你只需要在表演过程中向指挥低声传递特定的指令,或者微调几种乐器的音量即可。这被称为激活转向(Activation Steering)

然而,目前的方法有点像仅仅通过听取整个房间内的平均音高来为钢琴调音。这种方法效果尚可,但它错失了那些让音乐真正具有独特性的微妙且复杂的和谐感。

以下是 HiDRA(用于激活转向的高维随机投影)是如何改变这一局面的,其解释非常简单:

问题所在:“扁平”的视角

目前的方法是以一种“扁平”的方式观察管弦乐团的表演。它们计算“优秀”表演与“糟糕”表演之间的平均差异。

  • 局限性: 想象一下,试图通过只看投射在平坦墙壁上的影子来描述一座 3D 雕塑。你会错过所有的深度、曲线和隐藏的细节。同样,目前的方法忽略了隐藏在模型大脑内部的复杂、非线性的信号。它们只看到了“平均”差异,忽略了定义特定行为的微妙的二阶模式。

解决方案:“魔力棱镜”(HiDRA)

作者提出了一种名为 HiDRA 的新工具。把 HiDRA 想象成一个你滑入管弦乐团乐谱前的魔力棱镜

  1. 提升视角(棱镜): HiDRA 不再以原始的扁平形式观察音符,而是将它们投影到一个更高维的多维空间中。这就像是将那张平坦的雕塑影子通过棱镜转化为完整的、立体的 3D 物体,展现出所有隐藏的曲线。
  2. 寻找隐藏信号: 在这个全新的、扩张的 3D 空间中,诚实与不诚实回答之间的微妙差异变得更加清晰且易于捕捉。旧方法中令人困惑的“噪声”现在被从“信号”中分离了出来。
  3. 进行调整: 一旦系统识别出在 3D 空间中引导音乐转向的最佳方向,它就会利用棱镜的反向过程,将这种转向转换回原始的扁平乐谱。
  4. 结果: 管弦乐团完美地演奏出新的风格,而无需学习新曲目或重新训练乐手。

为什么有效(理论依据)

该论文使用了**“叠加假设”(Superposition Hypothesis)**的概念。想象模型的脑部是一个拥挤的房间,许多不同的想法正在同时交谈,像是在同一频率上的无线电台一样相互重叠。

  • 旧方法: 试图通过提高平均噪声的音量来寻找“真相”电台。它经常会把静电噪声也一并调大。
  • HiDRA: 使用棱镜来分离这些重叠的无线电台。它能找到那个“真相”信号最强的特定“频率”(或数学方向),即使该信号此前一直隐藏在静电噪声之中。

他们测试了什么

研究人员在三个不同的任务上测试了这个“魔力棱镜”:

  1. 越狱(Jailbreaking): 尝试让模型忽略安全规则。HiDRA 在让模型顺从这些请求方面比旧方法表现得更好。
  2. 诚实性(Truthfulness): 尝试让模型说实话。HiDRA 使模型变得更准确、更有信息量,同时不会让它听起来像个机器人或失去优美的文笔。
  3. 多项选择题: 尝试引导模型朝着特定的答案进行转向。与之前的技术相比,HiDRA 在推动模型走向正确答案(或远离错误答案)方面更加精准。

缺陷(局限性)

论文指出,虽然 HiDRA 功能强大,但在表演过程中运行棱镜效应确实需要更多的“肌肉”(计算能力)。这是一个为了获得更好控制而付出的微小代价,但它确实增加了计算机的一点额外工作量。

核心结论

HiDRA 是一个用于控制 AI 的聪明且“即插即用”的升级方案。它不需要重新训练 AI 或改变其架构。它仅仅是增加了一个数学透镜,让我们能够更清晰地观察并控制 AI 的行为,捕捉到以往方法因盲目而无法察觉的微妙信号。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →