✨ 要点🔬 技术摘要
想象一下,将大型语言模型(LLM)视为一支正在演奏交响乐的庞大且复杂的管弦乐团。“激活值”(activations)就是乐手们在任何给定时刻所演奏的单个音符。研究人员发现,如果你想让乐团演奏特定的音乐风格(比如更诚实,或者相反地,更具叛逆性),你不需要重新训练整个乐团。相反,你只需要在表演过程中向指挥低声传递特定的指令,或者微调几种乐器的音量即可。这被称为激活转向(Activation Steering) 。
然而,目前的方法有点像仅仅通过听取整个房间内的平均音高来为钢琴调音。这种方法效果尚可,但它错失了那些让音乐真正具有独特性的微妙且复杂的和谐感。
以下是 HiDRA (用于激活转向的高维随机投影)是如何改变这一局面的,其解释非常简单:
问题所在:“扁平”的视角
目前的方法是以一种“扁平”的方式观察管弦乐团的表演。它们计算“优秀”表演与“糟糕”表演之间的平均差异。
局限性: 想象一下,试图通过只看投射在平坦墙壁上的影子来描述一座 3D 雕塑。你会错过所有的深度、曲线和隐藏的细节。同样,目前的方法忽略了隐藏在模型大脑内部的复杂、非线性的信号。它们只看到了“平均”差异,忽略了定义特定行为的微妙的二阶模式。
解决方案:“魔力棱镜”(HiDRA)
作者提出了一种名为 HiDRA 的新工具。把 HiDRA 想象成一个你滑入管弦乐团乐谱前的魔力棱镜 。
提升视角(棱镜): HiDRA 不再以原始的扁平形式观察音符,而是将它们投影到一个更高维的多维空间中。这就像是将那张平坦的雕塑影子通过棱镜转化为完整的、立体的 3D 物体,展现出所有隐藏的曲线。
寻找隐藏信号: 在这个全新的、扩张的 3D 空间中,诚实与不诚实回答之间的微妙差异变得更加清晰且易于捕捉。旧方法中令人困惑的“噪声”现在被从“信号”中分离了出来。
进行调整: 一旦系统识别出在 3D 空间中引导音乐转向的最佳方向,它就会利用棱镜的反向过程,将这种转向转换回原始的扁平乐谱。
结果: 管弦乐团完美地演奏出新的风格,而无需学习新曲目或重新训练乐手。
为什么有效(理论依据)
该论文使用了**“叠加假设”(Superposition Hypothesis)**的概念。想象模型的脑部是一个拥挤的房间,许多不同的想法正在同时交谈,像是在同一频率上的无线电台一样相互重叠。
旧方法: 试图通过提高平均噪声的音量来寻找“真相”电台。它经常会把静电噪声也一并调大。
HiDRA: 使用棱镜来分离这些重叠的无线电台。它能找到那个“真相”信号最强的特定“频率”(或数学方向),即使该信号此前一直隐藏在静电噪声之中。
他们测试了什么
研究人员在三个不同的任务上测试了这个“魔力棱镜”:
越狱(Jailbreaking): 尝试让模型忽略安全规则。HiDRA 在让模型顺从这些请求方面比旧方法表现得更好。
诚实性(Truthfulness): 尝试让模型说实话。HiDRA 使模型变得更准确、更有信息量,同时不会让它听起来像个机器人或失去优美的文笔。
多项选择题: 尝试引导模型朝着特定的答案进行转向。与之前的技术相比,HiDRA 在推动模型走向正确答案(或远离错误答案)方面更加精准。
缺陷(局限性)
论文指出,虽然 HiDRA 功能强大,但在表演过程中运行棱镜效应确实需要更多的“肌肉”(计算能力)。这是一个为了获得更好控制而付出的微小代价,但它确实增加了计算机的一点额外工作量。
核心结论
HiDRA 是一个用于控制 AI 的聪明且“即插即用”的升级方案。它不需要重新训练 AI 或改变其架构。它仅仅是增加了一个数学透镜,让我们能够更清晰地观察并控制 AI 的行为,捕捉到以往方法因盲目而无法察觉的微妙信号。
技术摘要:用于语言模型激活转向的高维随机投影
问题陈述
激活转向(Activation steering)已成为在无需昂贵重训练的情况下控制大语言模型(LLMs)的主要方法。当前最先进的方法,如激活加法(Activation Addition)和方向消融(Directional Ablation),依赖于**均值差(Difference-in-Means, DiM)**向量。这些方法通过计算原始残差流中目标类与源类激活之间的线性均值差来估计转向方向。
然而,作者认为这些线性方法存在根本性的局限。在叠加假设(superposition hypothesis)下,神经网络通过在激活空间中重叠特征来编码比神经元数量更多的特征。因此,与行为相关的信号可能无法通过一阶均值偏移完全捕获。相反,判别性信号可能存在于 非线性特征子空间 或二阶统计结构(例如方差差异)中,而线性 DiM 估计器无法恢复这些信号。现有的尝试(如使用稀疏自编码器 SAE)通常表现不如线性基线,或者需要进行训练,这为寻找一种能够访问这些高阶信号且无需训练的方法留下了空白。
方法论:HiDRA
作者提出了 HiDRA(用于激活转向的高维随机投影) ,这是一个通过修改估计和应用转向方向的空间的**无需训练(training-free)**框架。
核心机制
HiDRA 通过在执行转向之前将模型激活提升到更高维的非线性空间,然后将修改后的激活投影回原始残差流来进行操作。该流水线包含三个步骤:
提升(投影): 给定第 ℓ \ell ℓ 层的激活向量 x ∈ R d x \in \mathbb{R}^d x ∈ R d ,HiDRA 应用一个高斯矩阵 A ∈ R m × d A \in \mathbb{R}^{m \times d} A ∈ R m × d (其中 m ≫ d m \gg d m ≫ d )进行的随机投影,随后接一个非线性激活函数 σ \sigma σ (默认:LeakyReLU)。x ′ = σ ( A x ) x' = \sigma(Ax) x ′ = σ ( A x ) 这将其映射到高维特征空间 H \mathcal{H} H 。
在提升空间内进行转向: 转向向量 d ( ℓ ) d^{(\ell)} d ( ℓ ) 被计算为均值差向量,但该计算是在提升后的高维空间内 使用投影后的激活完成的。d ( ℓ ) = 1 ∣ D t a r g e t ∣ ∑ t ∈ D t a r g e t x ′ ( ℓ ) ( t ) − 1 ∣ D s o u r c e ∣ ∑ t ∈ D s o u r c e x ′ ( ℓ ) ( t ) d^{(\ell)} = \frac{1}{|D_{target}|} \sum_{t \in D_{target}} x'^{(\ell)}(t) - \frac{1}{|D_{source}|} \sum_{t \in D_{source}} x'^{(\ell)}(t) d ( ℓ ) = ∣ D t a r g e t ∣ 1 t ∈ D t a r g e t ∑ x ′ ( ℓ ) ( t ) − ∣ D so u r ce ∣ 1 t ∈ D so u r ce ∑ x ′ ( ℓ ) ( t )
注入与重建: 在推理期间,将转向向量以强度 α \alpha α 添加到投影后的激活中。结果随后使用投影矩阵的伪逆 (A † A^\dagger A † ) 和非线性函数的逆 (σ − 1 \sigma^{-1} σ − 1 ) 投影回原始空间。x s t e e r e d ( ℓ ) = A † σ − 1 ( σ ( A x ( ℓ ) ) + α d ( ℓ ) ) x^{(\ell)}_{steered} = A^\dagger \sigma^{-1} \left( \sigma(Ax^{(\ell)}) + \alpha d^{(\ell)} \right) x s t eer e d ( ℓ ) = A † σ − 1 ( σ ( A x ( ℓ ) ) + α d ( ℓ ) )
理论基础
论文基于**高斯叠加模型(Gaussian superposition model)**提供了理论证明。
命题 3.1: 证明了如果特征空间可以分解为一个线性子空间和一个残差子空间,那么在特征空间中的 Fisher 比率(衡量判别能力的指标)将严格大于线性空间中的 Fisher 比率,前提是存在残差判别信号(即 v r e s ≠ 0 v_{res} \neq 0 v r es = 0 )。
定理 3.5: 证明了在高斯叠加模型下,提升空间中残差成分的范数由二阶判别信号(类间方差间隙)下界约束。这表明,带有非线性的随机投影允许线性估计器(如 DiM)捕获在原始线性空间中不可见的信号。
核心贡献
理论分析: 作者证明了在叠加假设下,行为子空间中存在二阶判别信号。他们展示了特征空间 DiM 能够证明性地捕获这些残差信号,而这些信号是标准线性均值偏移方法无法触及的。
HiDRA 框架: 他们引入了一种插件式的、无需训练的转向方法,可以无缝集成到现有流水线中。它不需要对模型进行重训练,并使用固定的、随机初始化的投影矩阵。
实证验证: 在多种不同 LLM 系列(Gemma, Llama, Qwen)和任务上的广泛实验表明,HiDRA 在保持通用模型能力的同时,一致优于基线方法。
实验结果
作者在三种不同的转向任务上评估了 HiDRA:
1. 越狱(Jailbreaking)
设置: 转向模型以顺从有害请求(使用 ADVBENCH 和 MALICIOUSINSTRUCT 等数据集)。
基线: 与 Mean-AcT(标准 DiM 转向)进行对比。
结果: HiDRA 在所有测试模型(Gemma 2, Llama 3.2, Qwen 2.5)中均实现了更高的攻击成功率(ASR)。例如,在 Gemma2-9B-IT 上,在全 Token 设置下,ASR 从 84.00%(Mean-AcT)增加到 90.00%(HiDRA)。至关重要的是,通用语言建模能力(通过 TINYBENCHMARKS 衡量)与基线相当,表明没有明显的可用性下降。
2. 真实性(Truthfulness)
设置: 使用 TRUTHFULQA 基准,转向模型生成更真实且信息丰富的响应。
结果: 与 Mean-AcT 和无转向相比,HiDRA 在 Gemma-2-2B 和 Llama-3-8B 上都提高了“真实 × \times × 信息丰富”的指标。该方法在通用基准测试上维持了性能,表明真实性的提升并非以牺牲通用能力为代价。
3. CAA 风格的多项选择问答
设置: 在多项选择设置中控制特定行为概念(如“谄媚/Sycophancy”、“幻觉/Hallucination”)的概率,并与对比激活加法(CAA)和稀疏激活转向(SAS)进行比较。
结果: HiDRA 对目标概念展现出更强的控制力。它在抑制负面属性(降低 token 概率)方面表现最好(针对所有六个测试概念),并在促进正面属性方面也表现出色(针对六个概念中的五个),优于 CAA 和 SAS。
消融实验
向量提取: 作者将 DiM 与线性判别分析(LDA)进行向量提取对比。结果表明,HiDRA 的性能增益主要源于高维投影 而非协方差调节,因为在原始空间中使用 HiDRA 配合 DiM 的表现优于 LDA。
非线性: 非线性映射的选择至关重要。虽然多项式映射(Cube, Cubic)能产生较高的 ASR,但它们会导致退化的生成结果。研究发现 LeakyReLU 和 Skip-softplus 变体是最优选择,因为它们是全局 Lipschitz 连续的,确保了在映射回残差流时能够实现稳定的扰动。
意义与主张
论文声称,HiDRA 通过利用高维随机投影的几何特性,提供了一种证明优于 传统方法的激活转向方式。
超越线性限制: 它解决了线性转向方法的局限性,通过捕获存在于激活空间非线性残差结构中的判别信号(特别是源于潜在特征叠加的信号)来解决问题。
高效性与兼容性: 与基于 SAE 的方法不同,HiDRA 是无需训练 的,也不需要学习稀疏字典。它可以作为一个“插件”,在不修改模型架构或权重的情况下,与任何现有的转向流水线结合使用。
鲁棒性: 该方法实现了更强的行为控制(更高的 ASR、更好的真实性、更精细的概念控制),且不会像其他干预方法那样带来显著的计算开销或能力下降。
作者总结道,尽管由于投影和重建步骤,HiDRA 会引入一定的推理时间计算开销,但它为解锁 LLM 中的高阶控制信号提供了一条有原则、样本高效的路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。