想象一个大型语言模型(LLM)是一座庞大而繁忙的火车站。在这个车站内部,成千上万的列车(数据路径)不断运行,承载着信息以决定人工智能接下来要说什么。通常,这些列车以复杂的方式合并与分叉,而人工智能的“道德罗盘”仅仅是它曾经阅读过的各种观点的模糊混合体。
有时,我们希望人工智能像一个严格的规则遵循者(义务论)那样行动;有时,我们又希望它像一个“最大多数人的最大利益”计算器(功利主义)那样行动。问题在于,当前改变人工智能想法的方法,就像在扩音器上大喊指令,或是试图用一根巨大而粗糙的杠杆来操控整个火车站。这种方法不精确,常常破坏其他功能,而且你永远无法确切知道人工智能在多大程度上听从了指令。
本文介绍了一种全新的、外科手术式的方法来引导人工智能的道德推理,称为收敛 - 发散路由(Convergent-Divergent Routing, CDR)。其工作原理分解为以下步骤:
1. 寻找“切换点”(分支点)
研究人员发现,在人工智能的“大脑”内部,存在一些特定的位置,“规则遵循者”列车轨道与“计算器”列车轨道在此并行一段距离,随后分叉。
- 类比:想象一条高速公路,前往“纽约”的车辆和前往“波士顿”的车辆在一段时间内共用相同的车道。随后,它们到达一个特定的出口匝道,道路在此分叉。
- 创新之处:研究人员没有试图操控整条高速公路,而是找到了人工智能层级中这些精确的分叉点。他们将这些点称为“分支点”。
2. “守门人”策略(二元控制)
一旦找到分叉点,他们就安装了一个简单的闸门。
- 类比:如果你希望人工智能成为一个“规则遵循者”,他们只需在分叉点关闭通往“计算器”道路的闸门。“规则遵循者”列车继续前行,而“计算器”列车则被阻挡,无法进入该特定路段。
- 结果:仅此一项就产生了惊人的效果。通过仅仅阻断不需要的路径,人工智能自然地开始按照预期的道德框架进行思考,而无需重新训练整个模型。
3. “微调旋钮”(双 Logit 校准)
阻断道路对于简单的“是/否”选择很有效,但如果你希望人工智能 70% 是规则遵循者,30% 是计算器呢?
- 类比:想象人工智能的思想是两种颜色的混合:蓝色(规则)和黄色(后果)。
- 以前的方法试图加入一大桶蓝色颜料,这往往使整个混合物变成一种浑浊、不可预测的颜色。
- 本文使用了一个精确的混合旋钮。他们识别出人工智能大脑中的两个特定“方向”(如同两个独立的旋钮),分别控制蓝色和黄色的量。
- 他们使用一个数学公式(称为双 Logit 校准)来微调这些旋钮,使最终颜色精确匹配用户的要求(例如,70% 蓝色,30% 黄色)。
4. 为什么这更好
- 精确性:这就像使用手术刀而不是大锤。他们只触碰那些正在进行道德决策的特定线路,而人工智能大脑的其他部分(其进行数学运算、写诗或回答常识问题的能力)完全不受影响。
- 可预测性:使用旧方法时,转动一个“旋钮”可能会导致人工智能失控或停止工作。而使用这种方法,如果你要求 50% 的某种风格,你就会得到精确的 50%。这是一种可靠且经过校准的控制。
- 无需重新训练:他们不需要教人工智能新事物。他们只是在人工智能运行时微调其内部齿轮。
核心结论
研究人员在现实生活中的道德困境(如著名的“电车难题”或日常伦理选择)上测试了这种方法。他们发现,该方法可以可靠地使人工智能从严格的基于规则的视角或基于后果的视角进行论证,甚至可以按照用户想要的任何比例混合这两种视角。关键在于,人工智能并没有失去执行其他任务的能力;它只是成为了一个能够按指令切换道德“人格”的大师。
简而言之:他们找到了人工智能大脑中道德哲学发生分叉的确切开关,并构建了一个精确的遥控器,可以将人工智能引导至你希望的具体伦理观点,而不会破坏其他任何功能。
技术摘要:路径分岔之处:大语言模型中道德推理的局部化与校准控制
问题陈述
随着大语言模型(LLMs)从被动的聊天机器人转变为主动的智能体和社会模拟器,对其伦理行为进行控制的需求也随之演变。现有的模型行为引导方法,如提示工程或添加标量引导向量,往往缺乏可解释性和校准保证。具体而言,引导系数的有效范围尚不明确,导致模型对目标伦理视角的遵循程度难以预测。作者认为,有效的道德引导需要既局部化(仅在伦理框架在网络内部竞争的特定位置进行编辑)又校准化(通过有界的偏好权重产生可预测的效果)的干预措施。本文聚焦于伦理框架中的经典对立项:义务论(基于规则的道德责任)与功利主义(基于后果的产出),这两者在道德困境中往往产生相互冲突的指令。
方法论
所提出的方法称为收敛 - 发散路由(CDR),它在推理阶段运行,无需对模型进行微调。该方法包含两个主要阶段:
1. 收敛 - 发散路由(CDR)与二元控制
核心假设是,伦理框架在 Transformer 块内部特定的“分岔点”处展开竞争,这些位置是路径先汇聚随后发散的地方。
- 分岔点识别:该方法识别注意力头在伦理框架间共享(收敛),但随后的前馈网络(FFN)单元发生发散(diverge)的层。
- 注意力头:在注意力头的表示上训练线性探针以预测伦理框架标签。具有高预测性能的头被标记为相关。
- FFN 向量:作者识别出与从指示词(如“义务论”)推导出的特定伦理方向对齐的 FFN 向量(上投影矩阵的列)。
- 门控机制:在识别出的分岔点处,该方法门控(阻断)从共享注意力头到非目标 FFN 单元的流。这阻止了来自共享头的信号传播到非目标伦理框架的下游单元,同时保持上游计算完整。
- 二元控制:仅凭这种门控机制即可充当二元开关,在不进行显式提示的情况下显著提升目标框架的推理能力,有效地使模型的输出极化。
2. 通过双重 Logit 校准实现细粒度控制
为了实现连续且校准的控制,而不仅仅是二元切换,作者引入了一个两阶段过程:
- 成对方向提取:利用在二元控制下(即抑制一个框架)获得的残差流,作者应用公共空间模式(CSP),这是一种从脑电图(EEG)信号处理中借鉴的技术。CSP 通过最大化两类之间的方差比并抑制共享方差,为每个分岔点层隔离出判别性方向(u(l) 代表功利主义,d(l) 代表义务论)。
- 双重 Logit 校准(DLC):这是一种应用于解码步骤残差流的闭式、最小-ℓ2-范数更新。
- 该方法基于残差流在提取方向上的投影,定义方向性 Logits。
- 它求解一个优化问题,以找到更新量 Δht(l),在最小化编辑范数的同时,强制生成的方向性投影与用户指定的偏好权重 (αU,αD) 对齐,其中 αU+αD=1。
- 这用 1-单纯形上的有界偏好权重取代了先前引导方法中使用的无界标量系数,从而确保了可解释性和可预测性。
主要贡献
- 局部化干预:本文提出了一种机械主义的道德引导方法,针对特定的“分岔点”(共享注意力头发散为不同的 FFN 单元),而非应用全局向量加法。
- 校准控制:通过适配 CSP 并引入双重 Logit 校准,该方法实现了细粒度控制,模型的伦理倾向可连续调整以匹配用户指定的权重 (αU,αD)。
- 可解释性:该方法提供了伦理推理如何被操纵的清晰机制,将框架间的竞争追溯至特定的架构组件。
- 通用能力的保留:编辑的局部性确保了通用语言能力(如常识问答、数学、翻译)在很大程度上得以保留,这与某些会损害性能的全局引导方法不同。
实验结果
该方法在真实世界的道德困境(AITA 数据集)上进行了评估,使用了 LLaMA-2-7B-Chat、Vicuna-7B-v1.5 和 Yi-1.5-6B-Chat 模型。
- 二元控制:该方法成功地将模型行为极化至目标框架。例如,在 LLaMA 上,设置 αU=1(纯功利主义)将功利主义输出率从约 62% 的基线提升至约 84%,而设置 αU=0 则将其降至约 20%。
- 细粒度校准:该方法展示了输入偏好权重 αU 与观察到的功利主义倾向(Uop)之间近乎单调的关系。目标比率与观察比率之间的平均绝对误差(MAE)显著低于基线(仅提示、Top-K 头引导和最佳层后 FFN 比率引导),偏差通常控制在 5 个百分点以内。
- 消融研究:
- 用其他方向提取方法(cPCA、PLS-DA)替换 CSP 会导致更高的校准误差。
- 移除门控机制(阻断)显著降低了模型区分高和低偏好权重的能力,特别是在 Vicuna 模型上。
- 仅在单层进行引导(不使用完整的分岔点逻辑)的效果不如完整的 CDR 流程。
- 通用能力:在 GSM8K、TriviaQA 和翻译任务上的评估显示,在大多数设置下通用能力的退化微乎其微,仅在某些模型的极端偏好权重下有轻微下降。
- 人工评估:人工标注者确认,模型的论证始终与其声明的伦理框架一致(LLaMA 的准确率为 0.81,Vicuna 为 0.85)。
意义与主张
作者声称,他们的工作提供了一种可靠、可解释且经过校准的机制,用于在推理阶段将大语言模型引导至特定的伦理框架。其意义在于:
- 超越了“黑盒”引导向量,转向对 Transformer 中伦理推理在哪里以及如何被处理的机械主义理解。
- 提供了一种校准控制方案,其中伦理对齐的程度是可预测且有界的,解决了先前工作中标量系数的不确定性问题。
- 证明了局部化编辑可以在不广泛扰动模型通用智能的情况下,改变高层推理立场。
本文总结道,虽然目前的焦点集中在义务论与功利主义的二元轴上,但收敛 - 发散路由框架为未来探索更多元化的价值体系和复杂的道德光谱提供了一条途径。作者强调了负责任使用和透明度的重要性,指出引导伦理立场的能力在高风险应用中存在选择性框架的风险。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。