← 最新论文
🤖 machine learning

Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

本文提出了一种名为“收敛 - 发散路由”并结合“双 Logit 校准”的方法,通过将大语言模型引导至功利主义或义务论等特定伦理框架,同时保留其通用能力,从而实现对大语言模型道德推理的细粒度、可解释控制。

原作者: Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一座庞大而繁忙的火车站。在这个车站内部,成千上万的列车(数据路径)不断运行,承载着信息以决定人工智能接下来要说什么。通常,这些列车以复杂的方式合并与分叉,而人工智能的“道德罗盘”仅仅是它曾经阅读过的各种观点的模糊混合体。

有时,我们希望人工智能像一个严格的规则遵循者(义务论)那样行动;有时,我们又希望它像一个“最大多数人的最大利益”计算器(功利主义)那样行动。问题在于,当前改变人工智能想法的方法,就像在扩音器上大喊指令,或是试图用一根巨大而粗糙的杠杆来操控整个火车站。这种方法不精确,常常破坏其他功能,而且你永远无法确切知道人工智能在多大程度上听从了指令。

本文介绍了一种全新的、外科手术式的方法来引导人工智能的道德推理,称为收敛 - 发散路由(Convergent-Divergent Routing, CDR)。其工作原理分解为以下步骤:

1. 寻找“切换点”(分支点)

研究人员发现,在人工智能的“大脑”内部,存在一些特定的位置,“规则遵循者”列车轨道与“计算器”列车轨道在此并行一段距离,随后分叉

  • 类比:想象一条高速公路,前往“纽约”的车辆和前往“波士顿”的车辆在一段时间内共用相同的车道。随后,它们到达一个特定的出口匝道,道路在此分叉。
  • 创新之处:研究人员没有试图操控整条高速公路,而是找到了人工智能层级中这些精确的分叉点。他们将这些点称为“分支点”。

2. “守门人”策略(二元控制)

一旦找到分叉点,他们就安装了一个简单的闸门。

  • 类比:如果你希望人工智能成为一个“规则遵循者”,他们只需在分叉点关闭通往“计算器”道路的闸门。“规则遵循者”列车继续前行,而“计算器”列车则被阻挡,无法进入该特定路段。
  • 结果:仅此一项就产生了惊人的效果。通过仅仅阻断不需要的路径,人工智能自然地开始按照预期的道德框架进行思考,而无需重新训练整个模型。

3. “微调旋钮”(双 Logit 校准)

阻断道路对于简单的“是/否”选择很有效,但如果你希望人工智能 70% 是规则遵循者,30% 是计算器呢?

  • 类比:想象人工智能的思想是两种颜色的混合:蓝色(规则)和黄色(后果)。
    • 以前的方法试图加入一大桶蓝色颜料,这往往使整个混合物变成一种浑浊、不可预测的颜色。
    • 本文使用了一个精确的混合旋钮。他们识别出人工智能大脑中的两个特定“方向”(如同两个独立的旋钮),分别控制蓝色和黄色的量。
    • 他们使用一个数学公式(称为双 Logit 校准)来微调这些旋钮,使最终颜色精确匹配用户的要求(例如,70% 蓝色,30% 黄色)。

4. 为什么这更好

  • 精确性:这就像使用手术刀而不是大锤。他们只触碰那些正在进行道德决策的特定线路,而人工智能大脑的其他部分(其进行数学运算、写诗或回答常识问题的能力)完全不受影响。
  • 可预测性:使用旧方法时,转动一个“旋钮”可能会导致人工智能失控或停止工作。而使用这种方法,如果你要求 50% 的某种风格,你就会得到精确的 50%。这是一种可靠且经过校准的控制。
  • 无需重新训练:他们不需要教人工智能新事物。他们只是在人工智能运行时微调其内部齿轮。

核心结论

研究人员在现实生活中的道德困境(如著名的“电车难题”或日常伦理选择)上测试了这种方法。他们发现,该方法可以可靠地使人工智能从严格的基于规则的视角或基于后果的视角进行论证,甚至可以按照用户想要的任何比例混合这两种视角。关键在于,人工智能并没有失去执行其他任务的能力;它只是成为了一个能够按指令切换道德“人格”的大师。

简而言之:他们找到了人工智能大脑中道德哲学发生分叉的确切开关,并构建了一个精确的遥控器,可以将人工智能引导至你希望的具体伦理观点,而不会破坏其他任何功能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →