← 最新论文
📊 statistics

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

本文介绍了局部多向修正(LoMC),这是一种支持门控干预框架,通过在紧凑且识别出的编辑支持内聚合原型修正方向,有效地抑制了路由基础模型的拒绝行为,从而在保持通用能力的同时增强了非拒绝响应。

原作者: Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、训练有素的机器人助手。这个机器人的设计初衷是提供帮助,但也非常谨慎;它有一个“安全开关”,会让它拒绝回答危险或不当的问题。

然而,有时这个安全开关会变得过于敏感。机器人可能会仅仅因为问题听起来有点像那些危险的问题,就拒绝回答一些无害的问题;或者当遇到一些其实很安全但有些刁钻的问题时,它可能会感到困惑。

这篇论文的作者想要解决这个问题。他们希望教会机器人不要轻易说“我不能做那个”,以免在面对无害问题时表现得过于保守,同时又不让它忘记如何保持聪明,也不要完全关闭它的安全开关。

以下是他们是如何做到的,我们使用一个简单的类比:

问题所在:“全或无”的方法

他们研究的机器人(被称为“路由基础模型”,Routed Foundation Model)就像一个庞大的专家团队。当你问一个问题时,机器人并不会动用整个大脑;它会从一个巨大的资源池中挑选出几个特定的“专家”来处理这项工作。

以往的方法试图解决拒绝问题的方式有两种,但两者都有缺陷:

  1. “蛮力”法: 他们试图将机器人的整个大脑推向一个新的方向,以停止拒绝行为。类比: 想象一下,你想修复书中的一个特定错别字,却试图通过重写整座图书馆来实现。这确实有效,但你可能会不小心改变其他优秀故事的含义(机器人失去了它的通用智能)。
  2. “挑剔”法: 他们试图只触碰那些处理拒绝行为的特定专家。类比: 想象一下,你想修理水管的一个漏水点,于是只拧紧了一个特定的螺栓。这很精确,但如果漏水实际上是由许多螺栓产生的复杂压力共同导致的,那么仅仅拧紧一个并不能解决整个问题。

解决方案:LoMC(局部多向修正)

他们创造了一种名为 LoMC 的新方法。可以将其视为一种结合了两者优点的两步走“外科手术式”修复。

第一步:寻找精确位置(“支持”)
首先,系统会扫描机器人的大脑,以确定究竟是哪些专家(experts)负责了“我不做那个”的行为。

  • 类比: 想象一名侦探正在观察犯罪现场。侦探并没有逮捕整个社区,而是识别出了参与该事件的精确三个人。他们给其他人贴上了“请勿打扰”的标签,只专注于这三个人。这保证了其余的社区(机器人的通用智能)是安全且不受干扰的。

第二步:多功能工具修正
一旦知道在哪里进行修复,他们就不再只使用一种工具。他们意识到,“拒绝”行为是复杂的,且来自不同的角度。因此,他们收集了多种不同的“修正方向”(就像工具箱里的不同工具),并将它们混合在一起,以创造出完美的修复方案。

  • 类比: 想象那三位专家很固执。侦探不再只是从左边推他们(一个方向),而是使用一个由四个人组成的团队,从稍微不同的角度进行推挤,从而温柔地引导他们进入一种新的思维模式。

神奇的门控机制
这是聪明之处:尽管他们使用的是复杂的、多角度的推挤,但他们只将这种力量应用于第一步中所识别出的那三位专家。

  • 类比: 这就像是在软管上安装了一个特殊的过滤器。水流(修正力量)非常强大且来自多个角度,但过滤器确保它喷洒在那些需要浇水的植物上。花园的其他部分则保持干燥且不受影响。

结果

作者在四种不同类型的先进机器人助手(包括纯文本和具备视觉能力的助手)上进行了测试。

  • 目标: 他们希望提高“目标合规率”(即机器人回答其应回答的问题的频率),而不降低“通用能力平均值”(即它在其他任务上的聪明程度)。
  • 结果: LoMC 是明显的赢家。它成功地教会了机器人停止拒绝无害的问题(在某些情况下,将回答率从约 8% 提高到了 96% 以上),同时几乎完全保留了它们的通用智能。
  • 对比: 旧的“蛮力”法虽然让机器人更擅长回答问题,但也让它们在其他任务上变得健忘或笨拙。旧的“挑剔”法则显得过于微弱,无法解决问题。LoMC 兼得了两者之长:高回答率且保留了智能。

总结

这篇论文介绍了一种对 AI 模型进行外科手术式调整的方法。他们不再是破解整个系统或猜测要修复哪一部分,而是:

  1. 定位导致 AI 过度拒绝的那些极其微小的部分。
  2. 应用一种精密的、多角度的修正,且仅针对这些部分。
  3. 保护AI 大脑的其余部分不受任何改变。

这使得 AI 变得更加乐于助人且不再那么“神经质”,同时又不会丢失其通用智能。作者强调,这是一种研究审计这些模型运作方式的方法,旨在确保其稳健性,而不是一种让它们忽略危险任务安全规则的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →