← 最新论文
🤖 machine learning

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

该论文提出了 DualSelect,一个耦合框架,通过共同选择兼容的任务样本和更新的安全参考,在不牺牲任务效用的情况下,在大型语言模型微调过程中保留安全性行为。

原作者: Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常礼貌、举止得体的机器人助手(一个大语言模型,或称 LLM),它经过了“安全对齐”训练,被教导永远不要说任何恶意、危险或非法的话。

现在,你想教这个机器人一项新技能,比如解决数学问题或编写代码。这被称为“微调”。问题在于,当你教它这些新技能时,机器人可能会意外地忘记它的礼貌。它可能会在解决数学问题时给出危险的建议,或者变得过于痴迷于“提供帮助”而忽略了安全规则。

论文 《双人舞:耦合任务—参考选择》(Two to Tango: Coupled Task–Reference Selection) 提出了一种新的方法来教这个机器人,使其在学习新技能的同时,不会丢失其安全礼仪。

以下是他们想法的简单拆解:

1. 问题:“一刀切”的错误

以往的方法试图通过向机器人展示一组固定的“优秀范例”(就像一本静态的安全手册)来保持其安全性,每当它学习新事物时都是如此。

  • 缺陷: 想象一下你正在教一名学生。如果你无论是在教他烹饪、开车还是做化学实验时,都向他展示同样的安全规则(例如“不要触摸火”),那么这种方法效果并不好。
    • 当学习化学时,特定的危险是“不要混合错误的化学物质”。
    • 当学习驾驶时,危险是“不要闯红灯”。
    • 一个通用的安全手册会错过这些特定的、活跃的危险。这在论文中被称为“不匹配”。机器人学会了新技能,却忽略了与该技能相关的特定安全规则。

2. 解决方案: “探戈”(DualSelect)

作者提出了一种名为 DualSelect 的方法。他们使用了探戈的比喻:两个舞伴(新任务和安全参考)必须共同起舞,而不是各自行动。

DualSelect 不再使用静态的安全手册,而是针对每一个新课程同时执行两件事:

  • 步骤 A:寻找合适的安全舞伴(参考选择)
    在教授新技能之前,系统会查看具体的课程,并询问:“在这个特定的课程中,哪些特定的安全规则最容易被违反?”

    • 如果课程是关于编程,它会挑选关于“不要编写窃取数据的代码”的安全范例。
    • 如果课程是关于医疗建议,它会挑选关于“不要给出危险剂量指示”的范例。
    • 它会挑选那些与新任务最“冲突”的安全范例,从而有效地凸显出特定的危险区域。
  • 步骤 B:挑选合适的学生(任务选择)
    一旦知道了哪些安全规则很重要,它就会查看新的课程数据。它会过滤掉那些会导致机器人违反这些特定安全规则的例子。它只保留那些能很好地符合所选安全规则的“安全”例子。

  • 步骤 C:修正(“方向盘”)
    即使在挑选了好的例子之后,机器人仍可能发生偏移。因此,DualSelect 添加了一个“修正”步骤。它获取梯度(机器人想要移动的方向),并将其轻轻地引导回它刚刚识别出的安全方向。这就像一个 GPS,它会说:“你正朝着悬崖行驶;让我们稍微向左转,以保持在安全的道路上。”

3. 它是如何运作的(“极小化-极大化”之舞)

论文在数学上将其描述为一个“极小化-极大化”(min-max)游戏:

  • 极大化者(安全): 试图找到在这一特定课程中,最难保持安全的安全范例。(它暴露弱点)。
  • 极小化者(任务): 试图找到在不违反这些特定安全规则的情况下,最容易学习的课程范例。
  • 结果: 他们在中间汇合。机器人使用仅遵循该任务特定安全约束的数据来学习任务。

4. 结果

作者在不同的机器人规模(从小型到大型)上进行了测试,使用了数学和通用指令数据集。

  • 安全性: 机器人比以往的方法更好地保持了其安全礼仪。它不会仅仅因为在学习数学就忘记了如何保持安全。
  • 效用性: 机器人不会变得“愚笨”或拒绝回答无害的问题(这是一个被称为“过度拒绝”的问题)。它仍然能很好地学习新技能。
  • 效率: 它不需要大量的额外计算能力;它仅比标准训练略贵一些。

总结类比

想象一下在训练一只狗。

  • 旧方法: 每当你教它一个新动作时,你都会给它一个通用的“表现良好”奖励。如果你教它“衔取”,它可能会忘记不要咬球。如果你教它“坐下”,它可能会忘记不要跳到人身上。
  • DualSelect 方法: 在教它“衔取”之前,你会专门复习“不要咬”这条规则。你会挑选那些可以安全咬动的球来进行训练。你在教它衔取的同时,会不断提醒它与该活动相关的“不要咬”规则。如果它开始咬东西,你会轻轻地将它的手(口)引开。

简而言之: DualSelect 使安全训练变得动态且针对当前任务,而不是静态且通用的,从而确保人工智能在学习新事物的过程中保持安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →