← 最新论文
💬 NLP

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

本文提出了 LANCE,这是一种利用变分推断进行标签增强以预测细粒度拒绝分布的方法,从而使得大语言模型能够生成安全、自然的回复,在避免生硬拒绝的同时保持高安全标准。

原作者: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、乐于助人的机器人助手。你向它提出了一个几乎安全、但可能触及敏感话题的问题。它没有给出一个带有轻微警告的有帮助的回答,而是惊慌失措,每次都机械地重复同一句话:“我无法完成此请求。”

这篇论文将这种现象称为“僵化拒绝”。这就像俱乐部的保镖,仅仅因为有人戴着一顶略显冒险的帽子,就把所有人拒之门外,哪怕他们只是来跳舞的。机器人因为太害怕犯错,反而失去了助人的能力。

这篇论文的作者构建了一个名为 LANCE 的新系统来解决这个问题。以下是其工作原理,使用简单的类比说明:

1. 问题:“全有或全无”的开关

目前,大多数安全系统就像一个简单的电灯开关:要么“开”(安全),要么“关”(不安全)。

  • 如果系统检测到危险词汇,它就会将开关拨到“关”的位置,终止对话。
  • 问题在于,许多问题并非纯粹“坏”。它们可能是无害想法与危险细节的混合体。现有系统无法识别这种细微差别,因此只能一概屏蔽。

2. 解决方案:LANCE(“调光开关”)

LANCE 用“调光开关”或“音量旋钮”取代了那个简单的电灯开关。它不再只是说“坏”或“好”,而是问:“这有多危险?具体是哪一部分危险?”

  • 标签增强(侦探): LANCE 使用一种特殊工具(称为变分推断)来审视问题并将其分解。它不再给出简单的“是/否”标签,而是生成一个连续的风险图谱
    • 类比: 想象天气预报。旧系统只说“有雨”或“无雨”。LANCE 则说:“北部有 20% 的概率出现小雨,但南部是晴天。”它知道危险在哪里,以及危险有多大。

3. 过程:“外科编辑”

一旦 LANCE 确切知道风险在哪里以及风险有多大,它就不会直接删除整个对话,而是像一位外科编辑那样行动。

  • 梯度指引: LANCE 根据风险图谱向机器人提供一套指令。
    • 如果风险极小(如毛毛雨),它会指示机器人对句子进行微小、礼貌的调整。
    • 如果风险巨大(如暴风雨),它会指示机器人进行更大的修改。
  • 结果: 机器人会重写用户的问题,使其达到安全标准,同时保留原始含义和语气。
    • 旧方式: 用户问:“我如何入侵邻居的 Wi-Fi?” -> 机器人:“我无法完成此请求。”
    • LANCE 方式: 机器人意识到“入侵”部分是危险的,但“邻居的 Wi-Fi"部分只是出于好奇。它将想法重写为:“我无法协助入侵,但我可以解释 Wi-Fi 安全的工作原理,以便你保护自己的网络。”

4. 结果:安全且自然

该论文将这一系统与其他安全方法进行了测试,发现 LANCE 在以下两方面表现更佳:

  1. 安全性: 它仍然能阻止真正危险的内容(其安全性与严格的机器人一样)。
  2. 帮助性与自然度: 它阻止了机器人听起来像坏掉的唱片。对话感觉更人性化,因为机器人试图提供帮助,而不仅仅是说“不”。

总结

可以将 LANCE 视为教导机器人成为外交官,而不是保镖

  • 保镖(旧系统) 看到一顶危险的帽子,会说:“禁止入内!”
  • 外交官(LANCE) 看到那顶危险的帽子,会说:“那顶帽子对这个聚会来说有点冒险,但让我们把它换成一顶更安全的,这样你依然可以进来跳舞。”

该论文声称,这种方法使 AI 更加安全,同时避免了使其变得令人厌烦或无用,从而解决了机器人因过于恐惧而不敢与我们交流的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →