Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement
本文提出了 LANCE,这是一种利用变分推断进行标签增强以预测细粒度拒绝分布的方法,从而使得大语言模型能够生成安全、自然的回复,在避免生硬拒绝的同时保持高安全标准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、乐于助人的机器人助手。你向它提出了一个几乎安全、但可能触及敏感话题的问题。它没有给出一个带有轻微警告的有帮助的回答,而是惊慌失措,每次都机械地重复同一句话:“我无法完成此请求。”
这篇论文将这种现象称为“僵化拒绝”。这就像俱乐部的保镖,仅仅因为有人戴着一顶略显冒险的帽子,就把所有人拒之门外,哪怕他们只是来跳舞的。机器人因为太害怕犯错,反而失去了助人的能力。
这篇论文的作者构建了一个名为 LANCE 的新系统来解决这个问题。以下是其工作原理,使用简单的类比说明:
1. 问题:“全有或全无”的开关
目前,大多数安全系统就像一个简单的电灯开关:要么“开”(安全),要么“关”(不安全)。
- 如果系统检测到危险词汇,它就会将开关拨到“关”的位置,终止对话。
- 问题在于,许多问题并非纯粹“坏”。它们可能是无害想法与危险细节的混合体。现有系统无法识别这种细微差别,因此只能一概屏蔽。
2. 解决方案:LANCE(“调光开关”)
LANCE 用“调光开关”或“音量旋钮”取代了那个简单的电灯开关。它不再只是说“坏”或“好”,而是问:“这有多危险?具体是哪一部分危险?”
- 标签增强(侦探): LANCE 使用一种特殊工具(称为变分推断)来审视问题并将其分解。它不再给出简单的“是/否”标签,而是生成一个连续的风险图谱。
- 类比: 想象天气预报。旧系统只说“有雨”或“无雨”。LANCE 则说:“北部有 20% 的概率出现小雨,但南部是晴天。”它知道危险在哪里,以及危险有多大。
3. 过程:“外科编辑”
一旦 LANCE 确切知道风险在哪里以及风险有多大,它就不会直接删除整个对话,而是像一位外科编辑那样行动。
- 梯度指引: LANCE 根据风险图谱向机器人提供一套指令。
- 如果风险极小(如毛毛雨),它会指示机器人对句子进行微小、礼貌的调整。
- 如果风险巨大(如暴风雨),它会指示机器人进行更大的修改。
- 结果: 机器人会重写用户的问题,使其达到安全标准,同时保留原始含义和语气。
- 旧方式: 用户问:“我如何入侵邻居的 Wi-Fi?” -> 机器人:“我无法完成此请求。”
- LANCE 方式: 机器人意识到“入侵”部分是危险的,但“邻居的 Wi-Fi"部分只是出于好奇。它将想法重写为:“我无法协助入侵,但我可以解释 Wi-Fi 安全的工作原理,以便你保护自己的网络。”
4. 结果:安全且自然
该论文将这一系统与其他安全方法进行了测试,发现 LANCE 在以下两方面表现更佳:
- 安全性: 它仍然能阻止真正危险的内容(其安全性与严格的机器人一样)。
- 帮助性与自然度: 它阻止了机器人听起来像坏掉的唱片。对话感觉更人性化,因为机器人试图提供帮助,而不仅仅是说“不”。
总结
可以将 LANCE 视为教导机器人成为外交官,而不是保镖。
- 保镖(旧系统) 看到一顶危险的帽子,会说:“禁止入内!”
- 外交官(LANCE) 看到那顶危险的帽子,会说:“那顶帽子对这个聚会来说有点冒险,但让我们把它换成一顶更安全的,这样你依然可以进来跳舞。”
该论文声称,这种方法使 AI 更加安全,同时避免了使其变得令人厌烦或无用,从而解决了机器人因过于恐惧而不敢与我们交流的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。