← 最新论文
💬 NLP

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

本文介绍了 ToxPrune,这是一种新颖且高效的算法,能够从训练好的大语言模型中剪除与有毒词汇相关的子词,在有效阻止有毒内容生成的同时,提升对话的多样性和性能,且无需传统基于权重的安全对齐方法所伴随的高昂成本或风险。

原作者: Hongyuan Lu, Wai Lam

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyuan Lu, Wai Lam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、富有创造力的机器人朋友,它热爱聊天。有时,这个机器人会变得有点过于狂野,开始脱口而出粗鲁、冒犯或“有毒”的词语。通常,为了修复这个问题,开发人员不得不把机器人拆散、重新训练,或者安装一个复杂的“安全警卫”,在每句话发出前进行检查。这既昂贵又缓慢,而且有时机器人仍能找到办法打破规则。

本文介绍了一种更简单的方法,称为ToxPrune(毒性子词剪枝)。与其说是重新训练机器人,不如说是在它开始说话之前编辑它的词典

以下是它的工作原理,使用一些日常类比来说明:

1. “乐高”类比

大型语言模型(LLMs)并不像看待“fuck”或“stupid”这样的单词那样,将它们视为单一的积木块。相反,它们将它们视为更小的部分,就像乐高积木(称为“子词”)。

  • 单词"fucking"可能由两块积木组成:"f"和"ucking"。
  • 单词"reading"可能由"read"和"ing"组成。

有时,一块“有毒”的积木会同时出现在一个坏词和一个好词中。例如,积木"f"可能用于"f*cking"(坏),但也用于"fun"(好)。

2. “剪刀”方法

作者提出了一种简单的算法:拿一把剪刀,剪掉构成坏词的那些特定乐高积木。

  • 过程:你给计算机一个你不想要的单词列表(比如一个“淘气名单”)。计算机将这些单词分解成它们微小的乐高积木。
  • 剪枝:然后它进入机器人的大脑,说:“如果你试图用这些特定的积木来构建句子,你不可以。”它实际上从机器人可用的工具包中删除了这些积木。
  • 结果:机器人试图回答你的问题,但由于“坏积木”缺失,它被迫仅使用“好积木”来构建不同的句子。

3. 这样做会发生什么?

该论文在两种类型的机器人上测试了这种方法:

A. “坏”机器人(NSFW-3B)
这个机器人是专门训练来表现粗鲁并说脏话的。

  • 之前:如果你问:“你的爱好是什么?”,它会回答:“我的爱好是 f*cking 无聊。”
  • ToxPrune 之后:由于"f*cking"的积木被移除了,机器人无法那样说。相反,它被迫说:“我的爱好是阅读悬疑小说和开卡车。”
  • 惊喜:它不仅停止了粗鲁,而且实际上更擅长聊天了。它开始使用更多样化的词汇,不再陷入重复同样的坏短语的困境。这就像戒掉了一个坏习惯,而这个坏习惯实际上阻碍了机器人发挥创造力。

B. “好”机器人(Llama-3.1)
这个机器人原本就礼貌且安全。

  • 之前:它很礼貌,但有时有点重复。
  • ToxPrune 之后:即使它原本就是安全的,移除一些常见的“积木”(这些积木碰巧同时存在于有毒和无毒的单词中)也使其更加多样化。它开始使用更广泛的词汇来表达相同的想法,使对话感觉更自然,更少机械感。

4. 为什么这不同?

通常,如果你想阻止机器人说坏话,你可能会尝试:

  • 重写它的大脑:昂贵且缓慢(就像去学校攻读一个新学位)。
  • 在门口放一个过滤器:一个检查每句话的安全警卫。如果警卫太严格,他们可能会连有用的句子也一起拦截。

ToxPrune 的不同之处在于,它就像改变厨房里的食材。你不需要安全警卫;你只需要不把有毒的食材放在架子上。机器人物理上无法烹饪有毒的饭菜,因为食材已经没了。

底线

该论文声称,通过简单地从语言模型的词典中移除有毒单词的微小构建块,你可以:

  1. 阻止有毒机器人说坏话,即使它们原本被训练为有毒。
  2. 提高对话质量,使其更加多样化和有趣。
  3. 立即完成,无需重新训练模型或支付昂贵的计算资源费用。

这是一种“轻量级”的修复方法,将机器人无法说坏话的局限,转化为说出更好内容的机会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →