DLM-SWAI: Steering Diffusion Language Models Before They Unmask
本文提出了 DLM-SWAI,这是一种无需训练的推理时方法,通过在去噪过程中利用预计算分数对令牌分布施加偏差,引导扩散语言模型朝向期望的风格和安全属性,从而在不重新训练或产生显著计算开销的情况下实现有效控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常有才华但略显固执的艺术家(即扩散语言模型),他通过从一页满是静态噪声的画布开始,逐字逐句地慢慢清理,直到浮现出清晰的句子来创作文本。这个过程被称为“去噪”。
问题在于,虽然这位艺术家擅长生成流畅的句子,但他们并不总是听从你的具体指令,比如“用简单的方式写”或“确保语气礼貌”。通常,要让他们听从指令,你得把他们送回艺术学校进行数月的再培训(微调),这既昂贵又缓慢。
DLM-SWAI 是一项新颖而巧妙的技巧,它允许你在艺术家工作的同时引导他们,而无需将他们送回学校。以下是其工作原理,借助一些简单的类比来说明:
1. “小抄”(离线分数构建)
在艺术家开始动笔之前,研究人员会制作一份特殊的小抄。
- 他们会查看成千上万条“简单”文本、“礼貌”文本或“有毒”文本的示例。
- 他们会统计每个类别中出现频率最高的词汇。例如,单词"being"可能经常出现在复杂、高级的写作中,而"people"则可能出现在简单的写作中。
- 他们根据每个单词属于特定风格的强度,为字典中的每个单词分配一个“分数”。这一步只需做一次并保存即可。
2. “轻推”(去噪时的引导)
现在,艺术家开始工作了。他们看着一张布满空白处(被掩蔽的标记)的杂乱页面,试图猜测那里应该填什么词。
- 通常情况下,艺术家会根据自身的训练进行猜测。
- DLM-SWAI 介入并给艺术家一个温和的轻推。它会说:“嘿,如果你要写‘礼貌’风格,你应该真的喜欢‘请’这个词,也许不喜欢‘闭嘴’这个词。”
- 它将这个轻推同时添加到页面上每一个空白处的猜测中。
3. “滚雪球效应”(为何它对扩散模型有效)
这是神奇的部分。在其他类型的 AI(它们从左到右一次生成一个词)中,轻推只会影响下一个词。但在这种“扩散”艺术家那里,轻推是同时在整页上发生的。
- 因为艺术家是在同时完善整个句子,这些微小的轻推会累积。
- 如果艺术家因为轻推而早早选了一个“礼貌”的词,这个选择会使下一轮猜测更有可能也是礼貌的。
- 这就像雪球从山上滚下:在顶端的一小推,随着滚动会聚集更多的雪(风格),等到句子完成时,最终会形成一个巨大而清晰的、符合所需风格的雪球。
他们发现了什么?
研究人员在三个方面测试了这种方法:
- 阅读水平:让文本听起来像是写给儿童(小学水平)的,还是写给大学生(高级水平)的。
- 礼貌程度:让请求听起来是友善的还是粗鲁的。
- 安全性:确保文本没有毒性或危害。
结果:
- 比单纯礼貌地请求更有效:在提示词中告诉 AI“请保持礼貌”往往行不通。DLM-SWAI 实际上能改变输出使其变得礼貌。
- 不会破坏艺术性:有时,当你强迫 AI 改变风格时,写作会变得胡言乱语。DLM-SWAI 在改变风格的同时,能保持句子流畅可读。
- 快速且免费:它不需要重新训练模型或使用额外的计算机。它只是利用“小抄”来引导过程。
注意事项(局限性)
- “过猛”的轻推:如果你把艺术家推得太狠(轻推太强),他们会感到困惑,开始像坏掉的唱片一样重复单词。你必须找到“金发姑娘”式的力度——足以引导,但不足以搞垮他们。
- “固执”的艺术家:如果艺术家已经被训练得非常安全(拒绝生成有毒内容),那么保持他们的安全性很容易。但如果你试图强迫他们变得有毒,他们可能会因为内部训练的反制而继续抵抗。这种方法在防止坏事方面比强迫坏事更有效。
一言以蔽之
DLM-SWAI 就像给一位已经在驾驶的司机配备 GPS。你不需要告诉他们去学习一条新路线(重新训练),只需轻轻将方向盘转向他们想要去的目的地,确保他们准确到达所需地点,而不会撞车。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。