Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining
本文首次对在解码前、解码中及解码后阶段实现语言模型毒性敏感度个性化的免训练方法进行了对比评估,在展示显著的对齐改进提升的同时,也揭示了个性化有效性与通用语言质量之间存在内在的权衡关系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座巨大且繁忙的图书馆里,那里有一位超级聪明的机器人管理员,随时准备回答你的任何问题。多年来,我们通过给它一本严格的规则手册来教它如何做到“安全”,这本手册规定:“绝不要说任何刻薄、无礼或危险的话。”其初衷是,如果每个人都遵守同一本规则手册,大家就能保持安全。但问题在于:对一个人来说可能只是个无伤大雅的玩笑,对另一个人来说却可能是一种深层的侮辱。一个在青少年听来显得强硬的词,在不同背景的人听来可能是一个歧视性词汇。问题的症结在于,机器人的单一规则手册过于僵化;它试图取悦所有人,结果要么变得平庸而保守,要么因为无法理解人们特定的感受而意外地冒犯了他人。这篇论文深入探讨了计算机科学中的一个领域,叫做“自然语言处理”(Natural Language Processing),这基本上是在研究如何教计算机理解并使用人类语言。这里的核心概念是“毒性”(toxicity),这只是一个高级词汇,指的是那些伤害、侮辱或威胁人们的语言。研究人员提出的核心问题是:我们能否教会机器人针对“你”实现安全性,而不需要每当一个新的人走进来时,都要从头开始重新构建整个机器人?
作者们决定测试一系列可以在不重新训练机器人(这就像是与其重新教育一整所学校的学生,不如只是给老师耳语一个提示)的情况下,即时调整机器人行为的“魔术技巧”。他们观察了机器人思考答案时的三个不同阶段:在它开口说话之前、在它挑选词汇时,以及在它说完话之后。他们使用了一个名为 PRISM 的数据集测试了七种不同的方法,该数据集包含了不同人群如何对各种句子进行“毒性”评分的真实案例。
以下是他们的发现,这有点像一场“选择你自己的冒险”游戏,每一个选择都有权衡。首先,他们发现所有七种方法都在一定程度上奏效了。它们成功地让机器人的回答符合特定用户对刻薄语言的敏感度,将错误率降低了 2�% 到 47%。这是一个相当大的进步!然而,论文指出并没有哪一种方法是绝对的“最佳”。这是一种平衡的艺术。
最有效的方法是让机器人针对特定个人实现安全的方法,被称为 URIAL。把 URIAL 想象成一位严厉的家长,在机器人开口说话之前,先在它耳边低声进行一段详细且冗长的警告。它在让机器人避免麻烦方面表现出色,但论文也发现了它的缺点:它有时会让机器人忘记事实,或者听起来有些机械和生硬。就像机器人因为太担心表现得不礼貌,以至于不再那么乐于助人了。
另一方面,在机器人说话过程中调整大脑的方法(如 PCAA 和 CGD),或者在机器人说完话之后从列表中挑选最佳答案的方法(如 CRR),则更加精准。它们更擅长精准打击你认为冒犯的内容,而不是仅仅让所有内容对所有人来说都变得过度安全。但它们降低整体“坏度”的效果并没有那种“严格耳语法”那么显著。
论文还提出了一个非常重要的观点:让机器人对某一群体更安全,并不总是会让它对所有人更安全。事实上,对于某些群体,比如种族混合背景的人,其中一种方法实际上让机器人的表现与他们的偏好变得更不一致了。这意味着,如果我们只看平均分,我们可能会忽略掉某些人的体验其实变差了这一事实。
因此,核心结论是,个性化安全性是一个多目标问题。你不能只追求最大化安全性而忽略其他一切。如果你希望机器人完美契合你的特定品味,你可能必须接受它会遗忘较少的事实,或者听起来没那么自然。作者们建议,与其试图寻找一个完美的解决方案,我们更需要构建能够让我们平衡这些权衡关系的系统,从而确保机器人对每个人来说都是安全、聪明且有礼貌的。他们警告说,我们必须小心,不要让这些“个性化”设置意外地导致机器人变得更难理解不同的文化或方言,从而引发新形式的不公平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。