Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
本文提出了一种拒绝教师引导的微调框架,该框架通过直接使用安全引导对基座模型进行训练,而非依赖于预对齐权重所提供的微弱初始化,从而在遭受有害微调攻击时同时提升安全性与下游任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,一种强大的新能力已经出现:即利用用户自己的数据,将大规模通用语言模型进行定制化调整以满足特定需求。这种通常被称为“微调”(finetuning)的服务,允许公司和个人为专门的任务定制这些数字大脑,从编写代码到分析医疗记录。然而,这种灵活性也伴随着一个隐藏的危险。如果用于定制的数据包含有害指令——例如制造武器或生成仇恨言论的请求——模型可能会学会忽略其安全规则。这种被称为“有害微调攻击”的漏洞,威胁着要将有益的工具变成危险的工具。开发者的核心挑战在于,如何找到一种方法,既能让用户定制他们的模型,又不会在无意中教会它们变得不安全。
在一段时间内,解决这一问题的标准方案是一个两步走的过程。首先,开发者会拿取一个基础模型,并在安全数据上对其进行广泛训练,教导它拒绝有害请求。这创造了一个“经过安全对齐”的模型。然后,他们会拿取这个已经安全的模型,并在此基础上针对用户的特定数据进行进一步训练。来自韩国科学技术院(KAIST)的研究人员现在发现,这种传统方法是有缺陷的。他们发现,从一个已经经过大量安全规则训练的模型开始,实际上会使模型更难有效地学习新任务。安全训练改变了模型的内部设置,使其处于一种不利于学习新技能的状态,从而导致一种折中局面:模型要么在用户的任务上表现不佳,要么更糟的是,在接触到坏数据时会忘记其安全规则。
为了解决这个问题,研究人员提出了一个颠覆性的策略。他们不再从一个已经被强行要求安全的模型开始,而是从一个原始的、具有适应性的基础模型开始,并同时在用户数据和安全数据上直接进行训练。然而,仅仅将这两类数据混合在一起会产生一个新的问题:模型会感到困惑,因为“有用”的目标与“安全”的目标有时会朝着相反的方向拉扯。为了解决这种冲突,团队引入了一个“拒绝教师”(Refusal-Teacher)。这是一个独立的、经过安全训练的模型,充当引导者的角色。它本身并不进行学习,而是观察学习过程并提供两项关键服务。首先,它在主模型看到用户数据之前,过滤掉其中的有害指令,防止坏数据造成破坏。其次,它通过使用“软性示例”而非僵化的规则,温和地引导模型如何处理安全性,从而帮助模型平稳学习。
这种新方法的实验结果令人瞩目。在研究人员引入不同比例有害数据(从零到一半的训练集)的测试中,他们的方法始终优于现有方法。当训练数据包含50%的有害提示词时,传统方法无法保持模型的安全,在某些情况下,有害响应的比例激增至近80%。相比之下,新方法将有害响应控制在1%以下,同时仍能让模型以极高的准确度学习用户的任务。这种成功在不同类型的任务(如解决数学问题或分析新闻文章)中均成立,并且适用于多种不同的模型架构。研究人员还发现,这种方法减少了模型在尝试同时学习两个对立事物时所产生的内部“张力”或冲突,从而实现了更稳定、更高效的训练过程。
这项研究表明,安全定制的关键不在于预先通过安全规则使模型“硬化”,而在于保持模型的灵活性,并在学习过程中进行精细的引导。通过使用一位教师来过滤毒素并提炼安全教训,该系统实现了一种此前难以企及的平衡。研究人员证明,即使有害数据被伪装或来自不同来源,这种方法依然有效,展现出了目前防御手段所缺乏的鲁棒性。虽然这项工作是一个重要的进步,但它也强调了人工智能的安全并非一次性的设置,而是一个需要持续、智能引导的动态过程。这些发现为服务提供商提供了一条清晰的路径,使其能够在提供定制化服务的同时,不必牺牲所部署工具的安全性,确保随着这些模型变得更加专业化,它们依然值得信赖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。