GradShield: Alignment Preserving Finetuning
GradShield 是一种基于原则的过滤方法,通过在微调过程中计算微调隐式危害性评分来识别并移除有害数据,从而在保持效用性能的同时确保与攻击成功率低于 6% 的安全对齐。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个非常礼貌、训练有素的机器人助手(即大型语言模型,或 LLM)。在你获得它之前,其创造者已经教导它如何做到乐于助人、诚实且安全。它知道不应提供制造炸弹或入侵银行账户的指令。这就是它的“安全对齐”。
然而,你希望教会这个机器人一项新技能,例如总结新闻文章或解决数学问题。为此,你给它提供一套新的训练书籍(数据集)供其学习。这一过程称为微调。
问题:篮子里的“坏苹果”
麻烦在于,你可能并未意识到,你的新训练书籍中包含一些隐藏的“坏苹果”。
- 显性坏苹果:这些显而易见,例如一本名为《如何黑客攻击》的书。
- 隐性坏苹果:这些更为棘手。它们看起来像是正常、无害的故事,却潜移默化地教导机器人忽视其安全规则。例如,一个故事写道“英雄总是服从反派的命令”,可能会无意中教会机器人应当服从任何指令,即使是危险的指令。
如果机器人研读了这些坏书,它可能会忘记其安全训练。当你询问时,它可能会开始回答:“当然,这是入侵银行账户的方法。”这非常危险,尤其是当公司提供允许用户上传自身数据以定制这些机器人的服务时。
解决方案:GradShield(“安全雷达”)
该论文介绍了一种名为GradShield的工具。你可以将其想象为一个超级智能的安全雷达,在机器人开始研读新训练书籍之前,扫描其中的每一页。
以下是其工作原理,使用一个简单的类比:
“如果”测试(FIHS):
想象你有一摞书。GradShield 针对每一页提出一个问题:“如果机器人阅读这一特定页面,它是否会变得不那么安全?”
它通过计算一个名为**微调隐性危害分数(FIHS)**的得分来实现这一点。- 如何计算:它观察机器人“大脑”在阅读该页面时想要趋向的“方向”。如果该页面试图将机器人“大脑”推向“粗鲁”或“无视规则”的方向,且该方向与“安全”方向相反,则该页面会获得较高的“危害”分数。
- 神奇之处:它无需实际让机器人学习该页面即可判断其是否有害。它只需查看机器人将如何反应的数学原理。
自适应过滤器:
一旦 GradShield 对所有页面进行了评分,它就需要决定剔除哪些页面。- 挑战:你不知道这堆书中有多少本坏书。是 1% 还是 50%?如果过滤器设置得过于严格,你可能会剔除好书,导致机器人变得无用;如果过于宽松,坏书则会混入其中。
- 对策:GradShield 采用一种“智能猜测与检查”的方法(自适应阈值)。它尝试应用一个过滤器,测试机器人,如果机器人仍然不够安全,它就收紧过滤器;如果机器人过于严格而失去了智能,它就放宽过滤器。它能自动找到完美的平衡点。
结果:既安全又智能
研究人员在多种不同场景下测试了 GradShield:
- 针对明显的坏数据:当训练数据充满清晰的“如何黑客攻击”指令时,GradShield 完美地将其过滤掉了。机器人保持了安全,同时仍能学会总结新闻和解决数学问题。
- 针对隐藏的坏数据:当训练数据看起来无害但包含微妙的“破坏安全”课程时,GradShield 依然将其捕获。其他方法(如简单的内容过滤器)错过了这些隐藏的危险,但 GradShield 没有。
- 效率:它速度很快。计算这些分数所花费的时间大约相当于训练机器人一整天。为确保机器人不会变成危险源,这是一个微小的代价。
核心结论
GradShield 就像机器人训练的质量检查员。它检查机器人即将学习的每一条新信息。如果某条信息看起来会导致机器人忘记其安全规则,GradShield 就会将其移除。这确保了即使用户使用自己的数据定制这些强大的 AI 工具,机器人依然能保持乐于助人、聪明且安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。