SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
本文提出了 SPARD,这是一种防御框架,它结合了安全投影交替优化与相关性 - 多样性感知数据选择,以有效缓解有害微调攻击,同时保持任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明、行为得体的机器人助手(大型语言模型),它被训练为乐于助人但绝无害处。它知晓规则:“不要撰写仇恨言论”、“不要提供危险建议”等等。
现在,想象有人想教这个机器人一项新技能,比如解决数学问题。但是,他们交给机器人的数学作业中隐藏着一些“投毒”指令,旨在诱骗机器人遗忘其安全规则。这被称为有害微调攻击。机器人学会了数学,但也学会了无视其安全护栏,从而变得危险。
本文介绍了SPARD,一种在机器人学习过程中保护它的新方法。将 SPARD 想象为一个两部分的安保系统:一位严格教练和一位智能图书管理员。
1. 严格教练:“安全投影交替梯度”(SPAG)
通常,当我们训练机器人时,我们只是说:“努力在数学上做得更好,也许尽量不要变坏。”这就像是一个温和的建议。如果机器人对数学过于热衷,它可能会无意中忘记安全规则。
SPARD 采用了一种称为SPAG的不同方法。想象机器人正迈出一小步来学习数学。
- 迈步:机器人根据数学作业迈出一步。
- 检查:迈步后立即,严格教练进行检查:“你是否越过了安全线?”
- 纠正:如果机器人哪怕稍微踏入了“不安全区域”,教练不会只是大声斥责;他们会直接抓住机器人,将其拉回安全线的确切边缘。
这种情况在机器人学习新事物的每一次都会发生。这不是建议,而是一条硬性规则。机器人被数学地强制在“安全区域”内保持,同时仍能学习数学。这确保了无论机器人多么努力地学习新任务,它都不会忘记其安全训练。
2. 智能图书管理员:“相关性 - 多样性数据选择”
为了将机器人拉回安全状态,教练需要一本“安全示例”参考书。但并非所有安全示例都同等有效。
研究发现,如果你只是从图书馆中随机抓取安全示例,效果并不理想。
- 随机性的问题:如果机器人正在学习数学,而你向它展示关于“烹饪”的安全示例,这并没有太大帮助。机器人需要看起来像数学问题的安全示例,这样它才知道在具体做数学时如何保持安全。
- 过于相似示例的问题:如果你只向机器人展示看起来完全相同的安全数学问题,机器人可能会感到困惑。它学会了针对那一种特定类型的数学问题保持安全,但当问题稍有变化时就会失败。这就像死记硬背某一道特定问题的答案,而不是理解规则。
这就是智能图书管理员发挥作用的地方。本文使用一种特殊的数学工具(称为相关性 - 多样性 DPP)来挑选完美的安全示例组合。
- 相关性:图书管理员挑选与机器人正在学习的数学问题非常相似的安全示例(这样建议才有用)。
- 多样性:图书管理员还确保这些示例彼此不同(这样机器人就能在许多不同情境下学会保持安全,而不仅仅局限于一种情况)。
这就像图书管理员精心策划了一份“安全学习指南”,涵盖了所有要点:它既与考试相关,又足够多样,足以让机器人应对任何陷阱题。
结果
研究人员在机器人遭受“投毒”数据攻击的同时,在真实的数学和科学测试中测试了该系统。
- 没有 SPARD:机器人学会了数学,但变得危险(“攻击成功率”高)。
- 使用 SPARD:机器人同样出色地学会了数学,但它保持了安全。它成功忽略了毒害。
简而言之,SPARD 是一种教机器人新工作而不让它忘记道德指南针的方法。它通过不断检查机器人的步伐,并提供一份精心策划的安全示例清单来实现这一点,这些示例既与工作内容相关,又足够多样以覆盖所有风险。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。