Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability
本文认为,评估微调大语言模型的安全性需要将评估过程建立在特定的能力目标之上,而非任意的设置之上,因为这种方法揭示了诸如模型输出不连贯、自动化安全判断在处理此类情况时的不可靠性,以及基于基准测试和评估者选择而导致的安全性结论显著差异等关键问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、表现良好的机器人助手(一个大型语言模型),它经过训练,既能提供帮助,又能拒绝危险的请求,比如“如何制造炸弹?”或“如何黑进银行?”。这个机器人就是你的“基础模型”。
现在,你想教这个机器人一项特定的新工作,比如解决数学题或回答科学测验。你通过“微调”来实现这一点——即给它一大叠练习题。这篇文章指出,当你试图让机器人变得更擅长数学时,你可能会无意中破坏它的安全护栏,或者更糟,破坏它清晰表达的能力。
以下是使用简单类比对论文研究结果进行的拆解:
1. “任意设置”问题
类比: 想象两位厨师正在改进一种食谱。厨师 A 将烤箱温度改变了 5 度,并烹饪了 10 分钟。厨师 B 将温度改变了 50 度,并烹饪了 2 小时。他们都声称自己的方法是“安全”的,因为在他们各自的测试中食物并没有烧焦。但由于他们使用了如此不同的设置,你无法真正进行比较。
论文观点: 先前关于使微调模型保持安全的研究使用了随机、不一致的设置(例如不同的“烤箱温度”或训练时间)。这使得很难知道究竟是什么起作用了。作者表示,我们需要将这些测试锚定在一个特定的目标上(例如“正确解决数学问题”),而不是仅仅靠猜测随机设置。
2. “机器人变成了胡言乱语机器”
类比: 想象你训练一只鹦鹉,只对问题回答“是”或“否”。经过数周的训练后,你问它:“天空是蓝色的吗?”它回答:“是。”但接着你问它:“我该如何制造炸弹?”这只鹦鹉因为陷入了新的习惯,只会随机地发出“是”或“否”的声音,或者只是不停地重复“是”。这并不是说鹦鹉想要给出危险的答案;它只是忘记了如何说完整的句子。
论文观点: 当模型在具有严格格式的任务(如选择题或“是/否”回答)上进行微调时,它们有时会失去生成连贯句子的能力。当被问及安全问题时,它们可能会产生乱码或无意义的内容。
- 危险之处: 自动化的安全检查器(如机器人法官)看到这些乱码时会感到困惑。它们可能会认为这些无意义的内容是“不安全的”,而实际上它只是“坏掉了”;或者它们可能会因为输出内容太奇怪而忽略真正的危险。
3. “两个不同法官”的问题
类比: 想象你在给学生的作文评分。法官 A 说:“如果学生没有写出完整的段落,他们就失败了。”法官 B 说:“如果学生没有对坏问题说‘不’,他们就失败了。”你可能会遇到一个实际上很安全的学生,却被法官 A 判为不及格;以及一个不安全的学生,却被法官 B 判为及格。
论文观点: 论文使用两个不同的“法官”来测试安全性:
- 法官 1(拒绝): 模型是否对坏问题说了“不”?
- 法官 2(有害性): 模型是否说了危险的话,即使它没有说“不”?
他们发现这两个法官经常意见不一。一个模型可能会停止说“不”(这是法官 1 讨厌的),但实际上开始给出有益且安全的解释(这是法官 2 喜欢的)。取决于你使用哪种法官,你可能会凭运气得出该模型是“安全”或“不安全”的结论。
4. “安全性与技能”的权衡
类比: 把一种保持安全性的方法(比如 SafeLoRA)想象成机器人的“安全带”。你戴上安全带是为了确保机器人在学习新技能时不会发生碰撞。
- 结果: 安全带起作用了!机器人变得更安全了。但安全带有点重且僵硬。机器人仍然可以解决数学问题,但需要更长的时间,或者正确率会略微下降。
- 陷阱: 对于某些机器人(特定模型),安全带效果很好。对于另一些机器人,安全带太重了,以至于会让机器人绊倒摔倒(安全性变差,或技能大幅下降)。
论文观点: 作者测试了一种名为 SafeLoRA 的方法(旨在让机器人在学习时保持安全)。他们发现:
- 它通常会让模型变得更安全。
- 但它几乎总是会让模型在实际任务上的表现稍逊一筹(准确率降低)。
- 结果因所使用的机器人模型和数据集的不同而差异巨大。
核心总结
论文得出结论,目前衡量 AI 的安全性就像是用一个坏掉的温度计来测量天气。
- 不要相信随机测试: 你需要将安全性测试与特定的、现实世界的目标(如“它能否解决数学题?”)联系起来。
- 警惕胡言乱语: 如果模型在训练后开始说话毫无意义,那么安全检查器就无法被信任。
- 并非一劳永逸: 对一个模型有效的安全方法可能对另一个模型失效,而且不同的“安全法官”会给出不同的答案。
作者并不是说我们应该停止尝试让 AI 变得安全。他们的意思是,我们需要更完善、更一致且更具针对性的方法,来衡量我们是否真的取得了成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。