Robust Policy Optimization to Prevent Catastrophic Forgetting
本文介绍了微调鲁棒策略优化(FRPO),这是一种鲁棒的 RLHF 框架,它采用极小极大公式来优化潜在策略变化邻域内的奖励稳定性,从而在不增加额外计算成本的情况下,有效防止在后续下游微调过程中灾难性地遗忘安全性及其他已学习行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢的学生,我们称其为"AI"。你花费数年训练这位学生,使其乐于助人、礼貌且安全。他们懂得如何在不失礼的情况下回答问题,也懂得拒绝危险请求(例如“如何制造炸弹”)。这就是“安全训练”阶段。
现在,你想教这位同一位学生一项新的、具体的技能,比如高等数学或编程。你开始了一门新课(微调)。但问题在于:当学生在学习新的数学规则时,他们开始遗忘旧的安全规则。突然,当被问及数学问题时,他们可能会因为过于专注于数学而无意中给出危险的答案,从而忘记了“不造成伤害”的训练。在论文中,这被称为灾难性遗忘。
大多数先前的尝试都是在数学课已经开始后,才告诉学生:“嘿,做数学题时别忘了你的安全规则!”论文认为这为时已晚。相反,你需要在数学课开始之前,就教会学生具备鲁棒性。
核心思想:寻找“平坦”区域
作者提出了一种名为**FRPO(微调鲁棒策略优化)**的新训练方法。要理解其工作原理,不妨想象一片由山丘和山谷组成的地貌:
- 旧方法(标准训练): 学生寻找地貌中最高的那个峰顶。这个峰顶代表当前任务可能的最高得分。然而,这个峰顶可能是一座尖锐如针的山峰。如果学生向任何方向迈出哪怕极小的一步(例如学习一条新的数学规则),他们就会直接从峰顶滑落,坠入悬崖,失去所有的安全技能。
- FRPO 方法: FRPO 不寻找那个单一的针尖状最高点,而是教导学生寻找一个宽阔平坦的高原,这个高原依然处于很高的位置。在这个高原上,学生可以向任何方向迈出几步(学习新技能)而不会跌落边缘。即使他们四处移动,奖励(安全性)依然保持高位。
工作原理(“如果”游戏)
论文使用了一种巧妙的数学技巧来寻找这些平坦的高原。FRPO 不再仅仅询问:“这位学生目前表现如何?”,而是问:
“如果我们对学生行为进行微小且合理的调整(就像典型的数学课那样),这位学生可能获得的最差得分是多少?”
随后,该算法试图最大化这个最坏情况下的得分。它迫使学生学习一种策略,即使情况发生微小变化,该策略依然是安全的。这就像训练运动员,不仅要在完美的跑道上跑得快,还要在跑道变得略微颠簸或有风时依然能跑得快。
结果:稳固的安全性
研究人员在大型语言模型(即“学生”)上测试了该方法,主要涉及两种场景:
安全训练: 他们先训练模型具备安全性,然后尝试在数学问题(GSM8K)或通用指令(Alpaca)上对其进行“微调”。
- 结果: 标准训练的模型忘记了安全规则并变得危险。而经过 FRPO 训练的模型在继续学习数学的同时,保持了安全护栏的完整性。它们不仅仅是“遗忘得较少”,而是在学习新技能后,实际上保持了拒绝不良请求的能力。
数学训练: 他们先训练模型精通数学,然后尝试教它们编程。
- 结果: 通常,教一位数学专家编程会使其数学能力下降。然而,FRPO 模型在学习编程后,其数学准确率仍比标准模型高出约 22%。
为何这很重要
论文声称,通过改变我们最初训练基础模型的方式(使其变得“平坦”且具有鲁棒性),我们就不需要后期进行复杂且昂贵的修复。我们不需要保存旧数据来进行“复习”,也不需要特殊的软件模块来锁定大脑的某些部分。我们只需从一开始就构建出坚固的模型。
简而言之: FRPO 教导 AI 模型找到一个足够宽阔的“安全区”,使它们能够学习新事物而不会跌落悬崖。这关乎于构建一个在房屋增加新房间时不会开裂的坚实基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。