Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings
本文表明,连续的直接偏好优化(Direct Preference Optimization)并不会均匀地降低先前学习到的偏好,而是根据目标、信号强度以及训练顺序之间的关系,产生从稳定性到正向迁移不等的各种结果,同时揭示了梯度对立并非导致这些效应的主要驱动因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但缺乏经验的助手(一个人工智能语言模型)如何行事。你不仅仅是教它一件事;你有一系列目标:要乐于助人、要无害、要诚实、以及要遵循指令。
通常,你可能会认为你是按顺序一个接一个地教授这些内容的。首先,你教它如何乐于助人;然后,你教它如何做到无害。这篇论文探讨的核心问题是:当你教授第二课时,助手会忘记第一课的内容吗?
人们普遍担心的是“灾难性遗忘”——就像一个学生为了数学考试而学习,结果学完数学后,就把之前为了历史考试所学的知识完全忘光了。
这篇论文研究了这种情况是否会在 AI 身上发生,以及如果发生了,为什么会发生。以下是利用简单的类比对研究结果进行的拆解。
实验:“四间房”
研究人员并没有只测试一种场景。他们设置了四个不同的“房间”(场景),以观察 AI 在切换任务时的反应:
- 冲突之房(分布冲突): 教授“乐于助人” vs. “无害”。这两者就像两种不同的语言;其提示词和目标非常不同。
- 权衡之房(多属性): 教授“冗长性”(话多) vs. “连贯性”(逻辑性)。这些是可能相互竞争的微调特征。
- 喧闹之房(强安全信号): 教授“无害”,其中安全信号极其响亮且明确,对比“乐于助人”。
- 和谐之房(兼容目标): 教授“遵循指令” vs. “诚实”。这些目标天然重叠且相辅相成。
重大发现:它并非“全盘抹除器”
最重要的发现是:AI 并不会均匀地遗忘所有内容。
如果你把 AI 的知识想象成一个花园,之前的理论认为,种下一朵新花(一个新目标)会抹掉旧的花。这篇论文发现事实并非如此。相反,花园发生了复杂的改变:
- 部分除草: 有时旧技能会变得稍微弱一些,但并未消失。
- 稳定性: 有时旧技能保持完全不变。
- 正向迁移: 有时,学习新技能实际上会让旧技能变得更好。
- 重新分配: 这是最棘手的部分。AI 并不只是整体变“差”了。它可能在处理简单任务时变差,但在处理困难任务时变好,反之亦然。
“自信”与“不确定”学生的类比:
研究人员观察了 AI 回答的单个问题。他们发现,当 AI 学习一项新技能时,它对待旧知识的方式并不尽相同。
- 在某些情况下,AI 对那些它之前非常有把握的答案(即“简单”问题)变得没那么自信了。
- 在另一些情况下,AI 对同样的简单问题变得更加自信了。
- 这完全取决于被教授的两个技能之间的关系。
谜团:为什么会发生这种情况?
研究人员对 AI 遗忘事物的原因有一个强烈的直觉。他们认为这就像两个人向相反方向拉绳子。
- 理论: 在教授第二项技能时,将 AI 拉向新方向的“数学逻辑”(梯度)与将 AI 拉向旧方向的数学逻辑直接发生了对抗。就像一场拔河比赛,绳子被扯断了。
现实检验:
他们测量了这种“拔河”现象,发现几乎没有发生对抗。
- 将 AI 拉向新方向的力量,实际上与旧方向的力量是垂直(呈 90 度角)的。
- 隐喻: 想象你正在向北走。然后有人告诉你向东走。你并不是在对抗你的向北步伐,你只是转了个弯。AI 并不是被新课程“推回”了,它只是在向侧面漂移。
结论
论文得出结论:我们不能假设教授一项新技能一定会毁掉旧技能。
- 取决于组合: 如果两项技能是兼容的(如诚实与指令),它们会互相促进。如果两者差异很大(如安全与乐于助人),旧技能可能会稍微减弱,但通常不会被抹除。
- 取决于信号: 如果新课程非常响亮且明确(如强烈的安全信号),它实际上可能会强化旧技能,而不是削弱它们。
- 取决于顺序: 先教 A 后教 B 与先教 B 后教 A 是不同的。
给构建者的启示:
如果你正在构建 AI,不要仅仅假设添加一个新功能会破坏旧有的功能。你需要观察这些目标是如何相互关联的。有时,你可以安全地堆叠它们;而有时,你需要注意教学的顺序,因为 AI 的“记忆”是以一种微妙且不均匀的方式发生偏移,而不是简单地删除过去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。