FOGO: Forgetting-aware Orthogonalization Optimizer
FOGO 是一种可扩展的优化器,它通过对动量更新进行谱正交化,并利用一种基于紧凑随机投影的记忆来解决梯度冲突,从而在不存储过去数据的情况下,减轻短期和长期遗忘,进而提升各种训练场景下的收敛性与知识保留能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“过度拥挤的房间”
想象你正在学习一项新技能,比如杂耍。你有一个教练(AI 优化器)在指导你的手部动作。
在标准的 AI 训练中,教练会把大部分注意力放在最简单、最常见的动作上。如果你在练习 100 个红球和仅 1 个蓝球的杂耍,教练会花 99% 的时间来纠正你处理红球的技术。蓝球会被忽视。
论文指出,这不仅仅是在一个接一个学习新任务(持续学习)时才会出现的问题。它在标准训练的每一个步骤中都会发生。“响亮”的指令(常见数据)淹没了“安静”但有用的指令(稀有数据)。随着时间的推移,AI 会忘记如何处理那些稀有的东西,因为它从未被重新审视过。这就是所谓的遗忘(Forgetting)。
解决方案:FOGO(聪明的教练)
作者引入了 FOGO,一种为 AI 设计的新型“教练”,旨在解决这个问题。它不仅告诉 AI 该做什么,还会记住 AI 曾经 做过什么,并保护这些记忆。
FOGO 的工作原理是一个由三部分组成的系统:
1. “均衡器”(谱正交化 - Spectral Orthogonalization)
想象一个音乐混音器,低音(常见数据)太响了,以至于盖过了小提琴(稀有数据)的声音。
- FOGO 的做法: 它充当了一个智能均衡器。它压低了响亮的低音音量,让小提琴的声音也能被听到。它确保即使是那些稀有、安静的学习方向,也有公平的机会影响 AI 的大脑,而不是被主导趋势所碾压。
2. “随身笔记本”(紧凑码本记忆 - Compact Codebook Memory)
通常,为了记住过去,AI 需要存储大量的旧数据(就像一座巨大的旧资料库)。这既慢又昂贵。
- FOGO 的做法: FOGO 并不存储整个资料库,而是保留了一个小巧的随身笔记本。
- 它使用了一种叫做**随机投影(Random Projection)**的技巧。想象一下将一个复杂的 3D 雕塑投射到 2D 墙上的影子。你会丢失一些细节,但你会保留其形状和各部分之间的距离。
- FOGO 将 AI 的学习方向投射到这个微小的 2D 影子空间中。它将重要过去方向的“精髓”记录为简单的点(质心)在这个笔记本中。
- 因为它只是一个由点组成的笔记本,所以几乎不占空间(仅为兆字节级而非吉字节级),而且读取速度非常快。
3. “交通警察”(冲突解决 - Conflict Resolution)
每当 AI 尝试学习新事物时,FOGO 都会检查它的随身笔记本。
- 检查过程: “嘿,如果你这样移动你的手(新指令),你会破坏处理蓝球的记忆(旧指令)吗?”
- 修复方式:
- 短期: 如果新的动作与主导趋势过于相似,FOGO 会轻轻地将其推开,以免稀有事物在“此时此刻”被忽视。
- 长期: 如果新的动作威胁要抹除之前任务中的关键记忆,FOGO 就会扮演交通警察的角色。它会拦截该动作,或者重新引导它,使其从旧记忆的“旁边”滑过,而不是撞上去。
在现实中是如何运作的(根据论文所述)
作者在四种不同的场景下测试了 FOGO,它始终优于标准教练(Adam 和 Muon):
- 不公平的课堂(类别不平衡学习): 当 AI 在某些类别很稀少(例如仅占 10% 数据)的数据集上进行训练时,标准 AI 会忘记这些稀有类别。FOGO 对它们的记忆能力更强,在不损害常见类别准确率的情况下,提高了对稀有项目的准确率。
- 变幻莫测的世界(持续视觉学习): 当 AI 必须一个接一个地学习识别不同风格的对象(例如照片、卡通、素描)时,Fող 在学习新风格时不会忘记旧风格。它比其他方法能更好地保持知识完整性,且无需存储旧图片。
- 会说话的机器人(LLaVA-7B 微调): 当对大型多模态模型(能够看图并说话的模型)进行微调时,FOGO 帮助机器人记住如何回答不同类型的问题(计数、推理、位置),而不会失去执行之前任务的能力。
- 语言学习者(GPT-2 预训练): 即使只是在学习预测句子中的下一个词(标准训练),FOGO 的学习速度也更快,且达到的误差率比标准方法更低。
总结
论文声称,遗忘是一个普遍存在的问题,而不仅仅是“持续学习”中的问题。只要“响亮”的数据淹没了“安静”的数据,遗忘就会发生。
FOGO 通过以下方式解决这一问题:
- 确保“安静的声音”能被听到(正交化)。
- 保留一个高效、微小的关键记忆(随机投影码本)。
- 在每一步进行检查,确保新学习不会抹除旧学习(冲突解决)。
其结果是:AI 学习得更快、记得更多,而且不需要一个装满旧数据的庞大硬盘来完成这一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。