Unlocking the Potential of Continual Model Merging: An ODE Perspective
本文提出了 ODE-M,这是一种新颖的持续模型合并框架,它利用常微分方程视角在参数空间中追踪低损失路径,从而有效缓解灾难性遗忘,并在异构任务基准测试中优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位精通完美意大利意面菜肴的大厨。接着,你聘请了第二位擅长日本寿司的大厨。最后,你又聘请了第三位专攻墨西哥塔可的大厨。
问题所在:
在人工智能领域,我们通常拥有“基础模型”(如同我们的大厨),它们擅长多种任务。当新任务出现时(例如学习制作寿司),我们通常不得不从头重新训练整个大厨,或者试图将新知识强行叠加在旧知识之上。
本文探讨了持续模型融合。这就像尝试将意大利大厨、寿司大厨和塔可大厨的技能融合成一位“超级大厨”,使其能完美胜任这三项任务,而无需从头重新训练。
旧方法(“跳跃”法):
以往的方法试图通过分别获取意大利大厨和寿司大厨的“大脑快照”,然后简单地将它们取平均值来融合这些大厨。
- 缺陷: 想象意大利大厨的大脑位于一个山谷(低损失/良好性能),而寿司大厨的大脑位于另一个山谷。如果仅仅在两者之间画一条直线,你可能不得不穿越中间一座陡峭、崎岖的山峰。
- 结果: 当人工智能试图沿这条直线行进时,它会遭遇“损失屏障”(即那座山峰)。它在尝试学习寿司的过程中被困在山上,从而忘记了如何制作意面。这被称为灾难性遗忘。你添加的大厨越多,这位“超级大厨”遗忘原始技能的程度就越严重。
新想法(“ODE”法):
作者提出了一种名为ODE-M(常微分方程驱动的融合)的新方法。他们不是从一个大厨“跳跃”到另一个大厨,而是构想出一条连接两个大脑的连续路径或平滑道路。
以下是他们如何利用简单比喻来实现这一点的:
平滑道路(模式连通性):
该论文假设,尽管这些大厨看起来不同,但在他们的大脑之间隐藏着一一条平滑、低洼的道路,在这条路上他们都能很好地烹饪。目标就是找到这条道路,而不是翻越那座山峰的直线路径。带限速的 GPS(速度场):
作者构建了一个“速度场”,这就像是一个引导“超级大厨”从意大利风格过渡到寿司风格的 GPS。- 问题: 有时,GPS 会试图将车开上陡峭的山坡(这会增加“损失”或使烹饪效果变差)。
- 解决方案: 系统实时检查地形。如果前方的道路开始上坡(即损失增加),系统就会对该特定方向施加“刹车”或“阻尼”。它会减缓导致遗忘的那部分移动,同时仍让车辆朝着新技能的方向前进。
“停车标志”(工作点):
你并不总是需要一直开车到达目的地(即新大厨的大脑)。有时,你只想学习部分寿司技能,而不愿失去你的意面技能。- 系统允许你在平滑道路上的任意点停车。
- 如果新任务非常重要,你就开得更远(更接近新大厨)。
- 如果旧任务更重要,你就更早停车(保留更多旧知识)。
- 这由一个“时间调度”控制,它就像一个旋钮,决定吸收多少新技能与保留多少旧技能。
为什么这更好?
- 无需登山: 通过遵循平滑、低损失的路径,人工智能无需攀登那座会导致其遗忘旧技能的“山峰”。
- 可控性: 它为用户提供了一个旋钮,可以精确决定添加多少新知识,而不会破坏旧知识。
- 结果: 在他们的测试中(使用能够识别汽车、花朵和交通标志等图像的人工智能模型),这种方法创造出的“超级大厨”在记住所有任务方面优于任何先前的方法。即使在逐个添加许多新食谱时,它也能在学习寿司的同时保留意面技能。
总结:
与其用一种粗暴的工具强行将两个不同的人工智能大脑拼凑在一起(这会破坏事物),不如利用本文提出的平滑、受引导的路径将它们融合。它就像一个谨慎的导航员,引导人工智能绕过“危险区域”(即会导致遗忘的区域),并让你精确决定沿该路径行进多远,以平衡新旧技能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。