Attention Retention for Continual Learning with Vision Transformers
本文提出了一种用于视觉 Transformer 持续学习的新颖注意力保留框架,该框架通过识别注意力漂移并应用实例自适应梯度掩码来缓解灾难性遗忘,从而保护先前学习到的视觉概念,并在多种场景下实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明、求知欲很强的学生(一个人工智能)如何识别不同的动物。首先,你向他们展示猫的照片。他们学会了专门观察尖尖的耳朵和胡须,以此来辨认那是猫。接着,你向他们展示狗的照片。他们学会了观察耷拉着的耳朵和湿润的鼻子。
传统人工智能存在一个问题,叫做**“灾难性遗忘” (Catastrophic Forgetting)**。当这个学生学习关于狗的知识时,他们对新信息的兴奋程度太高,以至于完全忘记了猫长什么样。他们可能会看着狗那耷拉着的耳朵,然后心想:“哦,那是只猫!”或者他们可能会完全不再关注胡须,因为新的课程覆盖了旧的知识。
这篇论文介绍了一种教导这个学生的新方法,叫做 ARCL-ViT,它充当了一个“记忆守护者”,以防止他们遗忘。
核心问题:“注意力漂移” (Attention Drift)
作者发现,在现代人工智能模型(特别是视觉 Transformer,或称 ViTs)中,问题不仅仅是学生会遗忘,而是他们的重心发生了偏移。
把人工智能的“注意力”想象成一个手电筒。
- 当学习关于猫的知识时,手电筒明亮地照在猫的胡须上。
- 当人工智能学习关于狗的知识时,手电筒开始发生漂移。它离开了胡须,开始照向狗的鼻子。
- 如果手电筒移动得太多,人工智能以后就会失去识别猫的能力,因为它不再看向正确的位置。
解决方案:“请勿触摸”掩码 (The "Do Not Touch" Mask)
作者提出了一个聪明的技巧来保持手电筒的稳定。他们并没有试图记住每一张旧照片(这会占用太多空间),而是使用了一个两步走的过程:
第一步:绘制“黄金区域”
在学生完成关于猫的学习后,系统会对手电筒当时照射的具体位置进行快照。它会创建一个地图(一个掩码),突出显示那些对于识别猫至关重要的部分(比如胡须)——即“黄金区域”。
- 类比: 想象老师在纸上的猫的胡须周围画了一个红圈,并说:“这是最重要的部分。不要改变你在这里的注意力。”
第二步:新学习的“停止标志”
当学生开始学习关于狗的知识时,系统会查看那个红圈。如果新的课程试图改变人工智能观察胡须的方式(因为数学计算表明它应该改变),系统就会踩下刹车。
- 机制: 用人工智能的语言来说,这被称为梯度掩码 (Gradient Masking)。当人工智能计算如何更新其大脑时,系统会在控制“胡须关注度”的大脑部分放置一个“停止标志”。它告诉人工智能:“你可以学习狗的鼻子,但你被严格禁止改变观察胡须的方式。”
为了确保这不会减慢人工智能的速度或干扰其学习引擎(优化器),系统还会调整学习的速度,确保人工智能能够平滑地学习新的关于狗的知识,而不会意外抹除关于猫的知识。
为什么这很特别
大多数其他方法试图通过以下方式解决问题:
- 重放旧数据: 每当学习新的狗的图片时,都给学生看旧的猫的图片。(这很难,因为你需要存储所有那些旧图片)。
- 建造新房间: 为每种新动物增加大脑的新部分。(这会让大脑变得庞大且混乱)。
作者的方法不同,因为它锁定了焦点。它不需要存储旧图片,也不需要建造新房间。它只是确保手电筒能稳稳地停留在重要的特征上。
结果
该论文在各种具有挑战性的任务上测试了这种方法,例如识别不同艺术风格或不同领域的动物。
- 结果: 使用这种方法的人工智能比标准人工智能更好地记住了旧概念(猫),同时也能很好地学习新概念(狗)。
- 证明: 他们展示了“手电筒”(注意力图)的图像。标准人工智能的手电筒到处乱晃,而新方法的手电筒则完美地聚焦在原始特征上,就像人类一样。
简而言之,这篇论文教会了人工智能如何在学习新事物的同时,不丢失对已知事物的关注,模拟了人类注意力如何自然地稳定在重要的概念之上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。