← 最新论文
💻 computer science

GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

GeoStack 是一个模块化框架,通过对适配器施加几何约束并利用权重折叠特性,使视觉 - 语言模型能够高效地组合知识且避免灾难性遗忘,从而实现无论集成专家数量多少均具备恒定时间推理的能力。

原作者: Pranav Mantini, Shishir K. Shah

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranav Mantini, Shishir K. Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位博学多才、无所不知的图书管理员,名叫CLIP。这位管理员擅长根据概括性描述(例如“一张狗的照片”或“日落”)来查找书籍。然而,如果你要求这位管理员专精于某个非常具体的领域,比如“珍稀兰花”或“城市卫星图像”,他们往往会忘记关于世界其余部分的所有知识。这被称为灾难性遗忘:他们越是学习某一件事,就越会忘记其他所有事情。

通常,为了解决这个问题,每次你想让管理员学习新主题时,都必须从头开始重新培训整个管理员。这既缓慢、昂贵,又混乱不堪。

本文的作者 Pranav Mantini 和 Shishir K. Shah 介绍了一个名为GeoStack的新系统。不妨将 GeoStack 视为不是重新培训管理员,而是为他们提供一套专用的、可堆叠的眼镜

问题所在:“万能却无一适用”的眼镜

过去,研究人员曾尝试为管理员制作“适配器”(小型附加组件),以帮助他们看清特定事物。

  • 如果你戴上兰花眼镜,管理员就会成为花卉大师,但会忘记如何识别汽车。
  • 如果你戴上汽车眼镜,他们就会忘记花卉。
  • 如果你试图同时戴上两者,镜片会相互冲突,导致管理员陷入困惑,无法看清任何一样东西。

解决方案:GeoStack(“魔法眼镜”系统)

GeoStack 通过创建一种名为GeoLayer的特定适配器来解决这一问题。以下是其工作原理,使用简单的类比进行说明:

1. “温和的轻推”(几何约束)
当 GeoLayer 被训练时,它不会试图彻底重写管理员的大脑。相反,它起到非常温和的轻推作用。论文将这种作用称为扰动

  • 想象管理员的知识是一个完美平衡的书籍堆叠。
  • 普通的适配器试图重新排列整个书堆,这会导致书堆倒塌。
  • GeoLayer 的训练目标是仅以非常特定、有序的方式轻微移动书籍(在数学上,这意味着变化是“上三角”且“近正交”的)。
  • 由于这种轻推非常微小且有序,管理员可以学习“兰花”知识,而不会碰倒“汽车”或“狗”的书籍。

2. “准阿贝尔”堆叠(顺序无关紧要)
通常,如果你先戴上红色眼镜再戴上蓝色眼镜,结果与先戴蓝色再戴红色是不同的。

  • GeoStack 之所以特殊,是因为它是准阿贝尔的。这是一个复杂的数学术语,本质上意味着你堆叠眼镜的顺序无关紧要
  • 无论你先将“兰花”眼镜戴上,还是先将“汽车”眼镜戴上,管理员看到的世界都是一样的。这意味着你可以混合搭配专家,而无需运行复杂的测试来寻找完美的顺序。

3. “魔法折叠”(即时速度)
你可能会想:“如果我堆叠 100 副眼镜,难道透过所有眼镜看不会花上永远的时间吗?”

  • 通常情况下,是的。但 GeoStack 有一个名为权重折叠的技巧。
  • 想象你有 100 张印有图案的透明胶片。通常,你必须一张一张地透过它们看。
  • GeoStack 允许你在开始观看之前,从数学上将所有 100 张胶片折叠成一张单一的胶片
  • 结果如何?无论添加了多少专家,管理员只需透过一层查看。即使添加了一千个专家,速度也保持恒定(O(1))。

他们证明了什么?

作者通过两种主要方式测试了这个系统:

  • “多领域”测试:他们在四个截然不同的世界上训练了管理员:通用物体(ImageNet)、细粒度花卉(Flowers-102)、食物(Food-101)和卫星地图(EuroSAT)。

    • 旧方法:当他们尝试组合这些领域时,管理员忘记了基础知识(例如识别通用物体)。
    • GeoStack 方法:管理员在保持通用知识完整的同时,同时成为了这四个特定领域的专家。
  • “增量学习”测试:他们逐个教管理员新的物体类别(例如先添加 25 种新动物,然后再添加 25 种,接着再添加 25 种)。

    • 旧方法:到最后,管理员几乎完全忘记了最初的 25 种动物。
    • GeoStack 方法:即使在学习了 100 种新动物后,管理员也几乎完美地记住了最初的动物。

核心结论

GeoStack 是一个框架,它使 AI 模型能够学习新技能而不遗忘旧技能。它通过强制新知识以非常温和、数学上“安全”的方式添加,从而不干扰基础来实现这一点。它允许你以任意顺序堆叠任意数量的专家,并仍能获得即时结果。

正如论文结论所述,这解决了学习更多遗忘更少之间的权衡,且无需降低计算机速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →