← 最新论文
💻 computer science

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

受海马体与新皮层互补作用的启发,所提出的 ComMem 框架通过利用一个快速适应的视觉缓存和一个慢速整合的文本原型系统来增强视觉-语言模型的测试时自适应,从而共同优化跨模态一致性,在多种分布偏移下实现了卓越的性能。

原作者: Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(AI 模型),他读过数百万本书,并且能完美地描述图像。这位图书管理员非常擅长识别照片中的“狗”或“猫”。然而,如果你突然给他看一张穿着超级英雄服装、身处雾气缭绕且下着雨的森林里的狗的照片,他可能会感到困惑。因为他的训练数据大多是阳光明媚的公园里清晰的狗的照片。

这就是这篇论文所要解决的问题:我们如何帮助一个聪明的 AI 快速适应新的、奇怪的或不断变化的环境,而不需要从头开始重新学习一切?

作者孙光龙(Guanglong Sun)及其团队提出了一个名为 ComMem 的解决方案。他们通过模仿我们大脑使用的特定技巧构建了它。

大脑的双系统技巧

我们的大脑并不只有一个巨大的记忆库。我们有两个截然不同的系统在协同工作:

  1. 海马体(“快速记录员”): 这部分大脑就像是一个便利贴本。它能非常迅速地抓取具体、详细的记忆。如果你今天在公园里看到一只独特的狗,海马体会立即把它记录下来。但这些笔记是脆弱的,如果尝试一次写太多内容,它们会变得混乱。
  2. 新皮层(“慢速图书管理员”): 这是深层的、有组织的图书馆。它持有通用的知识(比如“狗”的概念)。它的学习过程非常缓慢且谨慎,以确保新信息不会覆盖掉旧的、重要的事实。将一本新书归档到正确的书架上需要时间。

当前 AI 的问题:
大多数当前的 AI 方法就像是一个只有一个便利贴本的学生。他们试图从每一张新照片中即时学习,但却会忘记五分钟前学到的东西。或者,他们试图从“图书馆”中学习,但移动速度太慢,无法跟上新趋势。他们无法平衡速度与稳定性。

解决方案:ComMem

作者创建了 ComMem(互补记忆),它赋予了 AI 既有便利贴本,又有慢速图书管理员,并让它们彼此交流。

以下是其运作步骤:

1. 快速系统(“视觉便利贴”)

当 AI 看到一张新图片(比如那只穿着超级英雄服装的狗)时,它首先会检查自己的置信度。如果它对所见之物很有把握,它就会创建一个详细的视觉缓存

  • 类比: 想象这就像是拍一张高质量的快照,并把它贴在白板上。
  • 功能: 这个系统学习得很快。它能立即适应新环境的具体细节(雾气、服装)。它是灵活且具有可塑性的。

2. 慢速系统(“文本图书馆”)

与此同时,AI 拥有一个全局文本记忆。这是一个通用的描述列表(例如“狗是一种四条腿的动物”)。

  • 类比: 这位图书管理员正在缓慢地更新关于“狗”的百科全书条目。
  • 功能: 这个系统学习得很慢。只有当新信息非常可靠时,它才会进行更新。它确保 AI 不会仅仅因为看到了一只穿戏服的狗,就忘记了关于狗的基本规则。

3. “重构”(团队会议)

这是神奇之处。对于每一张新图片,AI 不仅仅使用一个系统。它会在“快速记录员”和“慢速图书管理员”之间召开一场会议。

  • 他们对比笔记:“便利贴说这是一只在雾中的超级英雄狗。而图书馆说这是一只狗。这两者匹配吗?”
  • 他们相互调整,以确保视觉图像和文本描述保持一致。
  • 如果他们达成一致,那么“快速记录员”会变得更加详细,而“慢速图书管理员”也会对其百科全书进行一次微小且安全的更新。

为什么这更好?

论文在 15 个不同的数据集(如包含数千个图像类别的 ImageNet)上测试了该方法。

  • 结果: ComMem 击败了所有以往最优秀的方法。
  • 类比: 想象一个正在参加考试的学生。
    • 旧的 AI: 要么因为看到第一眼看到的东西而惊慌失措并开始瞎猜(太快);要么死板地遵循教科书上的内容(太慢)。
    • ComMem: 迅速记下关于那个奇怪问题的笔记,然后对照他们的教科书进行检查,意识到:“啊,这仍然是一只狗,只是长得有点怪,”然后正确回答。

核心结论

论文声称,通过模仿我们大脑如何结合使用快速、详细的记忆缓慢、抽象的记忆,AI 可以更好地应对现实世界的混乱。它不需要从头开始重新训练;它只需即时适应,在看到新事物的同时变得更聪明,同时保持其核心知识的安全。

作者发现,这种方法不仅更准确,而且其效率足以投入实际应用,在“超级智能”与“处理图像所需的时间”之间取得了平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →