← 最新论文
🤖 AI

Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

本文介绍了 ViLoMem,这是一种采用“增长与精炼”原则的双流记忆框架,能够分别编码视觉干扰模式与逻辑推理错误,从而使多模态大语言模型克服基于轨迹的记忆局限,在各类基准测试中实现准确率提升并减少重复错误。

原作者: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但略显笨拙的机器人,去解决那些既包含图片又涉及数学问题的谜题。

目前,大多数这类机器人(称为多模态大语言模型)就像参加考试的学生:答错一道题后,立刻就会忘记这个错误。当它们在下一场考试中遇到类似的问题时,会再次犯下完全相同的错误。它们每次解决问题都像是从头开始,仿佛从未见过任何谜题一样。

一些研究人员试图通过给机器人一本“笔记本”来记录过去的错误,以此解决这个问题。但这些笔记本存在缺陷。它们只记录了错误的逻辑部分(例如,“我用了错误的公式”),而忽略了视觉部分(例如,“我在图片中看错了数字”)。这就像老师告诉学生“你算错了”,却从未指出学生看错了图表上的哪一行。

引入 ViLoMem:机器人的“双脑”记忆系统

这篇论文介绍了ViLoMem,这是一个受人类大脑工作方式启发的、更智能的双部分记忆系统。它不再使用一本杂乱的笔记本,而是利用两个截然不同、专门化的“流”式记忆,它们协同工作却又保持独立。

1. 两种记忆流

将机器人的大脑想象成拥有两位不同的图书管理员:

  • 视觉图书管理员(视觉记忆): 这位管理员只关心机器人看到了什么。如果机器人把闪亮的金属球误认为是橡胶球,或者看错了图表上的微小数字,这位管理员就会写下一条规则,例如:“当你看到闪亮物体时,要检查它是否像金属那样反光,而不是像橡胶。”它还会在未来的图片上绘制一个小小的“热力图”(就像聚光灯一样),精确地指示机器人应该看向哪里,以免遗漏重要细节。
  • 逻辑图书管理员(逻辑记忆): 这位管理员只关心思考过程。如果机器人使用了错误的数学公式或加法计算错误,这位管理员就会写下一条规则,例如:“记住,三角形的面积是 ½ × 底 × 高,而不是简单地将各边相加。”

2. 它是如何学习的:“增长与精炼”循环

该系统通过一个持续的练习与修正循环来运作:

  1. 尝试: 机器人利用其当前的记忆尝试解决问题。
  2. 检查: 一个“验证器”(像一位严厉的老师)检查答案。
  3. 诊断: 如果机器人答错了,系统会问:“这是视觉错误还是思考错误?”
    • 如果是视觉错误,视觉图书管理员会更新规则,并为下一次绘制新的聚光灯。
    • 如果是思考错误,逻辑图书管理员会更新规则。
  4. 清理: 该系统足够智能,能够避免杂乱。如果机器人两次犯了同样的错误,它不会写下两条新笔记,而是精炼现有的笔记,使其更清晰。这防止了记忆变得过于庞大和混乱(即所谓的“灾难性遗忘”问题)。

3. 为什么这很重要(结果)

研究人员在六种不同类型的难题上测试了该系统,这些难题涉及数学、科学以及真实世界的图像。

  • 结果: 使用 ViLoMem 的机器人在解决这些问题时表现显著提升。它们不再重复相同的视觉错误(如误读图表)和相同的逻辑错误(如使用错误公式)。
  • 类比: 想象一个机器人试图计算三角形的面积。
    • 没有 ViLoMem: 它可能会看错三角形的边(视觉错误),然后使用错误的公式(逻辑错误)。它失败了,忘记了,然后再次失败。
    • 有了 ViLoMem: 在失败一次后,视觉图书管理员会说:“下次,要看标有'12'的那条边,而不是'5'。”逻辑图书管理员会说:“下次,记得乘以 ½。”在下一次尝试中,机器人会看向正确的位置并使用正确的数学方法,从而得出正确答案。

4. “交叉训练”的额外优势

最酷的发现之一是,这种记忆系统具有可移植性。研究人员表明,一个较小、较弱的机器人可以从一个更大、更聪明的机器人的“笔记本”中学习。这就像一名初级学生阅读优等生的学习笔记,从而在不经历自己犯错的所有艰苦过程的情况下,瞬间变得更聪明。

总结:
ViLoMem 是一个通过区分“我看到了什么”和“我思考了什么”来教导 AI 从错误中学习的系统。通过将这两种学习类型保存在独立且有条理的文件中,AI 不再反复犯同样的愚蠢错误,从而成为一个更可靠、更准确的解题者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →