← 最新论文
💻 computer science

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1 是一个强化学习框架,它通过应用过程级监督来鼓励在复杂的推理轨迹中持续使用视觉证据,从而缓解多模态大语言模型中的长上下文视觉遗忘问题。

原作者: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人通过观察一张复杂的图片来破解谜题。你对机器人说:“看着这张图,告诉我发生了什么。”起初,机器人像是一个高度戒备的侦探,专注地盯着照片中的每一个细节。但随着机器人开始说话,开始写下它那冗长的、循序渐进的思考过程时,奇怪的事情发生了。随着它说话的时间越长,它似乎就越彻底地忘记了那张图片。它开始依赖于自己之前的言语,根据故事通常会如何发展来猜测图片中“可能”有什么,而不是基于图片中“实际”存在的内容。对于新一代的“多模态大语言模型”(MLLMs)——即能够看图并阅读的 AI 系统——来说,这是一个问题:它们在处理复杂推理方面变得越来越强,但它们也有一个缺陷:当它们的“思维链”变得越来越长时,它们会遭受“视觉遗忘”之苦。它们会偏离视觉证据,导致即便图片中包含真相,它们也会给出错误的答案。科学家们对此非常关注,因为如果这些 AI 模型无法在思考过程中“紧盯目标”,它们就无法胜任诸如解决带有图表的数学题或理解医学扫描图等严肃任务。

于是,Remember-R1 登场了,这是一种聪明的全新训练方法,旨在让机器人的眼睛无论故事变得多么长,都能始终紧盯着图片。把 AI 的推理过程想象成一次漫长的公路旅行。在过去,研究人员试图通过不断停车向司机重新展示地图(重新引入图像)来解决遗忘问题,但这既缓慢又笨拙。还有人尝试让司机列出一份他们“认为”自己看到了什么的清单,稍后再进行核对,但这就像是在检查一份代笔笔记,而不是在检查真实的道路。Remember-R1 采取了不同的方法。它不是改变行程或增加停靠点,而是扮演一个坐在后座的严厉而又乐于助人的教练,在司机驾驶的过程中不断通过“奖励”进行耳语。

该论文提出了一种名为 Remember-R1 的系统,它使用一种称为强化学习的技术来训练这些模型。其核心思想是直接监督模型的“思维过程”,而不仅仅是评判最终答案。研究人员设计了三种特定的“奖励”来鼓励模型保持对图像的关注:

  1. “关键词猎手”奖励(The "Keyword Hunter" Reward): 如果模型在推理过程中明确提到了它在图像中发现的具体标注细节(例如“蓝色球体”或“微型立方体”),它就会获得积分。这就像一场游戏,司机每经过一个特定的地标并准确命名,就能获得奖金,从而确保他们不是在凭空捏造。
  2. “记忆守护者”奖励(The "Memory Keeper" Reward): 如果模型在对话变长时开始减少对图像的注意力,该奖励会对模型进行惩罚。目标是保持“视觉注意力”从第一步到最后一步的稳定,防止模型陷入一种仅依赖自身文本的白日梦中。
  3. “聚光灯”奖励(The "Spotlight" Reward): 这确保了模型不仅仅是在随机地看图;它必须将注意力集中在真正回答问题的图片部分。如果问题是关于一辆红色的车,那么模型会将“聚光灯”对准红车而非背景中的树木,并因此获得奖励。

作者在两种不同规模的 AI 模型(30 亿和 70 亿参数)上测试了 Remember-R1,涵盖了包括数学、逻辑和通用视觉理解在内的七个基准测试。结果表明,这种方法是有效的。使用 Remember-R1 训练的模型表现始终优于未经训练的模型和其他现有方法。例如,在 MathVista 基准测试中,3B 模型的分数从 51.90 提升到了 65.50,7B 模型则从 62.30 跳升至 69.80。

至关重要的是,论文表明这种进步不仅仅在于最后得到正确答案,更在于模型“如何”得到答案。通过分析模型的“注意力”,研究人员发现 Remember-R1 减缓了模型遗忘图像的速度。标准模型往往在推理过程过半时就会对图片失去兴趣,而 Remember-R1 模型能让目光更久地固定在视觉证据上。论文明确排除了在推理过程中向模型“重示图像”是最佳解决方案的观点,指出这种做法成本太高且会破坏推理的连贯性。相反,他们认为,通过这些特定的奖励来训练模型维持自身的视觉焦点,才是更有效的路径。

简而言之,Remember-R1 表明,通过奖励 AI 模型在整个思维过程中成为优秀的“视觉侦探”——即通过识别关键词、保持记忆新鲜度和聚焦正确位置——我们可以阻止它们忘记正在观察的对象。这不仅让它们在数学或逻辑方面变得更聪明,更让它们成为了更可靠的观察者,确保它们漫长而复杂的叙述始终植根于所见图片的真相之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →