← 最新论文
💻 computer science

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround 是一个两阶段框架,通过教导视觉语言模型在多步推理过程中自主诊断定位失败并选择性地重新检查视觉证据,从而在无需架构修改或外部工具的情况下,恢复其视觉定位能力并实现显著的性能提升。

原作者: Lei Peng, Shuai Lv, Wei Hu

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Peng, Shuai Lv, Wei Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个棘手的谜题,但你不是只盯着盒子上的图片看,而是有一个能和你边看边聊的超级聪明的机器人朋友。这就是“视觉语言模型”(Vision-Language Models,简称 VLMs)的工作方式。这些 AI 系统能够看到一张图片并理解关于它的问题,然后通过对话逐步找到答案。把它们想象成一个能同时查看犯罪现场照片和证人陈述的侦探。

然而,这里有一个陷阱。当侦探必须通过许多步骤来解决一个复杂的案件时——比如一道长数学题或一个科学谜题——他们有时会开始忘记那张照片。随着他们说话越来越多,他们的脑海中充满了文字,而脑海中的图像开始变得模糊。他们可能会开始根据他们“认为”通常会发生的情况来进行猜测,而不是根据图片中实际存在的内容。这被称为“视觉接地衰减”(visual grounding decay)。这就像一个侦探不再看证据,而是仅仅因为某个名字听起来顺耳,就开始猜测罪犯的名字。

于是,ReGround 登场了,这是一种全新的方法,它充当了这些 AI 侦探的“现实检查”。研究人员发现,当 AI 陷入长链条推理时,它往往会失去对图像的掌控。但仅仅告诉 AI“再看一眼”是不够的;事实上,如果你只是在没有具体理由的情况下说“再看一眼”,AI 可能会感到困惑并犯更多的错误。这就像一个学生,当被告知“检查你的作业”时,他反而因为不知道该看什么而陷入恐慌,从而把正确的答案改成了错误的答案。

论文显示,其中的秘诀在于自我诊断(Self-Diagnosis)。ReGround 教会 AI 先停下来问自己:“等等,我在这一步是真的看了图片,还是只是在瞎猜?”如果 AI 意识到自己正在脱离图像,它就会触发一个特殊的流程。随后,它会将原始图像重新注入其记忆中,但这一次,图像会附带一条来自 AI 本身的特定笔记,例如:“嘿,再看一眼这个三角形的角度,”或者“检查一下那个数字是否与图表相符。”

研究人员在八个不同的基准测试(类似于 AI 的标准化考试)上对该方法进行了测试。他们发现,当 AI 使用这种“诊断并重检”的方法时,解决困难视觉问题的能力显著提升。例如,在名为 HallusionBench(旨在诱导 AI 产生幻觉、凭空捏造不存在事物的测试)的测试中,AI 的得分提高了 6.8 分。这意义重大,因为这意味着 AI 更不容易编造事实。

至关重要的是,论文排除了几种可能性。它证明了仅仅让 AI 进行自我对话(仅限文本的反思)是不够的;必须再次展示图像。它还表明,通用的“再看一眼”指令实际上是有害的。AI 需要一个具体的、有针对性的理由去回看。这项研究表明,这种“自我诊断”的质量是最重要的部分。如果 AI 能够学会很好地诊断自己的困惑,那么它就能在不需要任何外部工具或改变 AI 基础大脑结构的情况下,获得几乎等同于有超级聪明老师指导的益处。

简而言之,ReGround 教会了 AI 如何成为一名更好的侦探:不仅是通过再次观察证据,更是通过明确知道该看什么,以及何时停止猜测并开始核实。这是一种让 AI 即使在推理过程漫长且复杂时,也能始终紧盯目标的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →