← 最新论文
💬 NLP

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

本文提出了一种无需训练的框架,该框架通过构建空间证据图来验证推理链相对于视觉证据的忠实度、识别矛盾并引导模型纠正错误,从而增强多模态大语言模型的空间推理能力,进而显著提高其在各类基准测试中的准确性。

原作者: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,有一台计算机能够观察一张照片并回答关于它的问题,就像人类观察者一样。这类被称为多模态大语言模型的系统在描述场景、识别物体甚至解决谜题方面已经变得非常出色。然而,当被要求推理空间关系——例如判断一个物体是否在另一个物体的左侧,或者一个杯子是否放在一本书后面时——它们经常会出错。问题并不在于计算机看不见图像,而在于计算机的内部思维过程,即它用来得出答案的逐步逻辑,会偏离实际可见的内容。如果系统在推理过程的早期犯了一个小错误,比如误判了单个物品的位置,这个错误就会产生连锁反应。计算机可能会将这个错误的观察结果视为事实,并以此构建进一步的结论,最终得出一个自信却错误的答案,尽管图像清晰地显示并非如此。

长期以来,研究人员一直试图通过教这些模型更多关于空间知识,或添加额外的图层数据来帮助它们看得更清楚来解决这个问题。但一项新的研究表明,最有效的解决方案不在于教模型新的事实,而在于在处理过程中检查其工作。由杨阳(Yang Yang)及其同事领导的这项研究团队开发了一种方法,可以在不重新训练模型或更改其底层代码的情况下,实时验证计算机的推理是否符合图像。他们发现,当模型的推理链条忠实于视觉证据时,其答案的准确性会显著提高。事实上,在一项针对现实世界问题的标准测试中,那些坚持视觉事实的模型正确率约为 51%,而那些陷入缺乏依据的猜测的模型成功率仅为 34%。

为了解决逻辑漂移的问题,研究人员创建了一个框架,充当计算机思维的严厉编辑。当模型生成一段推理链时,该系统会将这段文本分解为关于图像的微小、原子化的断言,例如“苹果存在”或“碗在盘子的右侧”。随后,它会构建一个结构化地图,称之为“空间证据图”(Spatial Evidence Graph),将这些断言中的每一项都与其所指代的图像特定部分联系起来。这个地图允许系统将每一条陈述追溯到其来源,确保没有任何一条推理是在真空中漂浮的。

下一步是最关键的:检查支持每个断言的视觉证据的可靠性。系统并不会盲目信任自身的检测工具。相反,它会评估物体是否清晰可见、位置是否明确,以及深度等测量值是否稳定。如果系统检测到某个物体被部分遮挡,或者图像过于模糊而无法确定,它会将该条证据标记为“不确定”,而不是强行做出决定。这防止了计算机基于不靠谱的数据进行自信的修正。随后,系统会扫描整个推理链,从头开始寻找第一个与可靠视觉证据相矛盾的断言。

一旦定位到这个最早的错误,系统就会引导模型从这个特定的错误点开始重写其推理过程。它会告诉模型:“你说苹果在碗的右边,但视觉证据显示苹果实际上在左边。请修正这一步并更新你的结论。”通过修复错误的根源并重新生成后续步骤,模型避免了导致错误答案的连锁反应。这个过程是完全“无需训练”的,这意味着它可以在不要求模型学习新技能或访问新数据集的情况下,直接应用于现有模型。

这种方法的效果在涵盖广泛视觉推理任务的十五种不同模型与数据集组合上进行了测试。该方法将模型的平均准确率提升到了接近 69%,大幅超越了之前的先进技术。更重要的是,研究表明,这些模型在推理方面变得更加一致。其中间步骤中忠实于图像的比例大幅增加,证明该方法成功阻止了错误的扩散。研究人员还发现,这种面向过程的修正可以与其它增强空间感知的方法协同工作,这表明验证逻辑与提供更好的视觉工具同样重要。

虽然该系统非常有效,但研究人员也承认其局限性。它只能纠正那些明确写在模型推理步骤中的错误。如果模型犯了一个隐藏在内部处理过程中的隐性错误,系统则无法发现并修复它。此外,目前的测试是在静态图像上进行的,因此尚不清楚这种方法在处理动态视频或复杂的多视角场景时表现如何。尽管如此,这项研究提供了一条清晰的前行路径:通过将推理过程视为一种可以被审计和实时纠正的对象,我们可以让这些强大的人工智能系统变得更加可靠和值得信赖,确保它们的答案能够植根于它们所看到的现实之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →