← 最新论文
🤖 AI

Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback

本文介绍了迭代视觉思维(Iterative Visual Thinking, IVT),这是一个闭环框架,通过利用合成纠错推理和涉及群体相对策略优化(Group Relative Policy Optimization)的两阶段训练策略,使视觉语言模型能够通过利用视觉反馈来克服其无法自我纠正空间预测的能力,从而以极少的数据和计算资源显著提高定位精度。

原作者: Animesh Tripathy, Aswanth Krishnan

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Animesh Tripathy, Aswanth Krishnan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一场“热与冷”的游戏,你需要根据描述在照片中找到隐藏的物体,比如:“寻找向左看的斑马。”

问题:“盲目”的专家
目前的 AI 模型(视觉语言模型)就像是那些极其擅长在单次尝试中猜对答案的专家。如果你问它们,它们通常有 80% 的概率能答对。

然而,研究人员发现了一个奇怪的缺陷:这些专家在能够“看到”自己的错误时,却无法从错误中学习。

如果你告诉 AI:“这是用红色在你画出的猜测框,看一看,然后重试。”AI 不会变得更聪明,反而会变得困惑,其表现会从 80% 骤降至 48%。这就像一位大师级厨师,虽然能做出完美的佳肴,但如果你给他们看一张自己做的菜的照片并说:“看,这烧焦了,”他们会立刻忘记如何烹饪,并在下一次尝试中搞砸一切。他们缺乏这种“视觉自我修正”的能力。

解决方案:“迭代视觉思维”(IVT)
作者创造了一种新的训练方法,称为迭代视觉思维(Iterative Visual Thinking, IVT)。你可以把它想象成在教 AI 一项新技能:“绘图与擦除”循环。

AI 不再只是盲目猜测一次,而是被教会了:

  1. 猜测: 在它认为物体所在的位置画一个框。
  2. 观察: 计算机在图像上用红色画出这个框,并将其展示回给 AI。
  3. 思考: AI 看着这个红框,意识到:“噢,我偏左了,”或者“我抓错了一只斑马。”
  4. 精炼: 它画出一个新的、更好的框。

他们是如何教学的(两阶段配方)
你不能直接要求 AI 这样做;它必须针对此进行专门训练。研究人员使用了两步走的“教练式”过程:

  • 第一阶段:“老师”授课 (SFT)
    想象一下,一个学生(AI)做出了一个错误的猜测。一个“老师”AI 查看那个错误的猜测,画出那个红框,然后写下一段笔记:“看到那个红框了吗?它太大了,而且盖住了错误的动物。你需要把它向左移动。”
    随后,学生 AI 会在成千上万个这样的例子上进行训练。它学会了观察红框并修正错误的习惯。这是最关键的部分;如果没有这节课,AI 就不知道如何读取视觉反馈。

  • 第二阶段:“练习钻研” (GRPO)
    一旦 AI 学会了基本习惯,研究人员就让它利用奖励机制进行自主练习。每当 AI 做出一个猜测,它都会根据该框与真实物体之间的接近程度获得一个分数。

    • 目标: 防止 AI 在尝试精炼答案的过程中变得越来越差。在早期训练中,AI 经常会出现第一次猜测还行,第二次变差,第三次甚至更糟的情况。
    • 解决方法: 这个阶段教会了 AI “稳住阵脚”。它学会了进行细微、谨慎的调整,而不是大幅度摆动。它将这种“滑坡”(即随着步骤增加而表现变差)现象减少了 5 倍

结果
通过使用这种方法在一个相对较小的数据集(仅 2,400 个样本,在 AI 标准下非常微小)和仅一张显卡的情况下,他们取得了非凡的成就:

  1. 修复了崩溃: 当 AI 看到自己的错误时,不再会表现崩溃。
  2. 变得更强: AI 从单次尝试的 79.6% 正确率提升到了在精炼答案后的 82.0%
  3. 应对难题: AI 在最棘手、最容易混淆的描述任务中表现出了最大的进步,而在这些任务中,单次猜测通常会失败。

核心启示
这篇论文证明了空间自我修正是一项可以习得的技能,但它不会自然发生。你必须明确地教导 AI 如何观察自己的“红框”错误并进行修复。这把一个“单次猜测者”变成了一个能够观察、检查并改进的“思考者”,就像人类会做的那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →