CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
本文介绍了 CoSPlan,这是一个用于评估视觉语言模型在需要步骤完成和错误纠正的任务中的视觉序列规划能力的基准测试,并提出了场景图增量(SGI)方法,这是一种无需训练的方法,通过实现基于文本场景图更新的迭代推理来提高性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对 CoSPlan 论文进行的解释。
核心理念: “故障 GPS” 问题
想象一下,你正在给一个机器人下达在迷宫中导航或重新排列家具的指令。你说:“从门口开始,走到厨房,然后把花瓶放在桌子上。”
目前的 AI 模型(称为视觉语言模型或 VLMs)非常擅长阅读这些指令并对其进行描述。但当你要求它们真正去“构想”这些步骤并修正错误时,它们往往会失败。
这篇论文引入了一个新的测试方法,叫做 CoSPlan(纠错序列规划)。你可以把它看作是一个针对 AI 的“找错游戏”。
设置场景:
- 场景: 你向 AI 展示一张起始图片(例如,一个凌乱的房间)和一张目标图片(例如,一个整洁的房间)。
- 故事: 你告诉 AI 一个已经发生的故事。“首先,我们拿起杯子。然后,我们把它掉在了地板上。”
- 陷阱: 这个故事包含一个错误。也许是被告知要穿墙而过,或者把重箱子放在了摇晃的架子上。
- 测试: AI 必须完成两件事:
- 检测错误: 意识到:“等等,你不能穿墙而过!”
- 修复计划: 想出正确的下一步,以便尽管之前出了错,仍能达到目标。
为什么这对 AI 来说很难
作者发现,即使是非常聪明的 AI 模型(如 GPT-4o)也会在这个问题上挣扎。它们就像是一个能完美背诵国际象棋规则的学生,但当对手走出了一步奇怪的棋时,学生就愣住了,不知道该怎么办。
- “文本 vs 视觉” 的差距: 这些模型非常擅长在脑海中使用文字进行规划(文本)。但当它们必须在脑海中“看到”这些步骤(视觉)时,就会迷失方向。
- “捷径” 问题: 许多模型会试图“作弊”。它们不去思考具体的步骤,而是直接观察最终的目标图片,然后说:“哦,我要去那里。” 它们并没有真正检查之前的步骤是否合理。CoSPlan 测试通过添加一个看起来像目标但忽略了错误的“干扰项”选项,专门设计用来捕捉这种作弊行为。
他们玩的四种游戏
为了进行测试,研究人员创建了四种不同类型的谜题:
- Maze-E(迷宫): 一个机器人在迷宫中行走。错误可能是撞墙。
- Blocks-World-E(积木世界): 像玩叠叠乐一样堆叠积木。错误可能是试图把积木放在半空中。
- Shuffle-E(洗牌): 一个拼图游戏,其中碎片被交换了。错误是交换了错误的碎片。
- Robo-VQA-E(机器人视觉问答): 现实世界中物体的照片(如碗和水果)。错误可能是把水果放进一个已经装满的碗里。
解决方案:“场景图增量更新”(SGI)
由于 AI 难以一次性想象整个未来,作者提出了一种名为 SGI 的新方法。
类比: “精神白板”
想象你正在尝试解决一个复杂的谜题,但你不是试图把整个画面都记在脑子里,而是使用一块白板。
- 第 1 步: 你在白板上画出初始场景(一个“场景图”)。
- 第 2 步: 你执行第一个动作(例如,“移动杯子”)。你在白板上擦掉旧的位置,并在新位置画上杯子。
- 第 3 步: 你对每一个步骤都这样做,一步接一步。
- 第 4 步: 如果你意识到自己犯了错(例如,“哎呀,我把杯子移到墙里了”),你会停下来,擦掉与墙壁碰撞的部分,然后画出正确的移动。
为什么有效:
与其要求 AI 在一次巨大的跨越中“想象整个未来”(这会导致它产生幻觉或作弊),SGI 强制它通过“精神白板”进行一步步的更新。它将一个困难的视觉问题转化为了系列微小的、可处理的文本更新。
结果
- 问题所在: 在没有帮助的情况下,大多数 AI 模型在这些纠错任务中的表现并不比随机猜测好多少。它们既无法“看到”错误,也无法修复计划。
- 解决方法: 当研究人员使用 SGI 方法(这种循序渐进的白板法)时,AI 的表现显著提升(平均提升了约 4.4%,这在该领域是非常巨大的进步)。
- 核心启示: AI 在“用文字思考”方面正在变得越来越好,但它仍然需要帮助来“用图像思考”。通过将视觉规划分解为细小的、增量的更新,我们可以让这些模型在修复自己的错误时变得更加可靠。
总结
论文指出:“AI 擅长阅读指令,但不擅长构想错误带来的后果。我们构建了一个测试(CoSPlan)来证明这一点,并找到了一种方法(SGI)来帮助 AI 通过一次一次微小的步骤更新其精神图像,从而修复它们的计划。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。