← 最新论文
🤖 AI

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

本文提出了交错式视觉 - 语言推理(IVLR),这是一种策略框架,通过生成在文本子目标与视觉关键帧之间交替的显式轨迹,将逻辑连贯性与几何 grounding 相结合,以实现稳健的长视野机器人操作,并在具有挑战性的基准测试中取得了最先进的成功率。

原作者: Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人清理杂乱的厨房。这个任务不仅仅是“拿起勺子”。它是一个漫长的故事:“首先,把脏盘子移到水槽,然后拿起海绵,擦洗台面,最后把海绵放回去。”

目前的机器人“大脑”(称为视觉 - 语言 - 动作策略)就像演员:他们擅长演绎下一句台词,却极不擅长记住整本剧本。他们看着水槽,看到盘子,然后把它拿起来。但如果任务要求他们先拿杯子再拿盘子,他们可能会感到困惑,拿错东西,或者忘记自己最初为什么在这里。他们是“近视”的——只能看到紧接的下一步。

这篇论文提出了一种让机器人思考的新方法,称为IVLR(交错视觉 - 语言推理)。以下是其工作原理,使用简单的类比:

1. 问题:“健忘的演员”

将标准机器人想象成一个拿到剧本却必须在表演时逐行背诵的演员。如果剧本很短,他们没问题。但如果剧本很长(即“长视野”任务),他们就会忘记情节。

  • 纯文本计划就像一句写着“拿起杯子”的剧本。它告诉机器人做什么,但没有说明确切在哪里,或者场景应该是什么样子。这就像没有图片的食谱。
  • 纯视觉计划就像未来的电影胶片。它向机器人展示场景的样子,但如果没有文字,机器人可能无法理解为什么杯子在那里,或者事情发生的顺序。

2. 解决方案:“分镜导演”

作者赋予机器人一个分镜脚本。在机器人移动肌肉之前,它会暂停并在脑海中构建整个任务的完整“电影”。这个分镜脚本被称为IVLR-Trace

这个轨迹很特殊,因为它像漫画书一样将两样东西混合在一起,交替呈现:

  • 文本面板:“拿起白色马克杯。”(逻辑/因果顺序)。
  • 图像面板:一张白色马克杯正好放在它需要去的地方的图片。(视觉目标)。

机器人会在最开始一次性生成整个分镜脚本。这就像导演说:“好的,这是整部电影。场景 1:拿起马克杯。场景 2:放在盘子上。场景 3:拿起黄色马克杯……"

3. 机器人如何使用它:“带地图的 GPS"

一旦分镜脚本制作完成,机器人就不会像电子游戏角色那样盲目地跟随图像。相反,它在工作时会将分镜脚本“缓存”(保存在短期记忆中)。

  • 循环:在每一刻,机器人都会观察现实世界(它此刻看到的)并将其与分镜脚本(它计划看到的)进行核对。
  • 类比:想象你开车去参加派对。你有一张地图(分镜脚本),显示了路线和目的地。但你也有眼睛(实时摄像头)。如果你拐错了弯,你的眼睛会告诉你:“嘿,那不是地图上的那条街!”然后你会修正方向。
  • 机器人会不断这样做。它利用分镜脚本来记住事件的顺序视觉目标,但利用它的实时眼睛来确保它不会撞进一张在制定计划时并不存在的椅子。

4. 他们如何教导机器人(“伪监督”)

真实的机器人并没有自带分镜脚本;它们只有人们执行任务的视频。作者必须教导机器人如何制作自己的分镜脚本。

  • 他们取机器人执行任务的视频,并使用智能 AI 将视频切割成“场景”(阶段)。
  • 然后,他们使用另一个 AI 为每个场景编写说明(例如,“夹爪移动到马克杯”),并挑选一个“关键帧”(该时刻的代表性照片)。
  • 他们将这些制作好的分镜脚本作为训练数据喂给机器人。这就像给学生的课本填上了答案,以便他们以后能学会自己解决问题。

5. 结果:为什么这很重要

该论文在计算机模拟中测试了这种方法,机器人必须执行长步骤、多步骤的任务(如堆叠积木或移动马克杯)。

  • 没有分镜脚本:机器人经常失败,尤其是在长任务中(成功率仅为约 37%)。它在故事中间迷失了方向。
  • 仅有文本或仅有图像:表现有所改善,但不够好(约 60-68%)。
  • 使用完整的“分镜脚本”(文本 + 图像):机器人在最困难的任务中成功了92.4%

关键发现是你需要两者兼备。你需要文本来记住顺序(因果性),需要图像来记住位置(几何结构)。缺一不可。

6. 局限(注意事项)

该论文诚实地指出了缺点:

  • 思考时间:机器人在开始移动前必须“思考”约 10 秒以创建分镜脚本。这对于缓慢、谨慎的任务来说是可以接受的,但对于需要躲避快速移动球的机器人来说,这太慢了。
  • 过时的计划:如果机器人在制定计划之后世界发生了变化(例如,机器人在思考时有人移动了杯子),分镜脚本就会出错。机器人可能会试图遵循一个针对已不存在的世界的计划。
  • 仅限模拟:他们在计算机模拟中测试了这一点,而不是在真实厨房中的真实机器人上。

总结

这篇论文提出,与其强迫机器人仅根据此刻所见来猜测下一步,不如让它先为整个任务编写一本“漫画书”。通过将文字(计划)和图片(目标)混合成单一的“轨迹”,机器人可以在对即时世界做出反应的同时,记住全局画面。这是一种从“反应”向“规划与反应”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →