← 最新论文
⚡ electrical engineering

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

本文通过引入一种无需训练的“提示词回响”(prompt echoing)策略——即在图像的两侧同时重述问题,以同时引导感知并确保答案的可及性——识别并解决了视觉语言模型中的“问题优先悖论”(即:将问题置于图像之前虽然能直观地引导感知,却会导致生成答案时失败),从而显著提升了在多个基准测试中的性能。

原作者: Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一个机器人如何观察世界。这个机器人是一个特殊的计算机大脑,被称为视觉语言模型(VLM)。把它想象成一个超级聪明的学生,它能够看一张图片并回答关于它的问题,但它将一切都读作一行长长的文本。对于机器人来说,一张图片并不是单一的图像;它是一长串描述照片内容的微小拼图碎片(token)。

一个重大的问题是,科学家们一直在问:“当你与这个机器人交流时,你应该在向它展示图片之前告诉它要找什么,还是在展示之后?”按照常理,应该先说问题。如果你对人类说,“寻找那辆红色的车”,他们在看到街道之前就已经知道该把目光集中在哪里了。你会期望机器人的表现也一样。但这里有一个转折:当研究人员尝试用这种方法测试那些最聪明的机器人时,那些先听到问题的机器人,其答错的频率反而比后听到问题的机器人更高。这有点像告诉一名侦探,“寻找丢失的饼干”,然后把一张厨房的照片递给他们,最后发现他们因为盯着错误的地方看而错过了饼干。这种令人困惑的情况被科学家称为“悖论”。

这篇题为《问两次,看两次》(Ask Twice, Look Twice)的论文深入探讨了这个谜团,旨在弄清楚为什么机器人会失败,以及如何在不教它任何新知识的情况下修复这个问题。研究人员发现,机器人实际上在开始时确实听取了问题;它只是机器人的大脑被长长的图片碎片列表淹没了,以至于在它必须给出答案时忘记了问题。这就像读一本长篇小说,第一页告诉了你情节,但读到第100页时,你已经忘了开头了。他们发现的解决方案出奇地简单:把问题问两次。通过在图片前后各重复一次问题,机器人就能获得两全其美:它既知道要看什么,又能在说话时记住问题。

健忘机器人的谜团

研究人员首先通过三种测试,在五个不同的聪明机器人(VLM)上测试了这个“问题优先”的想法。他们保持图片和问题完全相同,只改变顺序。结果令人震惊。在一项名为 NaturalBench 的测试中,先听到问题的机器人比后听到问题的机器人低了 8.1 分。在另一个棘手的测试 Winoground 中,差距甚至更大,“问题优先”的机器人落后了 9.5 分。在某些情况下,比如使用 LLaVA 机器人时,先问问题让机器人变得如此困惑,以至于它开始对所有问题都回答“是”,在最难的部分得分竟然是完美的零分。

团队想要知道:机器人是在开始时忽略了问题?还是它听到了但随后忘记了?

侦探工作:思考的两个阶段

为了解决这个案例,研究人员使用了特殊的工具,在机器人思考时窥视其大脑内部。他们观察了两个特定的时刻:

  1. “观察”阶段: 问题是否改变了机器人看待图片的方式?
  2. “回答”阶段: 机器人是否在决定说什么时真正使用了问题?

他们发现了一些非常有趣的事情。“问题优先”的机器人确实完美地完成了第一部分。当问题出现在图片之前时,机器人的大脑实际上转移了焦点。如果你问“有水吗?”,机器人开始在图像块中看到“滴水”和“玩耍”,而不是仅仅看到“衣服”或“背景”。它正在正确的地方观察!

但接着,第二部分出错了。因为图片是由数百个微小的碎片组成的,机器人必须阅读完一长串图像 token 列表才能最终给出答案。当它到达结尾准备说话时,原始问题在它的记忆中已经变得如此遥远,以至于它几乎不再关注它了。相反,机器人只是根据它在图片中看到的内容进行猜测,往往得出了错误的答案。这就像一个学生虽然学习了正确的章节,但因为题目写在另一页上,所以忘记了具体的题目。

“回声”修复法

研究人员意识到机器人需要同时在两个地方听到问题。他们想出了一个叫做**问题回声(Question Echoing)**的小技巧。他们不再只是问一次问题,而是告诉机器人:“这是问题。现在看这张图片。然后,这是问题又一次。”

这个简单的改变产生了神奇的效果。第一份问题告诉机器人准确的观察位置(“观察”阶段),而第二份问题紧挨着答案,提醒机器人它应该说什么(“回答”阶段)。

他们甚至尝试了一个超级版本,叫做图像回声(Image Echoing),即在第一个问题之前和第二个问题之后各展示一次图片。这有助于机器人将整个图片看作一个宏大的场景,而不是一系列脱节的碎片。

结果

这种修复方法非常有效。通过仅仅重复问题(有时是重复图片),机器人的得分大幅提升。在最难的测试 Winoground 中,“回声”法的得分比“问题优先”法提高了多达 19 分。它甚至击败了此前被认为是最优的“问题最后”法。

最棒的部分是?他们不需要重新训练机器人或修改代码。他们只是改变了提问的方式。这就像意识到如果你想记住一个电话号码,大声重复两次可以帮助你在脑海中记更久。

为什么这很重要

这一发现意义重大,因为它表明我们如何与机器人交谈,与机器人本身有多聪明同样重要。长期以来,人们认为词序并不重要,或者“问题优先”是最符合逻辑的交流方式。这篇论文证明了逻辑对机器人并不总是正确的。

研究人员还发现,这不仅仅是某个特定机器人的小故障;它发生在不同类型的模型中,无论是较小的还是最大、最聪明的模型。他们甚至注意到,这种“问两次”的想法与人类使用了五十年的教学技巧相似——即老师在阅读段落前后都会提问,以帮助学生理解。看来,无论你是人类学生还是机器人,有时你只需要把重要的内容听两遍才能做对。

最后,论文指出,未来的机器人交流不仅仅在于让它们变得更聪明,还在于如何以正确的方式提问。而有时候,正确的方式就是问两次。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →