VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
本文揭示,最先进的视觉语言模型因无法从根本上抵御局部干扰而在视觉路径跟随任务中表现不佳,这一瓶颈即便在模型规模扩大、引入推理干预或施加明确指令的情况下依然持续存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在和一个非常聪明的机器人玩“连点成线”的游戏。你指着一个特定的红点说:“沿着这条弯曲的线走到尽头,并告诉我你经过的每个点的颜色。”
你原本会期望机器人能轻松完成这项任务。但根据这篇论文,即使是最先进的人工智能模型(称为视觉 - 语言模型,或 VLMs)也极不擅长这项简单的任务。它们并非只是随机犯错;它们会分心,并切换到一条与你要求它跟随的线几乎完全相同的其他线上。
以下是研究人员发现的要点,使用简单的类比进行说明:
1. “拥挤的火车站”问题
研究人员设计了两项主要测试,以评估这些 AI 追踪线条的能力。
- 电路测试:想象一块杂乱的电路板,上面有许多颜色相同的电线并排运行。你要求 AI 跟随连接到"7 号端口”的那根电线。
- 漩涡测试:想象一个带有彩色圆点的单螺旋楼梯(像拐杖糖的形状)。你要求 AI 从底部走到顶部。
结果:AI 开始时是正确的,但几乎立刻就会感到困惑。如果在它本该跟随的线旁边紧挨着另一根电线或螺旋转弯,AI 往往会“跳”到那个邻居线上。这就像一名徒步者试图在森林中跟随一条小径,但当两条路径并行延伸几英尺时,徒步者会不小心踏上错误的那条,并继续前行。
2. “双胞胎”干扰
论文发现,AI 失败的原因并非任务太难,也不是因为它无法“看见”。它失败是因为局部竞争。
可以这样理解:你试图在安静的房间里听朋友说话。这很容易。现在,想象你的朋友正在说话,但就在他们旁边,有一个穿着完全相同衣服、用完全相同的声音说着完全相同话语的双胞胎。即使你知道谁是你的朋友,你的大脑也可能会感到困惑,并开始听那个双胞胎说话。
研究人员发现,当“邻居”线与“目标”线看起来非常相似(颜色相同、角度相同、形状相同)时,AI 的注意力会瞬间转移到邻居线上。AI 并非以模糊的方式“跟丢”了;它主动选择了错误的路径,因为那条错误的路径在局部看起来太有吸引力了。
3. 为什么“更努力地思考”无济于事
研究人员试图通过要求 AI“逐步思考”(一种称为推理的技术)来解决这个问题。他们希望 AI 能停下来,仔细观察,并说:“等等,那是错误的线。”
类比:这就像要求一个迷路的游客“更努力地思考”该往哪个方向走。游客没有查看地图(视觉线条),而是开始根据一般规则进行猜测,例如:“通常,道路会这样弯曲,”或者“太阳在左边,所以我应该往右走。”
论文发现:
- 推理未能修复视觉问题:AI 并没有开始正确地追踪线条。相反,它开始使用“捷径”或猜测。例如,在漩涡测试中,一些 AI 停止追踪线条,仅根据螺旋的形状猜测圆点的顺序(例如:“内圈是红色的,所以下一个必须是蓝色的”)。
- 成本更高:当 AI 试图“思考”时,它消耗了巨大的计算能力(就像一个人自言自语了 10 分钟才说出“红、蓝、绿”),但它仍然给出了错误的答案。
- 指令失效:即使研究人员给 AI 一本严格的规则手册,规定“即使线条看起来相似,也不要切换线条”,AI 仍然无视规则并跳到了错误的线上。
4. “大脑更大”的迷思
通常,当 AI 犯错时,我们会假设是因为模型太小。我们会想:“如果我们只是把大脑做得更大,它就会做对。”
研究人员通过使用从小型到巨型(高达 2350 亿个参数)的模型对此进行了测试。
- 结果:更大的模型表现稍好,但提升不大。即使是最大、最昂贵的模型,仍然会在“拥挤的火车站”中迷路。让大脑变大并没有赋予它在纠缠不清的乱麻中抓住单一线索的更好能力。
5. 现实世界的混乱
最后,研究人员在现实世界的图像上测试了这一点,例如工厂中缠绕的电缆或复杂的地铁线路图。
- 发现:同样的问题发生了。当 AI 试图在三条线路交汇的车站中追踪一条地铁线路,或在结中跟随一根电缆时,它不断切换到错误的线上。这种“跳跃”行为不仅仅是他们虚假测试中的故障;它也发生在现实、混乱的情况中。
结论
该论文得出结论:当前的 AI 模型非常擅长识别事物是什么(例如,“那是一张地铁线路图”),但它们在跟随事物方面却出奇地糟糕(例如,“从 A 到 B 追踪这条特定的线”)。
它们缺乏一种特定的“肌肉”,即当一条看起来相似的线路就在旁边时,能够将注意力锁定在一条路径上。除非我们构建出具有专门机制来忽略这些“视觉双胞胎”的 AI,否则它们将继续在最简单的跟线游戏中迷路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。