Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving
本文引入了一个用于自动驾驶的新基准测试,旨在评估多视图多模态大语言模型是否能够正确识别支持其答案的具体摄像头视图,从而揭示传统仅针对答案的评估所无法发现的接地失败问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:“你找对地方了吗?”
想象一下,你正在参加一场非常困难的考试,身边站着六个朋友组成的团队。每个朋友都拿着一台相机,他们都在从不同的角度拍摄同一个街景:一个在前面,一个在后面,另外四个在两侧。
老师提出了一个关于场景的刁钻问题,比如:“靠近建筑物的行人最可能在做什么?”
在过去,研究人员只关心你的团队是否给出了正确的答案。如果你说“他们在等待过马路”,而这确实是事实,你就会得到一颗小红星。
但这篇论文认为,这还不够。
作者指出:如果你的答案是对的,但你其实看错了朋友的相机怎么办? 也许行人是在“左后方”的相机中清晰可见的,但你的团队却是根据“前方”相机得出的答案(可能是因为他们根据常识进行了猜测,而不是观察证据)。
这篇论文引入了一项新测试,旨在观察 AI 模型不仅能否回答问题,还能否指向包含证据的具体相机视角。
新测试:“六相机”挑战
研究人员利用 NuScene(一个流行的自动驾驶场景数据集)的数据构建了一个基准测试(标准化测试)。
- 设置: AI 被展示了来自汽车环视相机的六帧同步视频帧。
- 任务: AI 必须完成两件事:
- 识别出哪一个特定的相机(例如“左前”)包含了回答问题所需的视觉证据。
- 回答该问题本身。
- “黄金”真相: 研究人员人工检查了每一个问题,并确定了究竟应该使用哪个相机。这被称为“黄金视角”(Golden View)。
他们对 AI 进行了三种测试方式
为了理解 AI 在哪里失败,他们运行了三种不同类型的测试:
“寻找证据”测试(视角选择):
AI 看到所有六个相机,然后只需指出包含答案的那一个。它还不需要回答问题;它只需要找到正确的来源。- 类比: 老师问:“哪位朋友手里有那张猫的照片?”学生只需要指着那位朋友即可。
“先知”测试(完美条件):
研究人员只给 AI 提供正确的相机图像(黄金视角),然后向其提问。- 类比: 老师把那张猫的照片亲手交给学生,然后问:“这只猫在做什么?”这测试的是当证据被送到学生面前时,他是否能进行正确的推理。
“全流程”测试(真实世界):
AI 看到所有六个相机,并且必须在一个步骤内既选对相机又回答问题。- 类比: 学生看着六个朋友,选出正确的那位,然后回答问题。这是最难的测试,因为如果他们选错了朋友,即使由于运气好答对了,也会判定为失败。
他们的发现:“幻觉”问题
结果令人惊讶,揭示了许多先进 AI 模型中隐藏的缺陷:
“侥幸猜对”陷阱: 许多模型给出了正确答案,但指向了错误的相机。
- 例子: 一个模型可能会说“行人正在等待过马路”(正确答案),但声称是在“前方”相机中看到的(错误证据),而实际上行人仅在“左后方”相机中可见。
- 这表明 AI 正在猜测或使用“语言捷径”(即知道行人通常会等待),而不是真正地观察证据。
“前置相机偏见”: 即使证据明显在侧方或后方相机中,许多模型仍固执地坚持答案就在“前方”相机里。这就像一个侦探拒绝看向除了前门以外的任何地方,即使线索明明就在后院。
闭源模型与开源模型的差距:
- 那些昂贵的“闭源/专有”模型(如 Claude 和 GPT)在寻找正确相机视角方面表现得更好(准确率约为 75–80%)。
- 开源模型则表现挣扎,有些模型的准确率甚至不足 13%。
为什么这对自动驾驶汽车至关重要
论文强调,在自动驾驶汽车中,可靠的推理与正确的决策同样重要。
如果一辆自动驾驶汽车因为看到了小孩而决定刹车,但它“认为”自己是在前置相机中看到了小孩,而小孩实际上是在左后方,那么这辆车的内部逻辑就是破碎的。如果系统对于自己是在“哪里”看到了危险判断错误,那么在稍微不同的情境下,它就可能失效。
总结
这篇论文并不声称已经修复了 AI。相反,它构建了一个诊断工具。
可以把它想象成医生给病人做了一种新型 X 光检查。以前,医生只检查病人是否能走路(最终答案)。现在,他们要检查病人的腿部动作是否真的正确,还是只是在拖着脚走并碰运气。
论文得出结论,通过将“寻找证据”这一步与“回答问题”这一步分离,我们终于能够看清哪些 AI 模型是真的在“观察”世界,而哪些模型仅仅是在瞎猜。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。