VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence
本文介绍了 VISTAQA,这是一个综合基准测试,以及 GROVE 评估指标,旨在联合评估视觉问答的正确性和像素级证据定位的精确性,揭示了当前多模态模型在将答案与视觉证据对齐方面存在显著的性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一名侦探,仅凭一张照片来解开一个谜团。
在过去,如果侦探告诉你凶手的正确名字,你就会雇佣他们。你并不关心他们是如何得知的。他们可能是凭直觉、刻板印象或幸运猜测得出的结论。如果他们说:“是管家”,而且他们是对的,他们就会得到一颗金星。即使他们在照片中指错了人,还说:“看?那就是管家!”你仍然会给他们金星,因为那个名字是正确的。
本文认为,这种测试人工智能的旧方法已经行不通了。这就像雇佣了一名能给出正确答案却无法向你展示证据的侦探。
问题所在:“幸运猜测”型人工智能
作者指出,当前的人工智能模型(称为多模态大语言模型)非常擅长猜测正确的词语。但它们极不擅长证明为什么它们是对的。
- “仅文本”陷阱:如果人工智能说:“那只狗有三条腿”,但照片中的狗显然有四条腿,人工智能仍可能说“三条”,因为它从文本中学到狗通常有四条腿,或者它只是猜的。如果它碰巧猜对了数字,我们就会奖励它。
- “仅定位”陷阱:反之,有些人工智能模型擅长在图片中指出物体(例如在狗周围画一个圈),但不擅长回答问题。它们可能完美地指向那只狗,却说:“这是一只猫。”
本文将此称为“模态鸿沟”。人工智能的“大脑”(文本)和它的“眼睛”(视觉)没有正确地进行交流。
解决方案:VISTAQA(“展示你的思路”测试)
为了解决这个问题,作者创建了一个名为VISTAQA的新测试。
把 VISTAQA 想象成一位严格的老师,她不仅给你的最终答案打分,还会给你的解题过程打分。
- 规则:为了获得及格分数,人工智能必须同时做到两件事:
- 正确回答问题(例如:“车是红色的”)。
- 在图像中红色汽车的精确像素上绘制掩码(就像用荧光笔标记一样),以证明它确实看到了它。
如果人工智能答对了答案但高亮了错误的汽车,它就失败了。如果它高亮了正确的汽车但说它是蓝色的,它也失败了。它必须两者都完美做到才能获得高分。
数据集:挑战的混合体
这个测试不仅仅是单一类型的问题。作者建立了一个包含1,157 个由专家策划的谜题的库,涵盖:
- 六种思维类型:从简单的“这是什么颜色?”(感知)到复杂的“哪个物体离机械臂更近?”(推理)。
- 六个不同的世界:室内房间、户外街道、数学图表、科学图表、机器人实验室和自动驾驶汽车场景。
- “陷阱”问题:约 27% 的问题是陷阱。它们询问图片中不存在的事物(例如:“这个厨房里有多少头红大象?”)。聪明的的人工智能应该说:“没有”,并留白图片。而“产生幻觉”的人工智能则会尝试画出一头不存在的大红象。
评分标准:GROVE
如何给一个需要在两个方面都正确的测试打分?你不能简单地将分数相加。如果你在文本部分得了 100 分,但在图片部分得了 0 分,你不应该获得高平均分。
作者发明了一种新的评分系统,称为GROVE。
- 类比:想象一个两条腿的凳子。如果一条腿断了,凳子就会翻倒。你不能说:“嗯,另一条腿是完美的,所以凳子没问题。”
- 工作原理:GROVE 将“文本分数”和“图片分数”相乘。如果其中任何一个为零(或非常低),最终分数就会崩溃。这迫使人工智能必须两者都擅长,否则就会得到低分。
结果:人工智能仍在学习
作者用这个新的、更严格的测试,测试了当今最先进的人工智能模型(包括来自 Google、OpenAI 和其他公司的模型)。
结论是什么? 即使是最好的模型也感到吃力。
- 它们非常擅长猜测正确的词语。
- 它们在指出物体方面表现尚可。
- 但当被要求同时做到这两点时,它们的分数显著下降。
论文得出结论,虽然人工智能在“说话”方面变得越来越聪明,但它尚未完全学会同时“看”和“证明”其答案。人工智能所说的与它实际看到的之间存在巨大差距。
总结
- 旧方法:你得到正确答案了吗?是的?干得好。(忽略了你是否作弊或猜测)。
- 新方法(VISTAQA):你得到正确答案了吗并且你能指出图片中的证据吗?
- 评分(GROVE):如果你错过任何一部分,你就失败了。
- 发现:当前的人工智能仍然像一个能背诵答案键但不理解课程的学生。它们需要学会展示它们的解题过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。