EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
本文介绍了 EPIC-Bench,这是一个细粒度基准测试,包含涵盖 23 种具身任务的 6,600 个标注元组,该基准测试揭示出尽管当前视觉 - 语言模型具备先进的推理能力,但在物理交互的复杂视觉 - 文本对齐方面仍面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人助手。你告诉它:“去把桌上的红色马克杯拿起来。”为了做到这一点,机器人需要能够看见那个马克杯,理解“红色马克杯”指的是那个特定物体,找到一条通往它的路径而不绊倒,并知道确切在哪里抓取它。
很长一段时间以来,我们使用简单的测验来测试这些机器人的“眼睛和大脑”。我们会给它们看一张图片,然后问:“有红色的马克杯吗?”或者给它们提供多项选择题,比如"A) 有,B) 没有”。
问题出在哪里?机器人在作弊。它们并没有真正“看见”那个马克杯;它们只是根据问题的措辞进行猜测,或者利用常识。这就像一个学生死记硬背答案键,而不是学习学科知识。
这篇论文介绍了EPIC-Bench,这是一项新的、更难的测试,旨在阻止作弊,并检验机器人是否真的能够看见并与真实世界互动。
以下是他们所做工作的分解,使用了一些日常类比:
1. 新测试:“遮罩游戏”
EPIC-Bench 不再问“是或否”,而是要求机器人绘制遮罩(就像数字贴纸一样),覆盖它需要找到的确切物体。
- 旧方法:“有猫吗?”(机器人因为看到客厅而猜“有”。)
- EPIC-Bench 方法:“这是一张凌乱客厅的图片。请仅高亮显示那只睡在椅子下的猫。”
- 为何重要:如果机器人高亮了整把椅子或地板,它就失败了。这证明机器人确实查看了像素,而不仅仅是文字。
2. 测试的三个等级
该基准测试就像一个具有三个难度等级的视频游戏,涵盖了机器人在家中需要完成的所有任务:
等级 1:目标定位(“找不同”游戏)
机器人必须根据棘手的描述找到特定事物。- 基础:“找到红色的杯子。”
- 更难:“找到更高的那个杯子。”
- 棘手:“找到屏幕的左半部分"或“找到人类耳朵以下的部分。”
- 关键点:有时没有杯子,有时有五个。机器人必须完美地数出数量,而不仅仅是找到一个。
等级 2:导航("GPS"游戏)
机器人必须弄清楚如何移动。- 地面检测:“向我展示我可以行走的地面。”(它必须忽略太滑的地毯或地上的洞。)
- 可行路径:“从这里画一条线到门口。”这条线必须保持在地板上,不能穿过墙壁。
- 视觉匹配:“这是一张在某个房间里拍摄的玩具图片。请在另一张从不同角度拍摄的图片中找到同一个玩具。”
等级 3:操作(“杂工”游戏)
机器人必须弄清楚如何使用物品。- 功能识别:“我应该抓这个水壶的哪里?”(它需要找到把手,而不是滚烫的底部。)
- 接触:“哪些物体接触着面包?”
- 放置:“我能把这个重箱子放在那把脆弱的椅子上吗?”(如果会弄坏,机器人必须回答“不能”。)
3. 结果:机器人仍在学习
研究人员在这项新测试中测试了89 种不同的 AI 模型(包括著名的商业模型和开源模型)。
- 好消息:最聪明的模型,尤其是那些具有“思考”模式的模型(就像人类花时间推理一样),表现更好。它们正越来越接近理解世界。
- 坏消息:即使是最好的模型也感到吃力。
- 计数很难:如果你让它们找“三个苹果”,它们经常只找到一个,或者幻觉出第四个。
- 部分令人困惑:它们很擅长找到整个“椅子”,但极不擅长只找到“椅腿”。
- 方向很棘手:它们对左与右感到困惑,或者不明白“面向窗户”是什么意思。
- “作弊”消失了:因为测试要求绘制精确的遮罩,模型无法仅仅靠猜测。它们必须真正地去观察。
4. 为何这很重要
将 EPIC-Bench 想象成 AI 的驾驶考试。以前,我们只是问汽车:“你知道停车标志是什么吗?”现在,我们将汽车放在有障碍物的真实道路上,要求它开到特定地点,并检查它是否真的保持在车道内。
该论文得出结论,虽然我们的 AI“眼睛”变得越来越敏锐,但它们仍然缺乏在混乱、真实的家庭环境中安全、可靠地与物理物体互动所需的深刻理解。这一新基准为研究人员提供了一张清晰的地图,确切地指出了机器人失败的地方,以便他们能够解决这些具体问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。