AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
本文介绍了 AgroVG,这是一个包含超过 10,000 个图像 - 查询对、涵盖六个农业目标家族的大规模多源基准,旨在将视觉 grounding 评估为通用集合预测任务,从而揭示当前模型在处理农业场景中微小、遮挡及数量可变物体时存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人园丁如何在一片巨大而杂乱的田地里工作。你希望给它的指令简单明了,比如:“只采摘左边成熟的苹果”,或者“喷洒杂草,但忽略健康的作物”。
长期以来,人工智能研究人员擅长教导机器人识别图片中“有什么”(例如:“那是一个苹果”)。但他们并不擅长教导机器人听从关于“事物位置”的“具体指令”,尤其是当数十个相似物体拥挤在一起时,或者当你所要求的事物根本不存在时。
本文介绍了AgroVG,这是一个新的“试驾”(基准测试),旨在检测人工智能模型是否真的能够遵循这些复杂的园艺指令。
以下是他们所做工作的分解,使用了简单的类比:
1. 问题:“大海捞针”挑战
在普通照片中,要求人工智能“找到猫”很容易。但在农田里:
- 干草堆: 可能有 50 个看起来几乎一模一样的麦穗。
- 针: 你可能要求“找到右边最高的三个麦穗”。
- 陷阱: 有时你要求“找到红苹果”,但图片中根本没有红苹果。聪明的机器人应该说“我没看到任何”,但愚蠢的机器人可能会产生幻觉,无论如何都指向一片绿叶。
现有的测试并没有检查机器人是否能同时处理这三种棘手的情况:找到一个特定物品、找到多个特定物品,或者在物品缺失时正确地说出"无"。
2. 解决方案:AgroVG“驾驶考试”
作者建立了一个名为AgroVG的庞大测试库。把它想象成农业机器人的大型标准化驾驶考试。
- 规模: 它包含超过10,000 道测试题。
- 多样性: 它涵盖了六种不同的“驾驶场景”(类别):作物与杂草、水果、麦穗、害虫(虫子)、植物病害和树冠。
- 两个难度等级:
- 等级 1(方框): 机器人围绕目标画一个方框。这就像说:“目标就在这个方框里的某个地方。”
- 等级 2(掩膜): 机器人围绕目标画出精确的轮廓。这就像说:“目标恰好是这个形状,不多也不少。”这要难得多,因为叶子和虫子有着奇怪且锯齿状的形状。
3. 他们如何测试
他们并没有用这个测试来训练机器人。相反,他们让26 种不同的人工智能模型(包括像 GPT-4 这样的大型知名模型,以及专门的开源模型)直接参加测试(零样本)。
他们提出了类似这样的问题:
- “找到最大的虫子。”(单一目标)
- “找到左边所有的杂草。”(多个目标)
- “找到蓝色的花。”(当图片中没有蓝色的花时)。
4. 结果:机器人表现挣扎
结果有点令人警醒。即使是最聪明的人工智能模型也未能以优异的成绩通过测试。
- “集合”问题: 当被要求找到所有杂草时,机器人通常只找到了最大、最明显的那些,却漏掉了更小、更隐蔽的。它们就像一个只回答简单问题而跳过其余问题的学生。
- “幻觉”问题: 当被要求寻找不存在的东西时(例如在绿草图片中“找到红苹果”),许多机器人自信地围绕随机绿叶画出方框或掩膜。它们太急于取悦,凭空捏造了不存在的目标。
- “精度”问题: 当被要求画出精确轮廓(等级 2)时,机器人往往很马虎。它们可能会画出一个覆盖整株植物的掩膜,而不是仅仅覆盖病叶,或者完全错过了边缘。
底线: 表现最好的模型在“找到多个物品”的问题中只答对了约35%,在“精确轮廓”问题中答对的比例甚至低于17%。
5. 为什么这很重要(根据论文观点)
论文认为,在我们能够信任机器人进入田地并根据语音指令喷洒农药或采摘水果之前,我们需要一种方法来衡量它们是否真的在正确倾听和观察。
AgroVG 就是那把衡量尺。它向我们表明,虽然人工智能在“看”懂图片方面变得越来越好,但在嘈杂的现实世界环境中“听”懂复杂指令方面仍然非常糟糕。它强调,我们需要的是不仅擅长发现事物,而且擅长知道何时没有事物存在,并擅长正确计数和分组的机器人。
简而言之: 我们为农场机器人设计了一场非常艰难的考试。它们参加了考试,但大多不及格。这告诉我们,在让它们独自下田工作之前,我们还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。