Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City
本文介绍了 Robusto-2 基准测试,旨在评估并比较来自利马和纽约市的人类驾驶员与视觉语言模型(VLMs)在涵盖这两个挑战性地理区域的多种驾驶场景中的表现,结果表明,尽管人类与视觉语言模型的反应会因问题类型而异,但由于场景具有高度的分布外特性,两组对象均未表现出归因于特定城市的显著性能差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:自动驾驶汽车会产生“文化冲击”吗?
想象一下,你正在教一个机器人开车。你在一个安静、有序的小镇训练它。然后,你把它丢到一个混乱、繁忙的大都市,那里的交通规则更像是建议而非法律。机器人会惊慌失措吗?它能理解正在发生的一切吗?
这篇论文的作者想要测试的正是不止于此。他们提出了这样一个问题:如果我们向自动驾驶汽车的“大脑”(称为视觉语言模型,即 VLMs)展示来自两个截然不同的混乱城市——秘鲁利马和美国纽约市的视频,它们的反应会与人类驾驶员不同吗?人类驾驶员在面对利马和纽约时,反应又会有所不同吗?
实验过程:一场针对人类与机器人的驾驶测试
把这项研究看作是一场大规模的多语言驾驶测试。
测试对象:
- 10 名来自利马的人类: 熟悉秘鲁街道的真实驾驶员。
- 10 名来自纽约的人类: 熟悉纽约市街道的真实驾驶员。
- 10 个 AI 模型: 来自不同科技公司的不同“大脑”(即 VLMs)。
- 总计: 30 位“驾驶员”参加测试。
测试材料:
- 他们没有使用完美的晴天画面。他们使用了来自利马和纽约的行车记录仪视频。
- 他们专门挑选了最“混乱”的 5 秒钟片段——即 AI 最感到困惑或产生自我矛盾的场景。这些是“边缘案例(edge cases)”,比如雨中出租车强行切入,或者行人横穿马路。
测试题目:
不仅仅是观看视频,每个人(人类和 AI)都必须回答关于视频的问题,就像做测验一样。问题分为四个类别:- 事实类: “汽车正在做什么?”(简单的观察)。
- 评分类: “如果按 1 到 10 分评分,这里的交通有多混乱?”(主观判断)。
- 反事实类: “需要发生什么情况才会导致碰撞?”(想象力)。
- 推理类: “谁拥有优先通行权?”(逻辑与规则)。
令人惊讶的结果
研究人员原本预期 AI 会被“外国”城市搞糊涂(例如,基于美国数据训练的 AI 可能会在利马表现不佳)。他们也预期利马的驾驶员会与纽约的驾驶员看法不同。以下是他们的实际发现:
1. “地理”迷思
- 预期: “利马的驾驶员看利马会与纽约驾驶员看利ма 的看法不同。”
- 现实: 并非如此。 无论是在看哪个城市的视频,来自利马的人类和来自纽约的人类给出的答案几乎完全一致。
- 类比: 想象向一位亚马逊雨林的渔民和一位北极圈渔民展示一张风暴的照片。尽管他们生活在不同的地方,但他们都会达成共识:“那是一场风暴。”利马或纽约的驾驶混乱是如此具有普遍性,以至于人类大脑处理它们的方式是相同的。
2. 人类与机器人的差距
- 预期: 或许 AI 和人类表现得一样好。
- 现实: 并非如此。 人类和 AI 给出的答案经常大相径庭。
- 类比: 如果你问人类和机器人:“那辆车快要撞上了吗?”,人类可能会说:“是的,司机看起来分心了,”而机器人可能会说:“不,距离是安全的。”他们在观察同一个场景,但“思考”的语言却完全不同。
3. “问题类型”比“地点”更重要
- 答案最大的差异并不在于视频是在哪里拍摄的(利马还是纽约),而在于提出了什么样的类型的问题。
- 当被问及简单事实时,大家意见一致。当被要求想象“如果……会怎样”的情景时,AI 和人类产生了巨大的分歧。
“混乱”的结论
论文以一个转折结束。通常,我们认为“分布外(Out-of-Distribution, OOD)”的数据是某种奇特且独特的现象。但作者发现,混乱是普世的。
无论是利马还是纽约的混乱街道,这种“杂乱感”在人类和 AI 眼中看起来都是一样的。差距不在于城市之间,而在于**生物大脑(人类)与数字大脑(AI)**之间的差距。
为什么这很重要(根据论文所述)
作者指出,由于这些城市非常混乱,且目前还没有自动驾驶汽车在那里运行,因此它们实际上是完美的“压力测试”。
- 类比: 如果你想测试一个新引擎是否强劲,你不会在平坦的高速公路上行驶。你会让它行驶在乱石堆上。利马和纽约就是驾驶界的“乱石堆”。
- 通过在这些混乱的数据上测试 AI,我们可以看清 AI 的“认知骨架”在哪里会相对于人类驾驶员发生崩溃。
简而言之, 不同文化背景的人类看待驾驶混乱的方式是相同的。然而,AI 无论是在哪里接受的训练,其看待方式都与人类不同。这篇论文提供了一个新的数据集,旨在帮助研究人员弥合这一差距。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。