SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving
本文介绍了 SENSE-VAD,这是首个专门针对社交复杂视频异常(例如挑战基于运动检测的智能体间关系)的自动驾驶合成基准测试,通过利用 CARLA 和 Unreal Engine 生成多样化场景,并证明了当前最先进的方法无法解决这一独特的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一辆自动驾驶汽车如何成为一名优秀的司机。目前,这些汽车非常擅长发现“物理性”危险:比如停在路中间的车辆、红灯或从路缘迈步的行人。它们就像一名保安,只盯着那些跑得太快或站在错误位置的人。
但存在着一个完全不同于速度或位置的危险世界,那就是关于关系的危险。
问题所在:“社交盲区”
这篇论文指出,目前的自动驾驶汽车在“社交上是盲目的”。它们能看到一个正在奔跑的孩子,但无法分辨以下两种情况的区别:
- 正常: 一个孩子正开心地向人行道上的父母跑去。
- 危险: 一个孩子正从父母身边跑开,冲向车流。
对于标准的摄像头来说,这两个孩子都只是“正在快速移动的孩子”。危险不在于孩子的速度,而在于孩子与父母之间正在发生的故事。如果汽车读不懂这个故事,它可能就不会在应该刹车时及时刹车。
研究人员将这类驾驶问题称为“长尾”问题。你无法通过编程来处理每一次你见过的特定事故。相反,你需要一个系统,它能够说:“等等,根据这些人之间的互动方式,这个情况感觉很诡异,”并在发生碰撞之前将控制权交给人类。
解决方案:SENSE-VAD
为了解决这个问题,研究人员创建了一种新的训练工具,名为 SENSE-VAD。你可以把它想象成汽车的“社交剧场模拟器”。
- 它是电影制片厂,而非测试赛道: 他们没有通过撞毁真实的汽车来测试,而是利用一个游戏引擎(CARLA)创建了数千个虚假但真实的视频。
- “社交”剧本: 他们不仅仅是让汽车发生碰撞。他们编写了关于社交场景的剧本:
- 一个人正被另一个人抬着走(可能是在受伤或被绑架)。
- 一群人在互相追逐(是在进行警察追捕,还是在玩游戏?)。
- 一只狗在主人分心时四处乱跑。
- 一个遗落在路上的包看起来很可疑。
- 转折点: 在许多这些视频中,动作看起来完全正常。一个人在行走,仅仅是在行走。但因为他们是谁以及他们在做什么,这实际上是一场紧急情况。
实验:测试“聪明”的汽车
研究人员选取了目前最先进的 11 个 AI 系统(包括那些使用大型语言模型来“思考”场景的系统),并要求它们观看这些视频并识别危险。
结果令人震惊:
- “运动”专家失败了: 那些擅长识别快速行驶车辆或异常轨迹的系统感到很困惑。它们看到人们动作正常,便判定“一切正常”。
- “思考”专家也失败了: 即便是那些使用先进 AI 来“解读”场景(例如可以描述图像的机器人)的系统也大多失败了。它们能看到人,但无法理解人与人之间的“关系”。
- 得分: 最好的系统也仅能答对约 57% 的题目。这几乎跟抛硬币猜正反面差不多。
“为什么”:失灵的指南针
为了理解 AI 为什么会失败,研究人员与一个非常聪明的 AI(视觉语言模型)进行了一场“二十个问题”的游戏。他们问道:
- “你看到了什么?”
- “汽车应该怎么做?”
- “这里有危险吗?”
AI 的回答:
AI 完美地观察到了人们。它可以描述他们。但当被问及是否存在危险时,它要么:
- 对所有场景都说“是的,有危险!”(即使是正常场景);或者
- 即使一个孩子正跑向繁忙的马路,它也说“没有危险”。
这就像一个人可以详细描述电影场景,却完全错过了剧情转折。他们看到了演员,但没看懂故事。
总结
论文得出结论,我们不能仅仅通过修补现有的软件来解决这个问题。问题是根本性的:目前的 AI 观察的是“什么”在移动,但并不理解“为什么”在移动。
SENSE-VAD 是第一个专门设计用来教会汽车如何阅读道路“社交剧本”的工具。它证明了,除非我们教会汽车理解关系(如父母与孩子,或追捕者与受害者),否则它们对这一大类现实世界的危险仍将保持盲目。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。