From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs
本文介绍了 SPRINT,这是一个旨在评估多模态大语言模型(MLLM)主动风险推理能力的真实世界体育视频综合基准测试,研究揭示了尽管当前模型擅长检测危险,但它们在识别潜在诱因方面仍存在困难,并频繁产生误报,从而凸显了在动态物理环境中实现可靠主动安全方面的关键差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在看一部电影,但不仅仅是看到屏幕上发生了什么,而是你身边坐着一位超级聪明的伙伴,他能在剧情转折发生之前就预见到它们。在人工智能的世界里,这个朋友被称为多模态大语言模型(MLLM)。这些是强大的计算机大脑,它们可以“看”图像和视频,也能“读”文本,使它们能够以一种几乎接近人类的方式来理解世界。长期以来,科学家们一直在教这些 AI 伙伴在坏事发生之后去识别它们,比如识别一张火灾的照片或一段关于危险动物的文字。但真正的魔力——也是真正的安全挑战——在于主动性思维。这是一种观察一个场景,发现微小、微妙的线索(比如一个摇晃的梯子或一个倾斜过度的跑者),然后在灾难真正发生之前大喊:“等等!要出事了!”的能力。这就像是在房子烧毁后才打电话给消防队,与在火焰升起前就注意到烟雾并打电话之间的区别。
这正是中国人民大学的一个研究团队想要测试的内容。他们提出了一个简单但令人后怕的问题:我们目前的 AI 超级大脑真的能实时预测物理事故吗,还是它们只是在装聪明?为了找出答案,他们构建了一个新的测试场,名为 SPRINT(运动主动风险推理测试平台)。他们收集了近 3,000 段真实的运动事故视频——从滑板摔倒到体操跌落——并将它们与没有发生坏事的安全视频配对。他们不仅仅是问 AI,“有人受伤了吗?”(这在事后很容易回答)。相反,他们问的是:“即将发生什么问题,以及为什么?”他们想看看 AI 是否能在危险酝酿阶段就察觉到它,比如在滑板手撞向地面之前,注意到他的脚正在打滑。
结果却让人有些警醒。研究人员发现,虽然这些 AI 模型在危险变得显而易见时(比如看到一个人躺在地上)表现出色,但在预测危险发生之前的能力却令人惊讶地糟糕。当 AI 被给予一段运动事故视频并被要求在没有被告知寻找危险的情况下描述情况时,它经常完全忽略掉那些警告信号。更糟糕的是,当研究人员明确询问“这里有危险吗?”时,AI 开始陷入恐慌。它开始在安全的视频中发现危险,比如一名体操运动员完成完美的翻转或一名跑步者在冲刺,仅仅是因为这个问题让它变得疑神疑鬼。就好像这个 AI 太渴望说出“我发现问题了!”以至于它开始在不存在问题的地方凭空捏造问题。
这项分析了 14 种不同运动、共 2,888 段视频的研究揭示了 AI 在“感知”危险与“理解”危险之间存在着巨大的鸿沟。最好的 AI 模型在事故已经发生时,能正确发出存在隐患的信号,准确率超过 95%。然而,当被要求解释为什么会发生事故,或者要求从视频的前几秒就开始进行预测时,它们的表现骤降至 50% 以下。事实上,当研究人员使用一个询问关于危险的提示词在安全视频上测试 AI 时,一些模型竟然有一半以上的时间会将无害的高能运动误判为事故。
研究人员还尝试利用他们的新数据集来“教导”其中一个 AI 模型,希望能修复这些盲点。经过一些训练后,该 AI 在识别事故原因方面变得更好,并且不太容易在安全视频上“虚报警报”。然而,即使有了这些帮助,AI 在面对最难的部分时仍然感到吃力:即在没有任何提示的情况下,观察一段处于早期阶段的运动视频,并正确识别出可能导致事故的具体物理原因。
最后,论文指出,虽然我们目前的 AI 朋友在描述它们所看到的内容方面正变得越来越好,但它们尚未掌握“主动安全”的艺术。它们目前主要还是反应式的,在等待碰撞发生之后才去理解它。研究结论认为,对于 AI 要想在现实世界中真正实现安全——无论是驾驶汽车、帮助老年人还是观看体育比赛——它需要超越仅仅识别明显的隐患。它需要学会理解危险的成因,并信任自己的眼睛,而不是仅仅根据我们提出的问题做出反应。在此之前,我们可能仍需要保持对局面的关注,以防 AI 把一次完美的跳跃判定为一场即将发生的灾难。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。