← 最新论文
💬 NLP

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

本文介绍了 PaSBench-Video,这是一个流式视频基准测试,它表明当前的视觉语言大模型无法提供及时且准确的主动安全警告,因为它们难以在不触发过度误报的情况下,将新兴风险与安全场景区分开来。

原作者: Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名繁忙游乐场里的安全管理员。你的职责不仅仅是在孩子从滑梯上摔下来后大喊“停!”,而是要在摔倒发生前的那个“摇晃”瞬间就察觉到异样,发出警告,并给家长留出足够的反应时间去接住孩子。

这篇论文介绍了一种全新的 AI 摄像头“测试”,旨在观察它们是否能做到这一点。研究人员将其称为 PaSBench-Video

以下是他们做了什么、发现了什么以及为什么这很重要,我们使用简单的类比来进行说明。

1. 问题所在:AI 是一个“事后诸葛亮”侦探

目前的 AI 安全系统就像是只在犯罪发生后才出现的侦探。它们看着视频说:“噢,车祸了!”或者“噢,有人摔倒了!”

但为了实现真正的安全,AI 需要成为一个主动的闹钟。它需要看到危险正在积聚的过程(比如汽车紧急刹车或幼儿攀爬婴儿床栏杆),并在还有时间进行补救时就发出警报。

研究人员发现,现有的 AI 安全测试存在缺陷。这些测试就像是让一名司机针对昨天发生的一场车祸参加笔试,而不是观察他们实时驾驶的过程。旧的测试并不关心 AI 何时喊出“危险!”,只关心它最终是否做到了。

2. 新的测试:一场“实战演习”

团队创建了 PaSBench-Video,这是一个包含 740 个视频片段的海量集合。你可以把它看作是 AI 安全领域的“驾驶模拟器”。

  • 481 个片段展示了事情变糟的过程(一辆车即将撞上骑自行车的人、一个人即将滑倒、一个宝宝正在爬栏杆)。
  • 259 个片段展示了正常的安全场景(汽车平稳行驶、人们在公园散步)。

测试规则:

  1. 仅限实时: AI 只能看到到目前为止已经发生的内容。它不能偷看未来。
  2. “金发姑娘”区间(恰到好处): AI 必须在完美的时机发出“警告!”。
    • 如果喊得太早(在危险显现之前),那就是误报(就像烟雾报警器因为你烤焦了一片吐司而响起来一样)。
    • 如果喊得太晚(在碰撞发生之后),那就是毫无用处
    • 它还必须解释什么是危险的(例如:“那辆车正在刹车”,而不只是说“出事了”)。
  3. 静默测试: 如果视频内容是安全的,AI 必须保持沉默。

3. 测试结果:AI 在“狼来了”

研究人员测试了目前最智能的 13 个 AI 模型。结果令人清醒。

“狼来了”问题:
这些 AI 模型在时机把握方面表现得很糟糕。它们就像是一个神经质的保安,每当有人走过门口时就会尖叫“着火了!”。

  • 权衡取舍: 当研究人员告诉 AI 要提高灵敏度(以捕捉更多真实的危险)时,它就开始对安全场景频繁乱叫。
  • 数学逻辑: 捕捉真实危险与产生误报之间存在紧密的联系。为了捕捉 100% 的真实危险,AI 必须在 60%–80% 的安全视频中大喊“危险!”。这会让系统变得毫无用处,因为人们会不再听从它的警告(这种现象被称为“报警疲劳”)。

“盲区”问题:
AI 在驾驶场景中最容易出错。

  • 日常生活: 在家里,危险往往看起来很“怪异”(比如宝宝在爬墙)。AI 能很容易识别出这种“怪异感”。
  • 驾驶: 在交通中,一辆正在安全并线的车看起来与一辆即将撞车的车几乎一模一样。AI 无法分辨两者的区别。它看到“车辆在移动”就会陷入恐慌,对着正常的交通流大声发出警告。

“理由错误”问题:
即使 AI 在正确的时间发出了警告,它也经常找错原因。

  • 真实的危险: “一辆棕色的车正要驶出。”
  • AI 的警告: “一辆蓝色的巴士正在过来!”
    它看到了危险,却产生了幻觉,搞错了细节。这就像一名保安大喊“有入侵者!”,却指错了人。

计分板:
在最严格的测试(正确时机 + 正确原因 + 无误报)下,没有任何一个 AI 模型得分超过 20%。这意味着在 10 次尝试中,有 8 次 AI 要么漏掉了危险,要么喊得太早,要么喊得太晚,或者喊错了对象。

4. 现实检验:它还没准备好进入现实世界

论文还探讨了实际应用层面。即便 AI 足够聪明,它目前也还不够快,也不够便宜,无法投入使用。

  • 速度: 为了实现实时工作,AI 需要每 0.3 秒做出一次决策。而最快的 AI 需要思考 3.5 秒。这就像一名保安在孩子摔倒后还要反应 10 秒钟一样慢。
  • 成本: 如果想在单个摄像头上全天候运行这样的系统,使用最好的模型每天将耗费数千美元。

总结

这篇论文是对 AI 安全的一次“现实检验”。它表明,虽然 AI 在理解视频方面正在进步,但它还不足以成为一名主动的安全管理员

目前,这些模型就像是一个能在事故发生后完美描述车祸过程的学生,但却无法在车祸发生前预判它。它们依赖于表层的“怪异感”,而不是真正理解危险是如何积聚的。在它们能够区分“正常行驶的汽车”和“即将撞车的汽车”且不乱叫之前,它们还没有准备好保护我们的道路或家庭安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →