← 最新论文
💻 computer science

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

本文介绍了 TimeProVe,这是一个结合了轻量级动作驱动假设生成与针对性 VLM 验证的高效混合框架,旨在实现长视频中先进的时序推理能力,同时显著降低计算成本,并提出了用于评估日常生活场景的 OpenTSUBench 基准测试。

原作者: Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对 TIMEPROVE 论文的解释,通过日常类比将其拆解为简单的概念。

核心问题:大海捞针

想象你有一段某人在家一整天的视频录像,时长为一小时。你提出了一个问题,例如:“这个人是否吃了药,然后喝了水?”

为了回答这个问题,计算机需要从这 60 分钟的视频中找到一个特定的 10 秒钟瞬间。

  • 旧方法(“暴力破解”法): 想象雇佣一名超级聪明、昂贵的侦探(大型 AI 模型)逐帧观看整整一小时的视频。这极其缓慢,耗费巨额计算资源,并且经常让侦探被过多的无关信息(比如看那个人在睡觉或走向厨房)所淹没。
  • 字幕法(Caption Way): 另一种方法是先让一个廉价的机器人写一段视频摘要,然后让侦探阅读摘要。但这很冒险。如果机器人漏掉了一个微小的细节(比如一个细微的手部动作),侦达就永远看不见它,从而给出错误的答案。

解决方案:TIMEPROVE(“聪明侦察兵”系统)

作者提出了 TIMEPROVE,这是一个全新的系统,它就像一个两人搭档团队:一个快速、廉价的“侦察兵”和一个缓慢、昂贵的“专家”。

与其让专家观看整个小时,不如让侦察兵先完成繁重的体力活。

1. 侦察兵:基于动作的候选证据 (ACE)

侦察兵想象成一名快速、轻量级的保安,他会看一遍视频。

  • 他们做什么: 他们不会分析每一个细节。相反,他们只是记录下一个动作时间线:“在 1:05,那个人在走动。在 1:15,他们打开了冰箱。在 1:20,他们喝了水。”
  • 神奇的一步: 当你提出问题(“他们吃药了吗?”)时,侦察兵会使用一个小型、廉价的大脑(轻量级 AI)来查看那个时间线。它会猜测:“嗯,药瓶通常在水槽附近。让我们看看‘喝水’的时刻以及它之前的 10 秒钟。”
  • 输出结果: 侦察兵创建了一份短的假设清单(猜测),并指向非常短且具体的视频片段(例如仅 5 秒长),那里可能隐藏着答案。

2. 专家:时序验证器

现在,专家(昂贵且强大的 AI)只会在极短的时间内介入。

  • 他们做什么: 侦察兵只将那短短 5 秒钟的片段发送给专家。专家会仔细观察视觉细节(瓶子上的标签、手部动作)以确认侦察兵的猜测是否正确。
  • 结果: 如果专家说:“是的,那绝对是药,”系统就会给出答案。如果没有,它会迅速检查侦察兵清单上的下一个短片段。

为什么这是一个游戏规则的改变者

论文声称这种方法在三个方面实现了巨大的升级:

  1. 更便宜: 因为昂贵的专家只观察微小的片段而不是整个小时,成本降低了 93%。这就像是支付 5 分钟的咨询费,而不是 60 小时的轮班费。
  2. 更快: 系统不必等待专家处理数小时的数据。它显著缩短了等待时间。
  3. 更聪明: 通过首先关注动作(如“喝水”或“走路”),系统不会错过那些简单文本摘要可能会跳过的微妙细节。

新的测试:OPENTSUBENCH (OTB)

作者意识到现有的 AI 系统测试太简单了(就像可以通过猜测来回答的选择题)。因此,他们构建了一个新的测试,名为 OPENTSUBENCH

  • 类比: 想象一场驾驶考试,与其问:“司机在红灯前停下了吗?(A) 是, (B) 否”,不如问:“请描述司机在下午 2:00 到 2:15 之间具体做了什么。”
  • 这个新测试迫使 AI 必须证明它确实看到了证据,而不仅仅是猜出了答案。TIMEPROVE 在这项高难度新测试中比现有最优秀的系统高出了 7.3%

总结

TIMEPROVE 是一个聪明的工作流,它节省了金钱和时间。它使用一个快速、廉价的侦察兵来寻找长视频中最可能的时刻,然后仅在需要双重检查这些特定时刻时,才请出强大、昂贵的专家。这确保了答案的准确性,同时不会因为观看整部电影而浪费资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →