← 最新论文
💬 NLP

TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding

本文介绍了 VES-Bench,这是一个用于审计长视频理解方法是否解码了涵盖所有必要证据的帧的新基准,并提出了 TRACE,一种无需训练的智能体,它通过迭代构建证据包来以显著低于均匀解码的帧成本实现更高的答案准确率。

原作者: Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengyiang Liu, Junbo Niu, Xiaoyang Hu, Zhongyue Shi, Zitian Wang, Linjiang Huang, Si Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

观看一段长视频以回答一个特定问题,对于人类来说是一个感觉简单的任务,但对人工智能而言却依然具有惊人的难度。当一个人观看电影时,他们不仅仅是在看流动的图像;他们还在大脑中构建了一个事件的心理地图,记得角色在第一幕拿起了钥匙,而这把钥匙在最后一幕中被用来开门。然而,目前的计算机系统往往难以处理这种长时程的理解。它们可能会观察视频中的几个快照并猜测答案,或者尝试阅读剧情的文本摘要,从而完全忽略了视觉细节。核心问题在于,许多关于长视频的问题都依赖于散落在不同时间点的证据。如果系统错过了其中任何一个分散的时刻,它就无法得知真相,尽管它仍可能通过猜测产生一个看似正确且自信的答案。这种系统声称所知与其实际所见之间的差距,正是研究人员试图解决的核心挑战。

一个研究团队推出了一种名为 TRACE 的新方法,旨在迫使人工智能在回答之前先观察视频的正确部分。TRACE 不依赖于文本摘要或基于几个随机帧进行猜测,而是像一个细心的观察者一样,通过逐步构建来得出答案。它首先扫描视频,寻找与问题相关的微小、特定的片段,即“锚点”。然后,它将这些片段组合在一起,并要求系统仅根据目前所见的内容来回答问题。系统并不会止步于此,它会不断向自己的收藏中添加新的片段,并反复提问。这个过程会一直持续,直到答案不再发生变化,这表明系统已经收集到了足够的视觉证据来确定答案。至关重要的是,系统会通过最后一次重放最终的一组片段来检查自己的工作,以确保答案能够站得住脚。这种方法确保了最终的答案不是基于局部视角的猜测,而是基于完整视觉事实的结论。

为了测试这种方法是否真的有效,研究人员创建了一个新的测试场,称为 VES-Bench。这是一个包含 600 个问题的集合,这些问题选自 348 段公开视频,涵盖了诸如理清事件发生的顺序或统计特定动作发生次数等任务。与以往只检查最终答案对错的测试不同,VES-Bench 对过程本身进行审计。它会追踪系统在做出决定之前究竟观察了视频中的哪些帧。该测试验证了系统是否真的看到了回答问题所需的每一个时刻。如果一个系统得到了正确答案,但却错过了某个关键场景,审计会将其标记为失败,因为该答案并非真正由证据支持。这种严格的评估揭示了许多现有方法往往只是运气好,在没有看到视频所有必要部分的情况下就答对了。

当研究人员将 TRACE 应用于这项严格的测试时,结果显示出了明显的优势。使用与其他先进系统相同的底层技术,TRACE 在确保至少从每个必需场景中看到了两个不同的帧的情况下,正确回答了 50.7% 的问题。相比之下,其他观察了相似数量帧的方法往往无法覆盖所有必要的场景,或者必须观察两倍以上的帧数才能达到同样的确定程度。TRACE 在平均每个问题使用不到 100 个帧的情况下,就实现了这种高水平的准确性,而那些仅仅以统一速率扫描视频的系统所花费的成本要高得多。研究发现,成功的关键不在于观察更多的数据,而在于知道何时停止观察。通过等待答案稳定并随后双重检查原始视觉证据,TRACE 避免了基于不完整信息的猜测陷阱。

研究人员还发现,仅仅增加系统观察的帧数并不总能带来更好的答案。当他们测试一些观察帧数不断增加的标准系统时,准确率仅在一定程度上有所提高,之后增加帧数便不再有帮助。这表明问题不在于缺乏数据,而在于缺乏一种知道哪些数据重要的策略。TRACE 通过使用一种证据的“轨迹”解决了这个问题,系统学会了识别何时已经收集了足够的信息以确保确定性。这项研究证实,对于长视频而言,定位并整合特定视觉时刻的能力,比单纯处理海量视频数据更为重要。通过将答案建立在原始视觉片段的基础上,并仅在证据完整时才停止,TRACE 展示了一种让机器更可靠地理解随时间展开的世界的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →