← 最新论文
💻 computer science

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

本文介绍了 LongEgoRefer,这是一个利用长篇 Ego4D 视频构建的具有挑战性的新基准测试,它通过呈现极端的目标稀疏性和复杂的交互作用,解决了现有短片段数据集的局限性,并揭示了当前最先进的模型在长篇第一视角时空定位方面面临着显著困难。

原作者: Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你头上戴着一个摄像机,记录着你从醒来到入睡的一整天。这产生了一部长达约 45 分钟的、未经剪辑的海量电影。现在,想象有人给了你一个特定的句子,比如:“找到你拿起那个把手上有缺口的蓝色杯子并往里倒咖啡的时刻。”

你的任务是观看这部 4 5 分钟的电影,并精准地指出何时发生了这一幕,以及杯子在画面中的什么位置

这就是 LongEgoRefer 这篇论文所引入的挑战。以下是他们研究内容的拆解,我使用了简单的类比:

1. 问题所在:“大海捞针”

以往针对 AI 的视频游戏就像是在一小堆干草中寻找一根针。它们使用的是几秒钟长的短视频片段,其中的物体总是清晰可见的,比如一个在房间里跳动的红色小球。

但现实生活并非如此。在现实生活中,“你要找的针”(即你寻找的物体)可能只在 4 5 分钟的电影中出现短短几秒钟。它可能会被你的手遮挡,或者你可能在把它收起来之前只碰过它一次。该论文指出,目前的 AI 模型表现得很糟糕,因为它们习惯于处理简短且容易的任务。在面对长视频时,它们会迷失方向,并忘记自己原本在寻找什么。

2. 解决方案:为 AI 设计一场新的“考试”

作者创建了一个名为 LongEgoRefer 的新基准测试。你可以把它看作是为 AI 设计的一场全新的、难度极高的期末考试。

  • 素材来源: 他们使用了数千小时真实的“第一视角”视频(来自名为 Ego4D 的数据集),这些视频记录了人们的日常活动。
  • 题目内容: 他们编写了 1,498 个特定的问题(称为“指代性表达”)。这些问题并不简单,比如“杯子在哪?”,而是复杂的叙述,例如:“那个放在秤上的透明玻璃罐,随后被从一个银色袋子里倒出的深色颗粒填满了。”
  • 难度系数:
    • 时间维度: 视频非常庞大(平均时长 45 分钟)。
    • 稀疏性: 他们询问的物体可能只出现在视频中 1% 的时间里。这就像是要求一个人在一场 45 分钟的广播节目中找到一段特定的 10 秒钟对话。
    • 复杂性: 这些描述要求理解物体的运动方式以及它们与手的交互方式,而不仅仅是观察它们的外观。

3. 测试结果:AI 表现如何?

作者对目前最智能的 AI 模型(包括像 GPT-5 和 Gemini 这样的巨头)进行了这项新考试的测试。

  • 结果: AI 模型表现得非常吃力。即使是最先进的模型,得分也非常低。
  • 类比: 这就像是给一名学生一份数学测试卷,要求他们必须记住一本正在不断翻页的书里出现的某个特定数字。大多数模型在书的中段就迷失了。
  • 胜出者: 名为 GPT-5 的模型表现最好,但即便如此,它也仅在“时空”(即时间和地点)细节上达到了约 16% 的正确率。这证明了这项任务极其困难,即使是对目前最顶尖的技术而言也是如此。

4. 为什么它们失败了?

论文发现 AI 失败主要有两个原因:

  1. 记忆缺失: 模型无法追踪整个 4 5 分钟的故事。当视频进行到结尾时,它们已经忘记了物体原本的样子。
  2. “何时”与“何处”的陷阱: AI 必须先确定事件发生的“时间”,然后再确定物体的“位置”。如果 AI 猜错了时间(例如,实际发生在第 30 分钟,但 AI 猜是第 10 分钟),那么即使它知道物体的样子,也会彻底失败。这就像是试图在一本书中寻找特定的页面,却从错误的章节开始搜索。

5. 核心启示

论文的结论是,我们需要新一代的 AI,它们能够真正地“观看”长视频,而不会感到困惑或遗忘细节。他们已经发布了这个新的“考试”(基准测试)和代码,以便其他研究人员尝试构建更好的模型来解决这个“大海捞针”的问题。

简而言之: 他们利用真实的、长时长的视频构建了一个超级难的测试,旨在表明当今的 AI 在长视频流中寻找特定、罕见瞬间的能力仍然很弱,并向世界发起挑战,希望大家能解决这个问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →