想象一下,你头上戴着一个摄像机,记录着你从醒来到入睡的一整天。这产生了一部长达约 45 分钟的、未经剪辑的海量电影。现在,想象有人给了你一个特定的句子,比如:“找到你拿起那个把手上有缺口的蓝色杯子并往里倒咖啡的时刻。”
你的任务是观看这部 4 5 分钟的电影,并精准地指出何时发生了这一幕,以及杯子在画面中的什么位置。
这就是 LongEgoRefer 这篇论文所引入的挑战。以下是他们研究内容的拆解,我使用了简单的类比:
1. 问题所在:“大海捞针”
以往针对 AI 的视频游戏就像是在一小堆干草中寻找一根针。它们使用的是几秒钟长的短视频片段,其中的物体总是清晰可见的,比如一个在房间里跳动的红色小球。
但现实生活并非如此。在现实生活中,“你要找的针”(即你寻找的物体)可能只在 4 5 分钟的电影中出现短短几秒钟。它可能会被你的手遮挡,或者你可能在把它收起来之前只碰过它一次。该论文指出,目前的 AI 模型表现得很糟糕,因为它们习惯于处理简短且容易的任务。在面对长视频时,它们会迷失方向,并忘记自己原本在寻找什么。
2. 解决方案:为 AI 设计一场新的“考试”
作者创建了一个名为 LongEgoRefer 的新基准测试。你可以把它看作是为 AI 设计的一场全新的、难度极高的期末考试。
- 素材来源: 他们使用了数千小时真实的“第一视角”视频(来自名为 Ego4D 的数据集),这些视频记录了人们的日常活动。
- 题目内容: 他们编写了 1,498 个特定的问题(称为“指代性表达”)。这些问题并不简单,比如“杯子在哪?”,而是复杂的叙述,例如:“那个放在秤上的透明玻璃罐,随后被从一个银色袋子里倒出的深色颗粒填满了。”
- 难度系数:
- 时间维度: 视频非常庞大(平均时长 45 分钟)。
- 稀疏性: 他们询问的物体可能只出现在视频中 1% 的时间里。这就像是要求一个人在一场 45 分钟的广播节目中找到一段特定的 10 秒钟对话。
- 复杂性: 这些描述要求理解物体的运动方式以及它们与手的交互方式,而不仅仅是观察它们的外观。
3. 测试结果:AI 表现如何?
作者对目前最智能的 AI 模型(包括像 GPT-5 和 Gemini 这样的巨头)进行了这项新考试的测试。
- 结果: AI 模型表现得非常吃力。即使是最先进的模型,得分也非常低。
- 类比: 这就像是给一名学生一份数学测试卷,要求他们必须记住一本正在不断翻页的书里出现的某个特定数字。大多数模型在书的中段就迷失了。
- 胜出者: 名为 GPT-5 的模型表现最好,但即便如此,它也仅在“时空”(即时间和地点)细节上达到了约 16% 的正确率。这证明了这项任务极其困难,即使是对目前最顶尖的技术而言也是如此。
4. 为什么它们失败了?
论文发现 AI 失败主要有两个原因:
- 记忆缺失: 模型无法追踪整个 4 5 分钟的故事。当视频进行到结尾时,它们已经忘记了物体原本的样子。
- “何时”与“何处”的陷阱: AI 必须先确定事件发生的“时间”,然后再确定物体的“位置”。如果 AI 猜错了时间(例如,实际发生在第 30 分钟,但 AI 猜是第 10 分钟),那么即使它知道物体的样子,也会彻底失败。这就像是试图在一本书中寻找特定的页面,却从错误的章节开始搜索。
5. 核心启示
论文的结论是,我们需要新一代的 AI,它们能够真正地“观看”长视频,而不会感到困惑或遗忘细节。他们已经发布了这个新的“考试”(基准测试)和代码,以便其他研究人员尝试构建更好的模型来解决这个“大海捞针”的问题。
简而言之: 他们利用真实的、长时长的视频构建了一个超级难的测试,旨在表明当今的 AI 在长视频流中寻找特定、罕见瞬间的能力仍然很弱,并向世界发起挑战,希望大家能解决这个问题。
技术摘要:LongEgoRefer
问题定义
本文针对现有视频指代理解(Video Referring Expression Comprehension, Video REC)基准测试的局限性提出了研究,这些基准主要关注短小的、经过剪辑的视频片段(通常为 3-10 秒),其中目标物体出现得密集且可预测。这些设置无法反映现实世界中的第一视角(egocentric)录制场景,其特征包括:
- 长时长持续时间: 连续录制时长可达数十分钟甚至数小时。
- 稀疏的目标出现: 目标物体是瞬态出现的,通常在总视频时长中的占比不足 2%。
- 复杂的交互作用: 动态的人机交互(HOI)需要对时间上下文和状态变化进行理解。
- 语言复杂性: 指代表达通常较长、具有描述性,且对于在拥挤、视觉相似的场景中区分目标物至关重要。
核心挑战在于长时长、未剪辑的第一视角视频中的时空定位(Spatio-Temporal Grounding):给定一段自然语言查询,模型必须在目标物体在绝大部分时间内都处于缺失状态的情况下,识别出精确的时间区间(tstart,tend)以及对应的空间边界框(B)。
方法论
基准构建 (LongEgoRefer)
作者利用 Ego4D 数据集和 EgoTracks 注释构建了 LongEgoRefer。构建流程包括:
- 数据过滤: 选择时长超过 20 分钟且物体轨迹至少持续 10 秒,且相机佩戴者正在积极操作该物体的视频(is_active=True)。
- 混合标注: 使用半自动化流水线生成指代表达:
- LLM 生成: Gemini 2.5 Flash 为每个片段生成 10 个候选描述,随后进行汇总。
- 人工校验: 专家标注员对表达进行了严格的验证和精炼。大约 95.39% 的初始 LLM 生成描述经过了实质性的修改,以确保事实准确性、时间排他性(描述仅适用于特定时刻)和唯一性。
- 数据集统计: 最终的基准包含 1,498 条指代表达,分布在 433 个视频中。平均视频时长为 45 分钟(2,714.9 秒),平均指代表达长度为 63.5 个单词。目标物体在帧中的平均出现率仅为 1.3%。
基线模型与评估
为了评估基准测试的难度,作者建立了两类基线:
- 适配的 Video REC 模型: 将现有的端到端模型(如 VideoLISA, Sa2VA, Grounded SAM2)通过滑动窗口推理策略进行适配。长视频被分割成短窗口,模型独立处理每个窗口。
- 无需训练的两阶段流水线: 一种将任务解耦的模块化方法:
- 时间定位: 使用视觉语言模型(VLM)识别与查询匹配的粗略时间区间。
- 空间定位: 使用 Grounded SAM2(Grounding DINO + SAM2)在识别出的片段内定位物体。
指标: 评估采用了标准的视频 REC 指标,包括时间 IoU (tIoU)、视频 IoU (vIoU)、时空 IoU (STIoU) 以及针对负样本帧的改进型 IoU (IoU+n)。
关键结果
研究人员对 4 个视频 REC 模型、14 个开源 VLM 和 5 个闭源 VLM 进行了广泛实验。
- 整体难度: 即便是最先进的模型也面临显著困难。表现最好的模型 GPT-5 在 0.1 阈值下的时间 IoU (tIoU@0.1) 为 37.31,平均时空 IoU (mSTIoU) 为 8.76。大多数开源模型的 tIoU@0.1 仅为个位数。
- 开源 vs 闭源: 存在显著的性能差距。闭源模型(GPT-5, Gemini 2.5 Pro)的表现明显优于开源对应模型(如 InternVL 3.5, Qwen3-VL),尽管所有模型的绝对性能都较为有限。
- 误差传播: 两阶段流水线显示,第一阶段(时间定位)中的误差会严格限制第二阶段(空间定位)的表现。当提供真值(oracle)时间段时,空间定位性能大幅提升(例如,GPT-5 从 7.89 提升至 43.54),这表明时间定位是主要的瓶颈。
- 变量的影响:
- 时间分辨率: 减少帧采样(例如降至 64 帧)会导致性能急剧下降,表明需要密集的视觉线索。
- 物体稀疏性: 当物体出现率低于 1% 时,性能大幅退化。
- 视频长度: 随着视频时长的增加,性能普遍下降,尽管具有超大上下文窗口的模型(如 Gemini 2.5 Pro)表现出更强的鲁棒性。
- 语言复杂性: 更长、更复杂的指代表达与较低的性能呈相关性。
意义与主张
论文声称 LongEgoRefer 通过弥合当前基准测试与现实世界第一视角场景之间的差距,为评估视频理解建立了一个新的、更真实的标准。
- 内在难度: 该基准证明,在长时长视频中精确定位罕见事件和物体仍然是当前最先进模型(即使是具备高级推理能力的模型)面临的一个重大且尚未解决的挑战。
- 现有范式的局限性: 结果暴露了现有方法的根本瓶颈:
- 滑动窗口策略缺乏全局时间感知,导致高误报率。
- 两阶段流水线受到严重的误差传播影响,即时间上的不准确会导致空间定位失败。
- 未来方向: 作者强调,未来的模型需要具备强大的长时记忆、高级交互推理能力,以及在稀疏、杂乱的视觉环境中将复杂语言进行定位的能力。他们指出,虽然 LongEgoRefer 作为一个严苛的测试平台,但开发此类长时长视频的大规模训练数据集仍是未来的必要步骤。
论文总结道,LongEgoRefer 不仅仅是一个数据集,而是一个“极具挑战性的时空定位问题”,旨在推动研究向更具能力、以人为中心的 AI 系统发展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。