← 最新论文
💻 computer science

Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

本文总结了在 CVPR 2026 期间举办的联合第一人称视觉研讨会(Joint Egocentric Vision Workshop)上举行的第一届异步 CASTLE 挑战赛(Asynchronous CASTLE Challenge)的贡献与结果。

原作者: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图记住四天假期中发生的一切,不仅是那些高光时刻,还包括每一次对话、每一个移动的物体以及房间里每一个细微的变化,同时还要同时以十个不同人的视角进行观察。这就是一种计算机即使在喂养了数千小时视频后仍难以应对的记忆测试。在人工智能领域,研究人员正试图构建能够观看日常生活的长篇、非脚本录像,并能像人类读完日记或看完电影后那样,针对这些录像回答特定问题的系统。挑战在于海量的信息量,以及需要将可能被间隔数小时甚至数天之久的细节联系起来的能力。如果机器能够学会这一点,它最终可以帮助我们搜索多年的个人影像,以寻找某个特定的瞬间,或理解人们生活方式中的复杂模式。

为了测试我们离解决这一问题还有多远,一组研究人员组织了一场名为 CASTLY 的挑战赛。他们为参赛队伍提供了一个庞大的数据集,其中包含超过 600 小时的高清视频,这些视频是以高帧率记录的,以捕捉每一个细节。素材来自十名参与者在进行正常生活活动时佩戴的摄像头,以及五台从房间内观察的固定摄像头。数据非常丰富,包括音频、心率监测器,甚至还有热成像图像,创造了一个完整的四天活动数字记录。参赛队伍的任务在理论上很简单,但在实践中却极其困难:他们必须回答 185 个关于视频中发生了什么的单选题。这些问题要求计算机追踪人物、计数物体、记住物品藏在哪里,并理解事件发生的时间点,例如弄清楚谁先吃了一块蛋糕,或者在最后一天某人充电的速度有多快。

四支队伍接受了挑战,每支队伍都带来了不同的策略。获胜的队伍名为 WDL,他们将这项任务视为像侦探收集线索一样。他们的系统并没有尝试一次性观看全部 600 小时的视频,而是首先查看问题以寻找关键词,例如某个人的名字或特定的日期。然后,他们利用这些线索仅提取出视频和语音转录中最相关的部分,忽略其余部分。他们训练计算机模型严格专注于所发现的证据,针对每个问题运行严格、平衡且激进的提示词变体,以通过多样本自一致性来确保一致性。这种方法使他们的准确率达到了近 58%,这意味着他们答对了 185 个问题中的约 108 个。

另一支名为 MARS 的队伍采取了更具交互性的方法。他们构建了一个像好奇的代理(agent)一样的系统,逐步决定下一步要查看哪类信息。如果问题是关于身体活动的,系统可能会专门针对此类查询检查心率数据。如果问题是关于某人看向哪里,它就会调取眼动追踪数据。通过动态地选择要检查的证据片段,而不是尝试一次处理所有内容,他们将得分提高到了 57%。第三支队伍 TAHAKOM 将信息组织成一个结构化的关系图谱,将人物、地点和物体与时间戳相连。这使得他们可以向系统询问关于事件之间联系的具体问题,达到了 54.6% 的准确率。最后一支队伍 CuriosAI 则专注于防止计算机“一本正经地胡说八道”。他们建立了一个严格的过程,要求系统必须寻找证据,将其与原始视频进行核实,然后再进行回答,从而确保每一项主张都基于实际看到的或听到的内容。他们的最佳方法达到了 49.7% 的准确率。

比赛结果表明,尽管计算机在理解长视频方面正在变得更好,但仍有很长的路要走。顶尖队伍答对了超过一半的问题,这比随机猜测有了显著进步,但他们仍然漏掉了近一半的答案。或许最能说明问题的是,各支队伍答对的问题并不完全相同。当你把四支队伍的正确答案结合起来时,他们成功解决了 185 个问题中的 176 个,仅剩下 9 个问题是没有任何一支队伍能回答出来的。这表明目前还没有哪种单一的方法是完美的,但不同的方法捕捉到了拼图的不同部分。研究人员发现,最大的障碍仍然是在没有迷失在海量数据中之前,能否覆盖足够的证据。虽然这些系统可以浏览数百小时的素材,但在长时间跨度内对非脚本化的现实世界事件进行推理的任务,仍然是一个困难的问题。这场比赛并没有解决问题,但它清晰地表明,结合这些不同的策略可能是构建真正理解我们日常生活的机器的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →