想象一下,试图记住四天假期中发生的一切,不仅是那些高光时刻,还包括每一次对话、每一个移动的物体以及房间里每一个细微的变化,同时还要同时以十个不同人的视角进行观察。这就是一种计算机即使在喂养了数千小时视频后仍难以应对的记忆测试。在人工智能领域,研究人员正试图构建能够观看日常生活的长篇、非脚本录像,并能像人类读完日记或看完电影后那样,针对这些录像回答特定问题的系统。挑战在于海量的信息量,以及需要将可能被间隔数小时甚至数天之久的细节联系起来的能力。如果机器能够学会这一点,它最终可以帮助我们搜索多年的个人影像,以寻找某个特定的瞬间,或理解人们生活方式中的复杂模式。
为了测试我们离解决这一问题还有多远,一组研究人员组织了一场名为 CASTLY 的挑战赛。他们为参赛队伍提供了一个庞大的数据集,其中包含超过 600 小时的高清视频,这些视频是以高帧率记录的,以捕捉每一个细节。素材来自十名参与者在进行正常生活活动时佩戴的摄像头,以及五台从房间内观察的固定摄像头。数据非常丰富,包括音频、心率监测器,甚至还有热成像图像,创造了一个完整的四天活动数字记录。参赛队伍的任务在理论上很简单,但在实践中却极其困难:他们必须回答 185 个关于视频中发生了什么的单选题。这些问题要求计算机追踪人物、计数物体、记住物品藏在哪里,并理解事件发生的时间点,例如弄清楚谁先吃了一块蛋糕,或者在最后一天某人充电的速度有多快。
四支队伍接受了挑战,每支队伍都带来了不同的策略。获胜的队伍名为 WDL,他们将这项任务视为像侦探收集线索一样。他们的系统并没有尝试一次性观看全部 600 小时的视频,而是首先查看问题以寻找关键词,例如某个人的名字或特定的日期。然后,他们利用这些线索仅提取出视频和语音转录中最相关的部分,忽略其余部分。他们训练计算机模型严格专注于所发现的证据,针对每个问题运行严格、平衡且激进的提示词变体,以通过多样本自一致性来确保一致性。这种方法使他们的准确率达到了近 58%,这意味着他们答对了 185 个问题中的约 108 个。
另一支名为 MARS 的队伍采取了更具交互性的方法。他们构建了一个像好奇的代理(agent)一样的系统,逐步决定下一步要查看哪类信息。如果问题是关于身体活动的,系统可能会专门针对此类查询检查心率数据。如果问题是关于某人看向哪里,它就会调取眼动追踪数据。通过动态地选择要检查的证据片段,而不是尝试一次处理所有内容,他们将得分提高到了 57%。第三支队伍 TAHAKOM 将信息组织成一个结构化的关系图谱,将人物、地点和物体与时间戳相连。这使得他们可以向系统询问关于事件之间联系的具体问题,达到了 54.6% 的准确率。最后一支队伍 CuriosAI 则专注于防止计算机“一本正经地胡说八道”。他们建立了一个严格的过程,要求系统必须寻找证据,将其与原始视频进行核实,然后再进行回答,从而确保每一项主张都基于实际看到的或听到的内容。他们的最佳方法达到了 49.7% 的准确率。
比赛结果表明,尽管计算机在理解长视频方面正在变得更好,但仍有很长的路要走。顶尖队伍答对了超过一半的问题,这比随机猜测有了显著进步,但他们仍然漏掉了近一半的答案。或许最能说明问题的是,各支队伍答对的问题并不完全相同。当你把四支队伍的正确答案结合起来时,他们成功解决了 185 个问题中的 176 个,仅剩下 9 个问题是没有任何一支队伍能回答出来的。这表明目前还没有哪种单一的方法是完美的,但不同的方法捕捉到了拼图的不同部分。研究人员发现,最大的障碍仍然是在没有迷失在海量数据中之前,能否覆盖足够的证据。虽然这些系统可以浏览数百小时的素材,但在长时间跨度内对非脚本化的现实世界事件进行推理的任务,仍然是一个困难的问题。这场比赛并没有解决问题,但它清晰地表明,结合这些不同的策略可能是构建真正理解我们日常生活的机器的关键。
技术摘要:第1届异步 CASTLE 挑战赛结果
问题定义
本文报告了在 CVPR 2026 期间举办的联合第一视角视觉研讨会(EgoVis)上进行的试点任务——第1届异步 CASTLE 挑战赛。核心解决的问题是针对长期、多模态、多视角的的第一视角数据进行闭合形式问答(QA)。参赛者需要回答从 CASTLE 2024 数据集中提取的 185 个多选题(每个问题四个选项)。该数据集包含超过 600 小时的高清(UHD)视频(50 fps)及同步音频,记录了 10 名参与者的自然活动。数据包括 15 路视频流(10 路第一视角,5 路静态)、6DoF IMU 数据、GPS、生物识别信号、注视数据和热成像图像。问题要求跨越时间、空间和模态边界进行推理,测试诸如时间推理、物体追踪、视觉计数以及参与者识别等能力。
方法论与团队贡献
共有四个团队提交了详细说明其方法的技术报告。所有团队都使用了官方数据集和基准测试,并采用了不同的策略来处理 600 小时非脚本数据的“大海捞针”性质。
Team WDL(冠军): 该团队提出了一种以 Qwen 多模态大语言模型(LLM)为核心的证据感知型多模态推理流水线。他们的方法将非结构化问答转化为结构化的证据检索问题。关键组件包括:
- 证据感知上下文构建: 解析查询中的提示信息(姓名、日期、房间)以引导检索。他们根据词汇重叠度对官方 ASR 转录文本进行分段,并对辅助照片和视频帧进行排序。
- 问题类型路由: 一种将查询分类为静态视觉、语音/文本、时间或混合类型的机制,用以触发定制的指令块(例如,针对时间顺序或 OCR 的特定提示)。
- LoRA 微调与自一致性: 他们对基础模型进行了低秩自适应(LoRA)微调,仅在答案 Token 上计算损失。他们利用具有不同提示严格度的多样本自一致性,并通过基于置信度的加权投票聚合结果。
- 关键发现: 消融实验表明,LoRA 将准确率从 21% 提高到 50%,而增加采样的视频帧数则将性能推升至 58%,这表明证据覆盖范围是主要的瓶颈。
Team MARS(亚军): 该团队引入了一个源选择型智能体框架(Multimodal Agentic Reasoning with Source selection),该框架能够动态决定查询哪种证据模态,而不是同时处理所有原始媒体。
- 来源分类: 数据被组织为主要来源(视频摘要、转录文本)和辅助来源(注视、心率、照片、热成像)。长视频通过 DeepSeek 被预处理为事件摘要。
- 智能体决策循环: 一个 GPT-5.4 决策智能体在一个包含四种动作的迭代循环中运行:继续思考、添加数据(请求特定的模态,如用于体力消耗问题的生理数据)、回答或随机回退。
- 关键发现: 系统从 35% 的纯文本基准提升到了 57% 的准确率。最终从 55% 到 57% 的飞跃是通过完整的 MARS 智能体循环实现的,证明了针对复杂推理动态请求缺失模态的有效性。(注:该团队在最终排行榜上的准确率为 56.8%)。
Team TAHAKOM(季军): 该团队开发了一个具有层次化知识图谱(KG)检索功能的无训练智能体框架。
- 多模态知识图谱构建: 仅依赖第一视角视频(30 秒片段),他们生成了片段级的描述,并将其结构化为映射实体(人、地点、物体)及其关系(对话、交互)且具有严格时间间隔的有向图(SQLite)。
- 层次化智能体工作流: 基于 LangGraph 构建,由 PlannerAgent 进行查询分解,由 GraphRetrieval 代理执行“从严格到宽松”的 SQL 生成策略。
- 关键发现: 在知识图谱中加入“提及(Mention)”关系使准确率提高了 7%。此外,一个利用知识图谱边界提取原始视频以执行视觉任务(计数、OCR)的后备模块(ClipSearch/ClipAnalyze)带来了 4% 的提升,验证了访问原始像素对于落地任务的必要性。
Team CuriosAI(第四名): 该团队探索了两种基于共享五通道预处理层(身份、描述、物体、转录、动作时间线)的方法。他们的主要贡献是一个显式的**搜索–验证–回答(SVA)**流水线,旨在对抗视觉语言模型(VLM)的幻觉(Confabulation)。
- SVA 流水线: 该过程将问答解耦为三个阶段:搜索(通过混合检索找到 15 分钟的时间窗口)、验证(扩展到跨摄像头的相邻子窗口)和回答(通过具有证据优先级层级的 GPT-5 裁判融合证据)。
- 反幻觉纪律: 他们在验证过程中执行了严格的提示级规则:不得重复提示上下文、在静默片段中保持沉默、要求计数具备空间定位、并拒绝缺乏依据的高置信度答案。
- 对比: 他们的 SVA 方法实现了 50% 的准确率(每个问题约需 28 次 LLM 调用),而其第二种方法——时间–多模态–知识–图谱(TMKG)方案——准确率为 35%(每个问题 1 次调用)。
结果
本次挑战赛吸引了 43 名注册参与者和 272 份提交。最终排行榜(表 1)显示,前四名团队的准确率在 0.351 到 0.584 之间,显著高于 0.25 的随机基准线。
- Team WDL: 108 个正确答案 (58.4%)。
- Team MARS: 105 个正确答案 (56.8%)。
- Team TAHAKOM: 101 个正确答案 (54.6%)。
- Team CuriosAI (SVA): 92 个正确答案 (49.7%)。
重叠分析(表 2)显示,虽然排名第一的团队答对了 108 个问题,但所有入围团队的共同努力解决了 185 个问题中的 176 个。只有 9 个问题被所有团队漏掉,这表明当前的系统具有互补的优势。
意义与主张
论文声称,结果表明,虽然目前的系统能够导航大规模多视角数据集,但在非脚本环境下进行长上下文、闭合形式的问答仍然是一个极具挑战性的问题。作者强调了以下几点关键见解:
- 证据覆盖至关重要: 性能高度依赖于检索和验证正确证据片段的能力(例如 WDL 的帧采样和 TAHAKOM 的原始像素后备)。
- 动态模态选择: MARS 的成功表明,根据查询需求动态请求特定模态(如生物识别或注视数据)比静态处理更有效。
- 针对幻觉的验证: CuriosAI 的结果表明,尽管计算成本更高,但严谨的多步验证流水线对于防止大模型在长视频上下文中产生幻觉是必要的。
- 互补性: 高聚合得分(176/185)意味着,结合评估的各种方法(检索、智能体循环、知识图谱和验证)可以在未来的迭代中产生更优的性能。
报告总结认为,该挑战赛为场景和活动理解提供了一个强大的测试平台,未来的版本将旨在评估组合方法,以进一步推动该领域的现状。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。