← 最新论文
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

本文总结了 Perception Test 2025 挑战赛的结果,该挑战赛在一个统一的基准上评估了最先进的多模态视频模型,该基准整合了统一视频问答和跟踪等赛道,旨在凸显当前模型在通过单一接口处理多样化感知任务时所面临的显著困难。

原作者: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场规模宏大、 stakes 极高的计算机视觉人才秀,但参赛选手并非唱歌或跳舞,而是试图“看见”并理解世界的人工智能模型。本文便是这场名为“感知测试”(Perception Test)的 2025 年度赛事的成绩单,该赛事与一场重要的计算机科学会议同期举行。

以下是用简单类比对赛事情况的拆解。

核心理念:从专用工具到瑞士军刀

过去,人工智能模型如同专用工具:一个模型擅长在人群中识别特定的人(跟踪),另一个擅长发现车祸何时发生(动作检测),第三个则擅长回答关于视频的问题。

在今年的挑战中,主办方决定不再测试这些“专用工具”。相反,他们要求一把“瑞士军刀”。他们希望看到单个 AI 模型能否在不切换“帽子”的情况下同时完成所有任务。他们问道:“一个‘大脑’能否同时处理跟踪球体、识别声音以及回答关于场景的问题?”

五大主要项目(赛道)

比赛设有五个主要项目,分别测试 AI 的不同“肌肉”:

  1. 统一视频问答(“魔法眼”测试):

    • 旧方式: 若要测试 AI 能否跟踪一个移动的点,你必须构建一个专门的跟踪器。
    • 新方式: 主办方将这些高难度任务转化为多项选择题。想象一段视频,桌面上某个特定位置闪烁绿光。AI 被问及:“这五个点中,哪一个闪烁了?”
    • 转折: 他们加入了棘手的问题,例如“这些动作发生的顺序是什么?”或“哪个物体在假装做某事?”。这迫使 AI 利用语言来解决视觉谜题。
  2. 双重跟踪挑战:

    • AI 必须同时跟踪两样东西:一个完整物体(如一个弹跳的球)以及该物体上的特定点(如球上的红色贴纸),即使球被墙壁遮挡(遮挡)也是如此。
  3. 声音与动作侦探:

    • AI 必须观看一段视频,并指出:“在第 10 秒整,有人踢了球,你听到了‘砰’的一声。”它必须同时找出视觉动作和声音的“何时”与“何事”。
  4. “指哪打哪”侦探:

    • AI 被问及诸如“哪只狗在追猫?”的问题,它不仅要回答“棕色的那只”,还必须实际框出那只特定的狗,并在整个视频中持续跟踪它。
  5. 马拉松选手(一小时长视频):

    • 大多数 AI 模型在观看 30 秒片段后就会“力竭”。这个项目向它们抛出了一小时长的视频。AI 必须记住开头的细节,以便回答结尾的问题。

结果:两种速度的故事

论文报告了 AI 表现中一个有趣的分化:

  • 语言赢家: 当 AI 能够使用语言(回答问题、描述场景)时,其表现比去年大幅提升。事实上,在“指哪打哪”和“一小时长视频”测试中,得分几乎翻了一番。这仿佛 AI 突然学会了阅读手册并将其应用于视觉世界。
  • “沉默”的挣扎: 当 AI 必须在不使用语言的情况下完成任务(如仅跟踪一个点或寻找声音)时,其进步甚微。今年表现最佳的“瑞士军刀”模型实际上比去年的专用“单任务”模型更慢

核心结论: 论文总结道,虽然 AI 在谈论其所见之物方面变得令人惊叹,但它仍难以成为一个能同时完美完成所有任务的单一统一“大脑”。“通用感知”模型已近在咫尺,但尚未完全到来。

获奖者

  • 总投稿数: 超过 100 个团队提交了 450 次尝试。
  • 奖金: 获奖者共获得了 47,000 美元。
  • 顶尖表现者: "NJUST_KMG"团队是 frequent 赢家,在跟踪、声音和长视频类别中均名列前茅。另一支队伍"SGVR@KAIST"赢得了“指哪打哪”类别的冠军。

一言以蔽之

2025 年感知测试向我们表明,AI 正在迅速学习如何谈论其所见之物,但它仍在学习如何在不陷入混乱的情况下同时完成所有事情。“专用机器人”与“类人通用感知”之间的差距正在缩小,但终点线仍有一段距离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →