想象一场规模宏大、 stakes 极高的计算机视觉人才秀,但参赛选手并非唱歌或跳舞,而是试图“看见”并理解世界的人工智能模型。本文便是这场名为“感知测试”(Perception Test)的 2025 年度赛事的成绩单,该赛事与一场重要的计算机科学会议同期举行。
以下是用简单类比对赛事情况的拆解。
核心理念:从专用工具到瑞士军刀
过去,人工智能模型如同专用工具:一个模型擅长在人群中识别特定的人(跟踪),另一个擅长发现车祸何时发生(动作检测),第三个则擅长回答关于视频的问题。
在今年的挑战中,主办方决定不再测试这些“专用工具”。相反,他们要求一把“瑞士军刀”。他们希望看到单个 AI 模型能否在不切换“帽子”的情况下同时完成所有任务。他们问道:“一个‘大脑’能否同时处理跟踪球体、识别声音以及回答关于场景的问题?”
五大主要项目(赛道)
比赛设有五个主要项目,分别测试 AI 的不同“肌肉”:
统一视频问答(“魔法眼”测试):
- 旧方式: 若要测试 AI 能否跟踪一个移动的点,你必须构建一个专门的跟踪器。
- 新方式: 主办方将这些高难度任务转化为多项选择题。想象一段视频,桌面上某个特定位置闪烁绿光。AI 被问及:“这五个点中,哪一个闪烁了?”
- 转折: 他们加入了棘手的问题,例如“这些动作发生的顺序是什么?”或“哪个物体在假装做某事?”。这迫使 AI 利用语言来解决视觉谜题。
双重跟踪挑战:
- AI 必须同时跟踪两样东西:一个完整物体(如一个弹跳的球)以及该物体上的特定点(如球上的红色贴纸),即使球被墙壁遮挡(遮挡)也是如此。
声音与动作侦探:
- AI 必须观看一段视频,并指出:“在第 10 秒整,有人踢了球,你听到了‘砰’的一声。”它必须同时找出视觉动作和声音的“何时”与“何事”。
“指哪打哪”侦探:
- AI 被问及诸如“哪只狗在追猫?”的问题,它不仅要回答“棕色的那只”,还必须实际框出那只特定的狗,并在整个视频中持续跟踪它。
马拉松选手(一小时长视频):
- 大多数 AI 模型在观看 30 秒片段后就会“力竭”。这个项目向它们抛出了一小时长的视频。AI 必须记住开头的细节,以便回答结尾的问题。
结果:两种速度的故事
论文报告了 AI 表现中一个有趣的分化:
- 语言赢家: 当 AI 能够使用语言(回答问题、描述场景)时,其表现比去年大幅提升。事实上,在“指哪打哪”和“一小时长视频”测试中,得分几乎翻了一番。这仿佛 AI 突然学会了阅读手册并将其应用于视觉世界。
- “沉默”的挣扎: 当 AI 必须在不使用语言的情况下完成任务(如仅跟踪一个点或寻找声音)时,其进步甚微。今年表现最佳的“瑞士军刀”模型实际上比去年的专用“单任务”模型更慢。
核心结论: 论文总结道,虽然 AI 在谈论其所见之物方面变得令人惊叹,但它仍难以成为一个能同时完美完成所有任务的单一统一“大脑”。“通用感知”模型已近在咫尺,但尚未完全到来。
获奖者
- 总投稿数: 超过 100 个团队提交了 450 次尝试。
- 奖金: 获奖者共获得了 47,000 美元。
- 顶尖表现者: "NJUST_KMG"团队是 frequent 赢家,在跟踪、声音和长视频类别中均名列前茅。另一支队伍"SGVR@KAIST"赢得了“指哪打哪”类别的冠军。
一言以蔽之
2025 年感知测试向我们表明,AI 正在迅速学习如何谈论其所见之物,但它仍在学习如何在不陷入混乱的情况下同时完成所有事情。“专用机器人”与“类人通用感知”之间的差距正在缩小,但终点线仍有一段距离。
以下是论文《Perception Test 2025:挑战总结与统一视觉问答扩展》的详细技术总结。
1. 问题陈述
本文探讨了大型多模态模型(LMMs)的快速演进,以及超越专用单任务模型对其能力进行基准测试的需求。虽然之前的 Perception Test 版本在独立任务上评估模型(例如,对象跟踪、点跟踪、动作定位设有独立赛道),但该领域已转向统一感知。
核心问题在于确定当前的最先进(SOTA)模型能否通过单一、统一的接口(具体为基于语言的接口)来处理多样化的复杂时空感知任务,而不是依赖带有任务特定模型的工程化流水线。2025 年的挑战旨在测试模型能否在不进行任务特定微调或架构变更的情况下,泛化至跟踪、定位和推理等任务。
2. 方法论与挑战设置
该挑战作为 ICCV 2025 的研讨会组织,利用 eval.ai 平台进行。它设有五个整合赛道,从分散的任务转向统一方法:
A. 统一任务赛道(无语言接口)
这些赛道要求单一模型同时解决两个截然不同的任务:
- 统一对象与点跟踪:模型必须在视频帧中同时跟踪边界框(对象)和特定 2D 点(点),并处理遮挡情况。
- 指标: 平均 Jaccard (AJ),即点 AJ (TAP-Vid) 和对象 AJ (IoU) 的平均值。
- 统一动作与声音时序定位:模型必须在视频中识别并定位视觉动作和听觉事件。
- 指标: 动作和声音类别的平均精度均值 (mAP)。
B. 统一视觉问答(VQA)赛道(语言接口)
这些赛道使用自然语言查询来测试感知能力,包括一项新颖的扩展:
3. 统一多项选择视频问答 (mc-VQA):今年的核心创新。
* 新颖性:传统的非语言任务(点跟踪、时序动作定位)被重新表述为多项选择题。
* 技术:作者使用视觉修复(例如彩色条、闪烁指示器)和时间标记,将时空查询直接锚定在视频流中。这使得视觉语言模型(VLMs)无需复杂解码器即可“看到”任务要求。
* 新问题类型:
* 点跟踪: 在“绿色闪烁”后,从干扰项中识别特定的表面点。
* 动作排序: 识别正确的动作序列。
* 对象 - 动作交互: 识别特定时间段内涉及的对象。
* 假装动作: 识别动作是“虚假”或不正确的片段。
* 数据集:从原有的 11,528 道 3 选项问题扩展,新增了 1,842 道 5 选项问题,以减轻捷径学习的影响。
4. 锚定视频问答 (Grounded Video QA):模型通过在整个视频中跟踪代表答案的特定对象来回答问题。
* 指标: 高阶跟踪准确率 (HOTA)。
5. 一小时视频问答:模型回答关于超长视频(1 小时以上)的问题,以测试长期记忆和推理能力。
* 指标: Top-1 准确率。
评估协议:
- 阶段:验证阶段(提交次数不限)和测试阶段(限制为 30 次提交)。
- 约束:对于联合赛道,模型必须同时解决两个任务。禁止顺序微调(例如,先训练对象跟踪再训练点跟踪)。
- 模式:参与者需说明是否使用了微调、少样本或零样本评估。
3. 主要贡献
- 统一基准测试:成功将以往分离的任务(跟踪、定位)合并为统一赛道,迫使社区开发通用模型,而非集成流水线。
- 统一 mc-VQA 扩展:引入了一种新颖框架,利用视觉修复将复杂的时空任务(跟踪、定位)重构为多项选择 VQA 问题。这弥合了视觉感知与语言推理之间的差距。
- 全面评估:评估了来自 100 多个团队的 450 份提交,提供了 SOTA 模型(包括 Gemini、GPT-4V、Qwen、Llama 3-V)与人类基线的稳健对比。
- 长上下文分析:包含了一个专门针对一小时视频的赛道,推动了当前上下文窗口和时序推理的极限。
4. 结果
结果突显了基于是否存在语言接口而出现的性能分化:
带有语言接口的赛道(显著进步):
- 锚定视频问答:性能较 2024 年几乎翻倍。顶级模型(SGVR@KAIST)达到了 0.499 HOTA,而基线为 0.057。这表明模型现在能有效地将语言锚定在视觉流中。
- 一小时视频问答:顶级模型达到了 0.780 的准确率(随机基线为 0.203),显示出处理长内容的能力。
- 统一 mc-VQA:顶级零样本模型在原始集上达到了 81.2% 的准确率,在更难的 5 选项新集上达到了 65.4%。
- 观察: 模型在语言锚定任务中正迅速接近人类基线。
不带语言接口的赛道(停滞/小幅增长):
- 统一对象与点跟踪:顶级统一模型达到了 0.62 AJ,未超过 2024 年最佳专用模型的平均水平(点为 0.47,对象为 0.81)。
- 统一动作与声音定位:顶级模型达到了 0.52 mAP,与之前的专用获胜者相似。
- 观察: 虽然多任务模型具备能力,但在缺乏语言接口的情况下,它们难以超越专用的单任务流水线。
模型性能:
- 零样本与微调:顶级结果由微调集成模型(例如 Qwen-2.5VL + GLM-4.5V)和复杂的零样本方法(例如 Seed 1.6 Vision + Qwen-VL-Max)共同取得。
- 人类基线:人类在 mc-VQA 任务中得分为 91.4%,而最佳模型约为 82%,表明推理方面仍存在差距。
5. 意义
Perception Test 2025 是通用感知模型发展中的一个关键里程碑:
- 统一接口的验证:该挑战证明语言接口显著提升了复杂感知任务的性能,表明 VLMs 正成为通用感知的首选架构。
- 瓶颈识别:非语言统一赛道(跟踪/定位)的停滞表明,当前模型仍难以在没有自然语言支撑的情况下整合多样化的视觉任务。
- 未来方向:结果表明,多模态模型的下一个前沿不仅仅是扩展规模,而是改进时空推理和长上下文理解,以在不依赖显式语言提示的任务中达到人类水平的表现。
- 基准演进:通过引入“统一 mc-VQA"子集,作者提供了一种可扩展的方法,利用标准 VQA 指标来评估跟踪和定位能力,简化了未来研究的评估流程。
总之,虽然 LMMs 在语言锚定感知方面取得了令人瞩目的进展(锚定问答性能翻倍),但该挑战强调,真正的“通用感知”——即能够以统一、非语言的方式处理多样化视觉任务——仍然是一个开放且困难的问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。