想象一下你正在看一部电影,但你不仅仅是在享受剧情,而是在接受关于物体和事件计数、计算数量差异以及判断人群在场景切换后是增加了还是减少了的测试。这就是**视觉语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成超级聪明的数字侦探,它们能“看到”图像和视频,并能“阅读”文本,像我们一样试图理解这个世界。有一段时间以来,这些人工智能侦探在描述它们所见之物方面已经做得非常出色了,比如能说出“有一只狗在跑”。但科学家们一直在思考:这些人工智能真的理解故事、时间的流逝以及事物变化的逻辑吗?还是它们只是根据从训练数据中记忆下来的模式进行猜测?这个问题至关重要,因为如果人工智能不能真正理解物理世界——例如,即使摄像机角度发生了变化,它也知道如果把两个苹果和三个苹果加在一起,结果是五个——那么我们就无法信任它在现实世界中协助我们完成复杂任务。
于是,出现了一个名为 VidNum-1.4K 的新挑战,这是一个专门设计用来测试这些人工智能侦探能否在视频中进行数值推理的严苛“期末考试”。Shaoyang Cui 及其团队构建了一个包含 1,379 个视频片段和问题的庞大集合,迫使人工智能不仅仅是观察,还必须进行计数、比较和计算。他们将这些问题分为三个难度等级,就像一个带有递增关卡挑战的电子游戏。第一级是“简单模式”,人工智能只需要数一些简单的东西,比如“这个房间里有多少扇绿色的门?”第二级提升了难度,要求人工智能统计特定类型的物体,例如“有多少只棕色的狗?”,同时要忽略黑色的狗,即便摄像机切换到了不同的角度。第三级是“硬核模式”,要求人工智能执行多步逻辑,例如:统计足球比赛第一组镜头中的球员人数,在第二个镜头下根据特定约束再次统计人数,然后对这两个孤立的事件进行逻辑比较或计算以得出答案。
考试结果令人震惊。即使是最先进的人工智能模型,包括强大的闭源模型“Gemini-3.1-pro”,在允许其进行逐步思考时,也仅能答对约 60% 的题目。开源模型(即人工智能世界的社区构建工具)表现得更为挣扎,得分在 25% 到 45% 之间。论文指出,这些模型仍然在依赖“捷径”——比如根据它们以前听过的常见短语进行猜测——而不是建立一个稳定的“内部世界模型”来理解物体和数字如何随时间变化。例如,当视频切换到新场景时,模型经常会丢失计数,或者对同一个物体进行重复计数,这表明它们并没有真正理解视频开头的狗就是结尾的那只狗。
有趣的是,研究人员发现,要求人工智能“大声思考”(一种被称为“思维链”的技术)有助于它们解决最难的逻辑谜题,但有时却会让它们在之前原本能做对的简单计数任务上出错。这表明,虽然这些模型在高层数学能力方面正在进步,但它们追踪视频中移动物体的基本能力仍然不稳定。研究结论认为,仅仅通过扩大人工智能模型的规模(增加更多“参数”)可以帮助它们处理复杂逻辑,但并不能神奇地解决它们在不同视频场景中追踪物体时的困难。VidNum-1.4K 就像一面严厉且诚实的镜子,向我们展示了尽管我们的人工智能侦探正变得越来越聪明,但要真正理解动态变化的现实世界,它们还有很长的路要走。
技术摘要:VidNum-1.4K
问题陈述
当前的视觉语言模型(VLMs)在视频理解方面取得了显著进展,但一个关键的科学问题仍然存在:这些模型究竟是真正构建了一个稳定的“世界模型”来理解动态场景,还是仅仅依赖于记忆的数据集先验和表层相关性?虽然现有的基准测试解决了视频理解的问题,但在数值推理方面仍显得碎片化。标准的视频问答(VideoQA)数据集(如 TGIF-QA, NExT-QA)将计数视为语义任务的一个次要子集,缺乏明确的定量难度等级。相反,专门的重复计数基准(如 QUVA Repetition, Countix)侧重于将循环动作作为回归任务进行周期估计,未能评估多步逻辑演绎、跨事件一致性或跨频繁镜头切换的推理能力。目前缺乏一个全面的评估协议来衡量视频中的组合数值推理(compositional numerical reasoning),即模型必须基于时间证据进行算术运算、比较和逻辑演绎。
方法论:VidNum-1.4K 基准
为了填补这一空白,作者引入了 VidNum-1.4K,这是一个由 **1,379 个严格由人工标注的多选题(MCQs)**组成的综合基准,这些题目基于独立的视频片段。
数据构建
该基准通过一个严谨的、完全人工的、多阶段流水线构建而成,涉及约 300 名全职标注员,他们被分为四个隔离的小组以确保数据质量并防止偏差:
- 来源收集: 视频从涵盖五个宏观类别(知识、生活记录、体育、艺术表演、影视)和多种细粒度场景(如航空、生物、日常生活)的全球库中进行筛选。
- 创建与验证: A 组严格根据视觉证据生成问题,执行“仅限视觉描述”政策,以防止模型利用语言先验(例如,避免使用“克里斯蒂亚诺·罗纳尔多”等专有名词,而使用“穿红衣的男子”)。B 组尝试回答这些问题,以过滤掉琐碎项或无需视频输入即可解决的问题。
- 审计: C 组和 D 组进行整体审查和最终审计,以确保答案的正确性、优化时间戳并消除歧义,最终形成“金标准”集。
层级结构
该基准构建为一个三级层级结构,旨在测试递进的认知和感知需求:
- 第 1 层:同质计数(Homogeneous Counting): 侧重于基础的视觉落地和物体恒常性。模型必须在最小约束下对单一类型的物体、动作或事件进行计数,要求在连续运动过程中维持一个“内部计数器”(例如,在相机平移时追踪门的数量)。
- 第 2 层:受限与异质计数(Constrained and Heterogeneous Counting): 通过要求在多个实体类型之间进行辨别,或对具有多属性约束的单一实体进行计数(例如,统计特定品种的狗)来增加复杂度。这一层级测试模型在跨越时间间隔和镜头切换时,维持数值一致性的鲁棒重识别能力。
- 第 3 层:组合数值推理(Compositional Numerical Reasoning): 评估高阶认知能力,包括比较、计算、估计和顺序排列。这些任务要求严格基于时间证据进行多步算术运算(例如,隔离时间窗口、在特定约束下统计球员数量,并逻辑地比较结果)。
评估协议
作者使用两种协议评估了多样化的最先进(SOTA)开源和闭源 VLM:
- 直接回答(NoCoT): 模型直接提供最终选项。
- 零样本思维链(Zero-shot CoT): 提示模型在给出答案之前,先阐述中间观察结果和计算步骤。
视觉输入通过帧采样策略进行标准化(对于小于 48 秒的视频采用 1 FPS;对于较长视频采用 48 帧均匀采样)。
核心贡献
- VidNum-1.4K 基准: 引入了一个专门用于评估数值推理和“世界理解”能力的、具有多样性的专用视频问答基准,其特点是具有从感知到组合推理的独特三级层级结构。
- 全面的实证评估: 对代表性的开源和闭源 VLM 进行了严格评估,揭示了显著的性能差距,并识别了当前架构中的特定瓶颈。
结果
评估揭示了所有测试模型中存在的显著推理差距:
- 整体性能: 即便是最先进的闭源模型 Gemini-3.1-pro,在 CoT 设置下的准确率也仅勉强达到 60% 的阈值。代表性的开源系列(如 InternVL 系列)表现挣扎,通常处于 25%–45% 范围内。
- 任务特定瓶颈:
- 第 3 层敏感性: 思维链(CoT)提示是第 3 层(组合)推理的关键催化剂,这表明模型拥有原始的感知落地能力,但在缺乏显式引导时,在逻辑聚合方面会表现乏力。
- 动作 vs. 物体/事件: 基于动作的计数得分始终低于基于物体或事件的计数,这表明模型在追踪动态动作的连续、流动的边界方面存在困难。
- 数值一致性: 包含多镜头视频的测试暴露了严重的一致性缺失,模型经常在场景切换时丢失计数或重复计数。
- 缩放行为(Scaling Behavior): 对 InternVL3 系列(8B 到 78B 参数)的分析表明,增加模型容量可以带来通用的性能提升,特别是在第 3 层推理方面(在使用 CoT 时,准确率从 48.8% 上升到 57.1%)。然而,第 1 层和第 2 层的性能保持停滞或仅有微幅提升,这表明细粒度的实例追踪和跨镜头重识别是基本的感知瓶颈,无法仅靠参数规模的扩大来解决。
- CoT 的权衡: 虽然 CoT 通常能提高复杂任务的准确率,但它也引入了“收益伴随退化”现象,即一些先前正确的直接回答变得错误,这表明当前的模型依赖于不稳定的启发式“直觉”,而非鲁棒的因果推理。
意义
本文将 VidNum-1.4K 定位为下一代数值视频智能的严苛诊断测试平台。研究结果表明,当前的 VLM 缺乏能够处理现实世界多媒体内容内在复杂性(特别是关于时间动态和组合逻辑)的稳定“内部世界模型”。通过结合碎片化的时间上下文和多步推理要求,该基准作为一个严格的压力测试,旨在暴露这些弱点,从而指导开发具有更可靠且具备物理落地能力的视频理解模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。