← 最新论文
💻 computer science

VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning

本文介绍了 VidNum-1.4K,这是一个包含 1,379 个视频-问题对的全面人工标注基准,通过三级层级结构进行组织,旨在严格评估并揭示当前视觉语言模型在真实视频场景中执行复杂、多步数值推理时的显著局限性。

原作者: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一部电影,但你不仅仅是在享受剧情,而是在接受关于物体和事件计数、计算数量差异以及判断人群在场景切换后是增加了还是减少了的测试。这就是**视觉语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成超级聪明的数字侦探,它们能“看到”图像和视频,并能“阅读”文本,像我们一样试图理解这个世界。有一段时间以来,这些人工智能侦探在描述它们所见之物方面已经做得非常出色了,比如能说出“有一只狗在跑”。但科学家们一直在思考:这些人工智能真的理解故事、时间的流逝以及事物变化的逻辑吗?还是它们只是根据从训练数据中记忆下来的模式进行猜测?这个问题至关重要,因为如果人工智能不能真正理解物理世界——例如,即使摄像机角度发生了变化,它也知道如果把两个苹果和三个苹果加在一起,结果是五个——那么我们就无法信任它在现实世界中协助我们完成复杂任务。

于是,出现了一个名为 VidNum-1.4K 的新挑战,这是一个专门设计用来测试这些人工智能侦探能否在视频中进行数值推理的严苛“期末考试”。Shaoyang Cui 及其团队构建了一个包含 1,379 个视频片段和问题的庞大集合,迫使人工智能不仅仅是观察,还必须进行计数、比较和计算。他们将这些问题分为三个难度等级,就像一个带有递增关卡挑战的电子游戏。第一级是“简单模式”,人工智能只需要数一些简单的东西,比如“这个房间里有多少扇绿色的门?”第二级提升了难度,要求人工智能统计特定类型的物体,例如“有多少只棕色的狗?”,同时要忽略黑色的狗,即便摄像机切换到了不同的角度。第三级是“硬核模式”,要求人工智能执行多步逻辑,例如:统计足球比赛第一组镜头中的球员人数,在第二个镜头下根据特定约束再次统计人数,然后对这两个孤立的事件进行逻辑比较或计算以得出答案。

考试结果令人震惊。即使是最先进的人工智能模型,包括强大的闭源模型“Gemini-3.1-pro”,在允许其进行逐步思考时,也仅能答对约 60% 的题目。开源模型(即人工智能世界的社区构建工具)表现得更为挣扎,得分在 25% 到 45% 之间。论文指出,这些模型仍然在依赖“捷径”——比如根据它们以前听过的常见短语进行猜测——而不是建立一个稳定的“内部世界模型”来理解物体和数字如何随时间变化。例如,当视频切换到新场景时,模型经常会丢失计数,或者对同一个物体进行重复计数,这表明它们并没有真正理解视频开头的狗就是结尾的那只狗。

有趣的是,研究人员发现,要求人工智能“大声思考”(一种被称为“思维链”的技术)有助于它们解决最难的逻辑谜题,但有时却会让它们在之前原本能做对的简单计数任务上出错。这表明,虽然这些模型在高层数学能力方面正在进步,但它们追踪视频中移动物体的基本能力仍然不稳定。研究结论认为,仅仅通过扩大人工智能模型的规模(增加更多“参数”)可以帮助它们处理复杂逻辑,但并不能神奇地解决它们在不同视频场景中追踪物体时的困难。VidNum-1.4K 就像一面严厉且诚实的镜子,向我们展示了尽管我们的人工智能侦探正变得越来越聪明,但要真正理解动态变化的现实世界,它们还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →