← 最新论文
💻 computer science

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

为了应对传统单轮视频理解基准测试趋于饱和的问题,本文引入了 VideoGAIA,这是一个包含 271 个经专家验证的任务、具有严谨性、多轮且具备工具增强能力的基准测试,它揭示了当前前沿多模态大语言模型存在的显著性能差距,并旨在推动该领域向智能体化视频理解发展。

原作者: Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

多年来,我们测试人工智能的方式一直依赖于一个简单的游戏:给计算机看一段视频,问一个问题,然后等待答案。这种被称为“视频理解”的方法,已成为衡量机器如何观察和推理动态世界的一个标准度量。近年来,最先进的人工智能系统在这一领域已经变得如此精通,以至于它们几乎可以正确回答所有问题,达到了一个测试不再能揭示其真实极限的程度。这就像是一个学生背下了整本教科书并能背诵任何事实,但我们仍然不知道他们是否真的能在现实世界中解决新问题。为了突破这一瓶颈,研究人员需要一种新的衡量智能的方法,这种方法不仅仅是询问一个事实,而是要求机器表现得像一个充满好奇心的真人调查员。

来自中国大学和科技公司的研究团队推出了一种这样的新测试,称为 VideoGAIA。这项新基准测试不再是要求模型观看视频并回答单个问题,而是将视频视为一段更长调查过程的起点。在这种设定下,人工智能扮演着一个智能体(agent)的角色——一个数字助手,它必须弄清楚自己不知道什么,去寻找缺失的信息,然后将所有信息整合起来以完成一项复杂的任务。视频可能显示一个人拿着特定的手机,或者一辆车行驶在城市中,但问题的答案往往存在于视频之外。系统必须识别出视频中的线索,决定在互联网上搜索更多细节,阅读搜索结果,然后返回视频以检查新信息是否吻合。这种观察、搜索、阅读和检查的过程会经历多次回合,模仿人类研究某个主题的方式。

研究人员通过从互联网上收集的十万个海量视频构建了这项测试。他们利用强大的 AI 模型来帮助筛选有趣的片段,并生成那些仅靠观看视频无法回答的问题。例如,一段视频可能显示一位主持人正在演播室里展示多款手机,手里拿着一部透明背壳的银色手机,旁边是一个绿色产品底座;而问题则会询问驱动该型号的具体芯片组变体。视频本身并不会显示芯片组的名称或其营销细节。为了正确回答,AI 必须首先识别出视频中的手机,然后使用搜索工具在网上查找该产品的规格,阅读网页上的详细信息,最后确认该芯片组与视觉证据相符。团队通过一个严格的过程对这些潜在问题进行了筛选,由人类专家审查每一项任务,以确保其公平性、难度以及对真正推理能力的要求。经过超过一百小时的人类审查后,他们最终确定了一套包含 27 shame 271 个任务的集合,涵盖了技术、历史、地理、日常生活、文化和经济六个现实领域。

当研究人员在这一新基准测试上测试了目前最先进的二十个 AI 模型时,结果非常显著。即使是最强大的系统,此前在旧测试中的得分接近 90%,在 VideoGAIA 上也难以达到 60% 的准确率。表现最好的模型是一个名为 Seed2.0-Pro 的系统,其准确率达到了 58.30%,而其他模型的得分则明显更低。这一差距表明,虽然这些机器非常擅长识别眼前的物体,但它们仍在学习如何有效地使用工具来填补信息空白。研究发现,失败的主要原因并非缺乏知识或无法阅读网页,而是最初未能正确识别视频中的视觉线索。如果 AI 误认了视频中的物体或细节,它就会搜索错误的信息,从而导致错误的答案。

研究人员还观察到,仅仅让 AI 进行更多搜索或阅读更长时间并不能保证成功。有些模型进行了数百次工具调用,反复搜索网页,却仍然无法解决任务。而另一些模型调用次数较少,但更加精准,在收集到足够证据后便停止。最成功的智能体是那些能够保持“不确定感”的模型,即意识到自己信息不足,并明确知道下一步该寻找什么。它们会重新查看视频的特定部分以核实细节,将其与网页内容进行交叉验证,然后才给出结论。这种行为更接近于人类专家的工作方式:在得出结论之前仔细验证事实。

研究结果表明,下一代人工智能的定义将不在于它能否根据单张图像或一段视频回答问题,而在于它能否在世界中穿梭以寻找答案。VideoGAIA 基准测试为这种新能力提供了一个严苛的测试,揭示了通往真正智能助手的道路不仅需要更好的视觉能力或更大的数据库,更需要能够在连续循环中进行思考、搜索和验证的能力。虽然目前的模型已经取得了长足进步,但由于没有任何一个模型能掌握这项新测试,这表明在机器能够真正协助我们处理日常生活中复杂且开放式任务之前,仍有很长的路要走。这项工作提供了一个清晰的发展路线图,表明进步的关键在于教导这些系统不仅要做观察者,更要做积极的调查员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →