← 最新论文
💻 computer science

SLVMBench: Skill Learning from Video Memory

本文介绍了 SLVMBench,这是首个旨在评估视频大语言模型从包含嵌入式教程的长视频流中学习程序性技能,并将其应用于实时任务的能力的基准测试,研究揭示了由于长上下文记忆和技能迁移方面的局限性,当前模型在这一能力上表现得非常吃力。

原作者: Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在学习如何修理漏水的水龙头。你在 YouTube 上找到了一个完美的、时长 10 分钟的教学视频。你看着视频,一边点头一边学习,感觉自己已经完全掌握了。然后,你关掉标签页,去做了两小时别的事情。也许你看了许多随机的猫咪视频、烹饪节目,还有一部关于深海鱼类的纪录片。

现在,你回到水槽旁。水龙头正在滴水。你拿起扳手,但突然间,大脑一片空白。等等,我是先松开螺母还是先拧螺丝?是用扳手还是钳子? 你记不起那个教程了,因为那两小时的“猫咪视频噪音”淹没了它。

这正是 SLVMBench(基于视频记忆的技能学习)试图解决的问题。这也是第一次有人构建了一项测试,旨在观察 AI 是否能像人类一样:从视频中学习一项技能,在一段时间后忘记它,然后在真正需要使用时重新记起。

大考:“两小时干扰”挑战

研究人员为 AI 模型设计了一个超级困难的游戏。流程如下:

  1. 教程: AI 观看一段教它特定技能(如如何使用电动工具或修理小物件)的视频。
  2. 噪音: 紧接着,AI 被迫观看 2 小时 完全无关、枯燥或随机的视频。这就是“干扰”阶段。
  3. 测试: 然后,AI 会看到一段某人正在执行该任务的新视频,但视频会在一个关键步骤之前停止。AI 必须仅凭两小时前看到的那个教程来预测接下来会发生什么。

把它想象成一个记忆游戏:你需要记住一个秘密食谱,但在问你“第一个原料是什么?”之前,有人一直在你耳边大声喊着随机数字。

令人震惊的结果:AI 存在“记忆悬崖”

论文测试了目前最聪明的 AI 模型,包括 Gemini、GPT-4o 和 GPT-5.2 等知名模型。结果令人清醒。

当 AI 在看完教程后立即被要求解决问题(没有干扰)时,它的表现相当不错。这就像是在看完教程视频后立刻让你修理水龙头,你很可能会做对。

但一旦加入了两小时的干扰,AI 的表现便出现了断崖式下跌。

  • “悬崖”: 论文描述了一个“记忆悬崖”。对于一些顶尖模型来说,它们的记忆能力下降得如此厉害,以至于几乎无法与从未看过教程的情况相区分。
  • 数据: 其中一个表现最好的模型 Gemini 3.1 Pro,其得分从(有即时帮助时的)稳健的 74.92% 下降到了(长时干扰后的)59.45%。这是一个巨大的差距。但对于其他模型如 GPT-5.2,跌幅甚至更严重:从 57.94% 降至 44.89%。事实上,对于某些模型来说,长时间的等待使得它们的表现几乎与完全没有任何帮助时的盲猜无异。

作者指出,虽然这些 AI 非常擅长在观看视频时进行观察并回答问题,但当这些信息被埋没在数小时的其他内容之下时,它们处理起来却非常糟糕。

论文排除了什么(以及没排除什么)

论文非常明确地说明了这项测试不是关于什么的。

  • 它不是关于“常识”: 问题的设计确保了你无法仅靠聪明程度来猜出答案。你必须记住特定的教程。如果 AI 在没有教程的情况下也能答对,研究人员就会剔除该问题。
  • 它不是关于“被动观看”: 之前的测试只是问“在这个 1 小时的视频里发生了什么?”而这个测试问的是:“根据你几小时前看过的视频,下一步你应该做什么?”它关注的是执行,而不仅仅是记住事实。
  • 它不是“流式 AI”的胜利: 有些人认为专门设计用于观看长流媒体内容的模型(即“流式”模型)会表现得更好。论文显示,虽然它们表现得稍微好一点,但仍然面临巨大困难。一个名为 PEMF 的模型,在加入干扰后,准确率从 64.88% 骤降至 39.36%。这表明仅仅“看得更久”并不是灵丹妙药。

我们有多确定?

研究人员并非凭空猜测;他们构建了一个庞大且精心设计的数据库。

  • 数据: 他们收集了 1,220 个视频 并创建了 2,261 个问题
  • 人工验证: 真人花费了超过 750 小时 来检查每一个视频和问题。他们确保教程确实教授了该技能,确保“干扰”视频确实无关,并且将问题的计时精确到了亚秒级
  • 置信度: 论文报告这些结果时使用了 95% 的置信区间,这意味着他们在统计学上确定这些性能下降是真实的,而非偶然现象。

核心启示

论文的结论是,目前的 AI 模型就像那些如果考试前临时抱佛脚就能考高分的学生,但如果他们必须在两小时前学习,然后还要坐在一场枯燥的讲座中,他们就会忘得一干二净。

作者指出,要让 AI 真正像现实世界中的得力机器人一样——即通过视频学习一项技能并在几天后仍能运用——我们需要找到阻止这些“记忆悬崖”的方法。在此之前,即使是最聪明的 AI 模型,在面对嘈杂环境时,也很难保持技能的敏锐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →