ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos
本文介绍了 ProcObject-10K,这是首个旨在评估教学视频中以物体为中心的推理与时序定位的基准,它揭示了当前的多模态模型严重依赖语言先验而非细粒度的物体动态,同时证明了以物体为中心的微调能够有效弥合这一差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在观看一档烹饪节目。标准的人工智能可能会看着视频说:“厨师在切洋葱,然后煎它们。”它看到了动作(切、煎),但并没有真正理解食材发生了什么。它没有意识到洋葱从坚硬、脆爽的状态转变成了柔软、半透明的状态,或者如果厨师忘了加油,洋葱会烧焦而不是被煎熟。
这篇论文,ProcObject-10K,认为当前的人工智能过于关注“舞步”(动作),而不够关注“舞者”(物体)以及它们如何发生变化。
以下是研究人员所做工作的简要分解:
1. 问题:盲目的“厨师”
作者指出,现有的指令视频人工智能基准测试,就像要求学生只通过列出情节要点来描述一部电影,而忽略了角色情感或场景的变化。
- 差距:人工智能模型通常能猜出“接下来会发生什么?”这类问题的正确答案,因为它们在互联网上阅读了数百万份食谱(语言先验)。它们知道洋葱通常会被煎。
- 失败:然而,如果你要求人工智能指出视频中洋葱从生变熟的确切时刻,或者解释为什么发生了错误(例如,“黄油没有融化是因为它太冷了”),人工智能就会失败。它无法找到视觉证据。这就像一个背下了答案键但没有读过教科书的学生。
2. 解决方案:人工智能的新“健身房”(ProcObject-10K)
为了解决这个问题,研究人员建立了一个名为ProcObject-10K的新测试平台。可以将这想象为一个专门设计的健身房,旨在训练人工智能关注物体及其状态变化。
- 数据集:他们收集了超过 1,700 个视频片段(烹饪、组装、实验室工作),并创建了 10,500 个问题。
- 问题:他们不再仅仅问“厨师做了什么?”,而是问:
- 前提条件:“在打蛋之前,鸡蛋必须发生什么?”(它必须被敲开)。
- 状态演变:“鸡蛋从碗里到微波炉里发生了什么变化?”(它从液体变成了凝固的凝乳)。
- 反事实:“如果没有剥大蒜,会发生什么?”(它会变得块状且苦涩)。
- 错误:“黄油出了什么问题?”(它保持块状而没有融化)。
- 证据:至关重要的是,每个答案都必须由视频中的具体时间戳作为支撑。人工智能必须证明它在哪里看到了变化。
3. 测试结果:“回答与定位的差距”
研究人员在这个新健身房上测试了 13 个最先进的人工智能模型(如 GPT-4、Gemini 等)。
- 结果:这些模型在编写看似合理的答案方面表现出色(语言得分高),但在指出视频证据方面却表现糟糕。
- 比喻:想象一名侦探,他可以根据新闻写出一篇关于谁犯了罪完美故事,但当被要求指出证明这一点的监控录像时,他们却指错了房间。
- 数据:模型找到正确视频片段的能力低于 45%。它们依赖的是“常识”(即它们在互联网上读到的内容),而不是真正观看视频。
4. 修复:教导人工智能去“看”
为了帮助人工智能学习,研究人员创建了一种特殊的训练方法(监督微调)。
- 方法:他们不仅仅告诉人工智能答案。他们提供了“伪标签”——虚假但有益的提示,明确指出哪些物体(如鸡蛋或刀)是重要的,以及它们何时出现。
- 类比:这就像老师用荧光笔标出教科书中包含答案的具体句子,而不是仅仅把答案键给学生。
- 结果:当他们用这些“荧光笔”训练人工智能时,人工智能在回答问题以及寻找视频证据方面都变得更好了。
5. 额外收获:它无处不在
最棒的是,这项新技能不仅仅适用于这个特定的测试。
- 当他们将在这种“以物体为中心”的方法上训练过的人工智能,测试于它从未见过的其他视频任务时,其表现优于那些仅接受过通用视频数据训练的模型。
- 它甚至帮助人工智能充当机器人(具身智能体)的“规划者”,帮助它们理解如何在现实世界中操作物体,而不仅仅是观看视频。
总结
该论文声称,要真正理解指令视频,人工智能必须停止仅仅观看“动作”,转而追踪“物体”以及它们如何随时间变化。他们建立了一个新的测试(ProcObject-10K)来证明当前的人工智能对这些变化是“视而不见”的,并且他们表明一种特定的训练方法可以解决这一问题,使人工智能在理解现实世界中的因果关系方面变得更加聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。