MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
该论文介绍了 MemoBench,这是一个包含 360 个地面真值片段及一个多维度评估套件的诊断基准,旨在评估视频生成模型在动态变化的环境中,对于在被遮挡期间发生物理变化的物体保持记忆一致性的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一场魔术表演,魔术师在幕布后让一只兔子消失了。在兔子被藏起来的时候,魔术师喂了它一根胡萝卜,给它剪了头发,还教它玩杂耍。当幕布再次升起时,兔子跳了出来。如果兔子仍然只是一只毛茸茸的白兔,既没有胡萝卜也没有杂耍技能,那么这个魔术就失败了。观众期望兔子能记住它在隐藏期间发生的事情。这就是人工智能中“世界模型”(world modeling)的核心挑战。研究人员正试图构建能够理解现实世界运作方式,而不仅仅是拼接漂亮图片的视频生成器。他们希望这些 AI “世界”知道,如果一个杯子从桌子上掉下来并滚到了沙发后面,它并不会凭空消失;它仍然在那里,也许现在洒了一地的咖啡,等待着再次被看到。这种在物体不在视线内时仍能记住它们的能力被称为“物体恒常性”(object permanence),这是人类婴儿很早就学会的一项技能。但对于 AI 来说,在摄像机移动时追踪一个不断变化的世界是极其困难的。
于是有了 MemoBench,这是一个全新的“成绩单”,旨在测试 AI 在这场记忆游戏中的表现究竟有多好。研究人员创建了一个特殊的测试:AI 会看到一个物体的视频(比如融化的冰块或行走的机器人),然后摄像机转向别处使物体消失。在物体被隐藏期间,它会持续发生变化——融化、行走或倾倒粉末。接着,摄像机转回来,物体重新出现。核心问题在于:AI 是否记得物体在隐藏期间发生了什么?研究发现,目前的 AI 模型在这方面表现得很糟糕。即使是最聪明的模型也无法回忆起物体的最新状态。它们可能会把物体带回来,但往往形状不对、颜色不对,或者干脆变成了一个看起来略微相似的完全不同的物体。这项研究表明,仅仅告诉 AI 摄像机该指向哪里是不够的;AI 需要一个更强大的内部“记忆”来追踪那些在无人注视时发生的变化。
设定:与 AI 的捉迷藏游戏
由来自哈佛、麻省理工学院等顶尖机构的研究人员领导的团队,构建了一个名为 MemoBench 的基准测试。你可以把它看作是一个针对视频生成 AI 的大型、严苛的捉迷藏游戏。他们创建了 360 段视频片段 来测试这些模型。其中一半是在超逼真的视频游戏引擎(Unreal Engine 5)中制作的,另一半则是用真实摄像机在现实世界中拍摄的。
这个游戏遵循严格的三部分剧本:
- 可见(Visible): 摄像机展示一个目标物体(如机器人或融化的蜡烛)。
- 消失(Disappear): 摄像机转向别处。物体现在被隐藏了,但它仍在继续它的动作(融化、行走或倾倒)。
- 重现(Reappear): 摄像机转回来。物体再次可见。
AI 的任务是生成“消失”和“重现”部分的视频。它必须猜测物体在隐藏一段时间后看起来是什么样子的。如果物体在融化,AI 在重现时必须展示一个更小的、类似水洼的版本。如果物体在行走,AI 必须展示它在一个新的位置,而不是回到起点。
结果:AI 的注意力很短
研究人员在这一基准测试上测试了 10 个不同的最先进 AI 模型。结果令人警醒。
“静态”诡计:
一些模型试图作弊。它们并没有真正移动摄像机或追踪物体,而是让视频几乎保持静止。因为视频变化不大,它们在“平滑度”和“一致性”指标上获得了高分。这就像一个学生在考试时拒绝离开座位,因此他永远不会迷路,但也从未学到任何新知识。论文指出,像 LTX-Video 这样的模型在纸面上看起来表现很好,因为它们几乎不动摄像机,但它们违背了测试的精神。
记忆鸿沟:
即使是那些确实尝试移动摄像机并遵循指令的模型,也表现得非常挣扎。最重要的评分指标——物体重现得分(Object Reappearance Score, ORS),衡量了 AI 在多大程度上成功地找回了处于其新状态下的正确物体。
- 结果: 没有模型的得分超过 0.6(满分为 1.0)。
- 这意味着: 即使是最优秀的模型,也无法在超过 60% 的情况下正确回忆起物体的状态。通常,物体重现时会变成完全不同的形状,或者完全消失,取而代之的是一个幻觉(虚构出的物体)。
“摄像机控制”的错觉:
研究还观察了那些被给予明确摄像机移动指令(如“向左平移,然后向右转”)的模型。你可能会认为给 AI 一张地图会有所帮助。论文发现,虽然这些模型在遵循摄像机路径方面做得更好,但在记住物体状态方面依然表现糟糕。这就像拥有一个精确告诉你驾驶路线的 GPS,但你的汽车引擎却在你转弯时忘记了你之前在做什么。
我们是如何衡量的
为了确保不是在凭感觉猜测,团队使用了两种评分方式:
- 自动化指标: 计算机将 AI 生成的视频与真实视频进行对比,检查像素级的匹配度和 3D 几何结构。
- VQA(视觉问答): 他们使用了一个智能 AI 评委(大语言模型)来观看视频并回答“是/否”问题,例如:“机器人在同一个方向行走吗?”或者“蜡烛在隐藏期间融化了吗?”这种类人化的检查捕捉到了简单的像素对比会遗漏的错误,例如物体身份的变化或物理规律的失效(比如阴影移动方向错误)。
总结
论文得出结论,虽然 AI 在制作精美、流畅的视频方面已经做得非常出色,但在记忆力方面仍然非常薄弱。它将世界视为一系列互不相连的快照,而不是一个连续的故事。如果一个物体离开了屏幕,AI 往往会“忘记”它的存在,或者发明一个新版本。
作者认为,要让 AI 真正成为一个“世界模拟器”——这对于自动驾驶汽车或需要穿梭于真实房间的机器人至关重要——我们需要停止仅仅追求视频的美观,而是开始教导这些模型去真正记住那些在它们看不见时发生的事情。“消失与重现”测试是一个简单但强有力的证明,它表明目前的 AI 世界模型确实拥有非常短暂的记忆。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。