← 最新论文
💻 computer science

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

该论文介绍了 MemoBench,这是一个包含 360 个地面真值片段及一个多维度评估套件的诊断基准,旨在评估视频生成模型在动态变化的环境中,对于在被遮挡期间发生物理变化的物体保持记忆一致性的能力。

原作者: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场魔术表演,魔术师在幕布后让一只兔子消失了。在兔子被藏起来的时候,魔术师喂了它一根胡萝卜,给它剪了头发,还教它玩杂耍。当幕布再次升起时,兔子跳了出来。如果兔子仍然只是一只毛茸茸的白兔,既没有胡萝卜也没有杂耍技能,那么这个魔术就失败了。观众期望兔子能记住它在隐藏期间发生的事情。这就是人工智能中“世界模型”(world modeling)的核心挑战。研究人员正试图构建能够理解现实世界运作方式,而不仅仅是拼接漂亮图片的视频生成器。他们希望这些 AI “世界”知道,如果一个杯子从桌子上掉下来并滚到了沙发后面,它并不会凭空消失;它仍然在那里,也许现在洒了一地的咖啡,等待着再次被看到。这种在物体不在视线内时仍能记住它们的能力被称为“物体恒常性”(object permanence),这是人类婴儿很早就学会的一项技能。但对于 AI 来说,在摄像机移动时追踪一个不断变化的世界是极其困难的。

于是有了 MemoBench,这是一个全新的“成绩单”,旨在测试 AI 在这场记忆游戏中的表现究竟有多好。研究人员创建了一个特殊的测试:AI 会看到一个物体的视频(比如融化的冰块或行走的机器人),然后摄像机转向别处使物体消失。在物体被隐藏期间,它会持续发生变化——融化、行走或倾倒粉末。接着,摄像机转回来,物体重新出现。核心问题在于:AI 是否记得物体在隐藏期间发生了什么?研究发现,目前的 AI 模型在这方面表现得很糟糕。即使是最聪明的模型也无法回忆起物体的最新状态。它们可能会把物体带回来,但往往形状不对、颜色不对,或者干脆变成了一个看起来略微相似的完全不同的物体。这项研究表明,仅仅告诉 AI 摄像机该指向哪里是不够的;AI 需要一个更强大的内部“记忆”来追踪那些在无人注视时发生的变化。

设定:与 AI 的捉迷藏游戏

由来自哈佛、麻省理工学院等顶尖机构的研究人员领导的团队,构建了一个名为 MemoBench 的基准测试。你可以把它看作是一个针对视频生成 AI 的大型、严苛的捉迷藏游戏。他们创建了 360 段视频片段 来测试这些模型。其中一半是在超逼真的视频游戏引擎(Unreal Engine 5)中制作的,另一半则是用真实摄像机在现实世界中拍摄的。

这个游戏遵循严格的三部分剧本:

  1. 可见(Visible): 摄像机展示一个目标物体(如机器人或融化的蜡烛)。
  2. 消失(Disappear): 摄像机转向别处。物体现在被隐藏了,但它仍在继续它的动作(融化、行走或倾倒)。
  3. 重现(Reappear): 摄像机转回来。物体再次可见。

AI 的任务是生成“消失”和“重现”部分的视频。它必须猜测物体在隐藏一段时间后看起来是什么样子的。如果物体在融化,AI 在重现时必须展示一个更小的、类似水洼的版本。如果物体在行走,AI 必须展示它在一个新的位置,而不是回到起点。

结果:AI 的注意力很短

研究人员在这一基准测试上测试了 10 个不同的最先进 AI 模型。结果令人警醒。

“静态”诡计:
一些模型试图作弊。它们并没有真正移动摄像机或追踪物体,而是让视频几乎保持静止。因为视频变化不大,它们在“平滑度”和“一致性”指标上获得了高分。这就像一个学生在考试时拒绝离开座位,因此他永远不会迷路,但也从未学到任何新知识。论文指出,像 LTX-Video 这样的模型在纸面上看起来表现很好,因为它们几乎不动摄像机,但它们违背了测试的精神。

记忆鸿沟:
即使是那些确实尝试移动摄像机并遵循指令的模型,也表现得非常挣扎。最重要的评分指标——物体重现得分(Object Reappearance Score, ORS),衡量了 AI 在多大程度上成功地找回了处于其新状态下的正确物体。

  • 结果: 没有模型的得分超过 0.6(满分为 1.0)。
  • 这意味着: 即使是最优秀的模型,也无法在超过 60% 的情况下正确回忆起物体的状态。通常,物体重现时会变成完全不同的形状,或者完全消失,取而代之的是一个幻觉(虚构出的物体)。

“摄像机控制”的错觉:
研究还观察了那些被给予明确摄像机移动指令(如“向左平移,然后向右转”)的模型。你可能会认为给 AI 一张地图会有所帮助。论文发现,虽然这些模型在遵循摄像机路径方面做得更好,但在记住物体状态方面依然表现糟糕。这就像拥有一个精确告诉你驾驶路线的 GPS,但你的汽车引擎却在你转弯时忘记了你之前在做什么。

我们是如何衡量的

为了确保不是在凭感觉猜测,团队使用了两种评分方式:

  1. 自动化指标: 计算机将 AI 生成的视频与真实视频进行对比,检查像素级的匹配度和 3D 几何结构。
  2. VQA(视觉问答): 他们使用了一个智能 AI 评委(大语言模型)来观看视频并回答“是/否”问题,例如:“机器人在同一个方向行走吗?”或者“蜡烛在隐藏期间融化了吗?”这种类人化的检查捕捉到了简单的像素对比会遗漏的错误,例如物体身份的变化或物理规律的失效(比如阴影移动方向错误)。

总结

论文得出结论,虽然 AI 在制作精美、流畅的视频方面已经做得非常出色,但在记忆力方面仍然非常薄弱。它将世界视为一系列互不相连的快照,而不是一个连续的故事。如果一个物体离开了屏幕,AI 往往会“忘记”它的存在,或者发明一个新版本。

作者认为,要让 AI 真正成为一个“世界模拟器”——这对于自动驾驶汽车或需要穿梭于真实房间的机器人至关重要——我们需要停止仅仅追求视频的美观,而是开始教导这些模型去真正记住那些在它们看不见时发生的事情。“消失与重现”测试是一个简单但强有力的证明,它表明目前的 AI 世界模型确实拥有非常短暂的记忆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →