← 最新论文
💻 computer science

SlotDiT: Object-Centric Representations for Diffusion Transformers

本文介绍了 SlotDiT,这是一种文本引导的扩散 Transformer,它利用以对象为中心的基于槽(slot)的潜表示,实现了与传统的基于 VAE 的方法相比具有竞争力的视频生成质量,并在机器人应用中显著提高了任务完成率。

原作者: Gjergj Plepi, Sven Behnke

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Gjergj Plepi, Sven Behnke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以理解世界,不仅仅是将世界视为像素的模糊堆叠,而是将其视为由移动和相互作用的各种独立物体组成的集合。多年来,旨在生成视频或规划机器人动作的人工智能系统一直依赖于一种将每张图像视为巨大彩色点阵的方法。虽然这种方法能产生极其逼真的图像,但当机器人需要弄清楚如何拿起杯子或在桌子上滑动方块时,它往往会失效。问题在于,这些系统虽然能看到高清晰度的细节,却缺乏对其中独立物体的清晰心理地图。它们知道场景看起来是什么样子的,但很难理解场景内部正在发生什么。这种“看见”与“理解”之间的差距,限制了机器遵循简单指令或在现实环境中规划复杂动作的能力。

波恩大学的研究小组提出了一种让机器观察世界的不同方式。他们没有强迫人工智能去处理视频中的每一个像素,而是教会它将一个场景分解为少量独特的、可移动的部分。他们称这些部分为“槽位”(slots)。想象一下,当你看着一个繁忙的厨房柜台时,能瞬间识别出咖啡杯、烤面包机和水果盘是独立的实体,而不是一团混乱的形状和颜色。这个被称为 SlotDiT 的新系统,利用这种以物体为中心的方法来引导一个强大的视频生成计算机模型。通过专注于物体本身而非背景噪声,该系统能够更准确地预测场景随时间变化的方式,尤其是在给定像“将红方块移到蓝碗里”这样简单的文本指令时。

研究人员构建的系统分为两个主要阶段。首先,计算机学习观察一段视频帧并将其分离成这些独立的物体槽位。它识别场景中的实体,并为每个实体分配一个紧凑的数字表示。一旦场景被分解,系统就会使用文本指令来引导对接下来会发生什么的预测。该模型不再试图猜测未来每一个像素的颜色,而仅仅是预测这几个物体槽位将如何移动和变化。然后,它将这些预测重新缝合在一起,从而创造出一段关于未来的视频。团队将这种方法与依赖传统、重像素方法的旧系统进行了对比测试。他们在四个不同的数据集上进行了实验,范围从简单的桌面游戏计算机模拟到复杂的机器人执行家务的真实场景。

结果显示,在“细节视觉呈现”与“结构化理解”之间存在明显的鸿型。那些专注于高视觉保真度的旧系统通常能生成在人类眼中看起来平滑且逼真的视频。然而,当被要求遵循特定指令时,这些系统经常失败。它们可能会生成一段非常漂亮的方块滑动的视频,但方块最终会落在错误的位置,或者未能按要求与目标物体发生交互。相比之下,新的 SlotDiT 系统虽然有时生成的视频在视觉上没那么完美,但始终能成功完成实际任务。在一个名为 CLIPort 的数据集上(机器人必须将特定的方块放入特定的碗中),新系统的成功率达到了 73.0%,远高于排名第二的方法(后者仅达到 50%)。即使在涉及家务劳动的更复杂的现实场景中,这种以物体为中心的系统也保持了比其像素驱动对手更高的成功率。

除了能完成任务之外,这种新方法还表现出显著的速度和效率优势。因为系统只需要追踪少量的物体槽位,而不是数以千计的像素,所以生成预测所需的计算能力要少得多。在测试中,研究人员发现,新系统生成预测的速度比标准的超高清模型快了五倍以上。这种速度优势对于机器人学至关重要,因为机器需要实时思考和反应。这项研究表明,对于机器人要真正发挥作用,它们并不一定需要看到完美的超高清画面;它们需要以一种能够突出重要物体的方式来看待世界。通过优先考虑场景的结构而非图像的精细细节,研究人员证明了机器可以变得更好地遵循指令并规划自身的动作。

这项工作还揭示了一个关于人工智能的令人惊讶的事实:看起来更好并不总是意味着思考得更好。研究人员明确发现,那些生成的视频在视觉上最令人印象深刻的系统,往往是解决任务效果最差的。这表明,目前衡量视频生成能力的标准——即看起来有多逼真——在以构建能与物理世界交互的机器为目标时,可能会产生误导。研究结论指出,赋予机器人一个以物体为中心的视角,是提高其规划和控制动作能力的强大途径。尽管该系统仍存在一些局限性,例如需要追踪固定数量的物体,但这些发现提供了一条充满希望的前行之路。它暗示,机器人智能的未来可能不在于让机器“看”得更多,而在于帮助它们“理解”所见之物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →