← 最新论文
💻 computer science

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

OccluRank 是一个简单且可控的布局到图像生成框架,它通过在边界框中增加单个序数秩并采用一个序数感知实例交互模块,实现了精确的遮挡感知合成,从而无需复杂的几何条件或专门的推理程序。

原作者: Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,研究人员长期以来一直致力于教机器根据文本描述生成图像。最近,他们开发出一种方法,可以向这些机器提供关于物体应出现在图像中何处处的精确指令。通过在特定区域周围画一个简单的方框并对其进行标注,用户可以告诉计算机在该处放置一只猫、一辆车或一棵树。这种被称为“布局到图像生成”(layout-to-image generation)的过程,已成为需要精确控制场景布局的设计师和创作者手中的强大工具。然而,这项技术仍存在一个显著的盲点。虽然方框可以告诉计算机物体在哪里,但它无法告诉计算机哪个物体在另一个物体的前面。在现实世界中,物体经常发生重叠;一个人可能站在长凳前,或者一个杯子可能放在桌子上,遮挡住下方的部分桌面。目前的计算机模型在处理这种深度方面表现挣扎,往往会将重叠的物体融合在一起,变成一团混乱,或者放置错误的顺序,使场景看起来在物理上是不可能的。

一组研究人员现在推出了一种名为 OccluRank 的新方法,旨在解决这个特定的视觉重叠问题。他们的方法出人意料地简单,仅在标准指令中增加了一个信息:一个排序数字。该系统并不依赖复杂的 3D 模型、深度图或多层几何数据,而是要求用户为每个物体分配一个简单的数字,以指示它应该出现在前景还是背景。数字越小意味着物体离观察者越近,数字越大则意味着离得越远。研究人员构建了一个框架,利用这一个排序数字来引导计算机的决策过程。在计算机合并图像的不同部分之前,它使用一个特殊的模块让物体之间进行“对话”。如果一辆摩托车和一架书架需要重叠,系统会检查它们分配的数字,并确保摩托车的特征被处理为位于书架之上,从而有效地遮挡住书架中本该位于其后方的部分。

为了测试这种方法是否真的有效,该团队创建了一个名为 OccluLayout 的新数据集。他们使用 3D 计算机图形软件创建了数千个场景,将家具、动物和车辆以各种重叠配置排列在一起。由于这些场景是从头开始构建的,因此他们确切知道每个物体出现的先后顺序。随后,他们利用人工智能编辑背景并为物体添加详细描述,创建了一个已知正确答案的庞大训练数据库。这使得他们能够在无需猜测或依赖不完美的深度估计的情况下训练模型。他们还开发了一个新的测试系统 OccluLayout-Bench,该系统使用先进的语言模型来对结果进行评分。这些评估器不仅查看整体图像质量,还会检查具体细节:计算机是否绘制了所有请求的物体?它们是否保持在各自的方框内?它们是否保持了颜色和纹理?最重要的是,重叠的物体是否按照正确的由前向后的顺序出现?

结果表明,这种简单的排序系统非常有效。与其他试图解决同一问题的方案相比,这种新方法生成的图像中,物体的定义更加清晰,且重叠关系是正确的。在涉及多个物品的复杂场景测试中,该模型成功保留了应当处于前方的物体的可见性,同时正确地遮挡了应当处于后方的物体的部分。它能够做到这一点,而不需要额外的输入,如 3D 坐标或相机角度,仅依靠用户提供的简单数字列表。生成的图像不仅在物体顺序的结构上是准确的,而且保持了极高的视觉质量,物体看起来很自然,其属性也保持了一致性。

研究人员发现,他们成功的关键在于系统在将物体合并成最终图像之前处理物体间交互的方式。通过让物体根据分配的等级交换信息,模型学会了如何解决重叠区域的冲突。如果系统被告知斑马在冰箱前面,它会调整斑马的特征以覆盖冰箱,而不是将两者融合在一起。即使研究人员在测试模型处理训练期间从未见过的物体时,这种能力依然有效,这表明该方法学习的是关于如何处理深度的通用规则,而非仅仅是记忆特定的图像。这项研究表明,通过增加一个直观的指令层,可以引导计算机创建出尊重物体占据空间物理现实的复杂、分层的场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →