← 最新论文
💻 computer science

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

PoseAdapter 是一个轻量级框架,它通过利用具有精确空间-角度锚点的双流 2.5D 表示以及一种消除属性泄露并保持全局连贯性的上下文感知机制,实现了复杂多目标场景的高保真、可控图像生成。

原作者: Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

多年来,计算机已经学会了根据文字来绘画。如果你要求机器“画一只猫”,它可以生成一张逼真的猫科动物图像。但如果要求更具体一些,比如“一只坐在红色椅子上的猫,面向左侧,旁边有一只蓝色的狗”,计算机往往会感到困惑。它可能会把猫放在椅子上,但让它朝向错误的方向;或者它可能会混合两个动物的颜色,使它们看起来像是一个单一的、奇怪的生物。这种困难在于,目前的图像生成工具擅长捕捉场景的整体氛围,但在处理多个物体的精确几何关系方面却表现不佳。它们缺乏理解每个物体确切位置、大小以及在三维空间中指向何方的能力。

研究人员曾尝试通过向计算机输入复杂的3D地图来解决这个问题,这些地图类似于建筑师用来建造房屋的蓝图。然而,这些地图非常沉重,难以创建,并且会减慢处理速度。另一些人则尝试直接将物体剪切并粘贴到场景中,但这往往会导致生成的图像看起来像是由互不相关的部分组成的拼贴画,缺乏自然的阴影或一致的光照。挑战在于,如何找到一种方法,既能给计算机提供关于物体位置的严格指令,又不会强迫它处理过载的数据,或者失去场景的自然和谐感。

一组研究人员推出了一种名为 PoseAdapter 的新方法,旨在赋予计算机更敏锐的空间感和方向感。该系统并不依赖沉重的3D蓝图,而是为场景中的每个物体使用一套轻量级的指令:对物体的描述、一个显示其在屏幕上位置的简单方框,以及三个告诉计算机物体具体转向角度的数字。你可以把它想象成给计算机一份带有特定坐标和角度的清单,而不是一个复杂的3D模型。这种方法允许计算机生成具有高精度的图像,确保摩托车不仅处于正确的位置,而且还以正确的角度倾斜并面向正确的方向。

这项工作的核心创新在于计算机处理这些指令的方式。在创建一个包含多个物体的图像时,计算机面临着一个艰难的选择:如果它过于严格地专注于保持每个物体的独立性,场景看起来会显得僵硬且不自然,仿佛物体是被粘在背景上的。如果它过于专注于将它们融合在一起,物体就会开始混淆,导致红色的椅子变成蓝色,或者狗长出了猫的特征。为了解决这个问题,研究人员构建了一个双路径系统。一条路径充当严格的守卫,确保每个物体都留在自己的边界内,并保持其独特的颜色和纹理。另一条路径充当连接器,允许物体相互“观察”,从而自然地共享光影和透视关系。通过同时运行这两条路径,该系统能够在保持物体独立性的同时,让它们感觉像是属于同一个世界。

为了教这个系统如何工作,研究人员创建了一个庞大的新图像集,名为 OrientLayout。这个数据集包含超过11万个示例,其中每个物体都经过了位置、大小和方向的精心标注。团队投入了大量精力确保方向的准确性,甚至手动检查了数千张图像以纠正错误。他们利用这些数据来训练模型,使其理解简单的指令集与最终视觉结果之间的关系。训练过程旨在早期优先考虑场景的整体布局,确保计算机在关注细节之前先掌握大局。

在与其它领先方法进行测试对比时,PoseAdapter 展示出了明显的优势。在涉及单个物体的实验中,它能够极其准确地放置物体,在匹配请求的位置和角度方面远优于之前的系统。在包含多个物品的复杂场景中(例如摆满家具的房间或有多辆车辆的街道),这种新方法成功防止了困扰旧模型的属性混淆问题。在其他系统可能会在要求银色笔记本电脑屏幕时生成绿色屏幕,或者无法将汽车正确放置在斜坡上的情况下,PoseAdapter 既保持了每个物体的完整性,又保持了场景的凝聚力。该系统还证明了其速度更快,因为它不需要在创建图像之前生成或处理沉重的3D地图。

结果表明,对图像生成进行精确控制并不需要沉重的计算工具或复杂的3D建模。通过使用一套简单、高效的空间和角度指令,并通过平衡严格的分离与自然的连接,计算机现在可以创建既准确又具有视觉真实感的复杂多物体场景。这一进步使该领域更接近这样一个未来:用户可以像描述故事一样轻松地规定场景的精确构图,而计算机不仅能理解文字,还能理解它们所占据的空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →