想象一下,你站在房间中央,缓缓地转动身体,同时将四周的景象尽收眼底。这就是全景图像的体验——一种捕捉了围绕单一中心点、完整三百六十度世界的格式。与冻结了场景中单一切片的标准照片不同,全景图将整个环境包裹成一个单一且连续的循环。几十年来,制作这些图像需要相机和真实的地点,但人工智能的最新进展已允许计算机根据简单的文本描述来生成它们。然而,一个显著的障碍仍然存在:虽然计算机在根据文字绘画方面变得非常出色,但它们难以理解物体在圆周中应该处于什么位置。如果你要求计算机在左边画一把椅子,在右边画一盏灯,它往往会将它们放在错误的位置,或者完全忽略方向指令,因为人类描述圆形空间的方式与计算机处理平面图像的方式并不匹配。
北京邮电大学的研究人员开发了一种名为 PanoCtrl 的新系统来解决这个特定问题。他们的工作重点在于弥合我们用于描述方向的自然语言与构建 360 度图像所需的球面几何学之间的差距。团队意识到,现有的方法虽然在处理标准平面图片时表现良好,但在应用于全景图时却会失效,因为这些方法没有考虑到方向在观察者周围环绕的独特方式。为了解决这个问题,他们创建了一个框架,将生成过程视为一系列特定物体的集合,而不是单一的像素模糊块,每个物体在球体中都有明确的位置和大小。通过教计算机首先识别提到了哪些物体以及它们在圆周中的位置,他们可以引导图像生成过程,从而高精度地放置这些物品。
他们解决方案的核心包含两个按顺序进行的步骤。首先,系统读取文本提示并将其分解为一个结构化的物体列表,不仅确定物体是什么,还确定其在 360 度空间中的精确位置和大小。例如,如果文本说“窗户在我的左侧”,系统会将此转化为一个特定的坐标和视野范围,实际上是在为窗户应该出现的位置绘制一张无形的地图。这一步至关重要,因为它将模糊的人类方向指令转化为计算机可以遵循的具体空间指令。一旦创建了这张地图,第二步就会利用它来引导实际的绘画过程。系统将这些指令直接注入图像生成器,确保在计算机构建图像时,它确切地知道应该将窗户、椅子或灯放在哪里。这种双重方法使计算机既能保持真实房间的整体外观和感觉,又能严格遵守文本给出的方向指令。
为了训练这个新系统,研究人员不得不创建一个庞大的新数据集,因为现有的全景图像集合中没有任何一个包含了他们所需的详细的、物体级的方向信息。他们构建了一个名为 PanoGround 的数据集,其中包含数千张全景图像,并配有详细说明,指明每个物体相对于观察者的确切位置。该数据集作为一个训练场,让计算机学习“前”、“后”、“左”和“右”等词汇与其在球面图像中实际位置之间的关系。如果没有这个特定的数据,系统将无法学习球面空间的复杂规则,因为标准的图像数据集并不提供这种程度的方向细节。
当研究人员将他们的新方法与现有技术进行对比测试时,结果显示出准确性的明显提升。在实验中,新系统成功将物体放置在正确方向的概率接近百分之九十九,相比之下,其他领先方法的表现通常低于百分之八十五,这是一个显著的飞跃。此外,该系统大幅降低了物体放置的误差,这意味着物体出现在文本所述位置的精确度更高。除了位置准确之外,生成的图像质量也更高,看起来比以往模型生成的图像更真实、更连贯。这项研究表明,通过明确教导计算机理解物体及其球面位置,可以创造出真正遵循用户指令的全景图像,为更具沉浸感和可控性的虚拟环境开启了大门。
技术摘要:通过 PanoCtrl 桥接语言与球面空间
问题陈述
全景图像生成对于虚拟现实(VR)和增强现实(AR)等沉浸式应用至关重要。与透视图像不同,全景图代表了一个 360° 以观察者为中心的空间,其中方向性表达(例如“左”、“前”、“后”)是空间理解的基础。然而,现有的文本生成全景图的方法过度依赖隐式空间推理,难以在球面全景场景中忠实地落实物体级的方向性描述。
两个主要挑战阻碍了进展:
- 对齐差距(Alignment Gap): 以自我为中心的方向性语言与全景图所使用的等距柱状投影(ERP)空间之间存在根本性的不匹配。ERP 的畸变和球面环绕连续性使得建模诸如“左”或“右”之类的概念比在欧几里得图像平面上要复杂得多。
- 控制局限性(Control Limitations): 现有的可控生成方法是为具有固定布局或边界框的透视图像设计的。由于几何畸变,它们无法直接应用于全景图。此外,要求手动指定空间条件会降低基于语言交互的灵活性,而解耦流水线(先解析文本再生成图像)往往会导致语言理解与图像生成之间的不一致。
方法论:PanoCtrl
作者提出了 PanoCtrl,一个旨在显式桥接自然语言与球面全景空间的以物体为中心的框架。该框架采用端到端运行,由 PanoParse 和 PanoControl 两个主要模块组成,并集成到扩散 Transformer(diffusion transformer)骨干网络中。
1. PanoParse:文本到球面解析
PanoParse 将非结构化文本提示转换为结构化的物体级球面条件。PanoParse 不依赖生成模型来隐式解决空间差距,而是将任务公式化为球面空间中的集合预测问题。
- 输入: 从文本编码器提取的文本特征。
- 机制: 使用带有可学习物体查询(object queries)的 Transformer 解码器,该模块预测一组物体实例。
- 输出: 对于每个物体,它预测:
- 语义类别: 物体的类别。
- 球面 BFoV(视场角): 由中心经度 (θ)、中心纬度 (ϕ) 以及水平/垂直角度跨度 (α,β) 定义。
- 训练: 解析器使用针对地面真值球面标注的双向匹配(DETR 式)进行监督,利用分类损失和定位损失(箱分类和偏移回归)。
2. PanoControl:物体感知扩散引导
PanoControl 将解析出的物体条件注入扩散过程,以确保准确的空间落地。它采用了双分支设计:
- 物体条件构建: 通过 MLP 将解析出的特征(语义和几何)统一为控制 Token。
- 物体感知注意力注入: 物体 Token 通过门控注意力被注入到扩散 Transformer 的文本和图像 Token 流中。这确保了物体描述与生成内容之间的语义绑定。
- 空间残差增强: 为了在 ERP 空间中提供显式的区域级引导,该分支执行以下操作:
- 根据预测的 BFoV 从 ERP Token 网格中采样局部特征。
- 通过 QKV 变换和注意力机制增强这些局部特征。
- 通过残差融合将增强后的特征聚合回全局 Token 网格。
该分支直接解决了以自我为中心的描述与 ERP 表示之间的位置不匹配问题。
3. 训练目标
该框架通过联合目标进行端到端训练:
- 解析损失 (Lparse): 监督物体语义和球面位置的准确性。
- 扩散损失 (Ldiff): 结合了标准的全局去噪损失和物体区域损失 (Lobj)。物体区域损失在地面真值 BFoV 区域上应用掩码损失,迫使模型将更多的去噪能力分配给特定的物体区域,以提高局部保真度。
核心贡献
- PanoCtrl 框架: 一个以物体为中心的框架,通过将文本转换为结构化的物体级球面条件(BFoV)并将其集成到扩散 Transformer 中,显式地桥接了自然语言与球面空间。
- 双分支控制: 引入了用于结构化条件预测的 PanoParse 和用于注入物体感知注意力和空间残差增强的 PanoControl,实现了精确的方向性落地。
- PanoGround 数据集: 一个包含 12,688 幅 ERP 全景图像以及 37,980 个物体级球面标注和多样化方向描述的新数据集,为可控全景生成建立了基准。
实验结果
作者在 PanoGround 基准上对 PanoCtrl 进行了评估,并将其与最先进的方法(如 LayerPano3D、DiT360、HunyuanWorld)进行了对比。
- 空间对齐: PanoCtrl 在所有空间指标上均达到了最先进的性能:
- 物体存在率 (OPR): 98.59%(超过次优方法 13.26%)。
- 区域-文本对齐度 (RTA): 36.91(超过 DiT360 9.23)。
- 球面定位误差 (SLE): 25.34°(显著低于最强竞争对手的 47.63°)。
- 图像质量: 该方法表现强劲,在所有对比方法中实现了最佳的 FID (46.86)、FAED (2.77) 和 CLIP Score (32.54)。虽然其 Inception Score (IS) 为 3.35,略低于 DiT360 实现的 3.37,但差距极小。总体而言,这些结果表明,显式的物体级球面控制在不牺牲感知真实感或语义一致性的情况下,提高了空间准确性。
- 消融实验: 实验证实,解析模块和双分支控制(注意力 + 空间残差)都是必不可少的。移除解析损失或物体区域损失会导致性能显著下降。研究发现最优的空间混合系数为 0.7,且 8 个物体查询在表示能力与稳定性之间提供了最佳平衡。
重要性与主张
本文声称 PanoCtrl 有效解决了以自我为中心的方向性语言与球面全景表示之间的不匹配问题。通过在球面坐标中显式建模物体级空间条件并将其直接集成到扩散过程中,该方法在不牺牲图像质量或需要手动布局规范的情况下,实现了准确的方向性落地。作者认为这项工作是迈向使文本生成全景图在沉浸式内容创作中更具可控性和可靠性的重要一步,并由填补了物体级球面监督空白的全新 PanoGround 数据集提供了支持。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。