← 最新论文
💻 computer science

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

该论文介绍了 PanoCtrl,这是一个以物体为中心的框架,它通过解析器和控制模块将文本转换为结构化的物体级球面条件,从而在自然语言与球面全景空间之间架起桥梁,实现了具有精确空间对齐能力的先进可控文本到全景图生成。

原作者: Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你站在房间中央,缓缓地转动身体,同时将四周的景象尽收眼底。这就是全景图像的体验——一种捕捉了围绕单一中心点、完整三百六十度世界的格式。与冻结了场景中单一切片的标准照片不同,全景图将整个环境包裹成一个单一且连续的循环。几十年来,制作这些图像需要相机和真实的地点,但人工智能的最新进展已允许计算机根据简单的文本描述来生成它们。然而,一个显著的障碍仍然存在:虽然计算机在根据文字绘画方面变得非常出色,但它们难以理解物体在圆周中应该处于什么位置。如果你要求计算机在左边画一把椅子,在右边画一盏灯,它往往会将它们放在错误的位置,或者完全忽略方向指令,因为人类描述圆形空间的方式与计算机处理平面图像的方式并不匹配。

北京邮电大学的研究人员开发了一种名为 PanoCtrl 的新系统来解决这个特定问题。他们的工作重点在于弥合我们用于描述方向的自然语言与构建 360 度图像所需的球面几何学之间的差距。团队意识到,现有的方法虽然在处理标准平面图片时表现良好,但在应用于全景图时却会失效,因为这些方法没有考虑到方向在观察者周围环绕的独特方式。为了解决这个问题,他们创建了一个框架,将生成过程视为一系列特定物体的集合,而不是单一的像素模糊块,每个物体在球体中都有明确的位置和大小。通过教计算机首先识别提到了哪些物体以及它们在圆周中的位置,他们可以引导图像生成过程,从而高精度地放置这些物品。

他们解决方案的核心包含两个按顺序进行的步骤。首先,系统读取文本提示并将其分解为一个结构化的物体列表,不仅确定物体是什么,还确定其在 360 度空间中的精确位置和大小。例如,如果文本说“窗户在我的左侧”,系统会将此转化为一个特定的坐标和视野范围,实际上是在为窗户应该出现的位置绘制一张无形的地图。这一步至关重要,因为它将模糊的人类方向指令转化为计算机可以遵循的具体空间指令。一旦创建了这张地图,第二步就会利用它来引导实际的绘画过程。系统将这些指令直接注入图像生成器,确保在计算机构建图像时,它确切地知道应该将窗户、椅子或灯放在哪里。这种双重方法使计算机既能保持真实房间的整体外观和感觉,又能严格遵守文本给出的方向指令。

为了训练这个新系统,研究人员不得不创建一个庞大的新数据集,因为现有的全景图像集合中没有任何一个包含了他们所需的详细的、物体级的方向信息。他们构建了一个名为 PanoGround 的数据集,其中包含数千张全景图像,并配有详细说明,指明每个物体相对于观察者的确切位置。该数据集作为一个训练场,让计算机学习“前”、“后”、“左”和“右”等词汇与其在球面图像中实际位置之间的关系。如果没有这个特定的数据,系统将无法学习球面空间的复杂规则,因为标准的图像数据集并不提供这种程度的方向细节。

当研究人员将他们的新方法与现有技术进行对比测试时,结果显示出准确性的明显提升。在实验中,新系统成功将物体放置在正确方向的概率接近百分之九十九,相比之下,其他领先方法的表现通常低于百分之八十五,这是一个显著的飞跃。此外,该系统大幅降低了物体放置的误差,这意味着物体出现在文本所述位置的精确度更高。除了位置准确之外,生成的图像质量也更高,看起来比以往模型生成的图像更真实、更连贯。这项研究表明,通过明确教导计算机理解物体及其球面位置,可以创造出真正遵循用户指令的全景图像,为更具沉浸感和可控性的虚拟环境开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →