← 最新论文
💻 computer science

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT 引入了一种用于高分辨率图像生成的创新框架,该框架通过在两个相互关联的流中同时对低分辨率和高分辨率潜轨迹进行去噪,有效地将全局布局控制与细粒度细节合成相结合,从而生成细节丰富且视觉愉悦的图像。

原作者: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,用计算机创作艺术的梦想一直受限于一个简单的权衡:你要么拥有清晰连贯的画面,要么拥有充满复杂细节的画面,但两者很难兼得。现代人工智能通过训练可以将文字描述转化为图像,在捕捉宏观构图方面已经变得非常出色。它可以逻辑完美地将城堡置于山丘之上,或将猫置于垫子上。然而,当艺术家要求生成一张用于大型墙面或艺术印刷的高清大图时,这些系统往往会遇到困难。它们生成的图像往往在远距离观察时显得锐利,但近看时却会显得支离破碎,缺乏让场景具有真实感的密集、丰富的纹理。解决这一问题的标准方法一直是两步走的过程:首先,生成一张低分辨率的小图以确定布局,然后尝试在其上添加细节。但这种方法有一个根本性的缺陷。一旦小图生成完毕,计算机就无法通过修改大图来适应新增的细节,导致最终结果中的精细纹理感觉像是“贴”上去的,而不是自然地“织入”到场景之中。

一组研究人员提出了一种不同的解决方法,引入了一种名为 JoLT 的方法,即“联合潜空间轨迹”(Joint Latent Trajectories)。Joilt 不再是从下往上、从从小到大的构建图像,而是由内而外地构建图像,同时创造宏观构图和精细细节。想象一位艺术家,他不是先画出粗略的轮廓然后再进行填充,而是以一种连续不断的动作绘制整个画布,在不断调整山脉宽阔笔触的同时,也同步精炼每一片树叶。这就是新方法的核心。该系统运行两个相互沟通的并行过程。一个过程专注于整体布局和构图,确保场景在全局范围内符合逻辑;另一个过程则专注于高分辨率细节,为特定区域增加纹理和复杂度。至关重要的是,这两个过程并非相互独立,它们在创作的每一步都在共享信息。布局过程告诉细节过程应将元素放置在何处,而细节过程则将其不断演进的丰富性反馈给布局过程,使整体场景能够适应并容纳新的复杂度。

研究人员使用一种强大的图像生成器测试了这种方法,并将其与现有的最佳技术进行了对比。他们要求计算机根据复杂的描述生成图像,这些描述包含了许多不同的物体和环境,例如一个充满了船只、时钟和树木的被淹没的酒店中庭。结果令人震惊。JoLT 生成的图像不仅尺寸更大,而且比其他方法生成的图像更复杂、更细腻。当研究人员测量图像的信息密度时,JoLT 的作品显示出细节量的巨大提升,某些指标比次优方法高出了百分之五十。更重要的是,这些图像保持了连贯性。额外的细节并没有破坏场景或使其看起来混乱,相反,它们感觉像是所描绘世界中自然的一部分。该系统还赋予了用户一种全新的控制力:通过调整一个简单的设置,用户可以调高或调低细节量,在无需重写整个描述的情况下,精确决定最终图像的复杂程度。

为了验证这些改进对真实人类是否有效,研究人员进行了一项研究,让参与者将 JoLT 生成的图像与其它领先系统生成的图像进行对比。参与者一致认为 JoLT 的图像更优,认为其细节更丰富、视觉更复杂且更具艺术吸引力。他们还觉得这些图像在匹配原始文字描述方面与其它方法同样出色,这证明了增加如此多的细节并不会以牺牲准确性为代价。这项研究表明,关于高分辨率图像生成的旧思维模式——即从小开始并试图将其扩展——并不是唯一的路径。通过将场景的创建视为一个单一且统一的过程,让宏观构图与微观细节共同演化,我们便可以生成既具有宏大尺度又具有丰富纹理的图像。这为需要经得起近距离观察的艺术家和创作者开辟了新的可能性,将计算机从一个制作简单图片的工具,转变为一个能够生成高保真、高密度世界的合作伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →