几十年来,用计算机创作艺术的梦想一直受限于一个简单的权衡:你要么拥有清晰连贯的画面,要么拥有充满复杂细节的画面,但两者很难兼得。现代人工智能通过训练可以将文字描述转化为图像,在捕捉宏观构图方面已经变得非常出色。它可以逻辑完美地将城堡置于山丘之上,或将猫置于垫子上。然而,当艺术家要求生成一张用于大型墙面或艺术印刷的高清大图时,这些系统往往会遇到困难。它们生成的图像往往在远距离观察时显得锐利,但近看时却会显得支离破碎,缺乏让场景具有真实感的密集、丰富的纹理。解决这一问题的标准方法一直是两步走的过程:首先,生成一张低分辨率的小图以确定布局,然后尝试在其上添加细节。但这种方法有一个根本性的缺陷。一旦小图生成完毕,计算机就无法通过修改大图来适应新增的细节,导致最终结果中的精细纹理感觉像是“贴”上去的,而不是自然地“织入”到场景之中。
一组研究人员提出了一种不同的解决方法,引入了一种名为 JoLT 的方法,即“联合潜空间轨迹”(Joint Latent Trajectories)。Joilt 不再是从下往上、从从小到大的构建图像,而是由内而外地构建图像,同时创造宏观构图和精细细节。想象一位艺术家,他不是先画出粗略的轮廓然后再进行填充,而是以一种连续不断的动作绘制整个画布,在不断调整山脉宽阔笔触的同时,也同步精炼每一片树叶。这就是新方法的核心。该系统运行两个相互沟通的并行过程。一个过程专注于整体布局和构图,确保场景在全局范围内符合逻辑;另一个过程则专注于高分辨率细节,为特定区域增加纹理和复杂度。至关重要的是,这两个过程并非相互独立,它们在创作的每一步都在共享信息。布局过程告诉细节过程应将元素放置在何处,而细节过程则将其不断演进的丰富性反馈给布局过程,使整体场景能够适应并容纳新的复杂度。
研究人员使用一种强大的图像生成器测试了这种方法,并将其与现有的最佳技术进行了对比。他们要求计算机根据复杂的描述生成图像,这些描述包含了许多不同的物体和环境,例如一个充满了船只、时钟和树木的被淹没的酒店中庭。结果令人震惊。JoLT 生成的图像不仅尺寸更大,而且比其他方法生成的图像更复杂、更细腻。当研究人员测量图像的信息密度时,JoLT 的作品显示出细节量的巨大提升,某些指标比次优方法高出了百分之五十。更重要的是,这些图像保持了连贯性。额外的细节并没有破坏场景或使其看起来混乱,相反,它们感觉像是所描绘世界中自然的一部分。该系统还赋予了用户一种全新的控制力:通过调整一个简单的设置,用户可以调高或调低细节量,在无需重写整个描述的情况下,精确决定最终图像的复杂程度。
为了验证这些改进对真实人类是否有效,研究人员进行了一项研究,让参与者将 JoLT 生成的图像与其它领先系统生成的图像进行对比。参与者一致认为 JoLT 的图像更优,认为其细节更丰富、视觉更复杂且更具艺术吸引力。他们还觉得这些图像在匹配原始文字描述方面与其它方法同样出色,这证明了增加如此多的细节并不会以牺牲准确性为代价。这项研究表明,关于高分辨率图像生成的旧思维模式——即从小开始并试图将其扩展——并不是唯一的路径。通过将场景的创建视为一个单一且统一的过程,让宏观构图与微观细节共同演化,我们便可以生成既具有宏大尺度又具有丰富纹理的图像。这为需要经得起近距离观察的艺术家和创作者开辟了新的可能性,将计算机从一个制作简单图片的工具,转变为一个能够生成高保真、高密度世界的合作伙伴。
技术摘要:JoLT —— 用于上下文引导的高分辨率分块生成的联合潜空间轨迹
1. 问题陈述
当前的文本生成图像(T2I)生成模型,即使是像 FLUX.2 这样最先进的架构,在生成具有密集细节、高分辨率(HR)图像的同时保持全局连贯性方面仍面临挑战。虽然这些模型擅长生成低分辨率下具有美感的构图,但在渲染大型输出(如印刷品、壁画)所需的复杂局部细节时往往表现不佳。
现有的解决方案通常采用从低到高的分辨率范式:
- 生成一张低分辨率(LR)图像。
- 对 LR 图像进行上采样,并将其作为固定条件来生成 HR 细节。
作者指出了这种顺序化方法中的两个关键缺陷:
- 丰富度受限: 由于 LR 图像是先生成的,它受限于底层模型固有的复杂度限制。随后的细化步骤无法显著增强纹理丰富度,如果基础图像本身缺乏这种特性。
- 连贯性权衡: 一旦 LR 图像生成,它就无法受到 HR 信息的影响。这使得将细粒度元素无缝集成到全局布局中变得困难,从而导致在局部细节与全局场景连贯性之间产生权衡。
2. 方法论:联合潜空间轨迹 (JoLT)
JoLT 提出了一种无需训练的双流范式,将从“顺序生成”转向“低分辨率与高分辨率同时生成”。该方法耦合了一个全局 LR 轨迹和一个分块 HR 轨迹,允许它们在每个采样步骤中进行双向信息交换。
核心架构
系统利用预训练的流匹配模型(具体为 FLUX.2 Klein-9B),并在潜空间内运行。
- 初始化: 一个共享的高斯噪声样本初始化 HR 潜空间画布 (xˉ0)。该样本被随机下采样以创建 LR 潜空间 (x0),从而确保两个流都从一致的分布开始。
- 双流:
- LR 流: 根据“主提示词”(Master Prompt, c)对整个场景进行去噪,以维持全局构图和布局。
- HR 流: 基于“细节提示词”(Detail Prompt, cˉ)对重叠的空间窗口(分块扩散)进行去噪,以合成局部复杂细节。
双向信息交换
JoLT 的创新之处在于两个流之间的持续反馈循环:
LR → HR 条件化(联合先验):
- 在每个步骤 t,LR 流计算一个干净潜空间的“单次(one-shot)”估计值 (x^1)。
- 该估计值被解码到像素空间,进行上采样,然后重新编码以形成联合先验 (rˉt)。
- 该先验作为 HR 流的上下文参考。HR 模型通过对每个分块进行处理,使其既受当前噪声状态的约束,又受上采样后的 LR 先验对应裁剪区域 (Fi(rˉt)) 的约束。这确保了局部细节与不断演变的全局布局保持一致。
HR → LR 条件化(反馈):
- 在 HR 流更新其潜空间 (xˉt+Δt) 后,它会被随机下采样以保持边缘分布。
- 该下采样的 HR 数据使用强度参数 α 与 LR 更新进行线性混合。
- 应用方差匹配修正,以确保 LR 潜空间的统计特性保持一致。
- 这种机制允许 LR 流“看到”并融入 HR 流生成的精细细节,从而动态地优化全局布局。
控制机制
- 复杂度强度 (α): 一个在 [0,1] 之间的标量,控制注入到 LR 流中的 HR 信息权重。较高的 α 会产生更密集、更复杂的图像。
- 细节提示词 (cˉ): 一个辅助文本提示词,用于引导 HR 流添加特定的纹理、物体或风格元素,而不改变主构图。
3. 核心贡献
论文概述了三个主要贡献:
- 一种新型联合潜空间范式: JoLT 将标准的“从低到高”生成流水线转变为一个同步过程,使 LR 和 HR 分支能够共同演进,而非先后进行。
- 双向潜空间信息交换: 作者引入了一种利用现代扩散 Transformer 的上下文能力和方差匹配潜空间下采样的跨分辨率反馈机制。
- 可控的高密度合成: 该方法实现了对视觉复杂度 (α) 和局部内容/风格(通过 cˉ)的显式控制,且无需对模型进行微调。
4. 实验结果
作者使用经过蒸馏的 4 步 FLUX.2 骨干网络,在 200 个语义密集提示词上,将 JoLT 与强基准模型(DemoFusion, SEGA, ResDiT)进行了对比评估。
定量性能
- 复杂度: JoLT 在复杂度指标上显著优于所有基准模型。与最强的基准模型(DemoFusion)相比,JoNT 在 DCT 能量方面取得了 50% 的提升(613 对比 920),在 JPEG 比率方面取得了 26% 的提升(0.104 对比 0.131)。它在 IC9600 指标上也显示出 5% 的增益。
- 文本对齐: JoNT 保持了极具竞争力的文本对齐得分。其 LMM4LMM 相关性得分(0.367)与领先的基准模型仅差 0.004,在经过校正后,该差异被认为是统计学上不显著的。作者指出,严格的分解对齐指标有时会对 JoNT 造成惩罚,因为细节提示词有意添加了超出主提示词范围的合理内容。
- 美学与质量: JoNT 在 QIB 质量和 LMM4LMM 感知评分中均获得了最高平均分,证明了增加复杂度并不会降低视觉质量。
人类偏好研究
一项用户研究(2,700 次成对判断)显示:
- 细节与复杂度: 用户明显更倾向于 JoNT 提供的视觉细节和复杂度,而非所有基准模型。
- 提示词匹配度: JoNT 在提示词遵循度上优于 SEGA 和 ResDiT,与 DemoFusion 无显著差异。
- 艺术吸引力: 用户更偏好 JoNT 而非 SEGA 和 ResDiT。虽然 DemoFusion 在某些指标上表现相当,但 JoNT 在结构的密度方面始终获得更高评价。
全局-局部连贯性
使用 Qwen3.6-27B 作为评判器来评估局部裁剪区域是否属于周围场景,结果显示 JoNT 显著优于 SEGA 和 ResDiT,并与 DemoFusion 表现持平,证实了新增的细节并不会破坏全局场景。
5. 重要性与声明
论文将 JoNT 定位为大型艺术创作的实用工具。其重要性在于:
- 重构高分辨率合成: 它证明了将 HR 合成视为两个耦合的轨迹,比使用“从低到高”的级联方式更能实现密集、高保真的图像生成。
- 显式控制: 它将隐式的模型行为转化为显式控制。艺术家可以通过 α 来调节视觉密度,并通过语言层面的细节提示词来重塑固定的构图。
- 无需训练的高效性: 该方法无需对基础模型进行微调即可实现这些结果,而是依赖于推理阶段的架构创新。
作者对局限性保持了谦逊的态度,承认该方法依赖于单次(one-shot)估计(这限制了其仅适用于具有短采样调度(short sampling schedules)的蒸馏模型),并且极端的细节密度偶尔会降低场景的可读性。他们还指出,文本对齐指标在一致性方面存在显著差异,这表明人类判断仍然是评估复杂场景中提示词遵循度的金标准。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。