← 最新论文
🤖 AI

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

RaPD 引入了一种分辨率无关的像素扩散框架,该框架在连续的神经图像场潜在空间内运行,利用语义引导和坐标查询注意力机制,以固定的计算成本实现任意分辨率下的高质量图像生成。

原作者: Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你想画一幅画。大多数现代 AI 艺术生成器的工作原理就像是一个像素网格。它们决定在一个已经划分为微小方块(像素)的画布上进行绘画。如果你要求一张小图,它们会填充一个小网格;如果你要求一张巨大的 8K 图片,它们就必须构建一个巨大的网格,这需要大量的时间和计算能力。这就像试图通过拼接数百万个预先制作好的小方块瓷砖来绘制一幅壁画;壁画越大,你需要制作的瓷砖就越多。

一些较旧的方法试图通过使用神经图像场(NIFs)来解决这个问题。不要把这些方法想象成瓷砖网格,而要想象成一种连续、平滑的液体。你可以在任何一点将画笔浸入这种液体中,它会告诉你该处应该涂什么颜色。这非常棒,因为你可以画一个小点或一面巨大的墙,而无需改变液体本身。

问题所在:
论文指出,迄今为止这些“液体”方法的使用存在一个主要缺陷。它们被训练成了复印机,而不是创造者

  • 复印机问题:如果你拿一张低分辨率的照片,并要求 AI“想象”出缺失的细节以将其变为高分辨率,这种液体方法效果很好。它擅长插值(填补空白)。
  • 创造者问题:但是,如果你要求 AI 根据文本提示(例如“一只毛茸茸的狐狸在滑雪”)从头发明一张新图像,这种液体方法就会失败。它无法充分理解图像的故事语义,从而无法创造出连贯的内容。这就像拥有一桶油漆,它知道如何完美地匹配颜色,却完全不知道狐狸长什么样。

解决方案:RaPD
作者提出了RaPD(分辨率无关的像素扩散)。他们建立了一个新系统,将这种“复印机液体”转变为“创造者液体”。以下是他们是如何做到的,使用了简单的类比:

1. “智能液体”(语义表示引导)

想象 AI 的“液体”(潜在空间)就像一本空白笔记本。

  • 旧方法:这本笔记本只被教导如何完美地复制文本。
  • RaPD 的方法:在 AI 开始创作之前,他们使用一位聪明的老师(一个名为 DINOv2 的强大视觉模型)来教导这本笔记本。他们向笔记本展示图片并说:“不要只是复制像素;要理解这个形状是‘狐狸’,这种颜色是‘复古服装’。”
  • 结果:AI 学会了将图像的意义存储在连续的液体中,而不仅仅是视觉纹理。这弥合了“重建”与“生成”之间的差距。

2. “通用画笔”(坐标查询注意力渲染器)

一旦 AI 创建了它的“智能液体”(去噪后的潜在表示),就需要将其转化为图像。

  • 旧方法:画笔是一个简单的局部工具。它观察一滴微小的液体,并决定一个像素的颜色。它无法与邻居交流。
  • RaPD 的方法:他们构建了一个超级画笔,称为坐标查询注意力渲染器(CQAR)。这支画笔很特别,因为:
    • 它确切地知道自己在画哪里(坐标)。
    • 它在画一个点时,可以观察整幅画面。它会问:“我在这里画狐狸的耳朵;液体的其余部分是否表明身体在那里?”
    • 这使得它能够对整个图像进行推理,确保狐狸的尾巴不会出现在错误的位置,即使图像非常巨大。

3. “魔法画布”(分辨率无关)

这是最酷的部分。

  • 旧网格:要生成一张 4K 图像,AI 必须运行一个繁重、缓慢的过程来生成相当于 4K 的数据量。要生成一张 8K 图像,它必须再次运行该过程以生成更多的数据。
  • RaPD 的魔法:AI 只需生成一次“智能液体”。无论最终图片有多大,这都需要固定的时间。
    • 想要一张 512x512 的图像?你在液体中蘸取 512 个点。
    • 想要一张 4096x4096 的图像?你在同一液体中蘸取 4096 个点。
    • 成本:昂贵的部分(制作液体)保持不变。唯一变化的是你蘸取画笔的次数。这意味着 RaPD 可以几乎以生成小图的速度生成巨大的高分辨率图像,而其他方法则会随着图像变大而呈指数级变慢。

结果总结
论文表明,RaPD 能够:

  • 根据文本提示生成图像,其效果优于以前的基于像素的方法,错误更少(例如形状破碎)。
  • 扩展到任意分辨率(从小缩略图到巨大的 4K+ 墙面),而无需重新训练模型。
  • 在保持“创作”部分的计算成本固定的同时做到这一点,仅随着图像变大,为“绘画”部分支付少量额外成本。

简而言之,RaPD 教会 AI 理解连续图像的意义,并赋予它一支画笔,可以随时随地以任意尺寸绘制这种意义,无需每次画布变大时都重建整个工厂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →