← 最新论文
💻 computer science

Hierarchical Image Tokenization for Multi-Scale Image Super Resolution

本文提出了一种新颖的多尺度图像超分辨率方法,该方法在视觉自回归框架内结合了分层图像标记化(HIT)与直接偏好优化(DPO),通过一个仅含 300M 参数的紧凑模型实现最先进性能,既无需外部训练数据,又能支持灵活的单次多尺度输出生成。

原作者: Isma Hadji, Enrique Sanchez, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Isma Hadji, Enrique Sanchez, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张模糊、低分辨率的猫的照片,想要把它变成一张晶莹剔透、高清的杰作。这就是**图像超分辨率(ISR)**的工作。

长期以来,计算机完成这项工作要么是通过猜测缺失的细节(这有时会创造出虚假的特征,比如长出六只眼睛的猫),要么是通过逐步“去噪”图像,而这个过程非常缓慢。

最近,一种名为**视觉自回归(VAR)**模型的新方法变得流行起来。你可以把这些模型想象成一位不会一次性画完整个画布的画家。相反,他们分层绘制图像:先画草图,再画中等细节的版本,最后完成高清杰作。每一层都建立在前一层的基础上。

然而,你分享的这篇论文指出了这些“画家”目前工作方式存在的两个大问题,并引入了一种巧妙的解决方法。

旧方法的两个问题

1. “全有或全无”的梯子
想象画家有一架梯子,梯级代表不同的大小:小草图、中草图和最终的大画作。

  • 问题: 在以前的方法中,梯子坏了。你只能爬到最顶端的梯级(最终的 4 倍大小)。如果你试图停在中间的梯级(2 倍大小),图像看起来就会像垃圾或扭曲的一团糟。中间的“梯级”实际上并不存在为有效的图像;它们只是到达顶端所需的数学步骤。
  • 论文的解决方案(分层图像标记化): 作者构建了一架真实、坚固的梯子。他们教会模型先画小草图,再画中草图,最后画大画作,确保每一个步骤看起来都像真实、连贯的图像。现在,你可以在任何尺寸(1 倍、2 倍或 4 倍)停止过程,并获得完美的图像。他们称之为分层图像标记化(HIT)

2. 需要庞大的图书馆

  • 问题: 为了获得良好的结果,以前的模型需要非常庞大(像一本拥有数十亿页的巨型百科全书),或者需要一个巨大的、专门标记的“好与坏”示例库,以学习清晰图像的样子。
  • 论文的解决方案(DPO 正则化): 作者为模型引入了一位新的“教练”,称为直接偏好优化(DPO)。与其需要庞大的示例库,这位教练只需告诉模型:“嘿,高分辨率版本比模糊版本更好。确保你偏好清晰的细节。”
    • 这使得一个小得多的模型(仅 3.1 亿参数,而其他模型使用 10 亿参数)能够利用标准的日常训练数据进行有效学习。

结果:更聪明、更小的画家

通过结合这两个想法,作者创建了一个新系统,该系统:

  • 适用于任何尺寸: 它可以将小图像放大 2 倍、4 倍,甚至 8 倍,一次性完成,而图像不会在中间步骤中分崩离析。
  • 高效: 它比竞争对手更小、更快。当其他模型像笨重缓慢的坦克时,这辆车则像一辆灵活的运动型跑车,却依然能赢得比赛。
  • 需要更少数据: 它不需要秘密的庞大数据集就能表现良好;使用标准的公开数据就能发挥出色。

类比总结

可以将旧方法想象成试图建造摩天大楼,但只被允许打地基,然后瞬间跳到屋顶。如果你试图在半途停下,你得到的只是一堆瓦砾。

这篇论文引入了一种方法,即先建一楼,再建二楼,然后建三楼。每一层都是一个完整、可用的公寓。你可以停在二楼,拥有一个不错的居住空间,或者一直走到顶层。他们通过聘请一位更小、更聪明的工头做到了这一点,这位工头确切知道应该偏好哪些楼层平面图,而无需一个像城市一样庞大的蓝图库。

简而言之: 他们使图像放大变得灵活(适用于任何尺寸)、高效(使用更小的模型)且更智能(使用新的训练技巧),同时保持了顶级的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →