← 最新论文
🤖 machine learning

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

本文提出了一种端到端训练流程,联合优化一维语义分词器与自回归生成模型,在 ImageNet 256×256 数据集上实现了 1.48 的 FID 值,取得了最先进的图像生成性能。

原作者: Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想通过逐字描述来教计算机画画,就像一位讲故事的人。这被称为自回归生成。计算机根据之前的“词”(在这种情况下是视觉片段)来猜测下一个“词”。

然而,计算机通常执行此操作的方式存在一个大问题。

问题:“网格”与“故事”

大多数图像生成计算机将图片分解为二维网格(像棋盘)。它们试图通过像读书一样逐行读取这个网格来描述图片。

  • 问题所在: 在网格中,右上角的片段依赖于左下角的片段。但在故事(一维列表)中,你不能在讲完开头之前就先讲结尾。这种不匹配会让计算机感到困惑,导致生成的图片杂乱无章。

之前的尝试试图通过以下方式解决这个问题:

  1. 改变故事顺序: 强迫计算机以奇怪、随机的顺序读取网格(例如倒着读书或跳跃阅读)。
  2. 展平网格: 将二维图片压成一条长长的数据线。但往往,这种过度压缩导致细节丢失,或者计算机无法学会很好地绘制这些细节。

解决方案:EOSTok(“端到端”团队)

本文的作者创建了一个名为EOSTok的新系统。把它想象成两个共同学习的工人,而不是一个训练另一个。

1. 两位工人

  • 工人 A(分词器): 这是“压缩器”。它将一张高清照片压缩成一个简短的一维“令牌”(token)列表(就像一种秘密代码)。
  • 工人 B(生成器): 这是“讲故事的人”。它查看秘密代码,并尝试预测列表中的下一个令牌,以重建图像。

2. 旧方法(“两阶段”错误)

过去,这些工人是分开训练的:

  • 第一阶段: 工人 A 仅被训练以完美地压缩图片。一旦完成,它就被冻结(锁定)。
  • 第二阶段: 工人 B 被训练来预测令牌。
  • 缺陷: 工人 A 不知道工人 B 将是使用这些令牌的人。因此,工人 A 可能会创建一个对节省空间很完美但对预测下一步很糟糕的代码。这就像一位翻译用下一位翻译无法理解的语言写书。

3. 新方法(端到端训练)

EOSTok 同时训练这两位工人。

  • 反馈循环: 如果工人 B(讲故事的人)犯了错误,错误信号会一直传回给工人 A。工人 A 会学到:“哦,我需要稍微改变我的秘密代码,以便工人 B 能更容易地预测下一部分。”
  • 结果: 它们共同进化。工人 A 学会创建一种代码,这种代码不仅是良好的压缩,而且易于预测

秘密武器:三个技巧

为了让这一切完美运作,作者添加了三种特殊成分:

1. “像素检查”(APR 损失)
通常,计算机只检查“下一个令牌”的预测是否正确。但有时,计算机非常擅长猜测令牌,最终却产生了一张模糊、难看的图片。

  • 修正: 系统将计算机对下一个令牌的猜测转换回图片,并检查该图片是否与真实图片相似。这迫使计算机关注最终图像质量,而不仅仅是令牌猜测游戏。

2. “智能导师”(视觉基础模型)
作者引入了一位“智能导师”(一个已经知道物体长什么样的预训练 AI)。

  • 陷阱: 如果你强迫一维列表完全模仿导师的二维地图,你就会失去一维列表的好处(它又变成了网格)。
  • 修正: 他们使用了一种称为**“隐式对齐”*的方法。与其强迫一维列表复制导师的地图,他们只是确保系统内部的隐藏理解与导师的知识相匹配。这就像让学生从导师那里学习概念*,而不强迫他们模仿导师的笔迹。这保持了一维流程的流畅性,同时使内容更加智能。

3. “代码本”平衡
系统使用一个视觉令牌的字典(代码本)。

  • 如果字典太小,图片看起来会像块状。
  • 如果字典太大,计算机在选择正确单词时会感到困惑。
  • 作者发现,通过让计算机变得更大(更强大),它可以处理更大的字典而不会感到困惑,从而解决了细节与可预测性之间的权衡问题。

结果

论文声称,这种新方法取得了巨大成功。

  • 在标准测试(ImageNet 256x256)中,他们的模型取得了1.48的分数(越低越好)。
  • 这是一个**最先进(State-of-the-Art)**的结果,意味着在不使用额外引导技巧的情况下,它是目前世界上此类图像生成的最佳方案。
  • 该模型随着规模扩大而表现更好(可扩展性),证明了系统的稳健性。

简而言之: EOSTok 是一种教计算机画画的新方法,它让“压缩器”和“预测器”共同学习,根据真实像素检查它们的工作,并利用一位智能导师进行指导,而不强迫它们进入僵硬的网格。其结果是,计算机可以通过简单地预测拼图的下半部分来生成极其逼真的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →