想象一下,你想通过逐字描述来教计算机画画,就像一位讲故事的人。这被称为自回归生成。计算机根据之前的“词”(在这种情况下是视觉片段)来猜测下一个“词”。
然而,计算机通常执行此操作的方式存在一个大问题。
问题:“网格”与“故事”
大多数图像生成计算机将图片分解为二维网格(像棋盘)。它们试图通过像读书一样逐行读取这个网格来描述图片。
- 问题所在: 在网格中,右上角的片段依赖于左下角的片段。但在故事(一维列表)中,你不能在讲完开头之前就先讲结尾。这种不匹配会让计算机感到困惑,导致生成的图片杂乱无章。
之前的尝试试图通过以下方式解决这个问题:
- 改变故事顺序: 强迫计算机以奇怪、随机的顺序读取网格(例如倒着读书或跳跃阅读)。
- 展平网格: 将二维图片压成一条长长的数据线。但往往,这种过度压缩导致细节丢失,或者计算机无法学会很好地绘制这些细节。
解决方案:EOSTok(“端到端”团队)
本文的作者创建了一个名为EOSTok的新系统。把它想象成两个共同学习的工人,而不是一个训练另一个。
1. 两位工人
- 工人 A(分词器): 这是“压缩器”。它将一张高清照片压缩成一个简短的一维“令牌”(token)列表(就像一种秘密代码)。
- 工人 B(生成器): 这是“讲故事的人”。它查看秘密代码,并尝试预测列表中的下一个令牌,以重建图像。
2. 旧方法(“两阶段”错误)
过去,这些工人是分开训练的:
- 第一阶段: 工人 A 仅被训练以完美地压缩图片。一旦完成,它就被冻结(锁定)。
- 第二阶段: 工人 B 被训练来预测令牌。
- 缺陷: 工人 A 不知道工人 B 将是使用这些令牌的人。因此,工人 A 可能会创建一个对节省空间很完美但对预测下一步很糟糕的代码。这就像一位翻译用下一位翻译无法理解的语言写书。
3. 新方法(端到端训练)
EOSTok 同时训练这两位工人。
- 反馈循环: 如果工人 B(讲故事的人)犯了错误,错误信号会一直传回给工人 A。工人 A 会学到:“哦,我需要稍微改变我的秘密代码,以便工人 B 能更容易地预测下一部分。”
- 结果: 它们共同进化。工人 A 学会创建一种代码,这种代码不仅是良好的压缩,而且易于预测。
秘密武器:三个技巧
为了让这一切完美运作,作者添加了三种特殊成分:
1. “像素检查”(APR 损失)
通常,计算机只检查“下一个令牌”的预测是否正确。但有时,计算机非常擅长猜测令牌,最终却产生了一张模糊、难看的图片。
- 修正: 系统将计算机对下一个令牌的猜测转换回图片,并检查该图片是否与真实图片相似。这迫使计算机关注最终图像质量,而不仅仅是令牌猜测游戏。
2. “智能导师”(视觉基础模型)
作者引入了一位“智能导师”(一个已经知道物体长什么样的预训练 AI)。
- 陷阱: 如果你强迫一维列表完全模仿导师的二维地图,你就会失去一维列表的好处(它又变成了网格)。
- 修正: 他们使用了一种称为**“隐式对齐”*的方法。与其强迫一维列表复制导师的地图,他们只是确保系统内部的隐藏理解与导师的知识相匹配。这就像让学生从导师那里学习概念*,而不强迫他们模仿导师的笔迹。这保持了一维流程的流畅性,同时使内容更加智能。
3. “代码本”平衡
系统使用一个视觉令牌的字典(代码本)。
- 如果字典太小,图片看起来会像块状。
- 如果字典太大,计算机在选择正确单词时会感到困惑。
- 作者发现,通过让计算机变得更大(更强大),它可以处理更大的字典而不会感到困惑,从而解决了细节与可预测性之间的权衡问题。
结果
论文声称,这种新方法取得了巨大成功。
- 在标准测试(ImageNet 256x256)中,他们的模型取得了1.48的分数(越低越好)。
- 这是一个**最先进(State-of-the-Art)**的结果,意味着在不使用额外引导技巧的情况下,它是目前世界上此类图像生成的最佳方案。
- 该模型随着规模扩大而表现更好(可扩展性),证明了系统的稳健性。
简而言之: EOSTok 是一种教计算机画画的新方法,它让“压缩器”和“预测器”共同学习,根据真实像素检查它们的工作,并利用一位智能导师进行指导,而不强迫它们进入僵硬的网格。其结果是,计算机可以通过简单地预测拼图的下半部分来生成极其逼真的图像。
以下是论文《End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer》(EOSTok)的详细技术总结。
1. 问题陈述
自回归(AR)图像生成已成为扩散模型的一个有力替代方案,它依赖离散视觉令牌将图像压缩为潜在表示。然而,现有方法面临两个主要挑战:
- 空间错位:大多数图像令牌化器使用二维网格结构(保留空间布局)。这会在令牌之间产生双向依赖关系,与标准光栅顺序自回归建模所需的单向分解相冲突。
- 次优的训练范式:当前方法通常采用两阶段训练策略:首先训练用于重建的令牌化器(冻结),然后在生成的令牌上训练自回归模型。这阻止了令牌化器适应生成任务的具体需求。
- 损失函数差距:自回归模型中使用的下一个令牌预测(NTP)损失在离散令牌空间中运行,并不直接与最终像素空间生成质量相关。仅优化 NTP 可能导致“潜在空间坍塌”,即令牌化器仅使用少量令牌来最小化预测损失,从而降低图像保真度。
2. 方法:EOSTok
作者提出了EOSTok(端到端一维语义令牌化器),这是一个在单阶段流程中联合优化一维视觉令牌化器和自回归生成模型的框架。
A. 一维视觉 Transformer 令牌化器
- 架构:基于 ViT 自编码器结构(类似于 TiTok)。
- 过程:二维图像块被展平并与可学习的查询令牌连接。一个因果 ViT 编码器处理该序列,仅输出一维潜在令牌(丢弃空间块嵌入)。
- 量化:使用**IBQ(改进瓶颈量化)**将连续潜在向量映射到离散码本,以启用自回归建模。
- 解码器:一维 ViT 解码器通过将量化令牌与可学习的掩码令牌连接来重建图像。
B. 端到端联合训练
令牌化器不再被冻结,编码器、解码器和自回归模型同时训练。总损失函数结合了:
- 重建损失(Lrecon):标准的 VQ-VAE 损失(L1/L2、感知损失、GAN),以确保图像保真度。
- 下一个令牌预测损失(LNTP):自回归模型的标准交叉熵损失。
- 自回归预测重建(APR)损失(LAPR):
- 创新点:为了弥合令牌预测与像素质量之间的差距,令牌化器的解码器将自回归模型预测的令牌(在教师强制模式下)解码回像素空间。
- 机制:该损失将这些解码后的像素与真实图像进行比较。
- 效果:这为令牌化器提供了端到端的生成监督,防止令牌化器通过坍塌潜在空间(使用过少令牌)来“利用”NTP 损失。
C. 语义表示对齐(VFM)
为了在不强加二维空间先验(这会损害自回归性能)的情况下注入全局语义信息,作者提出了隐式对齐:
- 直接对齐(被拒绝):将一维潜在令牌直接对齐到二维 VFM 特征,会迫使二维结构进入一维空间,从而降低性能。
- 直接替换(被拒绝):用 VFM 特征替换图像块作为输入。
- 隐式对齐(提出):将一维编码器的隐藏块嵌入(在提取查询令牌之前)与 VFM 特征(例如来自 DINOv2)对齐。这将语义知识蒸馏到顺序潜在空间中,而无需施加显式的二维空间约束。
- 解码器对齐:解码器也与 VFM 特征对齐,将重建视为条件生成任务,有助于收敛。
3. 主要贡献
- 端到端训练框架:一种新颖的单阶段流程,联合优化重建和生成,使令牌化器能够学习专门针对自回归建模的表示。
- APR 损失:一种关键的损失函数,将自回归预测解码到像素空间,确保令牌化器学习到一个既具有重建性又具有生成可预测性的潜在空间,防止潜在空间坍塌。
- 隐式语义对齐:一种利用视觉基础模型(VFMs)改进一维令牌化器的策略,在不重新引入阻碍自回归建模的二维空间偏差的情况下提高生成质量。
- 最先进性能:在 ImageNet 256×256 生成任务上实现了无需分类器引导的最先进(SOTA)结果。
4. 实验结果
该模型在ImageNet-1K 256×256基准上进行了评估。
- 生成质量:
- EOSTok-H(6.44 亿参数):实现了1.48 的 gFID(无引导)和 239.5 的 IS。这是无引导自回归模型的新最先进结果,优于基于扩散的模型(如带引导的 REPA-XL/2,gFID 为 1.42)和其他自回归基线。
- EOSTok-L(3.12 亿参数):在无引导下实现了 1.74 的 gFID。
- 重建质量:
- EOSTok-L 实现了0.73 的 rFID,展示了高保真重建能力。
- 消融研究:
- APR 损失:没有 APR,码本使用率急剧下降(从约 99% 降至约 51%),gFID 显著恶化(8.01 对比 3.32)。
- 语义对齐:隐式对齐将 gFID 从基线的 12.27 提升至 3.32。直接对齐则恶化了性能,证实了二维先验对一维自回归建模有害。
- 序列顺序:与端到端监督训练的模型相比,原始令牌序列的性能显著优于反转或随机序列,证明潜在空间已针对因果预测进行了优化。
- 扩展性:性能随模型大小(S 到 H)和码本大小一致提升,更大的模型缓解了重建与生成之间的权衡。
5. 意义
本文从根本上改变了自回归图像生成的范式:
- 从两阶段到单阶段:证明了联合训练令牌化器和生成器比传统的冻结令牌化器方法产生更优越的结果。
- 一维令牌化的可行性:证明了当一维令牌化器通过语义引导和端到端反馈进行适当训练时,可以通过消除空间依赖冲突,在自回归生成方面优于基于二维网格的令牌化器。
- 弥合损失差距:引入 APR 损失解决了令牌级优化无法转化为像素级质量的关键问题,这是离散生成建模中的一个常见瓶颈。
- 可扩展性:该方法具有良好的可扩展性,使用 6.44 亿参数模型实现了最先进结果,表明将自回归视觉模型扩展到更大规模具有广阔前景。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。