想象一下,你正在试图教一个机器人同时做两件事:观察一张图片并描述它(理解),以及听取一段描述并画出一张图片(生成)。
长期以来,能够完成这些任务的最佳机器人都有一个主要缺陷。它们使用了一个“翻译器”设备(称为 VAE)来辅助绘图。
- 它是如何工作的: 当机器人想要画画时,它首先将想法压缩成一个微小的、抽象的摘要(就像一个压缩包),基于这个摘要进行绘画,然后使用一个单独的解码器将其“解压”回真实的图像。
- 问题所在: 这个“翻译器”是单独训练并固定不变的。这就像是试图用一本由别人编写且无法修改的字典来写小说。这造成了一个瓶颈,限制了机器人的绘画水平,因为机器人无法从头开始学习整个过程。
一些研究人员尝试移除这个翻译器,让机器人直接从原始像素(图像中实际的点)进行绘图。但这种尝试失败了。如果没有翻译器,机器人会感到困惑。它无法在弄清楚大局(比如“一只猫坐在垫子上”)的同时,又兼顾微小的细节(比如毛发的纹理)。画出来的东西显得杂乱无章,缺乏结构。
解决方案:“表示强制”(Representation Forcing)
这篇论文引入了一个聪明的技巧,叫做表示强制(Representation Forcing, RF)。你可以把它想象成教机器人在说话前先思考。
以下是这个类比:
想象一位建筑师(机器人)需要根据客户的描述来建造一座房子。
- 旧方法(VAE): 建筑师必须使用一套预制的、僵化的蓝图系统,而他们无法更改这套系统。如果系统不符合客户奇特的请求,房子看起来就会出错。
- 失败的方法(朴素像素法/Naive Pixel): 建筑师试图在没有任何计划的情况下,立即开始一块砖一块砖地铺设。因为没有结构性的引导,墙壁总是倒塌。
- 新方法(表示强制): 建筑师现在被要求先画一个草图。
- 首先,建筑师观察客户的话语,并画出一个简单的房屋简笔画(这就是“表示”)。这个草图捕捉了结构:墙在哪里,窗户在哪里。
- 至关重要的一点是,这个草图是由理解客户话语的同一个大脑绘制的。
- 然后,建筑师利用那个草图作为指南,去铺设实际的砖块(像素)。草图始终存在于建筑师的脑海中(“上下文”),以确保最终的房子看起来完全符合计划。
在论文中它是如何运作的
研究人员构建了一个单一的模型,按顺序执行三件事:
- 理解: 它观察一张图像并提取出“高层结构”(例如物体的形状和布局)。
- 预测: 当被要求绘图时,它首先预测出同样的“高层结构”作为一系列标记(tokens,类似于一种秘密代码),就像它预测句子中的下一个单词一样。
- 生成: 它利用预测出的结构作为引导,填充图像的实际像素。
因为模型学会了自己预测结构(而不是依赖外部工具),“理解”部分和“绘画”部分就成了最好的朋友。它们共享同一种语言。
结果
论文声称,这个简单的改变解决了问题:
- 更好的绘图能力: 机器人现在可以直接从原始像素进行绘图(无需外部翻译器),并且生成的图像与使用旧有翻译器方法的方法一样出色。
- 更好的理解能力: 因为机器人正在学习生成自己的结构计划,它实际上也变得更擅长理解图像了。这就像练习写文章能帮助你更好地理解如何阅读文章一样。
- 不再有瓶颈: 机器人现在是一个真正的“端到端”系统。它不需要任何预训练的、固定的工具来辅助绘图。它在自己的大脑内部从头开始学习一切。
简而言之,表示强制迫使 AI 在开始绘画之前先创建自己的内部“蓝图”,确保最终的图像具有坚实的结构,同时也让 AI 在理解所见事物方面变得更加聪明。
技术摘要:用于无瓶颈统一多模态模型的表示强迫技术
1. 问题陈述
统一多模态模型(UMMs)旨在将感知(文本输出)与生成(像素输出)集成到单个 Transformer 主干网络中。然而,当前最先进的 UMMs 依赖于一个结构性瓶颈:它们使用一个单独预训练且冻结的变分自编码器(VAE)进行图像生成。在这种范式下,图像在通过扩散过程进行生成之前被压缩到潜空间中,并通过一个固定的解码器进行恢复。
这种依赖产生了两个主要问题:
- 优化失配: 潜空间是针对重构目标而非统一模型的特定目标进行优化的。
- 质量上限: VAE 的有损压缩为生成质量设定了一个硬性的上限,即使进一步训练 UMM 也无法逾越。
一种直观的替代方案是直接在像素空间进行生成。虽然这对于独立模型是可行的,但将其应用于 UMMs 时会导致显著的质量差距。由于缺乏由潜空间提供的结构化引导,模型难以在学习高层语义结构(物体身份、布局)的同时,兼顾底层细节(纹理)的学习。
2. 方法论:表示强迫(Representation Forcing, RF)
本文提出了**表示强迫(RF)**技术,该技术通过使表示预测成为模型的原生能力,从而消除了对外部 VAE 的需求。其核心理念是将高层视觉表示植根于解码器本身,将其作为中间 Token 来引导像素生成。
2.1 核心机制
RF 通过强制解码器在生成像素之前,自回归地预测视觉表示来运作。这些表示作为文本提示与像素输出之间的显式结构支架。
- 表示来源: RF 不使用外部潜空间,而是利用模型自身理解编码器(经过联合训练)的特征。这些特征捕捉了如物体身份和空间布局等高层结构。
- 离散化: 为了使这些特征在符合语言模型(next-token prediction)的目标下可预测,RF 通过在线向量量化(online vector quantization)将编码器的连续特征离散化为一系列视觉表示 Token。
- 使用编码器的指数移动平均(EMA)副本提供稳定的目标。
- 特征针对可学习的原型码本(codebook of prototypes)进行量化。
- 该过程产生每个空间补丁(patch)一个 Token,从而保留图像的布局。
2.2 架构与训练
该模型遵循混合 Transformer(Mixture-of-Transformers, MoT)架构(基于 BAGEL),其中所有 Token 共享自注意力层,但会被路由到特定模态的前馈专家网络(FFN)。
- 统一序列: 模型处理一个统一序列:
[文本 Token] → [表示 Token] → [像素补丁]。
- 注意力模式:
- 文本和表示 Token 遵循**因果(自回归)**注意力。
- 像素补丁在彼此之间遵循双向注意力,但对先前的文本和表示 Token 遵循因果注意力。
- 训练目标: 模型通过组合损失函数进行端到端训练:
L=LLM+LRep+LFM
- LLM:用于文本下一 Token 预测的交叉熵。
- LRep:用于表示 Token 预测的交叉熵(预测离散化的编码器特征)。
- LFM:用于像素生成的流匹配(Flow-matching)损失(使用带有速度损失的 x-预测)。
- 推理: 过程分为两个阶段。首先,解码器根据文本提示自回归地预测完整的表示 Token 序列。其次,在文本和预测的表示 Token 的共同条件下,解码器执行迭代去噪,直接在像素空间合成图像。
3. 核心贡献
- 提出表示强迫(RF): 一种通过训练解码器预测视觉表示作为中间 Token,从而解决像素空间 UMMs 质量差距的方法。这消除了对任何预训练 VAE 的需求。
- 双重收益: RF 既提升了图像生成能力,也提升了理解能力。它使像素空间模型能够达到基于 VAE 的生成质量,同时在理解任务上表现更优。
- 端到端统一: 本研究倡导感知与生成共享单一、端到端学习的表示空间的 UMMs,而非协调多个独立的预训练组件。
4. 实验结果
作者进行了对照实验,比较了四种变体:像素空间(无 RF)、像素空间(有 RF)、基于 VAE(无 RF)以及基于 VAE(有 RF)。
4.1 图像生成
- 性能: 带有 RF 的像素空间模型(RF-Pixel)实现了 0.84 的 GenEval 总分(使用 LLM 重写器后为 0.88),达到了像 BAGEL 和 Show-o2 这样最先进的基于 VAE 的统一模型的水平。
- 质量差距弥合: 在没有 RF 的情况下,像素空间模型的 GenEval 得分仅为 0.25,生成的图像存在物体扭曲和构图不连贯的问题。有了 RF 后,得分跃升至 0.76,证明了 RF 提供了必要的结构化引导。
- 对比: RF-Pixel 在标准基准测试(GenEval, DPG-Bench)中匹配了基于 VAE 的基线模型,同时保留了丰富的纹理细节。
4.2 图像理解
- 性能: 带有 RF 的像素空间模型(Pixel+RF)通常优于其对应的基于 VAE 的模型(VAE+RF)。
- 具体表现: Pixel+RF 在 8 项理解基准测试中的 6 项上表现更好(包括 MMMU, MME 和 BLINK),而 VAE+RF 在 5 项上有所提升。值得注意的是,Pixel+RF 在通用视觉理解任务上显示出实质性增益(例如 MMMU 提升了 +4.3),这表明移除 VAE 瓶颈可以实现感知与生成的更紧密集成。
4.3 消融实验
- 预测 vs 对齐: RF(解码器预测)显著优于 REPA(辅助特征对齐),在 GenEval 上为 0.76 对比 0.43。通过自注意力进行的直接条件化比隐式特征对齐更有效。
- 离散 vs 连续: 离散 Token 预测(0.76)远优于连续回归(0.26)。离散化防止了自回归预测中的误差累积,并强制实现了高层结构与底层细节的分离。
- 编码器选择: 使用 DINOv3(自监督)作为理解编码器比使用 SigLIP2 效果更好,这可能是因为 DINOv3 的特征包含更丰富的空间和结构信息。
5. 意义与主张
论文声称,表示强迫代表了迈向完全端到端、无瓶颈统一多模态模型的有效步骤。
- 原生能力: 通过将表示从感知输出转变为生成目标,RF 将理解与生成统一在单一的表示空间内,而不依赖于外部潜空间。
- 像素空间 UMMs 的可行性: 结果表明,只要通过表示强迫提供结构化引导,像素空间生成不仅可行,而且在统一建模方面可能优于基于 VAE 的生成。
- 未来方向: 作者认为,这标志着朝着模型直接从原始输入中获取所有多模态能力(而非继承自独立训练的组件)的方向迈进。
注:作者承认存在局限性,包括使用了预训练的 LLM 主干而非从头开始训练,以及目前的研究重点是静态图像而非视频或时序模态。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。