想象一下,你正在尝试教一个机器人既能描述一张照片(理解),又能根据描述绘制一张新照片(生成)。
很长一段时间以来,实现这一目标的标准方法就像雇佣两位不同的专家,并强迫他们通过一名翻译进行交流。
- 翻译(视觉编码器):首先,你会将一张原始照片输入到一个预训练的“翻译”(如 VAE 或 CLIP)中。这位翻译将混乱的高清照片转化为简化的、压缩的“摘要”或“草图”(潜在空间)。
- 大脑(大语言模型):机器人的大脑随后读取这个摘要,以理解图像或规划新的绘画。
问题所在:该论文指出,这个“翻译”步骤实际上是一个瓶颈。这就像试图通过只看一张模糊的缩略图来描述一幅复杂的画作。你会丢失精细的细节,而且这个“摘要”可能针对某项任务(如识别物体)进行了优化,但在另一项任务(如绘制精确的纹理)上却表现糟糕。这也意味着机器人无法直接从原始像素中学习;它必须转而学习翻译的笔记。
解决方案:Tuna-2
作者引入了 Tuna-2,这是一种完全跳过翻译环节的新型机器人。
类比:“原始画布”方法
Tuna-2 不再先将照片转换为摘要,而是直接观察原始像素——图像中的每一个色点。
- 旧方法(Tuna/Tuna-R):就像阅读一本别人已经为你总结过章节的书。你能快速掌握大意,但会错过作者特定的措辞和微妙的细节。
- Tuna-2:就像阅读原始的、全文版的书。这需要更多的工作,因为需要处理的信息量更大,但你能获得完整、未经过滤的体验。
工作原理
- 不再使用预训练编码器:Tuna-2 不使用任何现成的“视觉编码器”。它将原始图像切割成小块(像马赛克一样),并将这些小块直接输入其大脑(Transformer)。
- 一个大脑处理所有任务:它使用单一、统一的大脑来执行两项任务:
- 理解:它观察原始图像块,并回答诸如“这只狗穿着什么?”之类的问题。
- 生成:它预测下一组像素以创建新图像,本质上是根据文本提示从头开始“绘画”。
- “掩码”技巧:由于直接观察原始像素令人应接不暇(数据量太大了!),研究人员教 Tuna-2 玩“捉迷藏”游戏。在训练期间,他们会隐藏(掩码)图像的部分区域,并要求机器人猜测那里有什么。这迫使机器人学习图像的真实结构,而不仅仅是死记硬背捷径。
研究结果
论文比较了三个版本:
- Tuna:旧方法(使用 VAE 编码器)。
- Tuna-R:中间路线(使用表示编码器,但不使用 VAE)。
- Tuna-2:新方法(完全不用编码器,仅使用原始像素)。
结果:
- 理解:Tuna-2 在精细细节方面表现最佳。如果你问“角落里那辆微型玩具车有多少个轮子?”,Tuna-2 答对的概率比其他模型更高。似乎由于不依赖预训练的翻译,它学会了更清晰地独自观察世界。
- 生成:Tuna-2 在生成高质量图像方面与使用编码器的模型同样出色。它能够生成美丽、逼真的图片并进行编辑(例如改变猫的颜色),而无需经过“翻译”步骤。
- 速度与规模:有趣的是,带有编码器的模型(Tuna-R)在最初的学习阶段速度更快。但一旦 Tuna-2 获得了足够的训练数据,它就会迎头赶上,并在理解复杂视觉场景方面变得更聪明。
核心结论
该论文声称,我们不再需要那些庞大的预训练“视觉编码器”。通过直接溯源(原始像素)并训练单一的统一模型,我们可以构建出能够高保真地观察和创造的人工智能。这是一条更简单、更直接的路径,用于打造真正理解并生成视觉内容的人工智能。
简而言之:Tuna-2 证明了你不需要中间人来教人工智能观察和绘画;你只需让它直接看原始图片,并从像素本身进行学习。
以下是论文《Tuna-2:像素嵌入在多模态理解与生成中胜过视觉编码器》的详细技术总结。
1. 问题陈述
当前的统一多模态模型(UMMs)通常依赖预训练视觉编码器(例如用于理解的 CLIP,用于生成的 VQ-VAE)将原始图像转换为潜在表示。这种模块化方法引入了几个关键局限性:
- 表示不对齐: 用于理解和生成的独立编码器在两项任务之间造成了脱节,阻碍了完全端到端的优化。
- 归纳偏置: 预训练编码器施加了固定的输入分辨率,并限制了对细粒度、低级视觉细节的访问,从而阻碍了需要精确感知任务的性能。
- 架构复杂性: 依赖多个模块化组件(编码器、连接器、解码器)使训练流程复杂化,并阻止模型直接从原始像素中学习真正统一的表示。
作者提出:我们能否构建一个统一的多模态模型,直接从原始像素执行理解和生成,完全摒弃预训练视觉编码器?
2. 方法论
本文介绍了Tuna-2,这是一个原生统一多模态模型,完全在像素空间中运行。该方法是通过逐步简化现有架构而开发的:
A. 架构演进
作者提出了一个三阶段演进过程,以实现最终的无编码器设计:
- Tuna(基线): 采用标准模块化设计,使用 VAE 编码器进行生成,使用表示编码器(如 SigLIP)进行理解。
- Tuna-R(中间阶段): 移除了 VAE,但保留了预训练表示编码器(SigLIP 2)。它使用补丁嵌入层将图像转换为令牌供 LLM 解码器使用,并通过流匹配执行像素空间生成。
- Tuna-2(最终阶段): 完全移除了预训练表示编码器。 它用简单的补丁嵌入层替换了复杂的编码器,直接对原始图像像素进行分词。整个系统是一个单一的、单体 Transformer 解码器,联合处理文本和视觉令牌。
B. 像素空间生成
Tuna-2 不使用潜在扩散,而是直接在像素空间中采用整流流匹配:
- 目标: 模型通过线性调度 xt=tx1+(1−t)x0 构建的噪声样本 xt 来预测干净图像 x1。
- 损失函数: 它最小化速度预测误差(vθ),其中 vθ=1−txθ−xt。
- 推理: 使用欧拉求解器逐步去噪图像。
C. 基于掩码的特征学习
为了解决在高维像素空间中学习鲁棒表示的困难(这容易产生表面捷径),作者引入了一种掩码方案:
- 机制: 在训练期间,随机图像补丁被掩码并替换为可学习的掩码令牌。
- 双重作用:
- 对于生成: 迫使模型从部分观测的噪声输入中重建干净补丁,从而创建一个更困难的去噪任务。
- 对于理解: 充当正则化器,迫使模型在部分视觉观测下进行推理,防止过度依赖特定的视觉线索。
D. 训练流程
该模型分两个阶段进行完全端到端训练:
- 阶段 1(预训练): 在图像描述和文本到图像生成任务上进行联合训练(70% 理解数据,30% 生成数据),使用 70 亿参数骨干网络(Qwen2.5-7B-Instruct)。
- 阶段 2(SFT): 在图像指令遵循、编辑和高质量生成数据集上进行监督微调。
3. 主要贡献
- Tuna-2 架构: 首个原生统一多模态模型,通过完全摒弃预训练视觉编码器,仅依赖像素嵌入,在理解和生成方面均实现了最先进的(SOTA)性能。
- 无编码器设计的实证验证: 证明了虽然预训练编码器有助于早期收敛,但在经过充分预训练后,无编码器的单体架构在多模态理解方面超越了它们,特别是在细粒度任务上。
- 像素空间可扩展性: 证明了像素空间流匹配可以扩展到大型统一模型,与潜在空间方法在高质量图像生成和编辑方面竞争。
- 掩码策略: 引入了一种基于掩码的学习方案,稳定了高维像素空间中的训练,并增强了表示的鲁棒性。
4. 实验结果
作者将 Tuna-2 与各种基线进行了评估(包括 Tuna、Tuna-R、Show-o2、BAGEL 以及仅生成模型如 FLUX.1)。
- 多模态理解(表 1):
- Tuna-2 在通用基准(GQA、MMVet、MMMU)和以像素为中心的基准(V*、CountBench、VisuLogic)上,在 70 亿规模的原生统一多模态模型中实现了SOTA 性能。
- 它在细粒度感知任务上显著优于 Tuna-R,这表明移除编码器的归纳偏置有利于更好地学习低级视觉细节。
- 图像生成(表 2 和 3):
- Tuna-2 在 GenEval 和 DPG-Bench 上与最先进的统一模型具有竞争力。
- 虽然 Tuna-R(带编码器)在生成指标上最初略占优势,但 Tuna-2 在经过 SFT 后迎头赶上。
- 多样性: 根据 LLM(GPT-5.4、Claude Opus)的评估,Tuna-2 生成的图像比 Tuna-R 和 Tuna 具有显著更高的多样性。
- 图像编辑与重建(表 4 和 5):
- Tuna-2 在图像编辑(ImgEdit)方面表现强劲,优于许多统一基线。
- 在图像重建任务中,Tuna-2 实现了与专用 VAE(如 FLUX.1)相当的重建质量(PSNR/SSIM),证明了像素空间表示可以忠实地编码视觉信息。
- 注意力分析(图 7):
- 可视化显示,Tuna-2 具有更准确和稳定的注意力图,即使在语言先验具有误导性时(例如,在足球背景下识别玻璃杯)也能正确聚焦于相关视觉区域,而基于编码器的模型往往依赖文本先验或显著的干扰项。
5. 意义与结论
本文从根本上挑战了预训练视觉编码器对于高性能多模态 AI 是必要的这一主流范式。
- 范式转变: 它证明了“端到端像素空间学习”是开发更强视觉表示的可行且优越的路径,特别是对于需要细粒度感知的任务。
- 简洁性: 通过剥离复杂的模块化编码器,Tuna-2 将架构简化为单一的 Transformer,减少了工程开销并实现了真正的联合优化。
- 未来方向: 结果表明,未来的原生统一多模态模型应优先考虑直接像素建模,而非潜在空间压缩,因为后者可能会引入信息瓶颈,限制模型感知和生成高保真视觉细节的能力。
总之,Tuna-2 证明了一个简单的、无编码器的架构,直接在原始像素上训练,可以在理解方面胜过复杂的、基于编码器的系统,同时保持具有竞争力的生成能力,为下一代多模态模型提供了可扩展的蓝图。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。