← 最新论文
💻 computer science

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Tuna-2 引入了一种原生统一多模态模型,该模型用直接像素嵌入替代了预训练视觉编码器,在视觉理解与生成方面均实现了最先进性能,同时证明了端到端像素空间学习是通往更强视觉表征的可扩展路径。

原作者: Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人既能描述一张照片(理解),又能根据描述绘制一张新照片(生成)。

很长一段时间以来,实现这一目标的标准方法就像雇佣两位不同的专家,并强迫他们通过一名翻译进行交流。

  1. 翻译(视觉编码器):首先,你会将一张原始照片输入到一个预训练的“翻译”(如 VAE 或 CLIP)中。这位翻译将混乱的高清照片转化为简化的、压缩的“摘要”或“草图”(潜在空间)。
  2. 大脑(大语言模型):机器人的大脑随后读取这个摘要,以理解图像或规划新的绘画。

问题所在:该论文指出,这个“翻译”步骤实际上是一个瓶颈。这就像试图通过只看一张模糊的缩略图来描述一幅复杂的画作。你会丢失精细的细节,而且这个“摘要”可能针对某项任务(如识别物体)进行了优化,但在另一项任务(如绘制精确的纹理)上却表现糟糕。这也意味着机器人无法直接从原始像素中学习;它必须转而学习翻译的笔记。

解决方案:Tuna-2

作者引入了 Tuna-2,这是一种完全跳过翻译环节的新型机器人。

类比:“原始画布”方法
Tuna-2 不再先将照片转换为摘要,而是直接观察原始像素——图像中的每一个色点。

  • 旧方法(Tuna/Tuna-R):就像阅读一本别人已经为你总结过章节的书。你能快速掌握大意,但会错过作者特定的措辞和微妙的细节。
  • Tuna-2:就像阅读原始的、全文版的书。这需要更多的工作,因为需要处理的信息量更大,但你能获得完整、未经过滤的体验。

工作原理

  1. 不再使用预训练编码器:Tuna-2 不使用任何现成的“视觉编码器”。它将原始图像切割成小块(像马赛克一样),并将这些小块直接输入其大脑(Transformer)。
  2. 一个大脑处理所有任务:它使用单一、统一的大脑来执行两项任务:
    • 理解:它观察原始图像块,并回答诸如“这只狗穿着什么?”之类的问题。
    • 生成:它预测下一组像素以创建新图像,本质上是根据文本提示从头开始“绘画”。
  3. “掩码”技巧:由于直接观察原始像素令人应接不暇(数据量太大了!),研究人员教 Tuna-2 玩“捉迷藏”游戏。在训练期间,他们会隐藏(掩码)图像的部分区域,并要求机器人猜测那里有什么。这迫使机器人学习图像的真实结构,而不仅仅是死记硬背捷径。

研究结果

论文比较了三个版本:

  • Tuna:旧方法(使用 VAE 编码器)。
  • Tuna-R:中间路线(使用表示编码器,但不使用 VAE)。
  • Tuna-2:新方法(完全不用编码器,仅使用原始像素)。

结果

  • 理解:Tuna-2 在精细细节方面表现最佳。如果你问“角落里那辆微型玩具车有多少个轮子?”,Tuna-2 答对的概率比其他模型更高。似乎由于不依赖预训练的翻译,它学会了更清晰地独自观察世界。
  • 生成:Tuna-2 在生成高质量图像方面与使用编码器的模型同样出色。它能够生成美丽、逼真的图片并进行编辑(例如改变猫的颜色),而无需经过“翻译”步骤。
  • 速度与规模:有趣的是,带有编码器的模型(Tuna-R)在最初的学习阶段速度更快。但一旦 Tuna-2 获得了足够的训练数据,它就会迎头赶上,并在理解复杂视觉场景方面变得更聪明

核心结论

该论文声称,我们不再需要那些庞大的预训练“视觉编码器”。通过直接溯源(原始像素)并训练单一的统一模型,我们可以构建出能够高保真地观察和创造的人工智能。这是一条更简单、更直接的路径,用于打造真正理解并生成视觉内容的人工智能。

简而言之:Tuna-2 证明了你不需要中间人来教人工智能观察和绘画;你只需让它直接看原始图片,并从像素本身进行学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →