← 最新论文
💻 computer science

Representation Forcing for Bottleneck-Free Unified Multimodal Models

本文介绍了表示强制(Representation Forcing, RF),这是一种使无瓶颈统一多模态模型能够原生预测视觉表示作为中间标记,从而引导像素扩散的技术,在消除对外部 VAE 需求的同时,在图像生成和理解方面均实现了最先进的性能。

原作者: Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人同时做两件事:观察一张图片并描述它(理解),以及听取一段描述并画出一张图片(生成)。

长期以来,能够完成这些任务的最佳机器人都有一个主要缺陷。它们使用了一个“翻译器”设备(称为 VAE)来辅助绘图。

  • 它是如何工作的: 当机器人想要画画时,它首先将想法压缩成一个微小的、抽象的摘要(就像一个压缩包),基于这个摘要进行绘画,然后使用一个单独的解码器将其“解压”回真实的图像。
  • 问题所在: 这个“翻译器”是单独训练并固定不变的。这就像是试图用一本由别人编写且无法修改的字典来写小说。这造成了一个瓶颈,限制了机器人的绘画水平,因为机器人无法从头开始学习整个过程。

一些研究人员尝试移除这个翻译器,让机器人直接从原始像素(图像中实际的点)进行绘图。但这种尝试失败了。如果没有翻译器,机器人会感到困惑。它无法在弄清楚大局(比如“一只猫坐在垫子上”)的同时,又兼顾微小的细节(比如毛发的纹理)。画出来的东西显得杂乱无章,缺乏结构。

解决方案:“表示强制”(Representation Forcing)

这篇论文引入了一个聪明的技巧,叫做表示强制(Representation Forcing, RF)。你可以把它想象成教机器人在说话前先思考

以下是这个类比:
想象一位建筑师(机器人)需要根据客户的描述来建造一座房子。

  1. 旧方法(VAE): 建筑师必须使用一套预制的、僵化的蓝图系统,而他们无法更改这套系统。如果系统不符合客户奇特的请求,房子看起来就会出错。
  2. 失败的方法(朴素像素法/Naive Pixel): 建筑师试图在没有任何计划的情况下,立即开始一块砖一块砖地铺设。因为没有结构性的引导,墙壁总是倒塌。
  3. 新方法(表示强制): 建筑师现在被要求先画一个草图
    • 首先,建筑师观察客户的话语,并画出一个简单的房屋简笔画(这就是“表示”)。这个草图捕捉了结构:墙在哪里,窗户在哪里。
    • 至关重要的一点是,这个草图是由理解客户话语的同一个大脑绘制的。
    • 然后,建筑师利用那个草图作为指南,去铺设实际的砖块(像素)。草图始终存在于建筑师的脑海中(“上下文”),以确保最终的房子看起来完全符合计划。

在论文中它是如何运作的

研究人员构建了一个单一的模型,按顺序执行三件事:

  1. 理解: 它观察一张图像并提取出“高层结构”(例如物体的形状和布局)。
  2. 预测: 当被要求绘图时,它首先预测出同样的“高层结构”作为一系列标记(tokens,类似于一种秘密代码),就像它预测句子中的下一个单词一样。
  3. 生成: 它利用预测出的结构作为引导,填充图像的实际像素。

因为模型学会了自己预测结构(而不是依赖外部工具),“理解”部分和“绘画”部分就成了最好的朋友。它们共享同一种语言。

结果

论文声称,这个简单的改变解决了问题:

  • 更好的绘图能力: 机器人现在可以直接从原始像素进行绘图(无需外部翻译器),并且生成的图像与使用旧有翻译器方法的方法一样出色。
  • 更好的理解能力: 因为机器人正在学习生成自己的结构计划,它实际上也变得更擅长理解图像了。这就像练习写文章能帮助你更好地理解如何阅读文章一样。
  • 不再有瓶颈: 机器人现在是一个真正的“端到端”系统。它不需要任何预训练的、固定的工具来辅助绘图。它在自己的大脑内部从头开始学习一切。

简而言之,表示强制迫使 AI 在开始绘画之前先创建自己的内部“蓝图”,确保最终的图像具有坚实的结构,同时也让 AI 在理解所见事物方面变得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →