← 最新论文
💻 computer science

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

UniAR 引入了一个统一的自回归框架,该框架利用单一的离散视觉分词器来桥接视觉理解与生成,通过共享上下文、并行位(parallel-bitwise)预测以及基于扩散的解码器实现高保真图像合成与编辑,并在多模态基准测试中取得了最先进的性能。

原作者: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人艺术家。在过去,如果你想让这个机器人观察一张图片并告诉你它看到了什么,你必须使用一副“眼镜”(一种将图像转化为数据的特定方式)。但如果你想让它出一张新图,你必须换上一副完全不同的“眼镜”,它们说着另一种语言。

这意味着,在机器人画完一张图后,它不能立即“观察”自己的作品来理解它。它必须把画作拿出来,通过另一副“观察”眼镜重新处理,然后才能尝试理解它。这就像是用法语写信,然后必须把它翻译回英语才能自己阅读一样。

UniAR 是一个解决这一问题的系统,它通过给机器人提供一副通用的眼镜,让它既能看也能画。

以下是它的工作原理,通过简单的概念进行拆解:

1. 通用翻译官(视觉分词器/Visual Tokenizer)

通常,计算机将图像分解为被称为“token”(标记)的微小拼图碎片。

  • 问题所在: 旧系统使用两套不同的拼图碎片。一套非常擅长识别猫(高层含义),但对毛发纹理(底层细节)表现很差。另一套擅长画毛发,但会对“什么是猫”感到困惑。
  • UniAR 的解决方案: 他们构建了一个单一的翻译器,将图像转化为一种由**二进制位(binary bits)**组成的特殊代码(即 0 和 1),就像一种庞大的数字摩斯电码。
    • 类比: 想象一下,与其使用一本拥有 10,000 个单词的字典,不如让机器人使用一种每个单词都是 64 位 0 和 1 组合的代码。这创造了一个极其巨大的词汇量(2642^{64}),使其能够描述几乎任何事物而不需要一本巨大的字典。
    • 神奇之处: 这个翻译器会在不同的“深度”观察图像。它能同时看到粗略的轮廓(类似于深层)和精细的纹理(类似于浅层)。这使得机器人能够使用同一套代码,既理解图像又能完美地绘制图像。

2. 快速书写者(并行位运算预测/Parallel Bitwise Prediction)

一旦图像被转化为那串 0 和 1 的代码,机器人就需要将其写出来,一次写一位。

  • 问题所在: 一位一位地编写整个图像的过程极其缓慢。这就像写小说时,每写一个字母都要等墨水干了之后再写下一个字母。
  • UniAR 的解决方案: 机器人不再一次只写一位,而是同时编写一组位
    • 类比: 想象一位打字员以前只能一个字母一个字母地打,然后等待;现在,他们可以在一次按键中输入整个单词(甚至是一个短句)。这使得机器人在生成图像时速度提升了 32 倍,因为它能一次性预测出代码的块(chunks)。

3. 画家(视觉解码器/Visual Decoder)

机器人写出了代码(0 和 1),但这还不是一张图片。它需要一位“画家”将代码转回真实的图像。

  • 创新点: 机器人编写代码,然后一个独立的“画家”(扩散 Transformer/Diffusion Transformer)接收该代码并绘制出图像。
  • 高效性: 机器人不需要编写每一个像素。它编写的是图像的一个压缩版本,然后由“画家”将其“放大”(upscale)成高分辨率的杰作(如 1024x1024 像素)。这让机器人的任务变得轻便且快速。

这个机器人能做什么?

因为机器人使用相同的“大脑”和“语言”来进行观察和绘画,它拥有了一些酷炫的新能力:

  • 自我纠错与对话: 你可以要求机器人“在水面上画一只船”。它画好了。然后,无需重新扫描图像,你可以问:“船是蓝色的吗?”或者“把背景改成沙滩”。机器人能瞬间理解自己的画作,因为它在创作和阅读时使用的是同一种语言。
  • 文本渲染: 它非常擅长在图像中绘制文字(比如在图片中的标牌上写下“Hello”),这在以往对 AI 来说是非常困难的。
  • 编辑: 它可以根据你的指令更换物体(比如把山羊变成兔子)或改变颜色。

它是如何训练的?

他们分三个步骤教导这个机器人:

  1. 阅读与写作基础: 他们向它喂入海量的文本和图像数据,让它学习通用代码。
  2. 微调(Fine-Tuning): 他们展示了高质量的范例,以确保它能很好地遵循指令。
  3. 强化学习(“练习”阶段): 他们让机器人尝试画图,检查结果是否优秀(使用奖励机制),并让它从错误中学习。这使得它的文本渲染和指令遵循能力变得更加锐利。

核心总结

UniAR 之所以是一项突破,是因为它停止将“理解”和“创造”视为两个独立的工作。通过使用单一、高效的基于二进制的代码来处理两者,机器人现在可以实现思考、绘画并讨论其作品的连续、无缝流转,同时比之前的模型更快、更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →