想象一下,你拥有一个超级聪明的机器人艺术家。在过去,如果你想让这个机器人观察一张图片并告诉你它看到了什么,你必须使用一副“眼镜”(一种将图像转化为数据的特定方式)。但如果你想让它画出一张新图,你必须换上一副完全不同的“眼镜”,它们说着另一种语言。
这意味着,在机器人画完一张图后,它不能立即“观察”自己的作品来理解它。它必须把画作拿出来,通过另一副“观察”眼镜重新处理,然后才能尝试理解它。这就像是用法语写信,然后必须把它翻译回英语才能自己阅读一样。
UniAR 是一个解决这一问题的系统,它通过给机器人提供一副通用的眼镜,让它既能看也能画。
以下是它的工作原理,通过简单的概念进行拆解:
1. 通用翻译官(视觉分词器/Visual Tokenizer)
通常,计算机将图像分解为被称为“token”(标记)的微小拼图碎片。
- 问题所在: 旧系统使用两套不同的拼图碎片。一套非常擅长识别猫(高层含义),但对毛发纹理(底层细节)表现很差。另一套擅长画毛发,但会对“什么是猫”感到困惑。
- UniAR 的解决方案: 他们构建了一个单一的翻译器,将图像转化为一种由**二进制位(binary bits)**组成的特殊代码(即 0 和 1),就像一种庞大的数字摩斯电码。
- 类比: 想象一下,与其使用一本拥有 10,000 个单词的字典,不如让机器人使用一种每个单词都是 64 位 0 和 1 组合的代码。这创造了一个极其巨大的词汇量(264),使其能够描述几乎任何事物而不需要一本巨大的字典。
- 神奇之处: 这个翻译器会在不同的“深度”观察图像。它能同时看到粗略的轮廓(类似于深层)和精细的纹理(类似于浅层)。这使得机器人能够使用同一套代码,既理解图像又能完美地绘制图像。
2. 快速书写者(并行位运算预测/Parallel Bitwise Prediction)
一旦图像被转化为那串 0 和 1 的代码,机器人就需要将其写出来,一次写一位。
- 问题所在: 一位一位地编写整个图像的过程极其缓慢。这就像写小说时,每写一个字母都要等墨水干了之后再写下一个字母。
- UniAR 的解决方案: 机器人不再一次只写一位,而是同时编写一组位。
- 类比: 想象一位打字员以前只能一个字母一个字母地打,然后等待;现在,他们可以在一次按键中输入整个单词(甚至是一个短句)。这使得机器人在生成图像时速度提升了 32 倍,因为它能一次性预测出代码的块(chunks)。
3. 画家(视觉解码器/Visual Decoder)
机器人写出了代码(0 和 1),但这还不是一张图片。它需要一位“画家”将代码转回真实的图像。
- 创新点: 机器人编写代码,然后一个独立的“画家”(扩散 Transformer/Diffusion Transformer)接收该代码并绘制出图像。
- 高效性: 机器人不需要编写每一个像素。它编写的是图像的一个压缩版本,然后由“画家”将其“放大”(upscale)成高分辨率的杰作(如 1024x1024 像素)。这让机器人的任务变得轻便且快速。
这个机器人能做什么?
因为机器人使用相同的“大脑”和“语言”来进行观察和绘画,它拥有了一些酷炫的新能力:
- 自我纠错与对话: 你可以要求机器人“在水面上画一只船”。它画好了。然后,无需重新扫描图像,你可以问:“船是蓝色的吗?”或者“把背景改成沙滩”。机器人能瞬间理解自己的画作,因为它在创作和阅读时使用的是同一种语言。
- 文本渲染: 它非常擅长在图像中绘制文字(比如在图片中的标牌上写下“Hello”),这在以往对 AI 来说是非常困难的。
- 编辑: 它可以根据你的指令更换物体(比如把山羊变成兔子)或改变颜色。
它是如何训练的?
他们分三个步骤教导这个机器人:
- 阅读与写作基础: 他们向它喂入海量的文本和图像数据,让它学习通用代码。
- 微调(Fine-Tuning): 他们展示了高质量的范例,以确保它能很好地遵循指令。
- 强化学习(“练习”阶段): 他们让机器人尝试画图,检查结果是否优秀(使用奖励机制),并让它从错误中学习。这使得它的文本渲染和指令遵循能力变得更加锐利。
核心总结
UniAR 之所以是一项突破,是因为它停止将“理解”和“创造”视为两个独立的工作。通过使用单一、高效的基于二进制的代码来处理两者,机器人现在可以实现思考、绘画并讨论其作品的连续、无缝流转,同时比之前的模型更快、更准确。
技术摘要:UniAR – 基于共享上下文的统一多模态自回归建模
问题陈述
统一多模态模型(UMMs)旨在将视觉理解与生成集成到单个系统中,使模型能够解释其自身生成的视觉内容,而无需重新编码。然而,现有方法通常依赖于两个迥异的视觉分词器(Tokenizer):一个针对高层语义(理解)进行了优化,另一个则针对底层细节(生成)进行了优化。这种双分词器架构分裂了表示空间,迫使生成的图像在被理解之前必须经过重新编码。这破坏了“共享上下文”的目标,并阻碍了真正的统一。此外,设计一个既能同时满足判别式理解与生成式细节的冲突需求,又能高效扩展词表规模的单一分词器,仍然是一个重大挑战。
方法论
作者提出了 UniAR,这是一个通过单一离散视觉分词器来桥接理解与生成的统一自回归框架。该架构由三个核心组件组成:
1. 统一视觉分词器
UniAR 通过 二值球面量化(Binary Spherical Quantization, BSQ) 将预训练的视觉编码器(SigLIP2-So400M ViT)适配为离散分词器。
- 无查找位式量化(Lookup-Free Bitwise Quantization): 不同于将特征映射到显式码本(如 VQ-VAE),BSQ 将视觉特征量化为离散的二值向量(u∈{0,1}64)。这消除了对显式码本的需求,并以极低的开销实现了理论上指数级增长的词表规模(264)。
- 多层级特征融合: 为了解决高层语义与底层细节之间的张力,分词器聚合了来自视觉编码器多个层级的特征(最终层及三个中间层)。这种层次化设计兼顾了细粒度细节与语义线索。
- 训练目标: 分词器使用原始 LLM 的交叉熵(CE)损失与 BSQ 软熵损失相结合的方式进行端到端微调。一旦适配完成,视觉编码器将被冻结以确保视觉索引的一致性。
2. 统一自回归模型
基于预训练的 LLM 主干网络(Qwen3-8B),该模型在下一 Token 预测范式下将视觉 Token 与文本 Token 等同对待。
- 并行位式预测(Parallel Bitwise Prediction): 为了缩短视觉序列长度并加速生成,UniAR 采用了并行位式预测机制。它在 2×2 的空间网格内同时预测多层级视觉二值向量。这在自回归预测中实现了 32 倍的视觉压缩率。
- 视觉预测头: 模型输出一组 BSQ 索引的逻辑值(Logits)。输出维度定义为 dvis=2×dBSQ×g,其中 g 代表层次级数和空间单元。
- 通过索引翻转实现的鲁棒性: 为了弥合教师强制(Teacher-forcing)训练与自回归推理之间的差距,模型在预训练期间应用了随机视觉索引翻转。这模拟了累积误差,从而提高了高温度采样时的稳定性,并为后续的强化学习提供了便利。
3. 基于 DiT 的视觉解码器
一个扩散 Transformer(DiT)解码器负责从预测的离散视觉 Token 中重建高保真图像。
- Token 到图像的转换: 解码器仅受视觉 Token 调节(通过将视觉信号以逐元素相加的方式添加到噪声隐藏状态中),并且不接收文本提示词作为输入。这种设计将所有的语义与结构生成任务留给了自回归模型。
- 分辨率上采样: 为了减轻自回归建模的计算负担,解码器采用了分辨率上采样策略(2D 双三次插值)。这使得模型在仅预测 256 个视觉 Token 的情况下,即可生成高分辨率图像(如 1024×1024)。
训练流水线
UniAR 遵循三个阶段的训练过程:
- 预训练: 在大规模多模态语料库(1T tokens)上进行预训练,理解数据与生成数据的比例为 1:1。视觉生成被限制在特定的分辨率(512×512 或 960×960),并由网格维度定义的空间先验约束。
- 有监督微调(SFT): 使用 ChatML 格式在精选的高质量数据(约 50B tokens)上进行训练。
- 强化学习(RL): 仅应用于图像生成任务,以优化质量、文本渲染和指令遵循能力。视觉解码器仅在此阶段引入,用于解码图像以进行奖励计算。
核心贡献
- 具有单一分词器的统一框架: UniAR 是首个利用多层级位式视觉 Token 实现统一的模型,有效地在共享上下文中实现了生成与理解的统一,而无需重新编码。
- 高效的位式量化: 在多层级特征上采用无查找的位式量化,显著扩大了理论词表规模且开销极低,同时多层级融合弥合了生成与判别需求之间的鸿沟。
- 并行位式预测与高效解码: 引入并行位式预测减少了视觉序列长度,而带有分辨率上采样的 DiT 解码器实现了紧凑视觉序列下的高效高分辨率生成。
实验结果
广泛的实验表明,UniAR 在图像生成与编辑方面达到了最先进(SOTA)的性能,同时在多模态理解方面保持了竞争力。
- 指令遵循: 在 GenEval 上,UniAR 取得了 0.86 的综合得分(使用提示词重写后为 0.86),超越了 GPT-4o(0.84)等闭源模型以及 FLUX.1-dev(0.82)等纯生成模型。它在物体计数、颜色-属性绑定以及空间关系方面表现尤为突出。
- 文本渲染: UniAR 在文本渲染基准测试中取得了 SOTA 结果,在 OneIG-EN 上得分 0.873(超过 GPT-4o),在 LongText-EN 上得分 0.917(超过 Gemini 2.5 Flash Image)。
- 图像编辑: 在 ImgEdit Bench 上,Uni-AR 得分为 3.73,优于 Flux.1 Kontext (3.71) 等专门的编辑模型以及 OmniGen2 (3.44) 等统一模型。
- 多模态理解: UniAR 在面向 OCR 的任务(OCRBench, DocVQA, InfoVQA)以及视频理解(MVBench)方面显著优于现有的统一模型。它达到了与 SOTA 开源 VLM(如 Qwen3-VL)相当的性能,但注意到在 MMMU 上略有滞后,这归因于缺乏纯文本预训练数据以及缺乏针对理解任务的强化学习。
- 涌现能力: 该模型展示了执行交替生成与理解的涌现能力。即使没有针对多轮交替数据的特定训练,UniAR 也能生成一张图像,随后在同一上下文中对其输出进行细粒度的提问,消除了重新编码的需求。
意义与主张
论文声称 UniAR 代表了迈向真正多模态统一的重要一步。通过利用单一离散视觉分词器和共享自回归上下文,UniAR 解决了视觉理解与生成之间固有的张力。作者强调,其方法:
- 消除了对差异化分词器的需求以及相关的重新编码开销。
- 通过高效的位式量化和并行预测,实现了高保真生成和鲁棒的指令遵循。
- 证明了统一的表示空间能够实现涌现能力,例如对生成内容的自我解释,这在碎片化架构中难以实现。
这项工作表明,结合多层级特征融合、无查找量化和并行位式预测,为统一多模态系统提供了一条可扩展且高效的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。