← 最新论文
🤖 AI

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

本文介绍了 UniSpace,这是一个统一的多模态框架,它通过采用一种新颖的补丁重参数化(Patch Reparameterization)技术,克服了语义视觉编码器中细粒度细节丢失的问题,使得单个冻结的基于 ViT 的模型能够在无需独立 VAE 通路的情况下,同时实现高保真度的图像理解、生成和编辑。

原作者: Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一个机器人如何观察世界。长期以来,科学家们一直为这些机器人构建了两种独立的“眼睛”。第一只眼睛是一个语义编码器(Semantic Encoder),它就像一位超级聪明的艺术评论家。它看到一张猫的照片,能瞬间识别出:“这是一只坐在地毯上的、毛茸茸的橘色猫科动物。”它完美地理解了图像的意义故事。然而,如果你要求这位艺术评论家仅凭笔记从头重画这只猫,它会失败得一塌糊涂。因为它太专注于宏观图景,以至于忘记了胡须的具体弧度或橘色的特定色调。

第二只眼睛是一个重建编码器(Reconstruction Encoder),它就像一台超精细的复印机。它能记住每一个像素、每一处阴影和每一处纹理。如果你要求它重画这只猫,它会做得非常完美。但如果你问它:“这是什么?”它可能只会回答:“这是一堆有颜色的像素,”而无法理解这是一只猫。

多年来,为了让机器人既能理解图像又能生成编辑图像,工程师们不得不同时使用这两只眼睛,并将它们的输出缝合在一起。这就像是在开车时,一只脚踩着油门,另一只脚踩着刹车。这篇名为 UniSpace 的论文提出了一个大胆的问题:我们能否构建仅仅一只既能完美胜任这两个工作的“眼睛”?我们能否在不让那位超级聪明的艺术评论家变成一个盲目的复印机的前提下,对其进行微调,使其不会忘记细节?

核心理念:调整“镜头”,而非“大脑”

UniSpace 的研究人员发现了一个令人惊讶的事实。他们发现艺术评论家的“大脑”(神经网络的深层)其实一直都没问题。问题不在于大脑,而在于图像观察信息的镜头(图像块嵌入/patch embedding)。原始的镜头旨在过滤掉微小细节以专注于意义,这实际上模糊了精细的线条。

为了解决这个问题,他们引入了一个巧妙的技巧,叫做图像块重参数化(Patch Reparameterization)。想象一下,艺术评论家戴着一副眼镜。原来的眼镜看书名很棒,但看清书页上的微型字体却很糟糕。研究人员并没有扔掉眼镜和大脑,而是在第一副眼镜旁边添加了第二副特殊的镜头。这副新镜头专门经过调校,用于捕捉那些微小的、模糊的细节。然后,他们将两副镜头的视野结合成一个超级强大的信息流。

其结果是一个既保留了原有的“理解这是只猫”的大脑能力,又能记住“这只猫左耳有一道抓痕”的系统。这个单一的信息流成为了 UniSpace——一个统一的视觉语言,在这里,理解、生成和编辑图像都在同一个空间内发生。

他们是如何测试的:“单眼”实验

团队不仅建立了一个理论,还构建了一个庞大的机器人大脑来进行测试。他们采用了一个预训练的“艺术评论家”(具体是一个名为 Qwen-ViT 的模型),并应用了他们新的双镜头技术。随后,他们训练了一个拥有 80 亿参数的巨型模型(称为 UniSpace),让它利用这个单一的视觉流来完成三种不同的任务:

  1. 理解: 观察图像并回答相关问题。
  2. 生成: 根据文本描述创造出一张全新的图像。
  3. 编辑: 对现有图像进行修改(例如将猫变成狗,或将背景改为海滩),同时保持图像其余部分的完美。

结果令人印象深刻。在图像编辑领域——机器人在改变其中一部分而不破坏整体方面通常表现挣扎——UniSpace 在标准测试 ImgEdit 上得分 4.28。这击败了其他类似规模的模型,如 SenseNova-U1(得分为 3.90)和 BAGEL(3.20),甚至接近了一个拥有 320 亿参数的巨型模型 Emu3.5(4.41)。

在根据文本生成图像方面,UniSpace 展示了它良好的复杂指令遵循能力。在名为 OneIG-Bench 的测试中,它取得了 0.547 的双语平均分,略微领先于竞争对手。它在 DPG-Bench(一个针对密集、详细提示词的测试)上也获得了 86.49 分,显示出它处理物体间复杂关系的能力比许多其他统一模型都要强。

他们排除了什么:“纠缠”陷阱

这个故事中最重要的部分之一是研究人员没有做的事情。他们首先测试了一个更简单的想法:如果我们不把“意义”和“细节”分开,而是直接把它们揉成一大堆混乱的数据会怎样?他们称之为“纠缠”(entangled)表示法。

他们发现,这种混乱的方法是一个陷阱。虽然机器人仍然可以理解图像,并且仍然可以从真实照片中重建图像,但当尝试从头生成一张新图像时,它会彻底失败。机器人的大脑过于专注于“意义”,以至于忘记了绘制写实图像所需的“细节”。论文指出,仅仅将这两类信息混合在一起是不够的;你需要将它们保持独立但又相互连接,就像高速公路上的两条车道,并行运行却互不碰撞。这就是为什么他们特定的图像块重参数化方法——即保留用于意义的原始路径,并添加一条单独的细节路径——至关重要。

总结

UniSpace 表明,我们并不一定需要为了让机器人能够看见、理解和创造而从头开始构建全新的、巨大的大脑。相反,我们可能只需要改变如何将信息喂给我们现有的脑部。通过重新调校“镜头”以引入更多细节,同时保持“大脑”对意义的专注,他们创造了一个可以完成所有工作的单一统一系统。

作者谨慎地指出,虽然这是一个巨大的进步,但该系统尚未达到完美。它在面对仅做一件事情的专业化模型(例如只负责编辑图像或只负责理解图像的模型)时,仍略显逊色。然而,对于一个试图在一个框架内完成所有工作的 80 亿参数模型来说,其表现是非常强劲的。它证明了单一的、统一的视觉空间是 AI 未来的可行路径,有望取代那些笨重的、多部分的系统,转而使用更优雅、更高效的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →