← 最新论文
💻 computer science

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

MergeTok 引入了一种统一的视觉分词器,通过利用令牌合并来建立结构先验,从而架起了连续 VAE 与离散 VQ 模型之间的桥梁,进而实现了高保真重建、稳定的训练以及适用于扩散和自回归图像生成的语义组织化表示。

原作者: Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人画画。为了做到这一点,机器人需要一本“字典”来理解图像是由什么组成的。在 AI 图像生成的领域中,这本字典被称为分词器(Tokenizer)

长期以来,研究人员必须在两种截然不同的字典类型之间做出选择,而两者都不完美:

  1. “平滑型”字典(连续型/VAE): 把它想象成一幅水彩画。它极其细腻且平滑,捕捉到了每一个微小的细节。然而,所有的颜色都混合在一起,变成了一大滩色彩斑斓的液体。如果你想让机器人只改变“天空”而不影响“草地”,这会非常困难,因为信息全部纠缠在一起了。
  2. “块状型”字典(离散型/VQ): 把它想象成一套乐高积木。它将图像分解为不同的、独立的块(代码)。这有助于机器人学习模式并循序渐进地构建事物(就像写故事一样)。但这些积木往往不稳定。有时机器人会忘记如何使用某些积木,或者积木会堆叠在一起,导致画面看起来模糊或出现“坍塌”。

核心理念:MergeTok

这篇论文的作者们提出了 MergeTok,他们问道:“为什么我们不能在同一个字典中既拥有水彩画的平滑感,又拥有乐高的结构感呢?”

他们构建了一个新的系统,这个系统就像一个能同时说“平滑语”和“块状语”的双语翻译员。他们不仅仅是将两个系统拼凑在一起,而是通过一种被称为**分词合并(Token Merging)**的巧妙技巧,在两者之间架起了一座桥梁。

它是如何工作的:“分组”类比

想象一下你正在组织一场拥有 1,000 名宾客(即图像的像素)的大型派对。

  • 问题所在: 如果你试图单独与每一位宾客交谈,过程会变得混乱且低效。如果你只是随机地将他们分组,你就会丢失重要的细节。
  • MergeTok 的解决方案: 系统配备了一位聪明的保镖(分词合并算法),他观察着宾客并说道:“你们三个看起来都穿着红色的衬衫,而且都在聊体育运动。让我们把你们作为一个‘体育队’单元组合在一起。”

这种分组以两种方式进行,以帮助机器人学习:

  1. 针对“平滑侧”(VAE): 系统告诉水彩画家:“嘿,这三个人是一个‘体育队’。当你绘画时,确保让他们看起来像一个凝聚的整体,而不仅仅是随机的红色色块。”这迫使平滑的绘画进行逻辑性的自我组织,从而在以后更容易进行控制。
  2. 针对“块状侧”(VQ): 系统告诉乐高搭建者:“既然我们知道这三个人是一个团队,那就给他们三个不同的乐高积木,这样他们就不会看起来全都一样;但要确保没有其他团队会占用这些特定的积木。”这防止了乐高积木的坍塌或过度重复。

魔法之桥

其秘诀在于,这个“体育队”名单(称为源图谱 Source Map)是创建一次后便共享使用的。

  • 它帮助平滑侧学会组织有序。
  • 它帮助块状侧学会稳定与多样化。

最棒的部分在于,真正画画的机器人(生成器)甚至不知道发生了这种分组。它看到的只是一个整洁的 256 个分词列表,随时待命。这就像保镖在幕后完成了所有的繁重工作,让艺术家可以全身心地投入到绘画之中。

研究发现

研究人员在大型数据集(ImageNet)上对该系统进行了测试。结果如下:

  • 更好的图像质量: 与以往最好的“平滑型”或“块状型”系统相比,该系统重建图像的质量更高(rFID 分数更低)。
  • 更智能的组织: 与旧方法相比,它创建的分词能更好地理解图像的含义(例如区分猫和狗)。
  • 多功能性: 由于它是一个统一的系统,它可以完美适配两种不同类型的 AI 艺术家:一种是按步骤构建图像的(自回归模型),另一种是通过清理噪声来构建图像的(扩散模型)。

总结

MergeTok 就像一位高级组织者,它将混乱的人群进行逻辑化的分组,并将结果交给艺术家。它解决了人们必须在“平滑但混乱”与“有结构但不稳定”之间做选择的老问题。通过在学习过程中将相似的信息合并在一起,它创造了一个既高质量又易于 AI 控制的超高效字典。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →