A More Word-like Image Tokenization for MLLMs
本文提出解耦视觉标记化(DiVT),这是一种新颖方法,它将图像块嵌入聚类为连贯的语义单元,并根据图像复杂度动态调整标记预算,从而使多模态大语言模型能够更高效、更兼容地处理视觉输入,同时显著降低内存和延迟成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教会一个聪明但非常字面化的机器人(大型语言模型)如何“看”图片。目前,我们实现这一目标的方式略显笨拙。
问题所在:“网格”与“故事”的冲突
将一张标准的数字照片想象成一个由无数小方块(像素)组成的巨大网格。目前,当我们把照片喂给机器人时,我们会将图像切割成固定大小的方块(就像棋盘一样),然后递给机器人一份冗长而乏味的方块列表。
- 机器人的视角: 机器人习惯于阅读文字。文字是独立且有意义的单元(如“猫”、“跑”或“蓝色”)。
- 当前方法: 机器人被迫阅读一份冗长且重复的“方块 1"、“方块 2"、“方块 3"列表,即使这些方块都只是空白的天空或同一面墙的一部分。
- 结果: 机器人被大量冗余且令人困惑的数据淹没。这就像试图通过列出画框中每一块砖的颜色来描述一幅美丽的画作,而不是直接说“一朵红玫瑰”。这不仅浪费了机器人的内存,还使其运行缓慢。
解决方案:DiVT(解耦视觉标记化)
这篇论文的提出者介绍了一种名为 DiVT 的新方法。DiVT 不像将图像切割成僵硬的网格,它更像一位聪明的编辑,审视图片并说:“好吧,这里真正重要的东西是什么?”
以下是其工作原理,使用一个简单的类比:
1. “分组”游戏(聚类)
想象你有一个堆满散落玩具的凌乱房间。
- 旧方法: 你不管玩具是乐高、洋娃娃还是袜子,都一个个把它们捡起来放进盒子里。结果你得到了 500 个小盒子。
- DiVT 方法: 你观察玩具,按它们的类别进行分组。你把所有乐高放在一堆,所有洋娃娃放在另一堆,袜子放在第三堆。你只为每个独特的组创建一个“标记”(一个盒子)。
- 如果房间是空的,你只需要做几个盒子。
- 如果房间堆满了复杂的玩具,你就做更多的盒子。
- 神奇之处: 盒子的数量会自动根据房间的“繁忙”程度进行调整。
2. “智能摘要”(标记构建)
一旦分组完成,DiVT 不会只是把玩具倒进盒子里。它为每个组创建一个单一、完美的摘要。
- 它不会向机器人发送 500 块“猫毛”的图像块,而是发送一个代表“猫”的标记。
- 它不会发送 100 块“蓝天”的图像块,而是发送一个代表“天空”的标记。
- 至关重要的是,它将微小的独特细节(如角落里的一只小鸟)保留为独立的标记,确保没有任何重要信息丢失。
3. “音量旋钮”(粒度控制)
研究人员添加了一个特殊的旋钮(称为阈值),让你决定摘要需要多么详细。
- 调高: 你会得到非常详细的描述(许多小组),这非常适合复杂图像,但会占用更多内存。
- 调低: 你会得到广泛的摘要(更少、更大的组),这速度极快且节省内存。
- 最棒的部分: 你可以在机器人已经训练好后再调节这个旋钮。你不需要重新训练机器人;只需更改设置以适应你的需求即可。
为何这很重要(结果)
该论文在从回答图片相关问题到描述场景的许多不同任务上测试了这种新方法。
- 速度与效率: DiVT 在使用显著更少的标记的情况下,实现了与旧方法相同(甚至更好)的结果。在某些测试中,它使用的数据量不到旧方法所需数据的十分之一。
- 减少困惑: 由于标记代表的是实际概念(如“一个杯子”或“一棵树”)而不是随机的网格方块,机器人对图像的理解要深刻得多。
- 无需重新训练: 你可以将这种方法与不同类型的相机(视觉编码器)和不同类型的机器人“大脑”(LLM)配合使用,而无需重建整个系统。
核心结论
该论文声称,通过将图像更多地视为一个故事(分组有意义的概念)而不是电子表格(僵硬的网格方块),我们可以使 AI 视觉更快、更便宜、更智能。这就像从逐字阅读一本书转变为按词阅读一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。