Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
本文介绍了 Slot-MLLM,这是一个新颖的框架,它采用基于槽注意力(Slot Attention)的以对象为中心的视觉分词器,使多模态大语言模型能够在统一的下一词元预测范式下,有效地编码和生成详细的、对象级别的视觉内容。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人同时“看”和“说”。目前,大多数机器人通过将图像分解为巨大的、由微小且均匀的正方形组成的网格(类似于像素化的马赛克)来观察图片。然后,它们试图逐字描述这个网格。问题在于,这种方法很混乱:机器人将“红色的汽车”和“蓝色的天空”仅仅视为一堆杂乱的彩色方块,这使得它难以理解汽车是一个独立的物体,或者难以在不破坏天空的情况下仅编辑汽车。
论文《Slot-MLLM:面向多模态大语言模型的以对象为中心的视觉标记化》提出了一种更聪明的方法。以下是使用简单类比进行的分解:
1. 问题所在:“马赛克”与“乐高套装”
可以将当前的图像模型想象成试图通过列出墙壁上每一块砖的颜色来描述一幅画。虽然准确,但这既缓慢,又无助于机器人理解特定的一组砖块构成了“门”或“窗”。
作者们认为,机器人不应观察整面墙,而应学会识别物体本身。他们希望机器人说“我看到一扇门、一扇窗和一棵树”,而不是“我看到这里有红色像素,那里有绿色像素”。
2. 解决方案:"SlotTok"(物体分类器)
团队创造了一种名为SlotTok的新工具。想象你有一个满是散落玩具的凌乱房间。
- 旧方法:你拍下整个房间的照片,并试图描述每一粒灰尘。
- SlotTok 方法:你有一套神奇的“箱子”(称为Slots)。当你观察房间时,机器人会自动将玩具分类到这些箱子里。一个箱子抓取所有“汽车”,另一个抓取所有“洋娃娃”,还有一个抓取“积木”。
这被称为以对象为中心的标记化。图像不再由成千上万个微小的像素组成,而是被转换为一个简短、整洁的“物体箱”列表。这使得数据更小(更高效),也更容易被机器人理解,因为它是按“事物是什么”来组织的,而不仅仅是按“事物在哪里”来组织的。
3. 两阶段训练:先学会看,再学会说
为了实现这一目标,他们分两个步骤训练了该系统:
- 第一阶段:美术课(连续学习)
首先,他们教机器人将玩具分类到箱子里,然后尝试仅凭这些箱子完美地重建房间。他们还教机器人将这些箱子与单词匹配(例如,“汽车”箱必须匹配单词“汽车”)。他们使用了一种特殊的“注意力引导”,确保机器人不会意外地将汽车放入“天空”箱中。 - 第二阶段:词汇课(离散学习)
一旦机器人擅长分类,他们便教它将这些箱子转换为简单的代码(就像条形码)。这使得机器人能够使用与阅读文本相同的“大脑”来“阅读”和“书写”图像。
4. 结果:"Slot-MLLM"(双语艺术家)
最终产品Slot-MLLM是一个能够无缝执行两项任务的单一“大脑”:
- 理解:当你向它展示一张图片并问“那只狗在做什么?”时,它会查看“狗箱”并给出正确答案。
- 生成:当你说“画一张猫在滑板上的图片”时,它不会只是猜测像素。它会创建一组新的“箱子”(一个用于猫,一个用于滑板)并将它们组装起来。
为什么这很特别?
因为机器人理解物体,所以它能够进行精确编辑。如果你让它“把红色的汽车变成蓝色的卡车”,它确切地知道要修改哪个“箱子”,而不会不小心把天空涂成蓝色或移动道路。
5. 他们的证明
该论文将此模型与其他顶级模型进行了测试,发现:
- 更好的理解能力:它在回答关于场景中特定物体的问题时表现更佳。
- 更好的编辑能力:与依赖“马赛克”网格方法的模型相比,它能够更准确地更改图像的特定部分(例如交换物体)。
- 高效性:它使用更少的“标记”(数据片段)来表示图像,使其更快、更高效,同时仍能生成高质量的图片。
简而言之:这篇论文表明,如果你教人工智能以独特的“物体”(就像将玩具分类到箱子里)而非像素网格来观察世界,它在理解所见之物以及根据指令创建新图像方面都会变得更加聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。