MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
本文介绍了多模态代码切换(MultiModal Code-Switching, MMCS),这是一种将视觉对象交织进文本中的新颖预训练范式,旨在提供显式的对象级监督,从而与传统的图文对齐方法相比,显著提高了数据效率和视觉接地能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人理解世界。你给它看一张凌乱书桌的照片,并告诉它:“有一个咖啡杯、一台笔记本电脑和一只猫。”在人工智能领域,这些机器人被称为多模态大语言模型(Multimodal Large Language Models,简称 MLLMs)。它们就像超级聪明的学生,能同时阅读文字并观察图片。为了学习,它们通常成对地进行学习:一边展示照片,另一边展示一段描述该照片的长段落。机器人尝试根据整张图片来猜测单词。
但这里有一个棘手的部分:一张照片是许多事物的混合体。如果机器人看到一张包含猫、狗和球的照片,而文字写着“猫正在追逐狗”,机器人必须弄清楚这张模糊、混乱的图片中,哪一部分属于“猫”,哪一部分属于“狗”。这就像是在解一个所有的碎片都被粘在一起变成一大团的拼图。机器人必须去猜测这些连接关系,这既缓慢又低效,而且经常导致混乱。这就像是通过一张大家挤在一起站成一堆的合影来学习朋友的名字;你可能会猜谁是谁,但你很可能会猜错很多次。
这正是南京大学的研究人员在他们的新论文中所解决的问题。他们意识到,旧的教学方式——将整张图片与整个句子粘在一起——实在是太混乱了。因此,他们发明了一个聪明的新技巧,叫做多模态代码切换(MultiModal Code-Switching,简称 MMCS)。
把 MMCS 想象成一场“填空”游戏,只不过空格不是一个单词,而是一个微小的、放大的局部图片。与其写下“猫在垫子上”,不如给机器人展示这样一个句子:“[猫的图片] 在 [垫子的图片] 上。”
在现实世界中,“代码切换”(code-switching)是指一个人使用两种语言(比如英语和西班牙语)在同一个句子中混合使用,例如说:“I went to the tienda to buy milk.” 研究人员借鉴了这个概念。他们将视觉对象(猫的图片)视为与文本不同的另一种“语言”或“代码”。通过用实际的图像片段替换掉单词“cat”,他们迫使机器人去观察那个特定的微小图片,并理解这个词代表的就是这个东西。不再有猜测,这种连接是明确且直接的。
团队构建了一个庞大的机器来创建这些特殊的训练样本。他们提取了数千张图像,编写了详细的描述,找到了照片中的特定物体(如猫、书或灯),然后用这些微小的图像片段替换了描述中的单词。他们创建了一个包含 773,000 个这类“混合语言”样本的数据集。
结果非常高效。通常,要教好一个机器人,你需要数十万个标准的图文对。但有了这种新的“代码切换”方法,机器人仅用 50,000 个样本就能学得一样好。事实上,一个仅用 50,000 个这类特殊样本进行训练的模型,其表现与使用 600,000 个标准样本训练的模型一样好,甚至更好。这就像机器人从需要一整个图书馆的教科书,变成了仅通过几张如此清晰的闪卡就能学到同样多的信息。
论文还表明,这种方法不仅帮助机器人识别物体,还让机器人更擅长理解物体在图片中的精确位置并进行精准描述。当研究人员观察机器人的“大脑”是如何运作时,他们发现它的注意力变得更加敏锐了。它不再模糊地盯着整张图片,而是在读到“猫”这个词时,能精准地聚焦在正确的位置。
简而言之,研究人员发现,通过将图片和文字混合在句子中——用它们的视觉对应物来替换单词——他们可以让 AI 模型更快、更准确地理解世界。他们证明了,如果你给出的数据足够清晰,你并不需要用海量的数据来淹没机器人。机器人不必去猜照片的哪一部分是猫;猫就在句子中,正对着它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。