STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs
本文介绍了 STBridge,这是一个共享目标对齐框架,通过监督微调和强化学习策略将两项任务都对齐到一个共同的目标状态,从而在统一多模态模型的视觉理解与生成之间架起桥梁,缩小其语义鸿沟,进而确保生成的编辑内容能够始终与描述性指令保持一致。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机可以观察一张图片并准确地告诉你它看到了什么,然后,又能同样轻松地根据你的话语画出一幅全新的画作。这就是“统一多模态模型”(Unified Multimodal Models, UMMs)的梦想。把这些模型想象成既是超级聪明的艺术家,又是资深艺术评论家的存在。它们被期望拥有一个能够胜任两项工作的单一大脑:理解视觉世界(就像评论家描述一幅画作一样)以及创造视觉世界(就像艺术家绘制一个新场景一样)。长期以来,科学家们认为,如果他们只是构建一个既能做这两件事的大型、强大的计算机大脑,它自然就会在两方面都变得出色。但问题在于:仅仅因为大脑是一个整体,并不意味着大脑的两侧能够完美地进行沟通。有时,模型的“评论家”部分可能会描述一个红色的猫,但其“艺术家”部分却可能画出一条蓝色的狗。它们都在根据相同的指令工作,但对于最终结果应该长什么样,却无法达成共识。这篇论文旨在解决描述与绘画之间的这种尴尬沉默,试图教会模型确保其文字和图像讲述的是完全相同的故事。
这项研究背后的研究人员来自吉林大学和腾讯优图实验室,他们决定通过一场关于图像的“西蒙说”(Simon Says)游戏来调查这种“对齐差距”。他们给模型一张初始图片和一个简单的指令,比如“添加一辆自行车”。然后,他们要求模型做两件事:首先,写一段详细的描述,说明新图片应该是什么样子的(即“目标描述”);其次,实际画出那幅新图片。随后,他们将描述与绘画进行对比,以观察它们是否匹配。他们发现,即使是最聪明的现有模型也经常出现脱节现象。模型可能会写出完美的自行车描述,却忘了把它画出来;或者画出了自行车,描述的内容却完全不同。这就像一位厨师写了一份巧克力蛋糕的食谱,却不小心烤出了一个披萨;或者一位翻译写出了完美的法语句子,说话时却用了西班牙语。
为了解决这个问题,团队发明了一种名为 STBridge(共享目标对齐,Shared-Target Alignment)的新型训练方法。想象一下你正在教一名学生同时成为作家和插画家。与其让他们分别练习写作和绘画,不如强迫他们在处理同一个目标时同时进行。在 STBridge 中,“目标”是一个特定的视觉状态。模型必须首先用文字描述这个目标,然后立即将这些文字作为蓝图来绘制图像。这就像是给艺术家一个严格的剧本:“你必须完全按照你打算画出的样子来描述场景,然后你必须完全按照你描述的样子去绘画。”如果描述与绘画不符,模型就会得到一个“差评”。
研究人员并没有止步于一次课程,而是使用了三步走的“训练营”。首先,他们使用监督微调(SFT)向模型展示了数千个描述与匹配图像相辅相成的例子,从而建立起基础的联系。接着,他们通过两个阶段使用强化学习(一种通过试错和奖励来学习的方法)。在第一阶段,他们奖励模型写出更好、更准确的关于其想要进行的改变的描述。在第二阶段,他们冻结了写作部分,仅针对那些完美匹配改进后描述的图像进行绘画奖励。这确保了模型不仅仅是通过随机猜测碰运气,而是真正学会了如何协调它的两个大脑。
结果非常令人印象深刻。当他们在各种挑战中测试 STBridge 时,模型的各项表现都得到了显著提升。在检查模型对视觉细节理解能力的 BLINK 测试中,得分提升了 5.15 分。在针对复杂图像编辑的 RISE 测试中,进步是巨大的,分数飙升了 21.00 分。或许最重要的一点是,他们测量了模型的文字与图像的匹配程度。在使用这种新训练方法之前,模型的描述与绘画仅在 57.4% 的情况下达成一致。而在使用 STBridge 之后,这种一致性飙升到了 90.0%。
论文指出,仅仅构建一个更大、更复杂的计算机大脑,并不足以让这些模型实现真正的统一。相反,你必须明确地教它们将它们的理解和生成锚定在同一个“目标状态”上。通过强迫模型描述它即将创造的东西,并随后精确地创造出它所描述的内容,STBridge 弥合了计算机所想与所作之间的鸿沟。这提醒我们,对于计算机要实现真正的创造力和可靠性,其文字与图像需要成为最好的朋友,而不是擦肩而过的陌生人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。