MultiLoReFT: Decoupling Shared and Modality-Specific Subspaces in Multimodal Learning via Low-Rank Representation Fine-Tuning
MultiLoReFT 是一种高效的低秩微调框架,它通过将预训练单模态模型中的共享信息与模态特定信息进行解耦,从而在不需要大规模配对数据集的情况下实现可扩展的多模态学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人理解世界。目前,大多数机器人就像是只懂一种语言的专家:一个机器人只能看图却不懂文字,而另一个机器人能读文本却看不见图像。为了让它们协同工作,我们通常试图强迫它们从头学习一种全新的、庞大的语言。但这就像是仅仅通过展示一本没有图片的字典来教蹒跚学步的幼儿一门全新的语言——这需要耗费极长时间,而且你需要数百万个示例才能掌握。
这个计算机科学领域的宏大构想是“多模态学习”(multimodal learning),这只是一个高级说法,意指“教计算机同时使用不同的感官,比如视觉和听觉”。问题在于,现实世界的数据是杂乱无章的。我们通常拥有数百万张照片和数百万条文本描述,但它们并不像连连看游戏那样完美配对。此外,当我们强迫这些不同的感官混合时,它们往往会纠缠在一起。这就像把牛奶和橙汁倒进同一个杯子里;你会得到一种饮料,但你无法分辨出哪部分是哪部分,而且如果你洒出一点点,就会失去整个味道。科学家们想知道:我们能否教机器人既保留“牛奶”(独特的视觉细节)和“橙汁”(独特的声音细节)各自独立,同时又让它们混合以理解大局,且不需要数百万个完美的示例?
于是,MultiLoReFT 登场了,它是一种聪明的全新方法,扮演着这些数字饮料的高级调酒师的角色。MultiLoReFT 并不是试图从头重建整个机器人,而是选取了两个已经非常聪明的、经过预训练的专家(一个负责图像,一个负责文本),并给它们一个微小且高效的升级。你可以把它想象成在它们的脑中加入了一组特殊的“混合吸管”。这些吸管的设计旨在同时完成两件事:首先,提取出两种感官达成共识的部分(共同的故事);其次,将仅属于其中一种感官的部分(特定的视觉纹理或独特的音调)保存在独立的、整洁的隔间里。
论文表明,这种方法效果惊人地好。通过使用一种“低秩表示微调”(low-rank representation fine-tuning)技术,该方法只对机器人大脑中极小的一部分进行微调,使得训练既快速又廉价。研究人员在合成数据(即他们已知确切答案的数据)和真实世界数据集(如人们说话的视频或带有不同语言说明的图像)上测试了该方法。他们发现 MultiLoReFT 成功地解开了信息的纠缠:大脑的“共享”部分学习了通用含义,而“独特”部分则保护了特定的细节。
最酷的一点是,这种方法不仅分离了信息,还让机器人变得更加鲁棒(稳健)。如果你拿掉一种感官——比如,你把音频静音了——机器人仍然可以猜出正在发生什么,因为其大脑中的“共享”部分已经学会了如何承担缺失感官的重量。这就像如果你失去了听力,但你的大脑已经学会了极其擅长读唇语,从而能够填补空白。论文指出,这种方法比那些试图将一切揉捏在一起或强行实现并不牢固的完美分离的旧方法效果更好。虽然结果在模拟实验和特定真实世界数据集上非常令人期待,但作者指出,这是在使人工智能更高效、更具可解释性方面迈出的一步,尤其是在医疗保健等数据难以获取、且理解“为什么”做出某个决定与决定本身同样重要的领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。