Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
该论文介绍了 Fusion Embedding 系列,这是一个统一的模型,它通过使用轻量级的、模态特定的适配器,将音频集成到冻结的视觉-语言嵌入空间中,从而在不更新基础参数的情况下,实现文本、图像、视频和音频之间的零样本跨模态检索。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为整个互联网构建一座终极图书馆。现在,如果你想找一首歌,你得问一位音乐管理员;如果你想找一张照片,你得问一位照片管理员;如果你想找一段视频,你得问一位视频管理员。他们说着不同的语言,并将书籍保存在不同的房间里。这使得搜索那些融合了多种媒介的内容——比如“一只狗对着满月吠叫的视频”——变得极其困难。
为了解决这个问题,科学家们使用了被称为“嵌入”(embeddings)的技术。把嵌入想象成一个独特的身份证或一组 GPS 坐标。在一个理想的世界里,如果你有一张狗的照片和一句说“一只狗”的文字,它们应该获得完全相同的 GPS 坐标,即使一个是图片,一个是文本。这让计算机能够理解它们是同一种东西。目前的巨大挑战在于,虽然我们已经有了优秀的文本、图像和视频 GPS 系统,但我们对声音的处理却非常糟糕。目前大多数理解声音的系统就像是只懂“噪音”的专家,完全无法与文本或图像管理员进行交流。
这篇论文介绍了一个名为 Fusion Embedding 的全新工具家族,它终于将文本、图像、视频和音频放入了同一个地图中。研究人员并没有试图从头重建整个图书馆,而是利用了一个已经非常强大的预构建图书馆(该图书馆已经能够处理文本、图像和视频),并找到了一种巧妙的方法来添加一个“声音部门”,且不会破坏原有的任何功能。
“冻结”图书馆的魔力
这里的核心秘诀在于研究人员保持了主图书馆的“冻结”状态。想象一下,主图书馆是一部由大师撰写的、完美的百科全书。通常,如果你想增加一个新章节(比如声音),你必须重写百科全书的部分内容,而这会面临改变原有词义的风险。
作者决定:“禁止重写。”他们让百科全书保持原样,精确到每一个字母。相反,他们在入口处建立了一个小巧而特殊的翻译间。
第一代(Generation 1) 是第一个这样的翻译器。它是一个只有 1640 万参数的微型连接器(可以把它想象成一个小型、高效的机器人),位于音频塔(负责听声音的部分)和冻结的百科全书之间。当你输入一段声音时,这个机器人会将噪音转化为百科全书能理解的格式。它并不改变百科全书,只是在用它的语言说话。令人惊讶的是,这种简单的设置效果出奇地好。它能将声音与文本描述匹配起来,甚至更棒的是,它能将声音与它从未见过的图像进行匹配,而这一切都是在从未见过任何声音图像的情况下完成的。这就像是在只懂法语的人面前放一本字典,教他理解一种新语言,而不需要教他新语言的语法规则。
第二代(Generation 2) 提出了疑问:“在不违反‘禁止重写’规则的前提下,我们能否做得更好?”他们意识到,虽然翻译间很棒,但百科全书本身也拥有一些可以辅助声音处理的未开发脑力。于是,他们添加了“模态门控深度适配器”(modality-gated deep adapters)。
你可以把这些想象成百科全书页面中隐形的秘密门。这些门只有在处理声音时才会开启。当文本或图像进入时,门是关闭的,书本会像往常一样被阅读。当声音进入时,门会打开,一个拥有 4420 万参数的特殊辅助模块会介入,帮助书本更好地理解声音。结果是:书本对文本和图像的输出与原始冻结版本保持了位对位(bit-for-bit)的一致性。如果你在添加声音功能前后运行相同的文本,计算机看到的将没有任何区别。这保证了你曾经保存的所有文本、图像或视频搜索结果依然完全有效。
他们发现了什么(以及没发现什么)
团队在海量的声音和说明文字数据集上测试了这个系统。他们发现,通过坚持“冻结基础”的原则,他们可以在标准的 AudioCaps 测试中达到 0.741 的高分,实现领先水平的音频到文本匹配。这意义重大,因为大多数实现此类功能的系统都必须重新训练整个大脑,这意味着它们往往会忘记如何做其他事情,或者破坏原有的结果。
然而,论文也告诉了我们哪些做法是无效的。研究人员尝试了几种看似会有帮助但实际上适得其反的做法:
- 重写说明文字: 他们尝试使用超智能 AI 来重写训练描述,使其更加“干净”。令人惊讶的是,这反而让系统的表现变差了。事实证明,系统从原始的、混乱的人类描述中学习的效果,比从精修后的 AI 描述中学到的效果更好。
- 使用更“强”的声音塔: 他们尝试将声音编码器更换为一个通常被认为是世界顶尖的编码器。但当将其接入他们的冻结系统时,这个“更强”的塔表现反而不如他们原本选择的那个。这表明,一个在独立系统中表现优秀的声学编码器,并不一定在冻结图书馆系统中同样优秀。
- 让连接器变得太宽: 他们尝试让翻译机器人变得更大、更宽。结果机器人并没有变得更聪明,反而开始死记硬背训练数据,导致泛化能力下降。
“协议”带来的惊喜
其中一个最有趣的发现不在于模型本身,而在于他们如何与模型对话。研究人员发现,向系统输入文本的方式比想象中更重要。如果你以“裸露”(bare)的格式(仅仅是单词本身)输入文本,表现会很差。但如果你按照原始百科全书训练时所使用的精确“聊天模板”(带有特定的指令和格式)来输入文本,性能会大幅跃升 14.5 个百分点。
这就像是在询问一位图书管理员问题。如果你只是大喊“狗!”,他们可能听不懂。但如果你用他们被教导过的、那种礼貌的特定格式说:“你好,管理员,我正在寻找一张狗的照片,”他们会瞬间找到。论文表明,如果你不尊重原始的训练格式,你可能会损失两位数的性能,这实际上让你的系统变得“愚笨”了许多。
总结
Fusion Embedding 家族证明了你不需要重建整座房子来增加一个房间。通过使用冻结的基础并添加智能的门控连接器,他们创造了一个统一的空间,让文本、图像、视频和音频都能共存。
- 第一代 展示了通过一个微小的连接器,就足以让音频成为图书馆中的“一等公民”。
- 第二代 展示了你可以在完全不改变任何文本或图像结果的前提下,为音频注入更多的脑力。
其结果是,该系统既可以根据声音找到匹配的视频,也可以根据视频找到匹配的声音,同时还能确保原有的文本和图像搜索结果完好无损。这是迈向未来的一步——届时你可以询问你的计算机:“给我看下雨的视频”,它会理解“下雨”既是一种声音,也是一种视觉呈现,同时也是一个词汇,而无需为每种媒介使用不同的应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。