Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features
这项受控研究表明,在增加注意力层数量以补偿模型容量的前提下,从视觉定位解码器中移除前馈网络可以使性能达到或超过标准架构,同时显著减少可训练参数量和延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,有一台计算机能够观察一张照片,并理解描述图中特定部分的句子,例如“坐在红椅子上的狗”。这种被称为“视觉定位”(visual grounding)的能力,依赖于一个复杂的内部系统,它就像一个翻译器,将文字与像素进行匹配。多年来,这种翻译器的标准设计一直包含两种截然不同的处理步骤。第一步被称为“注意力机制”(attention),它允许系统同时扫描图像和句子,决定图像的哪些部分与正在阅读的词汇相关。第二步被称为“前馈网络”(feed-forward network),它扮演着局部计算器的角色,对每一块信息进行单独处理,通过应用非线性变换来精炼细节,然后将其传递下去。
研究人员一直在探讨的问题是,当计算机已经使用一个庞大的、预训练过的“大脑”来进行繁重的工作时,这两步是否真的都是必要的。在现代系统中,一个大型预训练模型首先将图像和文本转换为丰富的、具有上下文信息的表示。随后,一个较小的、可训练的解码器会搭建在这个基础之上,以精准定位目标。由于理解世界的繁重工作已经由大型模型完成了,因此目前尚不清楚这个较小的解码器是否仍需要自己的局部计算器,或者仅仅依靠扫描机制是否就足以找到目标。这种不确定性至关重要,因为移除不必要的部件可以使这些系统更快、更小,这对于在日常设备上运行它们来说非常关键。
一位研究人员试图通过进行一项受控实验来回答这个问题,在实验中,他们在保持其他一切完全相同的情况下,从解码器中剥离了局部计算器。他构建了三个版本的解码器来测试这个想法。第一个版本包含四个块的扫描机制,但没有局部计算器。第二个版本在大小和结构上与之相同,但在每个块中都包含了局部计算器。第三个版本是一个对照组,它将扫描块的数量增加了一倍,以匹配第二个版本中的总可调参数量,从而确保任何性能差异都是由于处理类型的不同,而非仅仅因为可用的计算能力不同。他在多个数据集上测试了这些版本,这些数据集涵盖了从标准的图像描述到旨在迷惑系统的更困难、更棘手的句子。
结果呈现出一种细致入微的图景,而非简单的“是”或“否”。在标准且直观的描述任务中,没有局部计算器的版本表现得与带有计算器的版本一样好,在某些情况下甚至略优。这表明对于许多常见任务,仅靠扫描机制就足以从预训练的基础中检索出正确的信息。然而,当研究人员在专门用于衡量复杂组合推理能力的测试集上测试系统时,没有计算器的版本表现出了轻微但可衡测的准确度下降。它错过目标的频率比带有计算器的版本稍高。这表明,当任务需要以特定方式组合多个信息片段时,局部计算器确实能提供帮助。
至关重要的是,研究人员发现这种劣势并非永久性的。当他们为没有计算器的版本增加更多的扫描块以进行补偿时,它恢复了丢失的准确度,并达到了与带有计算器版本相当的水平。这一发现改变了我们对系统需求的理解:并不是局部计算器本身具有独特的必要性,而是系统需要一定程度的“容量”来完成工作。如果移除计算器,可以通过增加扫描机制的层数来替代这种容量。研究还表明,移除计算器减少了解码器中近一半的可调参数量,并使解码步骤变得稍微快了一些,尽管系统的整体速度仍然由位于起始阶段的大型预训练模型所主导。
研究人员还测试了系统是否会在面对困难句子(例如带有否定词或许多干扰物)时更容易出错,并预期缺乏计算器会导致性能随着任务难度增加而稳步下降。然而,他们并未发现这样的模式。系统并没有在压力下出现可预测的崩溃,句子的难度也并未一致地预测是否需要计算器。这表明,对这些组件的需求并不取决于“任务越难,计算器越多”这种简单的规则。
最终,这项研究得出结论:对于构建在预训练模型之上的视觉定位系统,局部计算器并非普遍必需。它们可以被移除而不影响标准任务的表现,并且如果任务有需求,其特定的贡献可以通过增加扫描机制的深度来替代。研究结果表明,这些系统的架构可以被简化并提高效率,前提是通过其他手段维持总体的处理能力。这为设计更小、更高效的模型提供了一条清晰的路径,使这些模型能够在不依赖传统设计中每一个组件的情况下,依然能够根据语言准确地定位图像中的物体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。