← 最新论文
⚡ electrical engineering

LF2{}^{2}AR: Accounting for Layerwise Dynamics to Improve Multimodal Adaptation of Language Models

本文介绍了 LF2{}^{2}AR,这是一种通过利用通过后期模态融合、带有注意力残差的后期分裂以及选择性访问机制实现的层级抽象-细化动力学,来改进语言模型多模态适配的新型架构,从而增强了跨模态对齐、推理性能以及高效的早期退出解码。

原作者: Santiago Cuervo, Adel Moumen, Yanis Labrak, Sameer Khurana, Antoine Laurent, Mickael Rouvier, Phil Woodland, Ricard Marxer

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Santiago Cuervo, Adel Moumen, Yanis Labrak, Sameer Khurana, Antoine Laurent, Mickael Rouvier, Phil Woodland, Ricard Marxer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的图书管理员,他一生都在阅读数以百万计的书籍。他比任何人都更了解语法规则、故事结构和词汇含义。现在,想象你想让这位图书管理员不仅仅是阅读文本,还想让他“阅读”一张句子的图片或“聆听”一个口述的故事,然后写下回复。问题在于,文本就像一座组织有序的图书馆,每本书都有清晰的标题,但图片和声音却像是一堆混乱的拼图碎片。书中的一个单词可能占据了一整页的像素,或者一百毫秒的声波。如果你只是把一堆拼图碎片交给图书管理员,他会感到困惑,因为他的大脑是为处理整洁、抽象的词汇而设计的,而不是处理原始、杂乱的细节。这就是科学家在试图教导经过文本训练的 AI 模型理解并生成图像和语音时所面临的挑战。他们需要一种方法,将这些杂乱、细粒度的感官数据转化为图书管理员那整洁、抽象的语言,然后再将图书管理员抽象的思想转化回杂乱的感官细节,且在过程中不丢失他从阅读中所学到的魔力。

这篇题为 LF²AR 的论文提出了一种巧妙的新方法来构建这些 AI 翻译器,其灵感来自于观察语言模型的“大脑”究竟是如何运作的。作者注意到,这些模型并不只是进行直线式的处理;它们拥有一种两步走的舞蹈。首先,它们将微小、杂乱的细节组合成宏大、抽象的思想(就像将单个字母组合成一个单词)。然后,在过程的后期,它们又将这些宏大的思想重新精炼回具体的细节,以预测接下来的内容。研究人员建议,在处理图像或语音时,我们需要在主脑之前增加一个特殊的“预处理”步骤来清理杂乱的输入,并在主脑之后增加一个特殊的“后处理”步骤来处理杂乱的输出。他们称之为后期融合(Late Fusion,用于清理输入)和后期分裂(Late Fission,用于处理输出)。

但真正酷的部分在于:他们意识到,模型有时需要窥视“宏大的思想”,有时则需要专注于“微小的细节”,这取决于它在特定时刻正在做什么。为了解决这个问题,他们发明了一种名为注意力残差(Attention Residuals)的机制。把它想象成一个智能遥控器,可以让输出层在查看高层级摘要和查看低层级细节之间进行即时切换,而不是强迫模型在整个大脑处理过程中携带每一个微小的细节。

团队在两个特定的任务上测试了这个想法:将文本转化为图像(其中文本被渲染为图片)以及将文本转化为语音。他们发现,他们的新架构 LF²AR 比标准方法表现得更好。它帮助模型更清晰地理解单词与声音/图像之间的联系,保持了模型在文本方面的推理能力,甚至还提高了模型的速度。通过使用这个“智能遥控器”,模型学会了在不需要时跳过不必要的深层网络,使得生成语音的速度提升了 1.9 倍且没有损失准确性。结果表明,通过尊重这些模型自然组织信息的方式——先抽象化,再精炼化——我们可以让它们更好地处理视觉和听觉这类杂乱的现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →