Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
本文介绍了目光注意力,这是一种用于多模态大语言模型的新机制,它通过在生成过程中动态选择与任务相关的视觉区域,并利用可学习的上下文令牌,在显著降低计算开销的同时保持或提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《学习看见你所需要的:多模态大语言模型的注视注意力》的通俗解释,并辅以生动的类比。
问题:被“信息淹没的图书管理员”
想象一下,多模态大语言模型(MLLM)就像一位超级聪明的图书管理员,正试图向你描述一张图片。目前,当这位管理员查看照片时,他会尝试阅读代表该照片的庞大百科全书中每一页上的每一个字。
即使你只问“狗在做什么?”,这位管理员仍然会疯狂地扫描整本书,包括关于天空、草地以及角落里那只猫的那些页面。这被称为密集注意力。这种做法效率低下,浪费大量能量(计算能力),并且实际上会因为试图同时处理过多无关信息,导致管理员的注意力变得“稀释”或分散。
人类并非如此。当我们描述一个场景时,我们的眼睛会自然地移动(或“注视”)到我们正在谈论的特定部分。如果我们谈论狗,我们就看狗;如果我们谈论猫,我们就看猫。我们不会以同等的强度呆滞地盯着整个房间。
解决方案:“注视注意力”
这篇论文的作者创建了一个名为注视注意力(Gaze Attention)的新系统。不妨将其想象成教导图书管理员像手持手电筒的人一样行动。
不再通读整本书,这位管理员现在会:
- 将书分成章节:将图像分解为小块、易于管理的部分(称为“注视区域”)。
- 创建“名著导读”摘要:对于每个章节,管理员会写一张微小、轻量级的摘要卡片(即“描述符”),说明图像的这一部分是关于什么的。
- 打开手电筒:当模型需要生成下一个词(例如“狗”)时,它会快速检查摘要卡片,挑选出与“狗”匹配的那一张,然后仅阅读该特定章节的细节。在那一刻,它忽略了书中的其余部分。
这一过程是动态发生的。随着句子从“狗在奔跑”变为“猫在睡觉”,模型会瞬间将其“手电筒”切换到猫的章节。
安全网:“上下文令牌”
曾有一个担忧:如果管理员只查看关于狗的具体章节,他们是否会忘记整个房间的整体氛围?
为了解决这个问题,作者添加了一些特殊的上下文令牌。想象这些令牌就像一张整个房间的广角照片,被贴在管理员的办公桌上。即使管理员正在放大查看狗,他们仍然可以瞥一眼这张广角照片,提醒自己:“哦对了,这是一个公园场景。”这确保了模型在不必每次都阅读整张图像的每一个细节的情况下,仍能保持“全局”意识。
结果:更快、更智能、更经济
该论文在多种任务上测试了这种新方法,从回答关于单张照片的问题到理解长视频。
- 效率:该模型取得了与旧有的“通读一切”方法相同(甚至更好)的结果,但使用的视觉令牌数量减少了高达 90%。这就像通过只阅读相关章节而不是整本小说来完成读书报告一样。
- 专注度:当研究人员观察模型注视的位置时,发现它非常专注且精准,很像人类的眼动。而旧的方法看起来则像是一团模糊、分散的混乱。
- 视频:这对视频特别有帮助。模型不再试图记住长电影的每一帧,而是学会了跳转到动作发生的具体帧和位置。
论文未声称的内容
重要的是要注意这篇论文没有说什么:
- 它并未声称该模型现在能以人类的方式“看见”或拥有意识。
- 它并未声称这将立即用于医疗诊断或自动驾驶汽车(尽管未来可能在这些领域发挥作用,但论文仅将其测试于标准的图像和视频问答基准上)。
- 它并未声称该模型是完美的;作者承认,如果“章节”(区域)的划分方式将一个物体一分为二,系统可能会感到困惑。
总结
简而言之,注视注意力教导 AI 模型停止呆滞地盯着整张图片,转而看向它们真正需要关注的地方。通过模仿人类如何移动视线,这些模型变得更快,消耗更少的计算能力,并且能够通过专注于那一刻至关重要的细节,更准确地描述场景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。