Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning
本文提出了空间-频谱视觉锚点学习(Spatial-Spectral Visual Anchor Learning, SSVAL),该方法利用视觉锚点提示注入(Visual Anchor Prompt Injection)和辅助空间-频率对齐损失,来缓解多模态大语言模型在推理过程中出现的表示偏差和视觉退化问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机能够同时“看”和“说”的世界。这就是多模态大语言模型(MLLMs)的领域,一种结合了理解图像能力与人类语言表达能力的类型的人工智能。你可以把它想象成教一个机器人观察一张凌乱房间的照片,然后准确描述发生了什么,或者回答诸如“有多少只猫躲在沙发下面?”之类的问题。为了实现这一点,计算机使用一个“视觉编码器”(它的眼睛)来观察图像,并使用一个“大语言模型”(它的脑子)来处理信息并说话。挑战在于,这两个部分天生并不使用同一种语言,因此科学家们使用一种特殊的翻译器来弥合这一差距。虽然这些人工智能系统已经变得非常聪明,但它们仍然在努力应对一个棘手的问题:随着计算机对图像进行更深层的思考,它似乎会遗忘细节,就像如果你试图在没有笔记本的情况下记忆一段故事太久时,可能会失去思路一样。
这篇论文针对人工智能视觉中这种特定的“遗忘”问题展开研究。研究人员发现,尽管这些模型在“眼睛”里开始时拥有清晰的图像,但随着信息穿过人工智能大脑的许多层级,信息会变得模糊且失真。他们测试了一个常见的想法:如果我们强迫人工智能在思考时始终盯着一张完美的参考照片(来自一个强大的外部视觉模型),情况会怎样?令人惊讶的是,他们发现这不起作用;即使有参考照片在旁边,人工智能仍然会感到困惑并丢失细节。相反,他们提出了一种名为“空间-光谱视觉锚点学习”(SSVAL)的新方法。把这想象成给人工智能一套神奇的便利贴(称为“视觉锚点提示词”),让它在训练期间学会把这些笔记写在上面。这些笔记吸收了参考照片中的完美细节,然后作为一个稳定的引导或“锚点”,稳住人工智能的注意力,使其在处理图像时保持稳定,防止信息漂移。
由杨乾龙及其团队领导的研究人员发现,这种“便利贴”方法比以往的方法效果显著更好。他们在几个具有挑战性的基准测试(类似于人工智能视觉的标准化考试)上测试了他们的系统。例如,在使用一个具有 70 亿参数语言模型的特定设置时,他们的方法将细粒度视觉测试(CV-Bench2D)的分数从 58.97% 提高到了 65.44%。在另一个旨在检查空间推理能力的测试(MMVP)中,分数从 33.47% 跳升至 41.33%。论文指出,通过使用这些作为锚点的学习提示词,并结合一些从不同“角度”(空间)和“频率”(例如平滑的绘画与锯齿状素描之间的区别)观察图像的额外训练检查,人工智能能让其视觉记忆在整个过程中都保持锐利。
这里的关键发现是,仅仅向人工智能展示一张更好的图片是不够的;它需要一个在思考过程的每一步中都能随身携带的稳定的内部参考点。该团队展示了他们的 SSVAL 方法不仅能帮助人工智能更好地记住细节,而且在实现这一目标时并不会让计算机变得明显更慢或更臃于。事实上,在思考阶段为系统增加的额外“重量”微乎其微——仅增加了约 1.55% 的参数,且计算能力的增加可以忽略不计。这意味着人工智能可以在不需要更大的大脑或更快的处理器的情况下,变得对所见事物更加聪明。结果表明,这种方法有效地阻止了视觉信息的退化,使人工智能能够以比以前更高的准确度回答关于物体位置和数量的复杂问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。