ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
本文介绍了 ADAPT,这是一个基于注意力的框架,通过视觉锚点、在线修正机制和偏好微调来对齐文本-图像交叉注意力动态,从而减轻多模态大语言模型的幻觉问题,在显著降低幻觉的同时保留了通用能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个多模态大语言模型 (MLLM) 视为一位非常聪明、博学多才的导游,而他刚刚拿到了一张照片。他的任务是准确地描述这张照片。然而,这位导游有一个坏习惯:在说话的过程中,他开始“走神”。他开始更多地依赖于他认为照片中应该出现的内容(基于他的通用知识),而不是照片中实际存在的内容。这就是幻觉 (Hallucination)——比如在照片里明明只有一辆蓝色的汽车,他却编造出“一辆红色自行车”这样的细节。
ADAPT 这篇论文研究了为什么会发生这种情况,并提出了一个三部分的解决方案,以让这位导游保持对照片的专注。
问题所在:“游离的目光”
研究人员发现,模型的“眼睛”(其内部的交叉注意力/cross-attention)起初表现很强,但随着描述内容的变长,会变得疲劳且混乱。
- 初期: 模型能精准地注视在正确的位置(例如:照片中的飞机)。
- 后期: 目光变得“模糊”。它可能会盯着图像错误的角落,或者可能完全停止观察图像,转而根据它刚刚说过的词汇进行猜测。
- 结果: 模型开始凭空捏造,因为它不再去核实视觉证据。
把这想象成一个正在考试的学生。起初,他们通过看教科书(图像)来回答问题。但到一半时,他们累了,不再看书,而是开始根据他们在课堂上记下的内容进行猜测(语言先验)。就在那时,他们开始出错。
解决方案:ADAPT
作者构建了一个名为 ADAPT(注意力动态对齐偏好微调)的系统来解决这个问题。他们使用了三种创意工具来保持模型的“目光”稳定。
1. “黄金锚点”(视觉增强)
在模型开始进行长篇描述之前,系统会快速进行一次早期的观察,以寻找最重要、不可辩驳的事实。
- 类比: 想象导游在开口说话前被给予了一支荧光笔。他快速扫描照片并高亮出主要主体(例如:“这是一架白色飞机”)。
- 修复方案: 这个高亮区域成为了一个“黄金锚点”。它是一个稳定的参考点,传达出:“无论如何,记住这是一架飞机。” 系统会对这个锚点进行清理,以消除偏差(例如,无论内容如何,模型总是看向图像左侧的情况)。
2. “聚光灯监督员”(注意力监督推理)
在模型说话时,这个监督员会实时观察它的“目光”。
- 类比: 想象一位严厉的老师站在导游身边。每当导游的眼睛偏离了“黄金锚点”或开始盯着空白区域时,老师就会轻轻拍拍他的肩膀。
- 修复方案: 如果模型的注意力开始游离或变得“涣散”,系统会立即将模型的注意力推回相关的图像部分。它并不强制模型说出完全相同的词汇,但它强制模型在说话之前先看清相关的证据。
3. “蒙眼训练”(视觉注意力引导 DPO)
这是一个训练步骤,让模型学会“倾向于观察照片”而非“靠猜”。
- 类比: 模型在两种场景下接受训练:
- 场景 A(正确方式): 模型看到带有“黄金锚点”高亮的照片,并给出了正确的答案。
- 场景 B(错误方式): 模型看到一个空白、充满噪声的屏幕(“蒙眼”状态)并尝试猜测答案。
- 修复方案: 系统教会模型:“如果你看的是空白屏幕,你不应该表现得很有信心;如果你看的是真实的照片,你应该表现得很有信心。” 这训练了模型去依赖视觉证据,而不是仅仅凭空捏造。
实验结果
当研究人员在不同的 AI 模型上测试该系统时发现:
- 幻觉减少: 模型制造虚假细节的情况减少了 40–60%。
- 依然聪明: 模型并没有失去其通用的对话或理解能力;它们只是变得更擅长紧扣图像的事实。
- 高效: 该系统运行迅速,增加的额外处理时间极少。
总结
简而言之,ADAPT 意识到 AI 模型在说话过程中会变得“分心”并开始猜测。为了修复这一点,它给了它们一个稳定的参考点(锚点)、一个捕捉游离目光的实时监督员,以及一种特殊的训练,让它们重视所见而非所想。其结果是,AI 能够如实讲述它所看到的图片。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。