← 最新论文
💻 computer science

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

本文提出了名为 AFTER 的新方法,通过事实增强激活引导(FAS)和查询自适应偏移优化(QAO)自适应地修正大型视觉语言模型中的语言偏差,从而有效缓解物体幻觉问题。

原作者: Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

发布于 2026-03-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 AFTER 的新方法,旨在解决大型视觉 - 语言模型(LVLM)中一个令人头疼的问题:“幻觉”

简单来说,就是 AI 看图说话时,经常“睁眼说瞎话”。比如图里明明只有一只手套,它却非说有一双;图里是个背包,它却说是滑雪板。

为了让你更轻松地理解这项技术,我们可以把 AI 想象成一个**“有点偏科的学霸”,而 AFTER 就是他的“私人纠偏教练”**。

1. 问题出在哪?(偏科的学霸)

想象一下,这个 AI 学霸读过海量的书(文本数据),对文字非常敏感,但看图的直觉(视觉数据)却有点弱。

  • 语言偏见(Language Bias): 当它看到一张图时,它往往更相信脑子里的“文字常识”,而不是眼前的“真实画面”。
    • 例子: 看到一个人戴着头盔,它脑子里的“常识”是“戴头盔的人通常拿着滑雪板”,于是它不管图里有没有滑雪板,直接脱口而出:“他在滑雪,旁边有滑雪板。”
  • 幻觉的三种表现:
    1. 类别幻觉: 把背包认成滑雪板。
    2. 属性幻觉: 手套明明只有一只,它非要说是两只(因为常识里手套是成对的)。
    3. 关系幻觉: 人明明是“拿着”头盔,它却说是人“戴着”头盔(因为“戴头盔”这个搭配太常见了)。

2. 以前的方法为什么不够好?(粗暴的“打乱”法)

之前的科学家试图通过**“破坏图片”**来纠正 AI。

  • 比喻: 就像给学霸戴上一副模糊的眼镜,或者把图片涂花,强迫他“别光靠猜,仔细看”。
  • 缺点: 这种方法虽然能让他稍微冷静一点,但它是**“负向引导”**(告诉它“别想错的”),而且没有利用“正确答案”来引导它。就像只告诉学生“别做错题”,却没给他看“标准答案”。

3. AFTER 是怎么做的?(聪明的“纠偏教练”)

AFTER 的核心思想是:不仅要告诉 AI 别想错的,还要用“事实”把它强行拉回正确的轨道。 它分两步走:

第一步:事实增强激活导向 (FAS) —— 建立“标准答案库”

  • 做法: 系统会先利用图片的“真实标注”(比如:这里有 1 个红色的球,那里有 2 只狗),把这些枯燥的数据变成一段**“事实描述文本”**。
  • 比喻: 教练给学霸准备了一份**“绝对真实的描述清单”**。
    • 原图:一张模糊的图。
    • 事实清单:“图中有一个红色的球,旁边有两只狗。”
  • 操作: 系统对比“看原图时 AI 脑子里的想法”和“看事实清单时 AI 脑子里的想法”。它发现这两者不一样,于是计算出一个**“修正向量”**(就像一根魔法棒),专门用来把 AI 从“瞎想”的状态,强行拉回到“事实”的状态。
  • 关键点: 这是**“正向引导”**,直接告诉 AI 什么是真的。

第二步:查询自适应偏移优化 (QAO) —— 定制“个性化教案”

  • 问题: 有时候,不同的问题需要不同的关注点。
    • 问:“图里有什么动物?”(关注点:狗)
    • 问:“图里有什么颜色?”(关注点:红色)
    • 如果只用一根通用的“魔法棒”去修正所有问题,效果可能不够精准。
  • 做法: AFTER 引入了一个**“智能小助手”**(偏移估计器)。它能根据用户具体问的问题,判断这根“魔法棒”需要微调多少。
  • 比喻: 就像教练不仅有一本通用的教材,还能根据学生具体哪道题不会,动态调整辅导的力度和方向。
    • 如果问的是“手套有几只”,小助手就会加大修正力度,专门针对“数量”这个偏见进行纠偏。

4. 效果如何?(学霸逆袭)

  • 更准: 在多个测试中,AFTER 让 AI 的“胡说八道”减少了最多 16.3%
  • 更快: 它不需要重新训练整个 AI 模型(那太贵太慢了),只需要在 AI 回答问题的那一瞬间,轻轻“拨动”一下它的内部神经(激活值),就像给走偏的火车轻轻推了一把,让它回到正轨。
  • 更通用: 这套方法不仅解决了幻觉,还保留了 AI 原本强大的看图能力,没有让它变笨。

总结

AFTER 就像是一位**“事实导向的私人教练”。它不再只是简单地让 AI“别乱猜”,而是通过“事实文本”给 AI 提供正确的导航,并根据“具体问题”**动态调整导航路线。

最终,这个 AI 在看图说话时,不再被脑子里的“刻板印象”带偏,而是能真正**“眼见为实”**,说出符合事实的描述。这对于让 AI 在医疗、自动驾驶等需要高度可信的领域应用,迈出了重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →