← 最新论文
🤖 AI

TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection

本文提出了一种名为 TARAC 的免训练框架,通过动态累积并重注入历史注意力机制来缓解大型视觉语言模型中的视觉注意力衰减问题,从而在几乎不增加推理开销的情况下显著降低了幻觉率并提升了感知能力。

原作者: Lei Jiang, Chunzhao Xie, Tongxuan Liu, Yuting Zeng, jinrong Guo, Yunheng Shen, Weizhe Huang, Jing Li, Xiaohua Xu

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Jiang, Chunzhao Xie, Tongxuan Liu, Yuting Zeng, jinrong Guo, Yunheng Shen, Weizhe Huang, Jing Li, Xiaohua Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 TARAC 的新方法,旨在解决大型视觉 - 语言模型(LVLM)在“看图说话”时容易**胡编乱造(幻觉)**的问题。

为了让你轻松理解,我们可以把现在的 AI 模型想象成一个正在参观博物馆的“导游”

1. 问题:导游为什么会“瞎编”?

现在的 AI 导游(比如 LLaVA、Qwen2-VL 等)非常聪明,能看懂图片并描述出来。但是,它们有一个致命的弱点:记性会随着说话变长而变差

  • 场景:导游看着一张图片(比如一座大楼),开始描述:“这是一座白色的大楼……"
  • 现象
    • 刚开始说话时,导游的眼睛(注意力)还紧紧盯着图片,描述很准确。
    • 随着他说的句子越来越长,他的眼神开始飘忽,对图片的注意力逐渐衰减
    • 到了最后,他可能完全忘了图片里到底有什么,开始靠自己的“老经验”瞎猜
    • 结果:图片里明明没有美国国旗,他却说“大楼上飘扬着美国国旗”;明明没有长椅,他却说“旁边有个长椅”。这就是幻觉

这就好比一个人看地图指路,看了一会儿地图,然后闭上眼睛凭记忆指路,指到后面就全指错了。

2. 现有的解决办法:太笨重

以前人们想解决这个问题,主要有两种笨办法:

  • 重新训练(Training-based):让导游重新上一遍学,背更多的书。但这太费钱、太费时间,而且学好了可能换个新地方又不会了。
  • 反复核对(Training-free,如对比解码):让导游每说一句话,就停下来,把图片拿出来重新看一遍,或者让另一个导游来对比。这虽然能减少错误,但速度极慢,就像让导游每走一步都要停下来查地图,游客(用户)等得都要睡着了。

3. TARAC 的妙计:给导游装上“记忆强化手环”

这篇论文提出的 TARAC,不需要重新训练,也不需要反复查图,它像一个轻量级的“记忆强化手环”,直接戴在导游手上。

它的核心原理基于一个心理学概念:遗忘曲线。人如果不复习,记忆就会随时间遗忘。TARAC 就是专门用来对抗这种遗忘的。

它是如何工作的?(三步走)

  1. 实时记录(积累注意力)
    当导游刚开始看图片时,TARAC 会悄悄记录他当时最关注图片的哪些部分(比如他盯着大楼的窗户看)。

  2. 不断“复习”(动态注入)
    随着导游说话越来越长,他的眼神开始飘了。这时,TARAC 就会把之前记录下来的“关注点”重新注入到导游的脑子里。

    • 比喻:就像导游每说几个词,手环就轻轻震动一下,提醒他:“嘿,别忘了你刚才看到的大楼窗户!”
    • 它不是死板地一直提醒,而是像滚雪球一样,把之前的记忆累积起来,同时保留最近看到的重点,让导游始终记得“我在看图”。
  3. 微调平衡(重新归一化)
    为了防止手环提醒得太猛,导致导游只盯着图片看而忘了说话,TARAC 会做一个平衡,确保他既记得看图,又能流畅地说话。

4. 效果如何?

实验证明,戴上这个“手环”后:

  • 胡说八道少了:在测试中,它把胡编乱造的句子减少了 25.2%
  • 看得更准了:对图片细节的感知能力提升了 10.65 分
  • 速度没变慢:这是最厉害的地方!它几乎不增加任何计算负担(只慢了约 4%),不像其他方法会让速度变慢好几倍。
  • 通用性强:不管是 LLaVA、Qwen 还是其他模型,插上就能用,不需要改代码。

总结

TARAC 就像给 AI 导游装了一个“防走神”的辅助系统。

它不需要让导游重新上学(省去了昂贵的训练成本),也不需要让他每句话都停下来查地图(省去了巨大的时间成本)。它只是通过一种聪明的机制,不断提醒导游“别忘了你正在看图”,从而让 AI 在描述图片时更加诚实、准确,不再凭空捏造。

这就好比给一个容易分心的孩子做阅读理解,不是让他重读一遍课文,而是老师在他读的过程中,时不时轻轻点一下重点,让他始终记得“答案在文章里”,而不是靠瞎编。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →