← 最新论文
💻 computer science

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

本文提出了 EAGLE 框架,这是一种轻量级黑盒方法,能够通过统一充分性与必要性指标来量化多模态大语言模型生成令牌时视觉感知与语言先验的相对贡献,从而显著提升模型决策的可解释性、定位能力及幻觉诊断效果。

原作者: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 EAGLE(鹰)的新工具,它的任务是**“给多模态大模型(MLLM)做心理侧写”**。

简单来说,现在的 AI 看图说话能力很强,但没人知道它到底是怎么想的。它是因为真的“看见”了图里的猫,还是因为脑子里觉得“这种图通常会有猫”而瞎猜的?EAGLE 就是为了解决这个“黑盒”问题而诞生的。

我们可以用几个生动的比喻来理解这篇论文的核心内容:

1. 核心问题:AI 是在“看图”还是“背答案”?

想象一下,你让一个学生(AI)看一张图片,然后让他描述图片。

  • 情况 A:学生真的盯着图片看,看到了苹果,所以说了“苹果”。
  • 情况 B:学生根本没看图片,只是根据题目里的“水果”两个字,或者根据他以前背过的题库,瞎猜说“苹果”。

现在的 AI 模型(MLLM)经常犯情况 B的错误,这叫“幻觉”(Hallucination)。比如图里明明没有狗,AI 却非说有一只狗,因为它觉得“草地 + 人”通常会有狗。

EAGLE 的作用:它就像一位**“侦探”**,能瞬间指出:

  • Where MLLMs Attend(AI 到底看了哪里):AI 说“苹果”时,它的注意力是不是真的聚焦在图片的苹果上?
  • What They Rely On(AI 到底靠什么):它是靠“眼睛看到的证据”(视觉),还是靠“脑子里的常识”(语言先验)?

2. EAGLE 是怎么工作的?(它的“独门秘籍”)

EAGLE 不像以前的方法那样去拆解 AI 复杂的内部代码(那是“白盒”做法,很难且容易出错),它是一个**“黑盒”侦探**。它不需要知道 AI 内部怎么算的,只需要像做实验一样观察 AI 的反应。

它的过程可以比喻为**“玩拼图”**:

  1. 把图片打碎(SLICO 分割)
    EAGLE 先把输入的图片切成很多小块(像马赛克一样)。
  2. 玩“遮遮乐”游戏(贪婪搜索)
    它开始一块一块地遮住这些图片碎片,然后问 AI:“现在你还敢不敢说‘苹果’?”
    • 如果遮住某一块,AI 马上就不敢说了,说明这块碎片至关重要(这是“必要性”)。
    • 如果只保留某几块碎片,AI 就能准确说出“苹果”,说明这几块碎片足够让 AI 理解(这是“充分性”)。
  3. 打分与排名
    EAGLE 给每一块碎片打分,最后排个序。分数最高的,就是 AI 真正“看见”并依赖的区域。

3. 两个核心指标:Insight(洞察)和 Necessity(必要)

论文里提到了两个很专业的词,我们可以这样理解:

  • Insight Score(洞察分)= “最小拼图”
    • 比喻:就像问“最少需要哪几块拼图,就能让你认出这是一只猫?”
    • 作用:找出那些足以让 AI 生成答案的关键区域。
  • Necessity Score(必要分)= “致命一击”
    • 比喻:就像问“如果我把这块拼图拿走,你是不是就认不出猫了?”
    • 作用:找出那些缺一不可的区域。如果拿走了它,AI 就瞎了。

EAGLE 把这两个指标结合起来,就能精准地画出**“热力图”**,告诉用户:AI 生成这句话时,眼睛到底盯着图片的哪个角落。

4. 为什么 EAGLE 很厉害?(它的超能力)

论文通过大量实验证明,EAGLE 比以前的方法(如 LLaVA-CAM, TAM 等)都要强,主要体现在:

  • 更诚实(Faithfulness):以前的方法画的热力图经常是“雾里看花”,一大片模糊的区域。EAGLE 画出来的图非常精准,就像用激光笔指在具体的物体上(比如精准指在香蕉上,而不是指在整棵树上)。
  • 更省资源(Efficiency):以前的方法需要巨大的显卡内存(像开着一辆重型卡车去送快递),而 EAGLE 只需要很少的内存(像骑一辆轻便的电动车),普通电脑也能跑。
  • 能抓“幻觉”:这是最酷的一点。如果 AI 胡说八道(比如把叉子看成勺子),EAGLE 能立刻指出:“看!就是叉子那个尖尖的部分干扰了 AI,导致它看错了。”只要把那块区域遮住,AI 就能变回正常。

5. 总结:这对我们意味着什么?

以前,我们面对 AI 的胡说八道,只能无奈地说:“哎呀,它又瞎编了。”
现在,有了 EAGLE,我们可以像老师批改作业一样:

  • 指出错误:“你这里说错了,因为你把叉子看成了勺子。”
  • 解释原因:“因为你太依赖文字常识,忽略了图片细节。”
  • 建立信任:在医疗、自动驾驶等安全领域,我们需要知道 AI 为什么做这个决定。EAGLE 就是那个能解释 AI 决策过程的“翻译官”。

一句话总结
EAGLE 是一个轻量级、高精度的 AI 解释器,它通过“遮遮掩掩”的拼图游戏,精准地告诉我们要:AI 到底了哪里,以及它是了眼睛还是了大脑。这让 AI 从“黑盒”变成了我们可以理解和信任的“透明盒”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →