← 最新论文
🤖 AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

该论文提出了针对细粒度负向查询的 FINER 基准及基于直接偏好优化的 FINER-Tuning 方法,有效缓解了多模态大模型在细粒度场景下的幻觉问题,并显著提升了其在现有基准及通用多模态任务上的表现。

原作者: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“超级视觉 AI"(多模态大语言模型,MLLMs)做了一次极其细致的“找茬”体检

想象一下,现在的 AI 就像是一个记忆力超群但有点“过度自信”的导游。你带它看一张照片,它能滔滔不绝地描述画面。但是,如果你故意问它一些带有细微错误的问题,它往往会为了迎合你,或者因为太想表现得“懂行”,而睁眼说瞎话(这就是所谓的“幻觉”)。

这篇论文的核心内容可以拆解为以下几个部分:

1. 发现了什么新问题?(FINER 的诞生)

以前的测试就像是在问导游:“图里有猫吗?”(粗粒度)。AI 答对了,大家就觉得它很聪明。
但现实生活中的问题要复杂得多,比如:“图里那只耳朵耷拉下来、坐在沙发底下、穿着紫色毛衣的猫,你看到了吗?”

  • 比喻:以前的测试是问“图里有水果吗?”,AI 看到苹果就说有。现在的测试是问“图里有红色的、带刺的、还没熟的草莓吗?”,如果图里其实是绿色的、光滑的青苹果,AI 却可能因为看到了“水果”和“红色”(可能看错了颜色),就自信满满地说:“有,我看到了红草莓!”
  • FINER(细粒度负向查询):作者发明了一套新的测试题(FINER 基准),专门用来问这种**“细节全错,但大框架好像有点对”的问题。他们发现,随着问题变得越来越细致(从问“有没有猫”变成问“猫有没有特定的耳朵形状和坐姿”),AI 的“瞎编”能力**反而越来越强,准确率直线下降。

2. 怎么治这个病?(FINER-Tuning)

既然 AI 容易在细节上“嘴硬”,作者就给它开了一剂药方,叫FINER-Tuning

  • 比喻:这就像是在训练一个**“较真的纠错员”**。
    • 以前训练 AI,主要是让它学会“看图说话”。
    • 现在,作者用一种叫**DPO(直接偏好优化)的方法,专门给 AI 看那些“带有陷阱”**的问题。
    • 训练过程
      • 给 AI 看一张图,问:“图里有只长着翅膀的狗吗?”
      • 错误回答(被拒绝):“有,我看到了长着翅膀的狗。”(AI 开始瞎编)
      • 正确回答(被接受):“没有,图里只有一只普通的狗,没有翅膀。”(AI 学会拒绝)
    • 作者让 AI 反复练习这种“拒绝错误细节”的对话,直到它学会**“宁可不说,也不乱说”**,并且能精准地指出哪里错了。

3. 效果怎么样?

经过这种“特训”后,AI 的表现有了惊人的提升:

  • 治好了“嘴硬”:在那些专门找茬的测试题里,AI 的准确率提升了24.2%(对于某些模型)。它不再轻易被那些半真半假的问题骗到。
  • 副作用很小:通常,让 AI 变得更“谨慎”可能会让它变笨(比如不敢回答正确的问题)。但这篇论文发现,FINER-Tuning 不仅没让 AI 变笨,反而让它在其他的看图任务(比如读图表、找文字)上也变得更聪明了
  • 比喻:这就像是一个学生,以前为了考高分,遇到不会的题也硬猜。现在老师教他“遇到不懂的不要乱猜,要诚实指出哪里不对”。结果发现,他不仅不再乱猜了,而且因为学会了仔细审题,做其他题目也变得更准确了。

4. 总结与启示

这篇论文告诉我们:

  1. 现在的 AI 还不够“较真”:它们在面对复杂的、带有细微错误的问题时,很容易产生幻觉(胡说八道)。
  2. 细节决定成败:要真正信任 AI(比如在医疗诊断或法律分析中),必须让它学会识别那些**“看似合理但细节错误”**的描述。
  3. 方法很有效:通过专门训练 AI 去拒绝错误的细节,可以显著提升它的诚实度和准确性,而且不会牺牲它原本的能力。

一句话总结
这篇论文给 AI 戴上了一副**“细节放大镜”,教会了它们在面对那些“看着像真的,其实全是假”的陷阱题时,能够果断说“不”**,从而变得更加可靠和诚实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →