← 最新论文
💻 computer science

Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

本文提出了指令 - 证据对比双流解码(IECD2),这是一个新颖的框架,通过自适应融合指令驱动和证据驱动的概率流,在平衡语言表现力与视觉忠实度的同时,显著减少视觉 - 语言模型中的幻觉现象并提升推理准确性。

原作者: Yashwant Pravinrao Bangde, Debaditya Roy

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yashwant Pravinrao Bangde, Debaditya Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的朋友,他热衷于讲述关于图片的故事。这位朋友擅长使用大词,并能让句子流畅自然。然而,有一个陷阱:有时当图片有些模糊或令人困惑时,你的朋友就开始编造内容。他可能会描述照片中实际上并不存在的狗,或者说一个人手里拿着一个红苹果,而实际上苹果是绿色的。在人工智能领域,这被称为“幻觉”。

你分享的这篇论文介绍了一种新方法,旨在帮助这位 AI 朋友在保持其讲故事 flair 的同时说出真相。他们将其方法称为IECD2(指令 - 证据对比双流解码)。以下是其工作原理,使用简单的类比:

问题:“讲故事的人”与“侦探”

作者们注意到,当 AI 观察图像时,通常存在两种相互冲突的本能:

  1. 讲故事的人(指令流):这部分 AI 希望给出一个漫长、有趣且语法完美的答案。它依赖于基于训练所预期看到的内容。如果你问“厨房里有什么?”,它可能会说“有冰箱、炉灶和一只猫”,因为这是常见的厨房场景,即使猫并不存在。
  2. 侦探(证据流):这部分 AI 非常严格。它只希望谈论它实际能在图像像素中看到的内容。它非常安全且准确,但可能很枯燥。它可能只会说“我看到一张桌子”,并拒绝猜测其他任何内容,即使显然有一只猫坐在上面。

解决方案:“双流”辩论

IECD2 不强迫 AI 在成为优秀的讲故事者或严格的侦探之间做出选择,而是让两者同时发言。

这就像是一个两人委员会决定接下来要说什么:

  • A 先生(讲故事的人) 提议:“我们说有一只猫吧!”(因为这听起来不错)。
  • B 先生(侦探) 检查照片后说:“我没看到猫。我只看到一把椅子。”

“交通灯”机制

IECD2 的魔力在于一个特殊的交通灯系统(称为“对比门”),它倾听双方的意见并决定要说什么。

  • 绿灯(一致):如果讲故事的人和侦探达成一致(例如,两人都说“是的,有一只猫”),AI 就会说“有一只猫!”。它让故事自然流畅地继续。
  • 红灯(分歧):如果讲故事的人想说一些侦探无法找到的内容(例如,“有一只猫!”对比“我什么都没看到”),交通灯就会变红。系统会静音讲故事的人的猜测。它迫使 AI 坚持真相,防止其编造那只猫。
  • 黄灯(谨慎):如果他们不确定,系统会更倾向于侦探以确保安全。

为什么这比之前更好

以前的方法试图通过以下方式解决这个问题:

  1. 让 AI 保持安静:这阻止了幻觉,但使答案变得枯燥且不完整。
  2. 尝试重新训练 AI:这需要很长时间,并且需要海量数据。

IECD2 的不同之处在于它不需要重新训练 AI。这就像给 AI 在说话时戴上一副新眼镜。它瞬间平衡了“有趣的故事”与“硬事实”。

结果

作者在许多不同任务上测试了这种方法,例如描述照片(图像描述)和回答关于图像的问题(视觉问答)。

  • 更少撒谎:AI 编造的虚假物体(如那只想象中的猫)大大减少。
  • 更好的故事:即使它停止了撒谎,也没有变得枯燥。它仍然提供了丰富、描述性的答案。
  • 速度:它运行迅速,不需要 AI 学习任何新内容;它只是改变了 AI 在最后一刻选择词语的方式。

简而言之,IECD2 教导 AI 实时将其自身的“想象力”与“相机”进行核对,确保它说的每一个字都有图片中实际存在的内容作为支撑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →