← 最新论文
💻 computer science

SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding

本文提出了名为 SECOND 的新方法,通过选择性和对比性解码机制,使视觉语言模型能够以物体为中心有效利用多尺度视觉信息,从而显著缓解感知幻觉问题并提升在多项基准测试中的表现。

原作者: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SECOND 的新方法,旨在解决人工智能(特别是“视觉 - 语言模型”)中一个非常头疼的问题:“幻觉”

简单来说,就是现在的 AI 看图说话时,经常“看图说话”说错了,或者凭空捏造出图片里根本没有的东西。比如,图片里明明只有一只猫,AI 却自信满满地说:“看,那只猫旁边还有一只狗!”

为了解决这个问题,作者提出了一套"精选与对比解码"(Selective and Contrastive Decoding)的策略。我们可以用几个生动的比喻来理解它的工作原理:

1. 核心问题:AI 为什么爱“瞎编”?

想象一下,你让一个 AI 看一张复杂的图片,然后回答“图里有没有狗?”。

  • 传统做法:AI 就像是一个拿着广角镜头的摄影师,一下子把整张图的所有细节(包括背景、树叶、远处的模糊影子)全部塞进脑子里,然后试图从中找答案。因为信息太多太杂,它很容易把背景里的一个模糊影子误认成狗,从而产生“幻觉”。
  • 现状:现有的多尺度技术(把图片放大缩小看)虽然试图解决这个问题,但往往是** indiscriminate**(不加区分)地把所有放大后的碎片都塞进去,导致信息过载,反而让 AI 更糊涂。

2. SECOND 的解决方案:像“侦探”一样层层递进

SECOND 的方法更像是一个经验丰富的侦探,它不是一次性看完所有东西,而是分步骤、有策略地观察。

第一步:由粗到细的“聚焦” (Selective Patch Selection)

想象你在看一张巨大的海报,上面有无数个小图案。

  • 普通 AI:试图同时看清海报上每一个像素,结果眼花缭乱。
  • SECOND
    1. 第一层(粗略扫描):先退后几步,看整张海报的大概轮廓。这时候它发现:“哦,这里好像有个像动物的形状。”
    2. 第二层(智能筛选):它不会把整张海报放大,而是只把刚才觉得“像动物”的那一小块区域裁剪下来,放大看。
    3. 第三、四层(精细确认):如果放大后还是看不清,它继续只针对那个“像动物”的区域再次裁剪、放大。
    • 比喻:这就像你用手机拍照,先拍全景,然后只放大你感兴趣的那个角落,而不是把整张照片强行拉伸导致全是马赛克。通过这种“只关注重点”的方式,AI 能更清晰地看到物体,忽略无关的背景噪音。

第二步:专家与学徒的“辩论赛” (Multi-Stage Contrastive Decoding)

这是 SECOND 最精彩的部分。它引入了一个“对比”机制。

  • 设定
    • 学徒(Amateur):代表早期的、粗略的观察(比如第一层扫描)。它看得不仔细,容易犯错。
    • 专家(Expert):代表后期的、精细的观察(比如第四层,只看放大的重点)。它看得很清楚,更准确。
  • 过程
    当 AI 要给出最终答案时,它不会只听“专家”的,也不会只听“学徒”的。它会让两者“辩论”
    • 如果“学徒”说:“我觉得那是只狗!”(基于模糊的猜测)
    • 而“专家”看着放大的细节说:“不,那只是一块石头,没有狗。”
    • SECOND 的策略:它会利用“专家”的清晰视角,去纠正“学徒”的模糊猜测。通过对比两者的差异,AI 能更坚定地排除那些“看起来像但其实是假的”东西。
    • 比喻:这就像你和一个朋友一起看图。朋友(学徒)说:“那边好像有个鬼!”你(专家)拿着放大镜仔细看后说:“别瞎想,那是个衣架。”通过这种对比和纠正,你最终得出的结论(衣架)就比朋友单凭想象(鬼)要准确得多。

3. 为什么这个方法很厉害?

  • 不需要重新训练:这个方法不需要给 AI 重新上课(训练),它是在 AI 现有的能力基础上,通过改变“怎么看图”和“怎么思考”来起作用的。就像给一个老练的侦探换了一套更先进的“放大镜”和“笔记法”,而不是让他重新学当侦探。
  • 效果显著:在测试中,SECOND 让 AI 在判断“图里有没有某样东西”时,准确率大幅提升,大大减少了“无中生有”的幻觉。
  • 通用性强:无论是简单的“是/否”问题,还是复杂的看图说话,它都能适用。

总结

SECOND 就像是给 AI 装上了一套智能变焦镜头自我纠错机制
它不再盲目地吞下所有图像信息,而是像人类一样:先扫视全局,锁定目标,然后只放大目标,最后通过对比“模糊印象”和“清晰细节”,剔除错误的猜测,给出最靠谱的答案。

这就解决了 AI“看图说话”时容易“睁眼说瞎话”的毛病,让它在医疗诊断、自动驾驶等需要高度准确的领域变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →