← 最新论文
💬 NLP

PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models

PatchGate 是一个无需训练的框架,它通过从解码器层中提取内在的、无需提示词的补丁级物体证据,并利用其校准解码逻辑值(logits),从而在不使用外部检测器或进行微调的情况下,同时提高可见物体的覆盖范围并减少幻觉,缩小了冻结视觉语言模型中的言语化差距。

原作者: Jihyung Ko, Eunji Jung, Hyeongsub Kim, Ziseok Lee, Jae Won Cho, Sanghyun Jo, Kyungsu Kim

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jihyung Ko, Eunji Jung, Hyeongsub Kim, Ziseok Lee, Jae Won Cho, Sanghyun Jo, Kyungsu Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,一种被称为视觉语言模型(vision-language models)的特定类别系统已经出现,它成为了计算机所见与人类如何表达之间的桥梁。这些模型在海量的图像和文本上进行训练,使其能够观察一张照片并生成描述、回答关于其内容的问题或解释场景。为了让这些工具在现实世界中真正发挥作用,它们的描述必须既精确又完整。它们不应凭空捏造不存在的物体(这种错误被称为“幻觉”),也不应忽略清晰可见的事物(这种失败被称为“遗漏”)。直到最近,修复这些错误通常需要从头开始重新训练庞大的模型,或者附加额外的专门软件作为“第二双眼睛”。这种方法计算成本高昂且速度缓慢,限制了这些系统改进或部署的速度。

来自首尔大学及其他机构的一个研究小组引入了一种名为 PatchGate 的新方法,该方法解决了这些可靠性问题,而无需改变模型的内核训练或添加外部工具。研究人员并不是试图教导模型新的事实,而是发现了如何通过倾听模型在说话之前的“内心想法”来解决问题。他们发现,甚至在模型生成第一个单词的描述之前,其内部层级就已经对图像中存在的物体进行了一份详细且无声的清单。通过读取这些隐藏的证据,并在生成过程中轻轻地引导模型的选择,他们使系统变得更加诚实(对于所见之物)且更加周全(对于所报之物)。

这一发现的核心在于理解这些模型是如何处理信息的。当视觉语言模型观察图像时,它会将图片分解成称为“补丁”(patches)的小型网格状区域。随着模型通过其人工神经的深层结构处理这些补丁,它会在提交任何句子之前,就开始形成对存在物体的感知。研究人员意识到,这种内部状态包含了一份“无提示词”(prompt-free)的物体列表——这意味着模型在人类要求其描述场景之前,仅基于视觉数据就已经识别出了诸如火车、旗帜或人等事物。然而,当模型最终开始说话时,它有时会忽略这些内部线索,导致细节缺失,或者自信地虚构出没有视觉支持的物体。

为了解决这个问题,研究人员开发了一个两步走的框架,充当模型输出的实时编辑器。首先,他们创建了一个名为“视觉证据提取”(Visual Evidence Extraction)的过程。这一步会窥视模型的后期处理层,以读取针对特定物体的最强信号。它构建了一份关于图像实际包含内容的简表,并根据视觉数据对每个潜在物体提供的支持强度分配置信度分数。这一过程不需要任何文本提示或外部检测器;模型只是在阅读其自身的图像地图。如果模型看到火车上的旗帜,这一步会以高置信度记录下该证据。如果模型没看到卡车,那么关于卡车的证据就会保持微弱或不存在。

第二步被称为“视觉证据包含-排除解码”(Visual-Evidence Inclusion-Exclusion Decoding),它利用这份内部简表来引导模型的写作。当模型决定下一个要生成的单词时,该系统会检查内部证据。如果模型正准备提到一个具有强大视觉支持但尚未被提及的物体(例如模型一直在跳过的可见天空),系统会给予该单词一个轻微的提升,使其更有可能被选中。相反,如果模型正准备说一些缺乏视觉支持的内容(例如虚构一辆并不存在的卡车),系统则会施加惩罚,降低该单词出现的可能性。这一切是同步发生的,在单次图像处理过程中同时修正模型遗漏的内容和编造的内容。

应用此方法的成果是显著的。在图像描述的标准基准测试中,该系统将可见物体的覆盖率提高了 13.4%,这意味着它成功地提到了照片中实际存在的更多事物。与此同时,它将幻觉物体的发生率降低了 12%,使描述更加值得信赖。至关重要的是,这些改进是在无需重新训练模型、无需添加任何外部目标检测软件,且仅增加极少量计算时间的情况下实现的。该方法通过利用模型自身的潜意识知识发挥作用,证明了可靠性问题的答案往往已经存在于系统内部,只需被正确地访问和利用即可。

这种方法挑战了那种认为修复幻觉需要构建更复杂系统或添加外部验证器的流行观点。相反,它表明,让模型立足于现实的最有效方式,是使其最终的言语与其已经收集到的内部证据保持一致。通过将模型的内部状态视为可验证的数据源而非黑盒,研究人员证明,通过精心的、无需训练的干预,可以使一个冻结的、预训练的模型变得显著更加可靠。这些发现为创造不仅具备流畅性,而且能忠实于其观察到的视觉世界的智能系统提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →