← 最新论文
💻 computer science

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

本文介绍了 Composer,这是一个多模态大语言模型,它通过使用学习到的代理标记(proxy-tokens)取代传统的文本坐标,从而弥合视觉定位中的语义-空间差距,进而显著提高了定位精度,同时保持了具有竞争力的回答性能。

原作者: Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在要求一个非常聪明但带点神秘感的机器人去观察一张照片并回答一个问题。例如:“蓝色的背包是在右边吗?”

目前的“聪明”机器人(被称为多模态大语言模型)非常擅长给出正确答案,但它们的工作方式就像一个黑盒。你问一个问题,它就吐出一个答案。你完全不知道它是如何找到那个答案的。它是真的看到了那个背包?还是仅仅根据其训练数据中经常出现“背包”这个词而做出的猜测?

问题所在:“虚假地图”

为了让这些机器人更诚实,研究人员尝试教它们指向自己正在看哪里。通常,他们会让机器人写下坐标,比如一段文本字符串说“x=100, y=200”。

本文认为,这就像是要求一个人通过阅读一串随机数字而不是看地图来导航城市。机器人将这些数字视为句子中的另一个单词。因为数字“100”与实际的像素之间没有真实的联系,机器人经常会产生幻觉。它可能会说:“我在坐标 100, 200 处看到了背包”,即使那里根本没有背包。它在撒谎,关于它到底在看哪里。

解决方案:“Composer”与神奇的索引卡

作者引入了一个名为 Composer 的新模型。Composer 不再使用随机数字作为坐标,而是使用学习到的代理标记(Learned Proxy-Tokens)

把图像想象成一个巨大的由微小图像碎片(像素)组成的图书馆。

  • 旧方法: 机器人试图通过喊出一个随机数字来描述一个位置。这就像是通过猜测一个随机页码来寻找图书馆里的一本书。
  • Composer 的方法: 机器人被给予了一组神奇的索引卡。每张卡片都有一个唯一的名称(一个“标记”),这个名称与图像的特定部分永久绑定在一起。

当机器人需要谈论那个背包时,它不会去猜数字。它只是拿起覆盖了那个背包的特定“索引卡”。这就像机器人对图像有一个直接的、物理上的抓手。它可以说:“我正在看卡片 #42”,由于卡片 #42 在机器人的记忆中与背包物理相连,它无法对它所看到的东西撒谎。

它是如何工作的:构建证据链

机器人不会直接跳到答案。它会构建一个循序渐进的故事,就像侦探破案一样:

  1. 找到物体: “我正在看背包(卡片 #42)。”
  2. 检查位置: “卡片 #42 是在房间右侧吗?是的。”
  3. 检查颜色: “卡片 #42 是蓝色的吗?是的。”
  4. 结论: “是的,蓝色的背包在右边。”

因为机器人使用这些“索引卡”(标记)而不是随机数字,它故事中的步骤与实际图像紧密相连。如果背包不是蓝色的,机器人就不能仅仅猜一个“蓝色”然后碰运气;它所持有的“卡片”会告诉它真相。

新的测试:“ComposerGCoT”

研究人员意识到,仅仅检查最终答案是否正确是不够的。机器人可能会为了得到正确答案而采取错误的原因(就像一个学生在做数学测试时,在没展示解题过程的情况下猜中了正确答案)。

因此,他们构建了一个特殊的测试数据集,名为 ComposerGCoT。这个测试不仅问:“你得到正确答案了吗?”它还会检查:

  1. 你是否遵循了正确的步骤?(推理一致性)
  2. 你是否真的看了图片的正确部分?(定位准确性)

实验结果

当他们用 Composer 与旧有的“坐标”模型进行对比测试时:

  • 准确率: Composer 得到最终正确答案的频率与旧模型一样高。
  • 诚实度: Composer 在实际指向图像正确位置方面的表现提升了 9%

核心启示

本文的结论是,通过给机器人提供可以“寻址”的抓手(代理标记)来抓取图像的部分,我们可以阻止它编造虚假的位置。这使得机器人的推理变得忠实(faithful)——这意味着它的解释与其所看到的实际内容相符。这是朝着构建能够让我们信任的 AI 迈出的重要一步,这种 AI 不仅能告诉我们它想到了什么,还能基于真实的证据告诉我们它为什么会这样想。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →