← 最新论文
🤖 AI

Thinking with Visual Grounding

本文引入了“视觉锚定思维”(visually grounded thinking)这一框架,在该框架中,视觉语言模型将自然语言推理与显式的视觉锚定交织在一起,通过可扩展的合成流水线和感知锚定的强化学习进行训练,该框架显著提升了在计数和空间推理任务上的表现,使得较小的模型能够媲美规模大得多的同类模型。

原作者: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在参加一场数学考试,但题目不是数字,而是关于图片的。你有一个聪明的助手(一个人工智能)试图通过大声对自己说话来解决这些图片谜题。

问题:“幽灵”推理
目前,这些人工智能助手很擅长说话。它们可以说:“我看到入口附近有一辆红色的车,所以答案是 A。”但问题在于,它们只是在“说”自己看到了它。它们并没有真正指向图片中的那辆红车。这就像一个正在考试的学生,写下了正确答案却无法展示其解题过程。如果你问:“你怎么知道那是红色的车?”人工智能可能会说:“我就是知道,”或者它可能只是在瞎猜。因为人工智能没有被强制要求指向证据,很难判断它到底是在观察图片,还是仅仅在凭空捏造。

解决方案:“视觉锚定”
这篇论文的作者 Junkai Zhang 及其团队提出了一种让 AI 思考的新方法,称为**“视觉锚定思维”(Visually Grounded Thinking)**。

你可以这样理解:

  • 旧方式: AI 说:“桌子上有一个黑色的笔记本电脑。”(这只是文字)。
  • 新方式: AI 说:“桌子上有一个黑色笔记本电脑 <指向屏幕上的精确位置>。”

每当 AI 提到一个物体(比如“棕色的椅子”或“蓝色的杯子”)时,它必须在图像中的特定物体上落下一个数字图钉(一个点)或画出一个框。这就像人工智能正拿着一个激光笔并说道:“我正在思考的就是这里的这个东西。”

他们是如何教 AI 做到的
教 AI 精确地指向某个物体是很困难的,因为你不能直接要求它“要精准”。因此,研究人员建立了一个特殊的工厂(数据流水线)来创建训练示例:

  1. 侦探: 他们使用了一个非常聪明的人工智能来解决图片谜题并写下步骤。
  2. 高亮工具: 他们使用了一个名为 SAM3 的工具(可以把它想象成一个超级精准的数字荧光笔)来自动寻找侦探提到的物体的精确形状。
  3. 老师: 他们将这些精确的形状转化为“点”或“框”,从而创建一个完美的标准答案。
  4. 奖励系统: 他们使用一种类似游戏的方式来训练 AI。如果 AI 答对了且指对了位置,它会得到高分;如果它答对了但指错了位置(或者根本没指向),它会得到较低的分数。这迫使 AI 学习“思考”与“指向”必须同步发生。

测试结果如何?
他们在两类任务上测试了这个新的“指向型”AI:

  1. 计数: “这张图片里有多少个甜甜圈?”
    • 结果: AI 在这方面变得更出色了。通过指向每个甜甜圈,它能准确计数,而不会被看起来相似的物品所迷惑。
  2. 空间推理: “哪个物体在男人的最左侧?”
    • 结果: 这是最大的惊喜。一个学习了如何指向的小型 AI 模型(40 亿个“脑细胞”)变得与一个没有学习指向的大型 AI 模型(270 亿个“脑细胞”)一样出色,甚至有时表现得更好。

总结
论文表明,当人工智能模型被强制要求将其思维与实际图像联系起来时——就像一个必须通过圈出所用数字来展示解题过程的学生一样——它们会变得更加聪明。

  • 对于计数: 仅仅在物体上点一个点就足够了。
  • 对于复杂的空间谜题: 在物体周围画一个框能帮助 AI 更好地理解大小和形状,但即便只是指向,效果也出奇地好。

简而言之,这篇论文证明了当你能指明你在思考什么时,你的思考会变得更好。 它将“魔术般的猜测”变成了“可验证的证据”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →