FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
本文介绍了 FOCUS,这是一个结合了视觉支持约束和群体相对策略优化(GRPO)的两阶段训练框架,旨在实现无需显式监督的鲁棒、类别无关的上下文目标定位,使一个 7B 参数的模型能够显著超越规模大得多的 72B 模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个朋友,他看书极其聪明,但在乱七八糟的房间里找东西却笨手笨脚。如果你对他说:“找那个红色的杯子”,他可能会寻找任何一个红色的杯子,因为他知道什么是“杯子”。但如果你的要求是:“找到那个边缘有缺口的特定红色杯子,就像这张照片里的那一个”,一个普通的聪明朋友可能还是会感到困惑,并抓起另一个红色的杯子,因为他们依赖的是关于“杯子”的通用知识,而不是你给出的具体视觉线索。
这篇论文介绍了一种新的方法,来教导计算机视觉模型(能够观察并理解图像的 AI)做到这一点:仅基于视觉示例来寻找特定的物体,而不依赖于物体的名称或类别。
以下是他们的方法——FOCUS 的拆解,使用了简单的类比:
问题所在:“名牌”依赖症
目前的 AI 模型就像是在学习解数学题时,通过记忆数字的名字而不是理解逻辑来解决问题的学生。
- 问题在于: 当这些模型尝试在一张新照片中寻找物体时,它们往往会忽略具体的视觉细节(如形状、位置或独特的划痕),转而根据物体的名称进行猜测(例如:“它是一只狗,所以它一定看起来像一只典型的狗”)。
- 结果: 如果你向他们展示一张戴着帽子的狗的照片,并要求他们在人群中找到“那只特定的狗”,他们可能会选错,因为他们在思考“狗”这个概念,而不是“那只”特定的狗。
解决方案:FOCUS(强制上下文目标定位)
作者创建了一个两步训练法,迫使 AI 停止基于名称进行猜测,转而开始基于视觉证据进行观察。
第一步:“聚光灯”训练(注意力优化)
想象你在教一个孩子寻找隐藏的玩具。你不是说“找那个泰迪熊”,而是指着玩具的照片说,“看这里”。
- 他们做了什么: 他们在训练过程中移除了所有的文本标签(如“猫”、“车”、“狗”)。AI 只会看到一系列图像:其中一些图像在目标物体周围画了一个框,而最后一张图像则是 AI 必须猜测该物体所在位置的任务。
- 诀窍: 他们添加了一个特殊的规则(一种“损失函数”),就像一个聚光灯。如果 AI 的内部“眼睛”(注意力)看向了图像错误的部位,或者忽略了示例图中的方框,系统就会给它一个“差评”。这迫使 AI 学习到:“我必须观察示例中显示的特定形状和位置,而不是仅仅根据我认为这个物体叫什么来做猜测。”
第二步:“教练的哨声”(使用 GRPO 的强化学习)
一旦 AI 知道该看哪里,它仍然需要变得精准。想象一位教练正在观察运动员练习投球。
- 他们做了什么: 他们使用了一种叫做**群体相对策略优化(GRPO)**的技术。可以把这想象成一位教练,他不仅仅是说“做得好”或“做得不好”。相反,教练会让运动员尝试五次不同的投球。
- 对比: 教练会比较这五次投球。如果其中一次投球比其他的稍微好一点,教练会说:“多做些那样的动作。”如果某次投球变差了,他们会说:“停止做那样的动作。”
- 奖励: AI 会根据其绘制的方框与真实物体匹配的程度获得一个“分数”(使用一种称为 IoU 的指标,即两个形状的重叠程度)。通过不断比较自己的尝试并挑选出最好的那些,AI 学会了如何以极高的精度绘制方框。
结果:小脑瓜,大成就
这篇论文中最令人惊讶的部分是他们使用的模型规模。
- 他们训练了一个拥有 70 亿参数的模型(可以理解为一个非常聪明但紧凑的大脑)。
- 他们将其与拥有 720 亿参数的庞大模型(巨型大脑)进行了对比。
- 结果: 他们这个经过特殊训练的小型模型击败了那些巨型模型。这证明了教导 AI 如何 看(策略)比仅仅扩大 AI 的规模(扩展)更为重要。
为什么这很重要(根据论文所述)
论文声称,这种方法在以下情况下至关重要:
- 物体没有名字: 比如寻找一个形状奇特、手工制作的工具,它不符合标准的分类。
- 你需要找到“那一个”特定的物品: 比如编辑一张照片,仅移除你所指的那个人,而不是所有看起来像他的人。
- 个性化搜索: 在一堆蓝色的杯子中找到“我的那个特定蓝色杯子”。
简而言之,这篇论文教导 AI 停止依赖它的“词典”,开始依赖它的“眼睛”,使其能够仅通过参考照片,就能在人群中找到特定的事物,即使它以前从未见过那个完全相同的物体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。