GRIT: Teaching MLLMs to Think with Images
该论文提出了一种名为 GRIT 的基于强化学习的方法,该方法通过自然语言与显式边界框坐标的交替穿插,使多模态大语言模型能够生成具有视觉依据的推理链,从而在无需标注推理或定位标签的情况下实现高效的数据利用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明的机器人如何解谜。通常,当你向这个机器人询问关于图片的问题时,它试图仅通过语言来回答。它可能会说“我看到一只鸟”,但它实际上并没有指向那只鸟。这就像试图仅用语言在黑暗的房间里描述一个位置,希望对方能猜出你在看哪里。
论文《GRIT:教多模态大语言模型用图像思考》介绍了一种训练这些机器人(称为多模态大语言模型,或 MLLMs)以不同方式思考的新方法。以下是使用简单类比进行的分解:
1. 问题:“盲目”的思考者
当前的 AI 模型擅长语言交流,但当它们观察图片时,往往仅用纯文本进行“思考”。它们可能会猜出正确答案,但无法向你展示它们是在哪里寻找到的。这就像一名侦探通过猜测凶手的名字来破案,却从未展示证据或指出指纹。这使得它们的推理难以令人信服,有时甚至不准确。
2. 解决方案:“指向”的习惯(GRIT)
作者创造了一种名为GRIT(基于图像和文本的 grounded 推理)的方法。他们教导 AI 在思考时进行指向,而不仅仅是说话。
- 类比:想象 AI 是一位正在向学生解释地图的老师。老师不再只是说“宝藏在那里”,而是在地图上的那个位置画一个方框,并说:“我正在看这里 [画方框],我看到一块岩石,所以宝藏一定在它旁边。”
- 工作原理:AI 生成一个思维链,将普通句子与边界框(围绕图像特定部分绘制矩形的坐标)混合在一起。它 literally 指向它用来解决问题的图像部分。
3. 秘诀:通过试错学习(GRPO-GR)
通常,要教会 AI 完成如此复杂的任务,你需要成千上万个示例,其中人类已经写出了每一步并画出了每一个方框。这就像雇佣一个教师团队为机器人编写教科书。
该论文声称取得了一项突破:GRIT 几乎不需要示例。
- 类比:AI 不像阅读教科书那样学习,而是像孩子玩电子游戏一样学习。你给它一张图片和一个问题。它尝试回答。如果它最终答案正确并遵循了规则(如画一个方框),它就会获得“高分”(奖励)。如果失败,则得分较低。
- 神奇之处:研究人员仅使用了20 个示例(就像 20 道练习题)来训练 AI。AI 弄清了规律:“为了获得高分,我需要在说话时指向图像。”他们将此称为GRPO-GR,这是一种特殊的训练方法,既奖励 AI 给出正确答案,也奖励其使用正确的“指向”格式。
4. 结果:更聪明、更诚实
当他们测试这些训练有素的机器人时:
- 它们在数学和计数方面变得更好:如果你问“巢里有多少个蛋?”,机器人不会只是猜一个数字。它会在其“思维”中指向这些蛋,逐一计数,然后给出答案。
- 它们统一了两种技能:以前,AI 要么擅长说话(推理),要么擅长指向(定位),但不能同时做到两者。GRIT 教会了它们同时做这两件事。
- 它们更可靠:因为 AI 必须指向证据,所以它更难编造谎言。如果它指向一个位置并说“我看到一只猫”,但那里没有猫,系统就会知道出了问题。
5. 他们的发现(以及未发现的)
- 数据效率:他们证明了不需要庞大的数据库。仅用 20 个示例就足以教会机器人这种新的“指向”习惯。
- 注意力:当 AI 指向一个位置(画一个方框)时,它在随后的思考中实际上会更加关注图像的该部分。就像指向的动作有助于机器人集中视线一样。
- 局限性:论文指出,虽然增加更多数据有帮助,但存在收益递减的点。为了让机器人在未见过的任务上表现得更好,它们需要数据具有更多的多样性,而不仅仅是更多相同的数据。
总结:
GRIT 是一种新的训练方法,它通过迫使 AI 机器人在说话时指向图像,教会它们“用眼睛思考”。这是一个巨大的飞跃,因为它几乎不需要数据(仅需 20 个示例)就能教会这种复杂的技能,并使 AI 的推理变得透明且值得信赖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。