Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
本文提出了一种拒绝校准组相对策略优化(RC-GRPO),这是一种强化学习策略,使多模态大语言模型能够在广义指代理解任务中有效地拒绝不存在的目标,同时不损害其对现有目标的定位准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人和人类玩“我看到……”(I Spy)的游戏。人类指着一张图片说:“找找红色的球。”如果红色的球在那里,机器人应该准确地指向它。但如果人类说:“找找红色的球,”而图片里实际显示的是一只蓝色的猫呢?一个聪明的机器人应该说:“我在这里找不到红色的球;这里没有。”然而,当今许多超级智能的计算机大脑(被称为多模态大语言模型)就像是那些害怕出错的急于表现的学生。它们如此渴望给出答案,以至于当它们看不见红色的球时,也会强行猜测,指着那只蓝色的猫并坚持说:“就是它!”这被称为“幻觉”——即编造并不真实的事实。
这篇论文探讨了一个特定且棘手的问题,被称为“广义指代表达理解”(Generalized Referring Expression Comprehension)。这是一个很高级的说法,意思其实是:“如果物体存在,机器人能否找到它?以及如果物体不存在,它能否诚实地说‘我没看到’?”研究人员发现,虽然这些机器人非常擅长寻找物体,但它们却很不擅长承认物体缺失。如果你只是训练它们更频繁地回答“不”,它们就会变得过于胆小,甚至连原本存在的物体也找不到了。团队需要一种方法,教机器人仅在真正必要时才说“不”,而不至于让它忘记在正确时如何说“是”。
该论文的作者提出了一种巧妙的新训练方法,称为“拒绝校准组相对策略优化”(Refusal-Calibrated Group Relative Policy Optimization,简称 RC-GRPO)。把机器人的学习过程想象成一场“靠近或远离”(Hot and Cold)的游戏。通常情况下,机器人的得分取决于它的猜测有多接近目标。但在物体不存在时,机器人仍会不停地进行猜测,因此它永远学不会正确的答案。研究人员的第一招是:在练习过程中,即使机器人想去猜测,也要强迫它说“无,我没看到”。这给了机器人一个明确的“奖励”,让它在物体缺失时能说出正确的话。
然而,他们意识到,如果仅仅因为机器人说了“无”就表扬它,它就会开始对所有情况都说“无”,即使物体明明就在那里。为了解决这个问题,他们增加了一条特殊规则:如果机器人在物体实际存在时却说“无”,它会受到严厉的惩罚。这就像是在告诉机器人:“如果球不在那里,你可以说你看不到它;但如果你在球就在你面前时还说看不见,你就会丢分。”他们还增加了第二个阶段,要求机器人解释它为什么认为物体缺失(例如:“我没看到红色的球,因为这里只有一只蓝色的猫”)。这迫使机器人真正去理解图片,而不是仅仅记忆模式。
结果显示,这种方法非常有效。当他们在三个不同的挑战性测试中测试这种新方法时,机器人在寻找物体和在物体缺失时拒绝猜测两方面都变得更出色了。例如,在其中一项测试中,他们的方法将机器人的整体准确率从 45% 提升到了 62%,并且显著超过了其他先进的方法。该论文表明,这种方法帮助机器人找到了完美的平衡点:它不再为缺失的物体编造虚假位置,但也并未丧失寻找真实物体的能力。这是朝着让 AI 不仅聪明,而且对其所见所未见保持诚实这一目标迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。