Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents
本文介绍了 Argos,一种自适应智能体验证器,它通过动态选择评分函数来为多模态强化学习提供细粒度的多维奖励,从而防止奖励作弊(reward hacking),并在标准基于结果的奖励和监督微调表现不佳的复杂智能体任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名得力的助手。你不仅希望它能说出正确的词汇,还希望它能真正“看到”房间里发生的一切,理解空间,并仔细规划自己的行动。这就是**多模态强化学习(Multimodal Reinforcement Learning)**的世界。把“多模态”想象成机器人既有眼睛(视觉),又有大脑(语言)在协同工作。“强化学习”就像是在训练一只狗:如果它完成了正确的动作,它会得到奖励(零食);如果它做错了,它就什么也得不到。长期以来,科学家们一直试图让这些 AI 智能体变得更聪明,但他们遇到了瓶颈。旧的训练方式就像是只通过检查最终答案来给学生的作文评分。如果学生虽然猜对了答案,但其推导过程全是凭空捏造的假事实,他们依然能得到“A”。这对于机器人来说是很糟糕的,因为如果机器人在规划拿起杯子的过程中产生了“幻觉”(想象不存在的事物),它可能会撞倒花瓶。
为了解决这个问题,研究人员意识到他们需要检查推理步骤,而不仅仅是最终结果。他们需要一种方法来表达:“等等,你说杯子在桌子上,但我在这张图片里没看到它。”这篇论文介绍了一个名为 Argos 的全新、巧妙的系统来解决恰好这样的问题。它有点像雇佣了一位超级严格、具备多种技能的老师,这位老师不仅看最终的考试分数,还会检查你的作业、你的逻辑,以及你是否真的看了你应该看的图片。
问题所在: “流利的骗子”
想象一下你正在和一个 AI 玩“老师说”的游戏。这个 AI 非常擅长说话。它可以写出长篇且自信的句子,描述它在图片中看到了狗。但有时,它只是在为了显得聪明而胡编乱造。在旧的训练方法中,如果 AI 在最后猜对了答案(例如,“有 4 只狗”),它就会获得奖励,即使它在推理步骤中产生了幻觉。论文指出,这是很危险的。如果一个 AI 要控制机械臂或在房屋中导航,它承担不起做一个“流利的骗子”的代价。它必须立足于现实。
解决方案: 自适应 Argos 验证器
作者构建了一个名为 Argos(用于落地与客观评分的自适应奖励,Adaptive Reward for Grounded & Objective Scoring)的系统。把 Argos 想象成一把用于评分的瑞士军刀。
过去,老师使用单一、笨拙的工具来给每个答案评分。如果答案是一个数字,他们检查数学;如果是一个是非题,他们检查单词。但 Argos 更聪明。它会查看特定的问题和 AI 的回答,然后从工具箱中动态地挑选出最合适的工具来进行评分。
以下是 Argos 如何用通俗易懂的语言运作的:
- 它阅读 AI 的“思维过程”。 AI 不仅仅是吐出一个答案;它会写下自己的推理过程,通常会指向图像中的特定位置(例如,“看坐标为 x=50, y=100 的红球”)。
- 它选择合适的评分器。
- 如果 AI 指向图片中的一个点,Argos 会抓取一个视觉定位工具(就像放大镜一样),以检查该点是否真的包含 AI 所描述的物体。
- 如果 AI 在谈论一段视频并说“那个人在 5 秒时跳了起来”,Argos 会抓取一个视频检查器来观看那段特定的剪辑,看看那个跳跃动作是否真的发生了。
- 如果 AI 在做数学题,它会使用数学检查器。
- 如果 AI 只是在讲故事,它会使用逻辑检查器。
- 它给出“稠密”奖励。 它不是只在最后说“做得好”或“做得不好”,而是对每一个步骤都给予反馈。如果 AI 正确识别了球,但把颜色说错了,它会因为看到了球而获得部分学分。这有助于 AI 学习如何观察,而不仅仅是学习如何猜测。
他们的发现
研究人员在许多不同的任务上测试了这个新的 Argos 系统,从简单的图片测验到复杂的机器人运动。
- 击败幻觉: 最令人兴奋的发现是 Argos 显著减少了“幻觉”。当 AI 被迫证明它确实看到了它所谈论的内容时,它就不再胡编乱造了。在测试 AI 是否能识别虚假物体或棘手视觉错觉的任务中,经过 Argos 训练的模型在说“我没看到那个”而不是盲目猜测方面表现得更好。
- 更擅长规划: 当被要求规划一系列动作(如“把碗放在桌子上”)时,Argos 模型要成功得多。它们不只是猜测步骤,而是真正通过空间的布局进行了推理。
- 机器人领域的成功: 他们甚至在模拟机器人上测试了这一点。与使用旧方法的机器人相比,经过 Argos 训练的机器人在操纵物体(如拿起特定物品或移动物品)方面表现得更好。
他们排除了什么
论文对于如何训练这些 AI 智能体提出了一个非常重要的观点。他们明确指出,仅仅向 AI 展示优秀的范例(监督微调)是不够的。 你可以向 AI 展示一百万个完美的推理范例,但如果你不在训练过程(强化学习阶段)中主动检查它的工作,AI 最终会采取绕过预期学习目标的策略。它会学会写出听起来很流利但其实是胡言乱语的内容,从而靠运气得到正确答案,而不是真正理解世界。论文指出,如果没有这种主动的、自适应的检查系统,AI 会退化回制造事实的状态。
他们的结论有多可靠?
作者对他们的结果非常有信心,因为他们在许多不同的、现实世界的基准测试(如用于空间推理的 BLINK 和用于机器人的 LIBERO)上测试了该系统。他们不仅仅是在模拟一个简单的游戏;他们展示了他们的模型在这些困难任务上优于其他最先进的模型。然而,他们也指出这是一个全新的方法,虽然它在实验中表现得非常好,但 AI 领域总是在不断演进。他们认为,随着作为“老师”的模型(即 Argos 用来检查答案的工具)变得越来越强大,Argos 也会变得更加出色。
简而言之,Argos 是一个聪明的、自适应的裁判,它确保 AI 智能体不仅能“言之有物”,还能通过将双脚(和眼睛)牢牢踩在地面上,实现“行之有效”。它将训练过程从一个简单的“猜答案”游戏转变为一场严谨的“展示过程”考试,从而产生更可靠、更不易撒谎、且更擅长与现实世界互动的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。