Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
本文提出了感知即推理(Perceive-to-Reason, P2R),这是一个将细粒度视觉推理解耦为独立的感知与推理阶段的统一框架,并通过角色感知强化学习策略(PRA-GRPO)进行了增强,从而显著提升了不同模型规模及高分辨率基准测试下的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个非常棘手的谜题,但这张图片的规模巨大,而最重要的线索就隐藏在拥挤场景中的一个微小斑点里。
这就是 Perceive-to-Reason (P2R) 试图为人工智能解决的问题。
问题所在:“大海捞针”
目前的 AI 模型(视觉语言模型)擅长观察一张图片并给出通用的回答。但当问题需要寻找微小的细节时——比如阅读高分辨率照片中的一个小标牌,或者发现远处物体的特定颜色——它们往往会迷失方向。
这就像是在一个坐着 5 万人的体育场里寻找一位特定的朋友。
- 旧的 AI 方法 就像是一个盯着整个人群看,然后瞎猜的人:“我觉得他们在那里!”或者在没有计划的情况下疯狂地放大和缩小不同的区域。因为它们试图同时处理所有事情,所以经常会错过微小的细节。
- 论文的洞察: 研究人员意识到,AI 之所以失败,不是因为它无法“思考”(推理),而是因为它首先无法正确地“观察”(感知)。它在还没找到数字之前,就开始尝试解数学题了。
解决方案:侦探与法官
该论文提出了一种新的训练 AI 的方法,称为 Perceive-to-Reason。与其让 AI 在一次巨大的脑力爆发中完成所有工作,不如将工作拆分为两个截然不同的角色,就像一个两人小组:
感知者(侦探):
- 任务: 观察巨大的、高分辨率的图像和问题。先不要管答案。只需找到线索隐藏的具体位置。
- 动作: 它在相关区域画一个框(例如,“红色的椅子在这里”)并将这个小块裁剪出来。
- 类比: 这就像一名侦探扫描犯罪现场,找到了那个单一的泥脚印,并把它放进证据袋中。
推理者(法官):
- 任务: 只观察“证据袋”(裁剪后的图像)以及画有框的原图。现在,回答问题。
- 动作: 它利用清晰的、放大的视图来做出最终决定。
- 类比: 这就像法官只观察那个泥脚印,以此来判断是否与嫌疑人的鞋子相匹配。他们不再需要担心其余混乱的犯罪现场。
核心秘诀:“PRA-GRPO”
你可能会问:“如果你只在最后告诉 AI ‘对’或‘错’,你该如何教它这样做呢?”(因为并没有一个老师在旁边指明框应该画在哪里)。
作者发明了一种名为 PRA-GRPO 的训练方法。可以把它看作是 AI 团队的一种专门化的教练训练课:
- 训练课: AI 在交替进行的轮次中进行练习。
- 第一轮(侧重感知): “侦探”尝试寻找位置。“法官”处于冻结状态(不学习)。如果侦探找到了正确的位置,法官就能轻松答对。AI 会收到一个针对侦探的“做得好”信号。
- 第二轮(侧重推理): “侦探”处于冻结状态(使用它刚刚学到的知识)。“法官”尝试根据那个位置进行回答。如果法官答对了,它会收到一个“做得好”信号。
- 结果: 通过轮流练习,AI 学会了:一个优秀的侦探会让法官的工作变得更容易,而一个优秀的法官能给侦探提供更好的反馈。它们学会了如何在不需要人类为它们画框的情况下协同工作。
发生了什么?
研究人员在不同规模的模型(20 亿、40 亿和 80 亿个“脑细胞”)上测试了该方法。
- 结果: 新方法 (P2R) 在寻找微小细节和回答复杂问题方面,明显优于原始模型。
- 证明: 在一项名为 V-Star 的测试中,40 亿参数的模型从答对率 81.7% 跃升至 93.2%。这是一个巨大的进步,尤其是在涉及细节微小的图像处理任务中。
总结
简单来说,这篇论文认为:“不要试图同时进行思考和观察。先找到图片的正确部分,然后再去思考它。”
通过将“寻找”线索的行为与“解决”谜题的行为分离,并通过让 AI 交替练习这些技能,计算机在观察那些重要的微小事物方面变得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。