← 最新论文
💬 NLP

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

本文介绍了 Perception-RFT,这是一个将组相对策略优化(Group Relative Policy Optimization)应用于无需中间推理标记的多模态文档问答任务的训练框架,证明了直接的视觉接地对齐通过降低超过 60% 的推理成本,并避免了语义鲁棒性与几何精度之间的“接地发散”(Grounding Divergence)权衡,其表现优于以推理为中心的方法。

原作者: Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去阅读一张凌乱的手写收据,并让它的手指精准地指向总价。这不仅仅是让机器人说出正确的数字,而是要让它在纸上物理定位到那个数字。这个领域被称为“多模态文档问答”(Multimodal Document Question Answering)。把“多模态”想象成机器人同时使用两种感官:眼睛(观察文档图像)和大脑(理解文本内容)。长期以来,科学家们一直被一个大问题困扰着:为了让机器人指向正确的位置,它是否需要先“大声思考”?它应该先说,“好吧,我看到了一个美元符号,然后是一个数字,所以总价一定在这里,”然后再指向,还是说这种额外的喋喋不休只会拖慢它的速度?这在现实世界中至关重要——比如当银行检查贷款申请或律师审计合同的时候——因为速度和准确性就是一切。如果机器人浪费时间去“思考”,或者指错了地方,可能会让人们损失金钱或错过关键细节。

本文的作者决定测试一个大胆的想法:如果我们告诉机器人停止思考,直接去看呢?他们构建了一个名为“Perception-RF T”(感知强化微调)的训练系统。他们没有让机器人生成冗长的文字解释(就像学生在数学考试中展示解题步骤那样),而是强迫它直接跳到答案以及该答案在页面上的坐标。他们使用了一种特殊的训练方法,叫做“群体相对策略优化”(GRPO),这就像一位教练给机器人团队一组答案,然后说:“你比其他机器人做得好,所以继续保持这样做,”而不需要解释为什么需要分步进行。

这里有一个令人惊讶的转折:机器人根本不需要“思考”部分。事实上,当研究人员确实允许机器人通过“大声思考”来尝试时,机器人最终会自发地停止这样做。在训练过程中,模型开始生成长长的推理链,但随着它们在任务中变得越来越熟练,它们会将这些想法压缩,直到几乎消失。到最后,那些被允许进行“思考”的机器人的表现实际上比那些被强迫只能直接“观察”并立即指向的机器人更差。那些“思考型”机器人速度更慢,消耗更多计算资源,且错误更多。论文表明,对于这项特定工作——即在文档中寻找某个位置——直接感知是一种超能力,而加入“推理”步骤反而是一种干扰。

研究人员还发现了一个棘手的现象,称为“接地偏差”(Grounding Divergence)。当他们用从未见过的文档(例如从财务收据切换到科学图表)来测试这些经过超级训练的机器人时,机器人变得非常擅长指向正确的位置,但有时在理解文字方面会变得稍微逊色一些。这就像一个学生变得太擅长在页面上寻找答案解析,以至于不再仔细阅读题目本身。然而,论文指出,对于大多数实际用途来说,让指针指对是最重要的事情。

最后,他们发现了一个捷径。通常情况下,你必须先用数千个示例来教机器人,然后才能开始那种高级训练。但这个团队展示了,如果你很早就切换到这种“直接观察”的训练方法——即在仅使用常规数据极小一部分的情况下就开始训练——机器人也能学得一样好。他们仅使用减少了 65% 的训练数据,就达到了同样高质量的结果。所以,主要的结论很简单:对于阅读文档并指向答案,不要过度思考。教机器最好的方式是让它去看,而不是让它说话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →