🤖 AI
Verifiable Process Rewards for Agentic Reasoning
本文介绍了可验证过程奖励(VPR),这是一个利用客观预言机生成密集、回合级监督以强化学习的框架,从而改善长程智能体推理中的信用分配,并在多样化的推理基准测试中展现出优于稀疏结果级反馈的性能与泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩一款复杂的游戏,比如解开一个巨大的谜题或穿越迷宫。
旧方法:“最终成绩”问题
传统上,当我们训练这些机器人(大型语言模型)时,只在最后给予反馈。这就像老师让学生参加一场包含 100 道题的数学考试,等学生做完后,才说:“你得了 B。”
- 问题所在:机器人不知道哪些具体答案是正确或错误的。是因为第 5 题错了?还是第 99 题?如果得了"B",也许它在难题上运气好,却错过了简单题。这使得机器人很难学会如何改进其逐步思考的过程。
新想法:“即时教练”
这篇来自清华大学的论文作者提出了一种新方法,称为可验证过程奖励(Verifiable Process Rewards, VPR)。
VPR 不像等待最终成绩,而是像一位严格、客观的教练,观察机器人做出的每一步动作,并立即给予反馈。
- 工作原理:机器人走一步。教练将其与一本“规则手册”(一个计算机程序或数学求解器)进行比对,该手册知晓绝对真理。
- 如果该步骤符合规则,教练会说:“做得好!”(+1 分)。
- 如果该步骤违反规则,教练会说:“坏棋!”(-1 分)。
- 神奇之处:这发生在每一次回合,而不仅仅是在最后。机器人能确切知道哪些步骤是好的,哪些是坏的,从而能够实时修正其策略。
他们测试的三种方式
研究人员在三种不同类型的游戏中测试了这位“即时教练”,以证明其有效性:
井字棋(策略游戏):
- 教练:一个超级聪明的计算机程序(MCTS),它能前瞻性地查看最佳的未来走法。
- 教训:机器人学会的不仅仅是当下看起来“还行”的走法,而是能赢得后续比赛的走法。它不再做出那些看似一时不错却会导致输掉比赛的“愚蠢”走法。
数独(逻辑谜题):
- 教练:一个逻辑求解器,检查数字是否符合网格规则。
- 教训:如果机器人试图在一个已经允许填入"5"的位置放入"5",教练会立即说:“不行!”这教会机器人要与整个谜题保持一致,而不仅仅是当前这个格子。
扫雷(猜测游戏):
- 教练:一个概率计算器,根据已揭示的数字,确切知道地雷可能在哪里。
- 教训:机器人学会计算风险。如果一个格子有 90% 的概率是地雷,教练会说:“别点那个!”这教会机器人谨慎地处理不确定性。
他们的发现
- 更好的学习:接受“即时教练”(VPR)训练的机器人,比接受旧式“最终成绩”方法训练的机器人学习速度快得多,在游戏表现上也优秀得多。
- 更聪明的思考:机器人不仅提高了在特定练习游戏中的表现,在通用推理任务上也变得更出色。这就像一个练习逻辑谜题的学生,突然在写文章或解应用题方面也变得更擅长,因为他们学会了如何逐步思考。
- 潜在风险:“教练”必须完美无缺。如果教练使用的规则手册存在漏洞或错误,机器人就会学到错误的教训,实际上反而变差。教练的质量至关重要。
一言以蔽之
这篇论文表明,如果你能构建一个系统,以 100% 的准确率逐步检查机器人的工作,你就能教会它进行比仅告知其最终输赢更好的推理。这将学习过程从“试错”游戏转变为一种有指导的、逐步的教程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。