Escaping the Verifier: Learning to Reason via Demonstrations
该论文引入了 RARO,一种新颖的逆强化学习框架,通过在策略与相对论批评者之间采用对抗博弈,使大语言模型仅通过专家演示即可进行有效的推理训练,从而在不依赖特定任务验证器的情况下,在推理任务上取得了强劲的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何解决复杂的谜题,或者创作优美的诗歌。通常情况下,要教导一个机器人,你需要一个“裁判”,他能瞬间给出反馈:“是的,这是正确答案,”或者“不,那是错误的。”
- 在数学领域,裁判很容易找:你只需要检查数字相加是否等于正确的总和。
- 但在诗歌或金融分析领域,并没有裁判。没有唯一的“正确”诗篇,也没有计算器能告诉你某种财务策略是否完美。
长期以来,科学家们认为,如果没有裁判,机器人只能通过单纯地记忆示例来学习(就像学生抄写教科书一样)。但这篇文章的作者们,即 RARO,却说:“等等,即使没有裁判,我们也可以通过展示专家的示例,来教会机器人如何去‘思考’和‘推理’。”
他们是这样实现的,使用了一个简单的类比:
“品味测试”游戏
作者并没有设置一个了解绝对真理的裁判,而是让同一个机器人大脑扮演两个角色,进行一场游戏:
- 厨师(策略/Policy): 这个部分的机器人尝试根据食谱烹饪一顿饭(解决问题或写一首诗)。它想要做出如此美味的佳肴,以至于看起来像是出自一位世界名厨(专家数据)之手。
- 美食评论家(相对论批判者/Relativistic Critic): 这个部分的机器人充当评委。但这里有一个转折:评论家同时得到两份菜肴:一份是由名厨制作的,另一份是由厨师(机器人)制作的。
游戏规则:
- 如果评论家能正确猜出哪盘菜属于名厨,哪盘属于机器人,他就能获得积分。
- 厨师获得积分的条件是,他能成功欺骗评论家,让评论家认为他的菜肴是由名厨制作的。
为什么这很特别
在过去,如果机器人变得非常厉害,评论家就会感到困惑。如果机器人的答案非常完美,评论家可能会只是随机猜测,导致机器人无法学到任何新东西。
作者加入了一个聪明的“平局”选项。如果评论家无法分辨机器人的答案与专家的答案之间的区别,他可以宣布**“平局”**。
- 这就像是评论家在说:“这两道菜太相似了,我无法分辨。”
- 这让游戏得以持续进行。机器人明白,为了获胜,它不仅要做到“还可以”,它还需要做到与专家“难辨真伪”。
他们的发现
研究人员在三种不同类型的挑战上测试了这个“品味测试游戏”:
数学谜题(Countdown): 一个需要通过组合四个数字来得到24的游戏。
- 结果: 机器人学会了通过多种组合进行“思考”,检查自己的工作,并在出错时进行回溯。它的表现几乎达到了那些由完美数学裁判训练出的机器人的水平,并且比那些仅仅靠记忆答案的机器人要出色得多。
更难的数学(DeepMath): 在这些复杂问题中,检查答案本身就和求解一样困难。
- 结果: 随着机器人的规模变大、变得更聪明,它的推理能力也持续提升,这表明该方法具有良好的扩展性。
创作诗歌: 一个没有“正确答案”的任务。
- 结果: 这是重头戏。机器人学会了创作比那些只会死记硬背示例的机器人更具创意、且更符合提示词要求的诗歌。它学会了在写作之前先规划自己的诗歌(例如:“我需要专注于感官细节”)。
核心结论
这篇论文表明,你并不需要一个完美的“标准答案”来教机器人如何推理。你只需要收集专家的示例集,并设定一种方法,让机器人与这些专家进行一场“找不同”的游戏。
通过这种方式,机器人学会了生成自己内在的“裁判”,从而帮助它检查自己的工作、纠正错误,并在那些预先不存在唯一正确答案的任务中,提出高质量的解决方案。它将机器人从一个简单的模仿者变成了一个深思熟虑的问题解决者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。