Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning
本文介绍了 Pyligent,这是一个通过将经过验证的搜索树转换为用于继续、完成和回溯动作的有监督目标,从而提高在需要延迟失败恢复的任务上的推理性能的训练框架,其表现优于各种结构化领域中的标准有监督微调。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人解迷宫。
旧方法:“完美游客”模式
传统上,当我们教 AI 进行推理时,我们会给它看一段人类完美解决迷宫的视频。我们会说:“看,他们向左转,然后向右转,最后找到了出口。照着做就行。”这被称为“仅限金标准”(Gold-Only)训练。
问题在于,机器人只看到了成功的路径。它从未见过人类撞到死胡同、意识到错误、退回到上一个路口并尝试另一种方法的情景。因此,当机器人自己撞到死胡同的时候,它会陷入恐慌。它会一直撞向墙壁,或者卡在那里动弹不得,因为它从未被教会如何说:“哎呀,走错路了,”然后退回去。
新方法:Pyligent(“勤奋的学习者”)
这篇论文介绍了一种名为 Pyligent 的全新训练框架。Pyligent 不仅仅是向机器人展示完美的路径,它还让机器人去探索、失败并从失败中学习。
把 Pyligent 想象成一个观察玩家玩游戏的游戏教练:
- 探索者(The Explorer): 机器人尝试解决谜题。它做出各种动作。
- 裁判(The Referee/Validator): 一位严格的裁判注视着每一个动作。如果机器人的某个动作起初看起来没问题,但随后导致了死胡同,裁判不会只说“游戏结束”。他们会暂停游戏,指向机器人出错的确切时刻,并说:“你应该在这里折返。”
- 教训(The Lesson): 机器人随后会看到自己错误的重播。它看到了死胡同,听到了原因(“你撞墙了”),并且被明确教授了一个特殊的指令:
(回溯) 。这个指令告诉机器人擦除错误的路径,并返回到上一个安全点以尝试其他方案。
三个动作
Pyligent 教会了机器人三个特定的动作,而不仅仅是“继续前进”:
- 继续(Continue): “这条路看起来不错,继续前进。”
- 完成(Finish): “我找到了解决方案,这就是答案。”
- 回溯(Backtrack): “等等,这条路是死胡同。让我们回到上一个选择点,尝试别的路。”
实验:效果如何?
研究人员在三种不同的“游戏”上测试了它,以观察机器人是否真的学会了从错误中恢复。
隐藏迷宫(隐藏有向图):
- 设定: 机器人只能看到紧接着的下一步,看不到完整的地图。它必须猜测该往哪走。
- 结果: 旧方法(仅限金标准)几乎 100% 失败。它会撞进死胡同并继续盲目前进。然而,Pyligent 机器人解决了 76% 的迷宫。它学会了识别死胡同,按下“回溯”按钮,并尝试另一条路线。
迷你数独(4x4 网格):
- 设定: 一个小型数字谜题,填入一个数字可能会导致剩下的部分变得无法完成。
- 结果: Pyligent 解决的谜题数量显著高于旧方法。即使面对非常困难的谜题,Pyligent 机器人也能更好地意识到:“我在这里填了一个 3,但稍后这违反了规则”,并撤销这个动作以尝试另一个数字。
Blocksworld(堆叠方块):
- 设定: 一个机械臂需要将方块从一堆移动到另一堆。如果它拿错了方块,整个计划就会崩溃。
- 结果: 旧方法几乎无法解决任何问题。Pyligent 使成功率翻了一倍。它学会了有时你必须放下当前的方块并拿起另一个,而不是固执地强行执行一个行不通的计划。
核心秘诀:“追踪恢复”(Traced Recovery)
Pyligent 有一个非常酷的特性,叫做**“追踪恢复”**。
当机器人遇到死胡同并按下“回溯”时,旧的方法会直接抹掉所有记录。但 Pyligent 会留下一张小纸条:“你走了这条路,但因为它 [X] 而失败了。”
这就像一个迷路的徒步旅行者转身离开,并留下一个路标说:“别走这条路,这里是沼泽。”这张小纸条能帮助机器人在再次尝试时,避免犯下完全相同的错误。
总结
这篇论文认为,聪明不仅仅在于知道正确答案,还在于知道如何修正错误。通过训练 AI 明确识别死胡同并练习“回溯”,我们可以让它们成为更具韧性的问题解决者。这正是“撞到墙就放弃的机器人”与“意识到‘我的错,让我们试试另一扇门’的机器人”之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。