Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair
本文证明了验证器选择的自训练(通过利用来自 VAL 验证器的机器可验证治理记录来筛选高质量规划示例)显著增强了受限模型在结构化工作流任务上的单次执行能力,同时保持了低延迟和模式有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一个模型的优劣通常取决于它进行对话或撰写故事的能力。但在许多现实世界的任务中,目标不在于听起来悦耳,而在于是否符合一套严格的规则。想象一个必须在桌子上移动方块以搭建塔形的机器人。它可能会说出正确的词汇,但如果它试图举起一个正支撑着另一个方块的方块,计划就会失败。这种失败不是风格问题,而是一种计算机可以瞬间检测出的机械错误。多年来,研究人员仅使用这些检查来拒绝错误的计划并尝试重新开始,这浪费了大量的时间和精力。一种新的研究方向提出了一个不同的问题:如果计算机能够识别错误并找到正确的解决方案,它能否利用这些成功的记录来教导模型,使其在下次不再需要如此费力思考的情况下,就能第一次就做到正确?
这个问题正是独立研究员耶稣·萨拉斯(Jesus Salas)近期研究的核心,他探索了成功的任务所留下的数字“纸质足迹”是否可以成为一名老师。这项研究聚焦于一类特定的问题,即规则清晰且结果可以由机器验证的问题。研究人员使用了一个涉及移动方块的知名测试环境,其中一个计算机程序充当裁判,以判定一个计划是否有效。目标是观察一个有时能解决这些谜题的大型、昂贵的人工智能模型,是否可以生成一些正确的答案,以及这些特定的答案是否可以用来训练一个更小、更快、且能可靠自主解决这些问题的同类模型版本。
实验始于一个以能够“思考”后再回答而闻名的大型人工智能模型。该模型被给予了一系列移动方块的谜题。它并非每次都能得到正确答案,但在几十次尝试中,它成功生成了一些被裁判程序接受为有效的计划。研究人员提取了这些稀有的成功计划,并将它们作为训练集。目标是教导同一个 AI 模型,但这次是在它不进行思考或推理的模式下,使其能够立即生成那些正确的计划。模型并没有预先获得答案;它只是从那些它自己偶然发现正确解法的几次经历中学习。
当这个经过训练的模型在面对一组从未见过的八十个新谜题进行测试时,结果令人瞩目。未经过训练的模型在不进行思考的情况下求解谜题时,仅成功了一次。而那个被教导过在回答前进行“思考”的模型成功了三十次。但是,那个在“思考版”产生的少量成功计划上进行过训练的模型,则成功了五十七次。它不仅变得更好了,而且在这一特定测试中变得更加可靠。此外,这个经过训练的模型比那个需要时间进行推理的版本运行得更快,且消耗的计算资源更少。它能在 80 个案例中的 57 个中生成有效的计划,而原始的“思考版”在 80 个案例中仅能完成 30 个。虽然训练后的模型效率极高,但研究指出,证明其在修复界面错误方面优于“思考版”模型的特定目标在预注册测试中并未达成,尽管训练后的模型在所有案例中都保持了输出格式的有效性。
为了确保这种进步来自于所选答案的质量,而非仅仅因为拥有更多示例,研究人员进行了第二次测试。他们将生成的有效计划池分为三组:一组由裁判程序选择,一组由模型本身盲目选择,另一组则由一个简单的规则选取第一个可用选项。在由裁判程序选择的计划上进行训练的模型,其表现明显优于在模型自身选择的计划上进行训练的模型。这证明了裁判的判断才是关键因素。模型不仅仅是在向任何成功学习;它是在向那种被独立检查器确认确实正确的特定成功学习。
研究还探讨了当一个更聪明的 AI 模型充当老师时会发生什么。在这种情景下,一个强大的推理模型生成了正确的计划,随后用于训练一个规模较小、能力较低的模型。这个较小的模型取得了显著进步,从只能解决两个谜题提升到了解决八十个中的五十一个。然而,研究人员谨慎地将此与第一个实验区分开来。在第一种情况中,模型利用自身的稀有成功进行自我教学;而在第二种情况中,它则是向一个更优秀的老师学习。两种方法都奏效,但第一种方法表明,只要模型拥有一种验证自身工作的方式,它就可以在不需要更聪明的朋友的情况下实现自我提升。
研究还观察了这种方法的局限性。改进是真实且可衡量的,但并非无限的。当研究人员尝试在模型产生的新成功案例上反复进行训练时,收益最终停止了。模型达到了一个点,即它无法再从现有数据中学习更多信息,这表明在没有新信息的情况下,模型通过自身进行提升存在上限。研究还指出,虽然训练后的模型在遵循特定方块谜题规则方面表现出色,但它并未成为所有规划类型的通用专家。它成为了针对所教特定规则的专家。
这项工作表明,构建既聪明又高效的人工智能系统有一种新的途径。我们不必依赖一个庞大、缓慢的模型来思考每一个问题,而是可以利用一个大型模型去寻找几个正确的解决方案,对其进行验证,然后训练一个更小、更快的模型来复制这种成功。较小的模型成为了处理常规任务快速且准确的专家,而大型模型和裁判程序则为那些需要深度思考的困难案例提供后盾。研究表明,一次成功尝试的记录不仅仅是一份日志;它是一个宝贵的资源,可以转化为一名老师,让机器能够从自身偶尔的卓越表现中学习,并将其转化为一种持久的习惯。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。