CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
该论文介绍了 CEDAR-GRPO,这是一个过程感知的强化学习框架,它通过将最终答案的正确性与溯因奖励相结合,增强了大语言模型的通用溯因推理能力,并且与基座模型及仅基于正确性的训练相比,在 11 个未见任务上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广阔领域中,研究人员一直在努力教机器如何像人类一样思考,而不仅仅是预测句子中的下一个词。人类思维中最具人性化的一种方式被称为溯因推理(abductive reasoning)。这是一种观察一组线索或现象,并向后推导以寻找最可能解释的心理过程。医生根据几个症状判断患者出了什么问题,侦探根据零散的证据重建犯罪现场,或者工程师诊断突然停止工作的机器,都是这种思维方式。长期以来,科学家们一直难以让大型语言模型很好地完成这项任务。虽然这些模型在召回事实或遵循严格逻辑规则方面表现出色,但在被要求从不完整的信息中推断隐藏原因时,它们往往会出错。它们往往会因为错误的原因猜对答案,或者编造听起来合理但并不符合所提供证据的事实。
来自谢里夫理工大学和德黑兰大学的一个研究小组致力于解决这个问题。他们想知道是否可以训练这些人工智能模型,使其在处理新的、未见过的难题时,能更好地进行溯因推理,而不仅仅是死记硬背训练过的特定谜题。他们开发了一种名为 CEDAR-GRPO 的新训练方法。该方法并非仅仅奖励模型得到正确答案,而是设计了一个同时奖励模型“如何得出答案”的系统。该系统会对模型的思维过程检查两个具体方面:首先,模型是否真正查看并解释了所提供证据中的每一个细节;其次,模型的推理方向是否正确,即是否从观察出发并构建出结论,而不是先有了结论再试图让证据去适应它。
为了测试这一点,研究人员选取了四种不同的开源语言模型,并在一组精心混合的任务上对它们进行了训练。这些任务涵盖了从为短篇故事选择最佳解释,到编写解释数据模式的代码等各种内容。至关重要的是,他们不仅仅向模型展示答案;他们使用了一种强化学习技术,就像教练一样,根据模型的推理步骤给予反馈。模型学到了,如果忽略了关键细节或逻辑颠倒,仅仅得到正确答案是不够的。训练完成后,研究人员在十一个完全不同的、模型从未见过的任务上对它们进行了测试。这些新任务范围广泛,包括诊断医学状况、调试计算机代码、破解复杂谜团以及理解冗长复杂的故事情节。
结果显示,各项指标均有明显提升。使用这种新方法训练的模型,其表现优于原始版本,也优于那些仅以获得最终正确答案为目标的模型。平均而言,新方法比原始模型提高了 7.4 个百分点,比仅针对正确性进行训练的模型提高了 2.7 个百分点。在某些特定情况下,提升幅度高达 30.8 个百分点。更重要的是,研究人员分析了模型在思考时生成的实际文本。他们发现,经过训练的模型表现得更像细心的调查员。它们更有可能在定论之前探索不同的可能性,明确排除错误的观点,并在不确定时承认自己的不确定。它们还表现出一种更强的习惯,即将结论直接与给定的具体事实联系起来,而不是依赖模糊的假设。
该研究还排除了几种其他的成功解释。研究人员证明,这种进步并非仅仅因为模型看到了更多示例,也不是由于通用推理能力的普遍提升。当他们使用相同数量的非侧重于溯因任务的通用推理数据来训练模型时,模型在特定的测试中并没有表现出同等程度的提升。这表明,对模型推理过程进行特定方式的奖励才是关键因素。研究结果表明,溯因推理可以作为一种可以跨领域迁移的通用技能得到加强,而不仅仅是仅适用于特定类型谜题的狭隘技巧。通过教导模型尊重证据并遵循从观察到解释的逻辑路径,研究人员在创造能够真正理解并解释周围世界的智能方面,迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。