Recursive Agentic Reasoning
本文引入了一个由三种递归推理算子(GROW、PRUNE 和 BRANCH)组成的统一框架,并通过广泛的评估证明,在多种模型和基准测试中,重复分支(branching)始终优于其他测试时推理方法,同时也强调了配对评估协议对于避免误导性比较结论的关键重要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当计算机程序试图解决一个难题时,它通常会产生单一的思维线索,即一段通向答案的文字序列。多年来,研究人员一直想知道,给予这些程序更多的时间和更多的尝试是否会使它们变得更聪明。与其接受第一个答案,我们是否可以要求计算机重试,或者将问题分解成较小的部分,亦或是生成几种不同的解决方案并从中挑选出最好的一个?这个问题处于现代人工智能研究的核心。目前,该领域充满了许多不同的策略,旨在通过投入额外的计算能力来提高推理能力。有些方法要求模型完善自己的答案,有些要求它将复杂的任务分解为一系列简单的步骤,还有一些则要求它生成许多独立的尝试并对结果进行投票。由于这些方法此前都是在隔离状态下进行的测试,使用了不同的测试题和不同的评分规则,因此无法得知在计算预算相同的情况下,哪种策略实际上效果最好。
一个研究小组致力于通过将这些不同的策略视为单一过程的变体来解决这一争论:即“递归”,或者说系统调用自身来解决问题的行为。他们定义了计算机进行此类操作的三种不同方式。第一种他们称之为“生长”(grow),涉及获取单一的推理路径并要求计算机不断扩展它,即反复完善同一条路径。第二种“剪枝”(prune),涉及要求计算机将一个难题分解为一系列有序的小问题,逐一解决它们,然后将答案重新缝合在一起。第三种“分支”(branch),涉及要求计算机同时生成五个完全不同的解决方案,然后选择其中出现频率最高的那个。为了确保公平比较,研究人员在完全相同的题目集上,使用完全相同的计算机模型,运行了这三种方法以及标准的单次尝试法。他们在五种不同类型的挑战中测试了这些方法,其范围从复杂的步进式逻辑谜题到研究生级别的学术问题,并使用了三种最先进的可用人工智能模型。
这项受控实验的结果清晰且有些令人惊讶。生成多个解决方案并对最佳方案进行投票的策略,即“分支”法,在他们运行的所有测试用例中都提高了答案的准确率。平均而言,这种方法比标准的单次尝试提高了近六个百分点的正确率。相比之下,另外两种方法的表现并不稳定。“生长”法(即深化单一路径)在大多数情况下提高了性能,但在解决某些类型的难题时实际上让计算机的表现变差了。“剪枝”法(即分解问题)仅显示出微小的提升,且这种提升往往与随机噪声无法区分。数据表明,没有必要建立一个复杂的系统来决定针对哪个问题使用哪种方法;那个仅仅尝试多条路径并选取共识获胜者的简单方法,在全局范围内都是更优的选择。
研究人员进行了深入研究,以理解为什么这种投票法如此有效,并发现其原因并非如大多数人所预期的那样。普遍观点认为,生成多个答案之所以有帮助,是因为它允许计算机探索许多不同的逻辑路径,并在其中找到正确的路径。然而,数据表明,主要的益处来自于另一个来源:从失败中恢复。当这些先进的计算机模型被要求进行长时间思考时,它们往往会在完成书写答案之前就耗尽了分配给它们的内存空间。在单次尝试中,这会导致一个空白响应,从而被计为一个错误答案。但当计算机被要求尝试五次时,这五次尝试都在同一时刻失败的概率是非常低的。投票系统会自动丢弃空白答案,并从成功的尝试中选择一个有效的答案。研究人员发现,标准方法未能产生答案的频率与投票法提升得分的程度之间存在强关联。在最难的测试中,投票法将空白、失败答案的比例降低了一半。
这一发现改变了我们看待如何让人工智能变得更聪明的方式。它表明,要求计算机尝试多次所带来的大部分收益,仅仅是由于它从技术限制中恢复了原本会丢失的答案。研究人员还强调了一个对于未来研究至关重要的教训:你如何统计结果至关重要。在最初的分析中,他们发现如果将失败的网络连接或超时计为错误答案,那么投票法在某些任务上的表现看起来会变差。这是因为投票法进行了更多的尝试,因此它更有可能遇到技术故障。通过严格地仅在所有方法都成功回答的问题上进行比较,研究人员揭示了真实的性能。他们的工作证明,对于当今最强大的模型而言,最可靠的获得更好答案的方法,就是采用尝试多次并选取共识的最简单策略;而这种增益很大程度上来自于确保计算机完成其思考过程,而非找到了更巧妙的解题路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。