Steering Recurrent Reasoners at Inference Time with Readout Feedback
本文介绍了读取反馈(Readout Feedback, RoFB),这是一种无需训练的推理时方法,它通过利用中间读取概率来引导潜变量动力学,从而提升循环推理模型的性能,在数独和迷宫等任务上取得了优于单纯增加计算步数或采样多条轨迹的结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在构建能够思考的机器的过程中,研究人员长期以来一直依赖一个简单的原则:给计算机更多的时间,它很可能会找到更好的答案。正如人类数学家可能会停下来完善证明,或者国际象棋选手在片刻反思后重新考虑走法一样,现代人工智能系统也越来越多地被设计为能够停顿、重新考虑并进行迭代。这种被称为“推理时计算”(inference-time computation)的方法,允许模型生成多条可能的推理路径,评估它们,并选择最有希望的一条。虽然这种策略已被证明对大语言模型非常有效,但另一类机器——循环模型(recurrent models)——则是基于略微不同的逻辑运行的。这些系统通过反复更新其内部状态(一种类似于心理草稿本的东西)来解决问题。它们不是生成许多独立的草稿进行比较,而是通过不断迭代,逐步完善一个单一且不断演进的思维过程。悬而未决的问题在于,这种单一的思维线索是否可以在发生过程中得到更有效的引导,而不仅仅是任其自然运行或尝试许多不同的起点。
东京大学的一个研究小组提出了一种实时引导这些内部思维过程的新方法。他们将这种方法称为“读出反馈”(Readout Feedback),这是一种倾听模型自身中间猜测,并利用这些信息轻轻推动其内部状态向正确解靠拢的技术。其核心思想出奇地直观:随着模型越来越接近解决谜题,它对问题不同部分的内部表示会开始自我组织。属于同一类别的项会自然地聚集在一起,而属于不同类别的项则会相互远离。研究人员发现,他们可以检测到这种组织模式,并向系统中注入一种微妙的力量来鼓励这种模式,从而有效地帮助模型在无需重新训练或增加计算能力的情况下走出困惑。
为了测试这个想法,该团队将这种方法应用于三种具有独特内部架构的不同类型的循环推理模型,并要求它们解决两个经典的逻辑谜题:数独(Sudoku)和迷宫(Maze)。在数独中,目标是用数字填满网格,使得每一行、每一列和每一个区域都包含从一到九的所有数字。在迷宫任务中,模型必须在充满障碍物的网格中找到最短路径。研究人员让这些模型经历其标准的求解过程(涉及数百次更新其内部状态),然后将标准过程与经过其新反馈循环增强后的过程进行了对比。他们发现,在六种模型与谜题的组合中,有四种情况下的反馈方法产生了显著更好的结果。在某些情况下,改进后的模型解决谜题的准确度,是标准模型即使被允许运行更长时间或尝试数十个不同起点也无法达到的水平。
这种性能提升背后的机制依赖于模型自身的置信度。随着模型处理谜题,它在每一步都会为每个可能的答案生成一个概率。研究人员观察到,当模型陷入困境或徘徊不定时,这些概率是混乱且无结构的。然而,当模型即将得出解决方案时,正确答案的概率会开始趋于一致,形成清晰的模式。这种新方法利用了这一模式。在求解过程中的特定时刻,它会计算不同部分谜题之间概率模式的距离。如果两个部分的谜题被预测具有不同的答案,系统就会施加一个力,将它们的内部状态推开;如果预测它们相同,则鼓励它们保持靠近。这创造了一种自我修正的动态机制,帮助模型逃离死胡同,并更快地收敛到正确的解。
结果显示出惊人的特异性。对于其中一个专为复杂推理设计的紧凑型系统,反馈方法将其在数独上的成功率从大约百分之六十八提高到了百分之七十四以上,这是一个在不改变模型底层代码或训练数据的情况下实现的实质性提升。对于另一个处理迷宫谜题的模型,该方法使其能以比标准方法更少的计算步骤达到高水平的准确度。事实上,改进后的模型有时甚至优于标准模型,即便标准模型被允许运行数百个额外的步骤或采样数十条潜在路径。这表明,提升性能的关键不在于仅仅做更多的功,而在于通过积极引导系统的内部动力学来做正确方向的功。
然而,研究人员谨慎地指出,这种方法并非万能药。在六个测试案例中有两个案例中,反馈循环没有产生可衡量的收益,而在一个特定实例中,由于模型本身已经处于近乎完美的水平,该方法几乎没有产生影响。这表明,当模型具备解决问题的能力但难以有效组织其思维时,该技术效果最好。当模型已经高度自信,或者问题的内部结构不具备这种聚集特性时,反馈信号就很难发挥作用。这项研究表明,虽然这种方法释放了现有模型的隐藏潜力,但它并不是一种可以解决所有类型推理问题的魔杖。
这项工作的意义超越了仅仅解决谜题。它为如何控制人工智能在思考过程本身提供了新的视角。与其仅仅依赖暴力手段——增加步骤或采样更多选项——这种方法证明了模型可以通过其自身的中间信号来进行引导。这类似于一个人在解决复杂问题时,如果卡住了,不会从头开始,而是停下来查看当前的笔记,意识到哪些逻辑存在冲突,并据此调整自己的思路。研究人员发现,这种闭环控制可以应用于“冻结”的模型,这意味着只需在求解阶段添加一层反馈,即可应用于那些已经完成训练且不再学习的系统。
尽管目前的研究局限于特定类型的逻辑谜题和较小规模的模型,但其发现为未来推理系统的发展指明了一个充满希望的方向。作者承认,将这种技术应用于处理庞大词汇量和复杂人类语言的大语言模型将是一个巨大的挑战,并且可能需要不同的适配方式。尽管如此,在这些结构化任务上的成功有力地证明了推理模型的内部动力学中蕴含着尚未被充分利用的潜力。通过倾听模型自身的声音并利用它来引导旅程,研究人员找到了一种让这些系统思考得更有效的方法,证明了有时提高机器推理能力的最佳方式不是教给它更多知识,而是帮助它倾听自己。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。