Maximum Likelihood Reinforcement Learning
本文介绍了最大似然强化学习(MaxRL),这是一种通过提供一种在帕累托占优于现有方法并显著提高测试时扩展效率的计算索引目标,从而弥合期望回报强化学习与最大似然之间差距的新型框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的世界里,有两种教导计算机如何思考的主流方式。第一种就像一位严厉的老师,为每一个问题都提供正确答案,让学生能够将自己的作业与标准答案进行对比,并据此调整自己的理解。这种被称为“监督学习”的方法,已经为我们今天使用的最令人惊叹的图像识别器和语言工具提供了动力。第二种方法更像是孩子学习走路:这里没有标准答案,只有环境本身。学习者尝试迈出一步,摔倒,再次尝试,并最终通过感受行动带来的后果来学会平衡。这就是“强化学习”,这种方法旨在处理那些路径并非由数据构成的直线,而是由一系列通向最终结果的选择所组成的情境。多年来,当人工智能系统面临那些唯一的反馈只是在最后给出简单的“是”或“否”的问题时——例如解决数学题或在迷宫中导航——研究人员一直依赖于这第二种方法。他们将问题视为一场最大化奖励的游戏,假设只要人工智能能获得足够的“是”信号,它就能学会成功。
一项新的研究挑战了这一长期以来的假设,表明这种教导这些系统的标准方式实际上是对一个更强大、但此前难以触及的原理的一种粗略近似。这项研究由多所大学的研究人员共同完成,他们发现,当一个人工智能模型生成一个正确答案时,它实际上是在隐性地创造一个成功的概率。在一个理想的世界里,训练模型最好的方式是直接最大化这个概率,即所谓的“最大似然”(maximum likelihood)概念。然而,由于生成答案的过程往往涉及难以被计算机内部数学轻易衡量的不可预测步骤,科学家们被迫使用了强化学习这种“游戏”式的方法。这项新工作证明,这种标准方法仅仅是对真实目标的一个一阶猜测。它忽略了隐藏在模型挣扎但最终成功的那些稀有时刻中的微妙且关键的信息。通过开发一种名为“最大似然强化学习”(Maximum Likelihood Reinforcement Learning,简称 MaxRL)的新型训练框架,该团队找到了一种弥合这一差距的方法,使系统能够以一种此前无法实现的精度从其成功中学习。
这项发现的核心在于计算机如何权衡其错误与胜利。在传统方法中,每当模型产生一个正确答案时,它就会收到一个奖励,系统会调整其内部设置以使该结果变得更可能发生。然而,这种方法对正确答案的处理并不考虑问题的难度差异。如果模型轻松解决了一个简单的谜题和一个复杂的谜题,传统系统给予它们的信用是相等的。新的研究表明,这是低效的。真正的目标是最大化正确的可能性,这在数学上要求系统必须更加关注那些成功率极低的困难问题。标准方法之所以无法做到这一点,是因为它只关注平均成功率。新的框架 MaxRL 通过观察整个尝试的历史记录改变了计算方式。它会问:“如果我们多次尝试这个问题,会有多少次能做对?”通过分析多次尝试中成功的频率,系统可以推断出问题的真实难度,并据此调整其学习过程。
为了测试这一想法,研究人员构建了一个能够模拟这种更高级学习过程的系统。他们创建了一系列可以像调节旋钮一样进行微调的目标函数。在旋钮的一端,系统表现得与当今使用的标准强化学习方法完全一致;在另一端,它表现得像理想的最大似然训练器——这在理论上是完美的,但在实际中通常无法运行。在中间位置,旋钮允许系统利用更多的计算能力,来获得对那个理想目标的更准确的近似。团队发现,随着他们增加用于针对每个问题生成多次尝试的计算量,系统的性能得到了显著提升。这不仅仅是系统变得更加稳定,其学习的本质也发生了变化。它开始集中精力攻克那些旧方法所忽略的难题,从而实现了对任务更深层次的理解。
这种方法的测试结果在各种测试中都非常惊人。在一个研究人员可以直接将新方法与理论上的理想状态进行对比的受控环境中,随着计算能力的增加,新系统紧密贴合了完美训练器的表现。相比之下,标准方法遇到了瓶颈,即使给予海量数据,也无法取得显著进展。当团队转向更复杂的现实场景,如迷宫导航和数学推理时,这种优势变得更加明显。在涉及数学推理的任务中,新方法的效率比当前最先进的方法高出多达二十倍。这意味着,要达到同样的技能水平,新系统所需的尝试次数和计算时间都要少得多。或许最重要的一点是,新方法没有受到经常困扰这些系统的“过拟合”(overfitting)问题的影响——即模型过度学习并记忆训练数据,以至于无法泛化到新的、未见过的场景。当其他方法随着时间的推移,其生成多样化正确解的能力逐渐退化时,新框架保持了健康的答案多样性,这表明它真正学习到了底层的逻辑,而非仅仅是记忆模式。
这项工作的意义不仅在于让人工智能变得更聪明,更在于它改变了我们对机器学习极限的认知。长期以来,在复杂的推理任务上训练这些系统的困难一直被归咎于算法本身或数据的缺乏。这项研究表明,瓶颈实际上在于目标函数——即系统试图实现的数学目标。通过将目标从单纯的“最大化平均奖励”转向“最大化正确性的可能性”,研究人员解锁了一个全新的效率水平。系统不再仅仅是在猜测正确答案,而是在学习理解成功的概率,这种方式镜像了人类如何从罕见且艰难的胜利中学习。研究人员指出,这种方法在存在明确验证方式(如数学或编程)的情况下效果最好,但其原理同样可以应用于其他具有二元结果(binary outcome)的领域。随着人工智能继续应对更复杂、更抽象的问题,从稀疏反馈中进行高效学习的能力将至关重要。这一新框架提供了一条前进的路径,表明通过完善我们定义成功的方式,我们可以教会机器不仅学得更快,而且学得更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。