Understanding Curriculum Learning in Large Language Models via Cross-Difficulty Optimization Dynamics
本文引入了相对迁移(Relative Transfer)作为一种原则性的度量,用以解释课程学习在大语言模型中有效性差异的原因,并提出了迁移感知动态课程采样(TDCS),这是一种根据跨难度迁移关系动态调整数据采样的方法,在多种推理任务和模型规模下均能一致地优于现有的调度策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,研究人员正不断尝试教导被称为“大语言模型”的海量计算机程序去解决复杂的难题,如数学谜题、编程挑战和逻辑谜题。为了实现这一目标,他们向模型输入了海量的训练数据。多年来,一个流行的想法是将这些数据像学校课程表一样进行组织:从最简单的例子开始,逐渐引入更难的例子。这种被称为“课程学习”(curriculum learning)的方法假设,正如人类学生通过在攻克难题前掌握简单概念来更好地学习一样,机器也应该遵循同样的路径。然而,当科学家将这种方法应用于不同类型的推理任务时,结果却令人困惑。有时,“由易到难”的方法效果显著;而有时,它表现得并不比随机猜测好多少,甚至更糟。这种不一致性引发了一个根本性的问题:为什么一种在某种情况下运作良好的策略,在另一种情况下却会完全失败?
复旦大学的一个研究小组致力于通过观察模型在学习过程中其“大脑”内部发生了什么,来解开这个谜团,而不仅仅是观察进度表本身。他们发现,课程学习的成功完全取决于模型如何将从一类问题中学到的知识转移到另一类问题中。想象一下一个学生学习骑自行车;如果掌握自行车能立即帮助他们学习骑摩托车,那么课程的顺序就不那么重要了。但如果学习自行车反而会在他们尝试摩托车时让他们感到困惑,那么课程的顺序就变得至关重要。研究人员发现,对于某些任务(如解决数独谜题),学习最难的例子会自动提高模型解决最简单例子的能力。而对于其他任务(如编写代码或解决特定的数学应用题),学习最难的例子对帮助解决较容易的例子几乎没有作用,有时甚至会产生干扰。
为了理解这一现象,该团队开发了一种衡量不同难度水平之间知识“转移”的方法。他们观察到,当模型练习一项困难的任务时,它会在其内部设置中产生一种特定的变化模式。研究人员测量了这种模式在多大程度上有助于或损害了模型在较容易任务上的表现。他们发现,在数独任务上,最难的问题为较容易的问题提供了强力的正向推动,这意味着模型可以安全地只专注于困难的例子。相比之下,在代码生成等任务上,最难的问题对较容易的问题几乎没有帮助,且仅仅专注于这些困难例子会导致模型忘记如何处理简单的案例。这解释了为什么固定的“由易到难”进度表在某些任务上会失败:它迫使模型忽略了那些它仍需练习的简单例子,因为困难的例子并没有承担起它们应有的支撑作用。
凭借这种理解,研究人员创建了一种名为“转移感知动态课程采样”(Transfer-aware Dynamic Curriculum Sampling)的新方法。该系统不再遵循一个从易到难的僵化计划,而是像一位实时观察模型的聪明教练。它不断检查当前的困难例子是否正在有效地帮助模型处理较容易的例子。如果困难的例子提供了强有力的推动,系统就会让模型专注于它们。如果这种推动微弱或为负向,系统会自动混合更多的简单例子练习,以保持这些技能的敏锐度。这种方法使得训练策略能够根据特定任务的性质进行调整,而不是强行将所有任务都套入同一个模具。
这种新方法的测试结果非常惊人。在三个不同的推理基准测试(数独、代码生成数据集和数学推理数据集)中,该方法始终优于所有标准策略。在数独任务上,它比最好的固定进度表显著提高了准确率。在代码生成任务上,它也取得了最高分,证明了模型受益于重新练习较简单的例子,而不是直接冲向最难的例子。或许最重要的是,该方法在不同规模的模型上都有效,从拥有 15 亿参数的小型模型到拥有 70 亿参数的模型,甚至在模型利用自身生成的答案进行自我教学时也是如此。
这项研究表明,对于所有的人工智能任务,并不存在一种单一的“最佳”组织训练数据的方法。课程的有效性不是一个普遍规律,而是知识在特定任务的不同难度水平之间流动的特定属性。通过测量这种流动并据此调整训练组合,研究人员得以创造出一个更稳健、更高效的学习过程。这项工作使该领域超越了简单的试错法,为某些训练进度之所以成功或失败提供了一个清晰、可衡量的理由。它为课程学习多样化的表现提供了一个统一的解释,并为构建更好、更具适应性的人工智能系统提供了一个实用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。