← 最新论文
💬 NLP

DARC: Decoupled Asymmetric Reasoning Curriculum for LLM Evolution

DARC 是一个两阶段、模型无关的框架,通过解耦难度校准提问者(Questioner)与非对称自蒸馏求解器(Solver)的训练,使大语言模型(LLM)的自我演进趋于稳定,并在不依赖人工标注的情况下,在推理基准测试中实现了显著的性能提升。

原作者: Shengda Fan, Xuyan Ye, Yankai Lin

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengda Fan, Xuyan Ye, Yankai Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人如何解决复杂的谜题。你有两个机器人:一个是提问者(负责创建谜题),另一个是求解者(负责尝试解决谜题)。

目标是让这两个机器人互相学习,在没有任何人类帮助的情况下变得更聪明。这被称为“自我博弈”(self-play)。然而,这篇论文指出,旧的方法就像一场混乱的舞蹈,舞伴们不断地踩到对方的脚,导致混乱和停滞不前。

以下是这个新方法 DARC 如何通过一个简单的两步课程来解决这个问题的。

问题所在:“移动目标”之舞

在以往的方法中,提问者和求解者是紧密耦合的,会根据对方最新的表现不断变化。

  • 问题: 想象提问者试图创建一个对于求解者当前技能水平来说“刚刚好”的谜题。但只要求解者稍微变强一点,提ло提问者心中“刚刚好”的标准就又变了。提问者一直在追逐一个移动的目标。
  • 结果: 机器人变得困惑。谜题的难度在“太简单”和“太难”之间剧烈波动,求解者开始从自己的错误中学习(就像一个学生抄袭了朋友的错误答案,然后又把这个答案教给另一个学生)。这导致了一个不稳定的训练过程,使得机器人停止进步甚至退步。

解决方案:DARC(解耦非对称推理课程)

作者建议将这场舞蹈拆分为两个独立的、稳定的阶段。可以将其理解为将课程设计者学生分离。

第一阶段:课程设计者(提问者)

提问者不再通过观察求解者的表现来决定问什么,而是使用固定的地图(一个外部文档库)和一个明确的目标(特定的难度等级,如“简单”、“中等”或“困难”)。

  • 类比: 想象一位拥有教科书和评分标准的老师。他们根据教科书编写出一道专门设计为“中等难度”的测试题,而无需观察学生的当前表现如何。
  • 益处: 问题是稳定且有据可依的。难度是由老师控制的,而不是由学生波动的表现决定的。

第二阶段:学生(求解者)

现在,求解者在第一阶段创建的问题上进行训练。但这里有一个巧妙的转折:非对称自我蒸馏(Asymmetric Self-Distillation)

  • 设置: 求解者实际上是它的两个版本。
    1. 特权教师: 这个版本可以看到问题以及来源文档(教科书)。它解决问题并对正确答案进行投票。
    2. 学生: 这个版本只能看到问题。它必须在不看教科书的情况下解决问题。
  • 类比: 想象一位大师级厨师(教师)拥有所有的食材和食谱。他烹饪了一道菜并说:“这是完美的味道。”然后,一名学生厨师(学生)只得到了这道菜的描述,必须凭借记忆和技巧去重现它,而看不到食材。学生通过尝试匹配大师的结果来进行学习。
  • 益处: 因为“教师”拥有原始资料,所以答案是高质量的,不太可能出错。学生学会了仅凭问题本身来解决问题,从而防止了它只是死记硬背教科书或复制错误。

为什么有效(结果)

论文在各种 AI 模型(如 Qwen 和 LLaMA)以及数学和通用推理任务上测试了这种方法。

  • 稳定性: 与混乱的“移动目标”之舞不同,这种方法非常平稳。训练奖励稳步上升,没有出现崩溃。
  • 性能: 机器人的表现显著提升。与初始版本相比,它们在推理测试中平均提高了 10.9 分
  • 无需人类: 它们在没有任何人类编写的答案或标签的情况下实现了这一点。
  • 击败竞争对手: DARC 的表现优于其他“自我教学”方法,甚至接近了那些使用大量人工标注数据进行训练的模型。

核心要点

  1. 解耦是关键: 将问题的创建与问题的解决分离,可以防止“移动目标”问题。
  2. 非对称性提供帮助: 一个拥有来源文档访问权限的“特权”教师,为没有这些权限的学生创造了更好的训练标签。
  3. 这是一个课程: 系统将学习过程组织为从易到难,就像一个好的学校教学大纲一样,而不是随机抛出问题给 AI。

简而言之,DARC 就像是给 AI 提供了一个由严厉老师设计的、结构化且可靠的学校课程,而不是让它试图通过一场混乱、不协调的自我捉迷藏游戏来进行学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →