← 最新论文
💻 computer science

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA(解耦重要性采样锚定)是一种新颖的离线分布匹配强化学习方法,它通过重要性采样预先计算并冻结配分函数估计以消除校准误差,从而使大语言模型能够学习到多样化的解决方案策略,这些策略的表现优于奖励最大化基线方法和在线耦合分布匹配方法。

原作者: Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位天才学生(一个人工智能)如何解决一道难题或编写一段代码。目标不仅仅是获得一个正确答案,而是要教会这位学生想出多种不同且有效的解决方案来解决同一个问题。这至关重要,因为在现实世界中,通往成功往往有多条路径,拥有多种选择能使学生更具稳健性和创造力。

然而,训练这些 AI 学生的标准方法(称为“奖励最大化”)存在一个缺陷:它就像一位只表扬学生给出的第一个正确答案的老师。一旦学生找到了一个“足够好”的解决方案,老师就不再鼓励他们尝试其他方法。学生因此陷入死胡同,反复重复同一条路径,即使存在其他同样有效的路径。这被称为“模式崩溃”。

为了解决这个问题,研究人员开发了一种名为分布匹配(Distribution-Matching)的方法。这种方法不再仅仅追逐最高分,而是试图教导学生去匹配一个包含所有可能正确解决方案的特定“理想地图”。这就像给学生一张展示通往宝藏的所有有效路线的地图,而不仅仅是老师碰巧首先选择的那一条。

问题:“在线”地图是破碎的

这种“分布匹配”方法的棘手之处在于计算地图本身。要知道每一个可能解决方案的概率,你需要一个称为配分函数(Partition Function)的数学值。

以前的方法试图在学生解决问题的同时学习这张地图。这就像试图在蒙着眼睛开车穿过城市的同时绘制城市地图,并猜测街道在哪里。因为地图是在行进中猜测的,地图中的错误会与驾驶指令混在一起。学生因此感到困惑,无法判断他们失败是因为驾驶技术差,还是因为地图错了。

解决方案:DISA(“离线”地图)

这篇论文介绍了DISA(解耦重要性采样锚定)。作者意识到,“地图”(即配分函数)实际上并不依赖于学生当前的驾驶技能;它仅取决于问题本身和游戏规则。

因此,他们将过程改为三个清晰的步骤:

  1. 阶段 1:“超级专家”探索(离线)
    在学生开始学习之前,研究人员聘请了一位“超级专家”AI(一个更大、更智能的模型)来探索问题空间。这位专家生成了数千种不同的解题尝试。利用一种称为重要性采样(Importance Sampling)的统计技巧,他们利用这些专家的尝试计算出了一份高度准确、预先计算好的所有可能解决方案的地图。

    • 类比: 在学生参加考试之前,一支顶尖数学家团队用 1000 种不同的方法解决了这个问题,并写下了一本包含所有解决方案的完美详细指南。
  2. 阶段 2:“作弊条”创建
    研究人员将那本庞大的指南压缩成一张小巧、易读的“作弊条”(一个简单的数学函数),可以立即告诉你任何给定问题的地图长什么样。

    • 类比: 他们将 1000 页的指南总结成一张完美的索引卡,可以放在学生的口袋里。
  3. 阶段 3:学生学习(在线)
    现在,学生开始训练。关键在于,“作弊条”是冻结的。它不能改变。学生尝试解决问题,老师使用固定的作弊条来检查学生是否正在探索正确多样的解决方案。

    • 类比: 学生拿着索引卡参加考试。老师在评分时不会试图重绘地图;他们只是检查学生的答案是否与预先批准的地图匹配。如果学生犯了错,那显然是学生的错,而不是地图的错。

为什么这效果更好

通过将制图与学习分离开来,DISA 避免了旧方法的混乱。

  • 不再混淆:学生从稳定、准确的目标中学习。
  • 更多创造力:因为目标包含了所有有效路径(而不仅仅是最容易的那一条),学生学会了生成多样化的解决方案。
  • 更好的结果:在数学和编程基准测试中,DISA 的表现与现有最佳方法相当甚至更好。它特别擅长生成多个正确答案(通过"pass@16"衡量,即检查 16 次尝试中是否有任何一次是正确的),而其他方法往往只停留在一种类型的答案上。

总结

DISA 就像在课程开始之前聘请专家团队编写一本完美的教科书,而不是在学生参加考试时试图编写教科书。这确保了学生能学到多样化的技能,而不仅仅是死记硬背通往答案的单一、狭窄的路径。该论文表明,这种“离线优先”的方法能带来更智能、更多才多艺的 AI 智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →