← 最新论文
🤖 machine learning

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

本文介绍了卡尔曼引导的提示词选择(Kalman-Guided Prompt Selection, KGPS),这是一种高效的方法,它通过使用卡尔曼滤波器将提示词难度建模为一个动态状态估计问题,从而为强化学习微调自适应地选择最优提示词,进而显著提高训练效率和最终模型性能,且无需额外的采样。

原作者: Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个聪明但有点固执的机器人如何解决复杂的谜题。你拥有一个庞大的谜题库,从“在图片中找猫”到“解决让爱因斯坦都感到困惑的物理问题”应有尽有。如果你给机器人的谜题是它已经解决过一千次的,它会感到厌倦且学不到任何东西。如果你交给它一个极其困难、几乎不可能完成的谜题,它会感到挫败并放弃,同样学不到任何东西。那个“甜点位”(sweet spot)是:谜题要足够难,能让机器人思考,但又要足够容易,让它最终能够解决。这正是大语言模型(LLM)强化学习(RL)的核心挑战:为机器人的当前技能水平找到“金发姑娘原则”(Goldilocks)下的难度水平——即既不过难也不过易,而是恰到好处。

问题在于,机器人在你教学的同时也在进行学习。昨天的难题今天可能就变简单了,而曾经简单的题目可能已经变得过于基础。传统的挑选方法就像使用一张静态地图:它们要么只在开始时猜测一次难度并一直沿用(这很快就会过时),要么测试每一个谜题以确定其难度(这既耗时又浪费时间)。本文介绍了一种更聪明的新方法,旨在让机器人在保持参与感的同时,不浪费哪怕一秒钟的时间。


问题所在:移动的目标

把训练 AI 比作教练一支足球队。在赛季开始时,你的球员在点球练习方面表现很差。这时,你希望把球门设得近一些。但随着球员水平的提高,那些近处的球门就变得太容易了。如果你一直把球门设在那里,他们就会停止进步。如果你突然把球门移到球场的另一头,他们会射失每一个球并感到沮气。

教练们(研究人员)需要一种方法,根据球队当前的表现来不断调整球门的距离。有些教练试图通过让每位球员在每场比赛前进行一次练习射门来测量每个人的技能(这被称为“基于评估”的选择)。这种方法很准确,但它非常耗时,导致球队几乎没时间进行真正的比赛。其他教练则根据直觉或简单的公式来猜测技能水平(这是“基于预测”的方法)。这种方法很快,但他们的猜测经常出错,因为他们假设球员的技能保持不变,而实际上球员每天都在进步。

解决方案:卡尔曼教练

由 Haodong Zhu 及其同事领导的研究团队提出了一种名为 KGPS(卡尔曼引导的提示词选择)的新方法。他们不再仅仅是猜测或测试所有内容,而是将每个谜题的难度视为一个不断变化的移动目标

他们使用了一种名为卡尔曼滤波器(Kalman Filter)的数学工具。要理解这一点,想象你正在追踪一只在迷雾森林中飞行的鸟。你无法完美地看到这只鸟,但你知道它通常飞行的速度以及它通常会如何转向。

  1. 预测: 在看到鸟之前,你根据它上一刻的位置来猜测它现在的位置。
  2. 更新: 当你终于捕捉到鸟的踪迹(即一次“rollout”或测试运行)时,你会调整你的猜测。
  3. 不确定性: 这是最巧妙的部分。如果鸟突然剧烈转向(这发生在 AI 的大脑发生快速变化时),你的猜测就会变得不再确定。你会意识到:“哇,这只鸟的行为变得难以预测了!”于是,你会扩大搜索范围。

在 AI 世界中,“鸟”是指特定提示词(问题或任务)的难度。当 AI 模型学到了新知识并改变了其内部大脑结构时,就会发生这种“剧烈转向”。KGPS 意识到,当 AI 发生巨大变化时,我们对某个问题的旧有猜测可能是错误的。因此,它会自动为该问题的记忆增加“不确定性”。

实际运作方式

系统会对库中的每一个问题保持一种“信念”(belief)。这种信念不仅仅是一个单一的数字(比如“难度为 50%”),而是一个可能性的云团。

  • 如果 AI 一段时间没见到某个问题: 不确定性的云团就会扩大。系统会认为:“我已经很久没检查这个问题了,而且 AI 已经发生了很大变化。也许这个问题现在对 AI 来说正合适!”这自然地让那些被遗忘的旧问题重新回到训练序列中。
  • 如果 AI 刚刚解决了一个问题: 云团就会缩小。系统知道这个问题对于当前版本的 AI 来说到底有多难。
  • 选择: 系统会挑选那些“云团”暗示 AI 最有可能学到新知识的问题——通常是那些处于难度光谱中间位置的问题。

实验结果:更快、更智能

研究人员在一些极具挑战性的任务上测试了这种方法,包括数学问题、规划任务(如数字倒计时)和几何谜题。他们将 KGPS 与“猜测型”教练和“测试一切型”教练进行了对比。

结果令人印象深刻。在一个使用 DeepSeek-R1-Distill-7B 模型的特定数学基准测试中,KGPS 实现了与“测试一切型”方法相同(甚至略好)的最终性能,但它使用的 rollout 次数减少了 83%。用通俗的话说,AI 用极少的工作量就达到了同样优秀的学习效果。

此外,论文表明 KGPS 在预测问题难度方面比之前的“猜测型”方法要准确得多。其他方法的预测误差率约为 0.40,而 KGPS 将其误差控制在约 0.15。这意味着 AI 始终在合适的难度水平上进行练习,而不是在太简单或太难的事情上浪费时间。

为什么这很重要

这篇论文表明,我们不需要浪费大量的计算资源来确定下一步该教 AI 什么。通过将任务难度视为一个随 AI 学习而变化的动态、移动的状态,KGPS 扮演了一个高效教练的角色。它知道何时推动 AI,何时退后,以及何时重新审视旧话题,而无需进行额外的测试。它将 AI 训练这一混沌的过程变成了一段平滑且具有适应性的旅程,证明了只要运用一点聪明的数学,就能让 AI 变得更聪明、更快速、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →