← 最新论文
🤖 AI

MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop

该论文介绍了 MulFeRL,这是一个多轮强化学习框架,它通过将失败样本上的丰富口头反馈转化为可训练的学习信号来增强推理能力,从而在领域内和领域外任务中均优于现有的监督学习和 RLVR 基准。

原作者: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 MulFeRL 论文的解释,已将其转化为通俗易懂的语言并辅以创意类比。

问题所在:AI 的“沉默失败”

想象一下,你正在教一名学生解决复杂的数学题。你给了他们一份测试卷,结果他们答错了。

在标准的 AI 训练(称为 RLVR)中,老师只会说:“错误。” 就这样。没有解释,没有提示,只有一个零分。

  • 问题在于: 如果学生做错了 100 道题,他们会得到 100 个“错误”的分数。他们完全不知道自己为什么失败了。是因为加法算错了?还是理解错了题目?或者是漏掉了某个步骤?
  • 结果: AI 会陷入停滞。它会不断进行随机猜测,因为其“学习信号”(反馈)过于稀疏且毫无帮助。这就像学开车时,只有在你撞墙时才被告知“撞车了”,却从未有人告诉你是因为你忘了看后视镜。

解决方案:MulFeRL(“带着剪贴板的教练”)

研究人员提出了 MulFeRL(多轮反馈引导的强化学习)。这个系统不再只是简单地说“错误”,而是扮演一个严厉但乐于助人的教练,提供具体的口头建议。

以下是它的工作原理,分步详解:

1. “全军覆没”的陷阱

通常情况下,如果 AI 尝试解决一个难题并失败了,训练就会停止。因为没有“正确”的答案可以与“错误”的答案进行对比,训练循环就会中断。

  • MulFeRL 的应对策略: 当 AI 完全失败时,系统不会放弃。它会暂停并请求一个“反馈提供者”(比如聪明的人类或更强大的 AI)来观察这一团乱麻。

2. “口头反馈”(教练的笔记)

反馈提供者不会只说“错误”。它会写下一段话:

  • “你尝试使用勾股定理,但你忘了先对数字进行平方运算。”
  • “你在第 3 步漏掉了一个负号。”
    这就是口头反馈。它将模糊的失败转化为了具体的教训。

3. “再生”(重来一次)

现在,AI 有了第二次机会。它带着原始题目加上教练的笔记,再次尝试解决问题。

  • 神奇之处: 如果 AI 正确使用了这些笔记,它最终可能会得到正确答案。
  • 功劳归属: 系统现在知道了:“啊!当我们给 AI 关于平方运算的具体提示时,它成功了。” 这将“失败”转化为了可以从中学习的“成功”。

4. 两种学习方式(计分卡)

论文介绍了两种特定的评分方式:

  • 场景 A:“好坏参半”(GRPO)
    有时,在获得笔记后,AI 会尝试 8 次。其中一些尝试仍然是错误的,但另一些是正确的。

    • 类比: 这就像一支运动队,有些球员失误了,但其他球员表现出色。教练可以说:“看看那些成功的球员,模仿他们的动作。” AI 通过将自己的“好尝试”与“坏尝试”进行对比来学习。
  • 场景 B:“彻底扭转”(FCO)
    有时,由于笔记非常出色,所有 8 次尝试都变得正确了。

    • 类比: 整个队伍突然表现完美。在标准训练中,这会让人感到困惑,因为没有“坏例子”可以用来对比。
    • MulFeRL 的妙招: 它观察前后对比。它将“之前”(所有人都在失败)与“之后”(所有人都在成功)进行对比。它告诉 AI:“还记得你之前是怎么失败的吗?还记得拿到笔记后你是如何成功的吗?多做更多‘之后’版本的行为。” 这被称为反馈对比优化(FCO)

5. “固定槽位”(便利贴)

为了确保 AI 真的阅读了笔记,MulFeRL 并没有简单地把反馈粘贴在页面底部。它将反馈放在一个固定的、特殊的框内(类似于 <feedback> 标签),直接置于思考过程的正中间。

  • 类比: 这就像学生在计算器上贴了一张便利贴,上面写着“检查正负号!”,而不是在每周收到成绩单时才去读报告。这迫使 AI 在工作过程中必须关注这些建议。

为什么这很重要

论文表明,通过使用这种“带着剪贴板的教练”的方法:

  1. 它解决了“沉默失败”问题: 它找到了一种方法,即使 AI 最初完全失败,也能从中学习。
  2. 它学习得更快: AI 进步得更快,因为它得到了关于如何修正错误的具体指令,而不仅仅是一个分数。
  3. 它具有迁移性: 尽管它是针对数学问题进行训练的,但它在科学和通用推理任务上也表现得更好,这证明它学到的是一种更好的思考方式,而不仅仅是记住了数学答案。

总结

MulFeRL 是一种让 AI 在失败时不会陷入僵局的方法。它不再忽略失败的尝试,而是利用口头反馈来引导 AI 再次尝试。随后,它不仅奖励 AI 得到正确答案,还奖励 AI 根据反馈进行改进。它将“我失败了”转化为“这是我如何修复它的”,使学习过程更加丰富且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →