← 最新论文
💬 NLP

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

该论文提出了探索增强策略优化(EEPO)框架,通过“采样后遗忘”的两阶段机制打破大语言模型强化学习中的主导模式循环,从而显著提升其在推理基准测试中的探索能力与性能。

原作者: Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 EEPO 的新方法,旨在解决大语言模型(LLM)在“强化学习”过程中遇到的一个核心难题:如何在“利用已知经验”和“探索未知可能”之间找到完美的平衡

为了让你轻松理解,我们可以把训练一个数学解题 AI 想象成教一个学生参加数学竞赛

1. 核心问题:学生变成了“复读机”

在传统的训练方法(比如论文中提到的 GRPO)中,老师(算法)会给学生出很多题,让学生尝试不同的解法。

  • 初期:学生很聪明,会尝试各种思路(A 方法、B 方法、C 方法),虽然有些会错,但有些是对的。
  • 中期:老师发现"A 方法”得分最高,于是疯狂表扬 A 方法。
  • 后期(熵崩溃):学生为了拿高分,彻底放弃了 B 和 C,只死记硬背 A 方法。哪怕题目稍微变个花样(比如换个数字或换个问法),学生只会机械地套用 A 方法,结果就错了。

这就是论文指出的“熵崩溃”(Entropy Collapse): 模型变得太自信、太单一,失去了探索新解法的能力,导致它只能解决训练过的题目,遇到新题目就“翻车”。

2. 现有方法的失败:强行“喝兴奋剂”

以前的科学家试图解决这个问题,主要靠两种笨办法:

  1. 提高温度(Temperature):就像给学生喝点“兴奋剂”,让他说话随机一点,不要那么确定。但这就像让一个只会做 A 题的学生,随机乱猜 B 或 C,结果往往是一团糟,或者训练变得极不稳定。
  2. 增加奖励权重:告诉学生“偶尔做对 B 题也要给大奖”。但这就像在泥潭里喊话,学生还是习惯性地往 A 题那个“舒适区”跑,因为 A 题太容易得分了。

比喻:这就像强迫一个只会走直线的机器人去走迷宫,你只是把它的轮子调得松一点(增加随机性),它还是会在原地打转,或者撞墙,因为它潜意识里还是觉得走直线最安全

3. EEPO 的妙招:先采样,再“失忆”

EEPO(探索增强策略优化)提出了一种非常巧妙的"采样 - 遗忘"(Sample-then-Forget)机制。我们可以把它想象成**“分阶段考试 + 临时失忆”**。

具体步骤:

  1. 第一阶段(采样)
    老师先让学生做一半的题目(比如 5 道题)。学生很自然地用了他最擅长的"A 方法”,做对了 3 道。
    此时,学生脑子里全是"A 方法”的记忆。

  2. 中间环节(遗忘/失忆)
    这是 EEPO 的魔法时刻!在让学生做剩下 5 道题之前,老师对学生施了一个**“临时失忆咒”**。

    • 这个咒语专门针对刚才做过的"A 方法”。
    • 它不是让学生变笨,而是暂时把"A 方法”从学生的短期记忆里抹去,让他觉得"A 方法”好像没那么顺手了,或者根本想不起来。
    • 比喻:就像你刚学会一首歌,马上有人把这首歌的旋律从你脑子里“擦掉”了一瞬间,逼着你不得不去哼唱另一首你平时很少哼的曲子。
  3. 第二阶段(探索)
    因为"A 方法”暂时“想不起来”了,学生被迫去尝试"B 方法”或"C 方法”。

    • 结果惊喜地发现:原来"B 方法”也能解题,甚至解得更好!
    • 这样,模型就探索到了以前被忽略的“宝藏路径”。
  4. 最后(复习)
    等这一轮训练结束,老师把“失忆咒”解开,学生的长期记忆(模型参数)还是正常的,但他在这一轮里已经见识了多种解法,变得更加全面和灵活。

4. 为什么这个方法这么牛?

  • 打破死循环:它直接切断了“越做越顺 -> 越顺越只做这个 -> 彻底不会别的”这个恶性循环。
  • 精准打击:它不是盲目地增加随机性(像喝兴奋剂),而是针对性地让模型在“最得意”的时候“忘”一下,逼它走出舒适区。
  • 轻量级:这个“失忆”过程非常快,只发生在做题的当下,不需要重新训练整个模型,所以速度很快,不浪费时间

5. 实验结果:真的有效吗?

论文在五个高难度的数学竞赛数据集(如 AMC, AIME 等)上测试了三种不同的大模型。

  • 结果:EEPO 方法比传统的 GRPO 方法,在解题准确率上平均提升了 10% 到 33%
  • 特别之处:在那些题目稍微变个花样(分布外数据)时,EEPO 的表现尤其好。因为它学会了多种解法,不再死板地套用旧公式。

总结

如果把训练 AI 比作教学生

  • 传统方法是:学生做对了一道题,就让他反复做这道题,直到他变成只会这一招的“做题机器”。
  • EEPO 方法是:学生刚做完一道题,老师就让他“忘”一下刚才的解法,逼着他必须换一种思路去解下一道题。

通过这种"先做,再忘,逼你换思路"的策略,EEPO 成功让 AI 保持了好奇心探索欲,从而在复杂的数学推理任务中表现得更加聪明和灵活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →