← 最新论文
💬 NLP

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

本文介绍了 FREIA,一种新颖的无监督强化学习算法,它利用自由能驱动奖励和自适应优势塑造来动态适应不断演进的推理能力,从而在没有真实标签监督的情况下,在数学推理等任务中超越现有基线。

原作者: Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名学生(一个大语言模型)如何解决复杂的数学问题,但你没有带答案的老师的指导。你无法告诉他们“对”或“错”。你只有学生自己的尝试。这就是无监督学习所面临的挑战。

本文介绍了一种名为FREIA的新方法,旨在帮助这些人工智能学生在不感到困惑或陷入僵局的情况下自主学习。以下是通过简单类比对其工作原理的解释。

问题:“回声室”与“独狼”

当人工智能在没有老师指导的情况下尝试学习时,通常会陷入以下两种陷阱之一:

  1. 回声室(共识陷阱):人工智能将自己提出的问题问了 10 次。如果其中 9 次它回答"4",而 1 次回答"13"(正确答案),它会认为"4"一定是正确的,因为大家都同意了。它忽略了少数派中正确的答案,仅仅因为它不受欢迎。
  2. 独狼(自信陷阱):人工智能对一个错误的答案变得非常自信。由于它感到确信,它便因此奖励自己,即使这个答案是错误的。它会陷入一个“自信地错误”的循环中无法自拔。

现有的方法通常使用“静态”的规则手册。无论人工智能是刚刚起步还是已经身经百战,它们都以同样的方式对待每一种情况。这导致人工智能要么过度探索(浪费时间),要么过早停止探索(陷入僵局)。

解决方案:FREIA(智能教练)

作者创建了FREIA,它就像一个智能教练,会根据学生的表现调整策略。它使用两个主要工具:

1. “自由能”奖励系统(FER)

将其想象为一个动态评分系统,用于平衡两个相互竞争的目标:一致性好奇心

  • 概念:想象人工智能在一个有 100 个人的房间里(这些是它自己生成的答案)。
  • 当房间混乱时(低置信度):如果答案五花八门(有人说 4,有人说 13,有人说 99),人工智能知道它还不知道答案。教练会说:“不要盲目随大流!保持好奇。奖励那些稀有、独特的答案,因为我们需要探索新想法。”
  • 当房间平静时(高置信度):如果 99 个人说"13",只有一个人说"4",人工智能相当确定自己是对的。教练会说:“干得好!坚持多数人的意见。我们不再需要探索了;让我们锁定这个正确答案。”

该系统基于自由能原理,其核心思想可以概括为:“最小化惊讶”。如果人工智能对自己的答案感到惊讶,它就会进行探索;如果它不感到惊讶,它就会巩固其知识。

2. 自适应优势塑造(AAS)

这是学习信号的交通控制器

  • 问题:有时,纯属运气,人工智能会“幸运地”在早期就找到了正确答案,但这只是偶然。如果系统将这种偶然视为巨大的胜利,人工智能可能会过拟合(死记硬背这个偶然事件)并停止学习。
  • 解决方案:AAS 观察奖励的“形状”。
    • 如果奖励呈现奇怪的偏斜(正偏):这意味着有几个巨大的赢家,而大多数是输家。教练会说:“等等,那个巨大的胜利可能只是偶然。让我们降低奖励的幅度,以免你过于兴奋而停止探索。”
    • 如果奖励普遍很高(负偏):这意味着人工智能表现优异,但它可能对自己偶尔犯的小错误过于苛刻。教练会说:“不要为了那一次小错误而对自己太严厉。继续前进。”

为何有效(结果)

研究人员在九个不同的数据集上测试了 FREIA,包括高难度的数学问题、SQL 代码生成和几何学。

  • 类比:想象一场比赛,其他选手因为对地图感到困惑而在原地打转。FREIA 则是那位会查看地图、意识到自己迷路并改变方向以找到正确路径的选手。
  • 结果:FREIA consistently 击败了其他“无监督”方法。在数学任务中,与其他方法相比,它将人工智能的准确率提高了显著幅度(0.5 到 3.5 分)。即使在“多数票”错误的情况下,它也能找到正确答案,而其他方法未能做到这一点。

总结

FREIA 是一种人工智能自我学习的新方式。它不再盲目随大流或盲目信任自己的自信,而是利用一个智能、自适应的系统,知道何时该保持好奇,何时该果断决策。它防止人工智能陷入坏习惯,并帮助它在没有任何人(没有人类教师)告知答案的情况下找到真理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →