← 最新论文
🤖 machine learning

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

本文表明,将一种源自预训练隐藏状态的简单、基于表示的多样性奖励同时引入推理时采样和训练后强化学习中,通过促进对新颖行为的发现而非仅仅是对现有行为的精炼,显著提升了语言模型的性能和样本效率。

原作者: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不再仅仅是遵循指令,而是真正学会独立思考,通过尝试、失败并再次尝试来解决谜题和编写代码的世界。这就是**强化学习(Reinforcement Learning, RL)**的领域——这是人工智能的一个分支,其中智能体通过与环境交互以最大化奖励来进行学习。把它想象成训练一只狗:如果它坐下,它会得到零食;如果它跳起来,它什么也得不到。随着时间的推移,狗会学会通过哪些最佳行为来获得最多的零食。

在大型语言模型(我们今天使用的超智能 AI 聊天机器人)的世界中,这个过程被称为“后训练”(post-training)。科学家们给模型喂入一道数学题或一个编程任务,让它生成答案,并检查其是否正确。如果正确,模型就会获得“奖励”,并学习下次如何更好地完成这项特定任务。然而,这里有一个陷阱。目前的方法往往像是一个仅仅死记硬背教科书答案的学生。它们在自己已经掌握的特定技巧上变得非常精通,但很少能发现新的解决问题的方法。它们只是在让已有的技能变得更加锐利。科学家们提出的重大问题是:我们能否教会这些 AI 模型成为好奇的探索者,而不仅仅是记忆者?我们能否鼓励它们尝试奇特、新颖且多样化的方法,从而找到其基础训练从未向其展示过的解决方案?

这篇题为《基于表示的语言模型探索》(Representation-Based Exploration for Language Models)的论文,深入探讨了正是这样一个问题。研究人员 Jens Tuyls、Dylan J. Foster、Akshay Krishnamurthy 和 Jordan T. Ash 提出了一种巧妙的新方法来让 AI 模型进行探索。他们没有仅仅让模型随机猜测或简单地重复已知内容,而是给了模型一个“多样性奖励”。想象一下你正在一片巨大的森林中寻找隐藏的宝藏。一个随机漫步者可能会到处乱撞,而一个聪明的漫步者可能会尝试访问每一种不同类型的树木,以确保自己不会错过任何线索。这篇论文建议使用 AI 自身的内部“思想”(其隐藏状态)来衡量一个新想法与其已经尝试过的想法相比有多么不同。如果一个想法相对于其之前的尝试显得“新鲜”或“新颖”,它就会获得额外的奖励,从而鼓励模型继续探索那条新的路径。

团队通过两种主要方式测试了这个想法。首先,他们研究了“推理时”(inference-time)探索,这就像是一次性的测试。他们针对单个数学问题生成了数千个答案,并使用他们的“多样性奖励”来挑选出最有趣的答案进行检查。他们发现这种方法效率极高。例如,在处理名为 MATH 的困难数学数据集时,使用 Qwen-2.5-14b-Instruct 模型配合其方法,寻找正确答案的效率比随机选择答案提高了 50% 以上。事实上,对于某些任务,使用这种探索策略所需的尝试次数比单纯随机尝试减少了 3 到 13 倍。

其次,他们将这种探索策略整合到了实际的训练过程(后训练)中。他们想看看这是否能帮助模型学习新的行为,而不仅仅是磨练旧的行为。结果令人鼓舞。当他们使用这种探索奖励来训练模型时,模型不仅在原有的技巧上变得更强,还开始生成看起来更加新颖且具有创造力的答案。在处理一项名为 AIME 2024 的高难度数学竞赛数据集时,他们经过探索增强的模型表现得与使用四倍样本量的标准训练方法一样出色。这表明,通过刻意鼓励多样性,我们可以帮助 AI 模型在不需要海量额外数据或计算能力的情况下,发现新的能力。

然而,作者也谨慎地指出,这并不是解决一切问题的灵丹妙药。他们发现,该方法在更强大、更有能力的模型上效果最好;较弱的模型有时不仅无法受益,甚至表现会变差。他们还表明,虽然这种方法有助于模型找到新的解决方案,但这并不一定意味着模型在通用意义上变得更“聪明”,而是指它更擅长在浩如烟海的可能答案空间中寻找正确答案。论文指出,这种“刻意的探索”是一条切实可行的前进路径,提供了一种超越单纯磨练现有技能、迈向发现语言模型中真正新行为的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →