← 最新论文
💬 NLP

Mitigating Exploration Bias in RL for Multi-Instruction Following

本文通过提出一种结合了用于激活困难指令的行为引导启动(behavioral bootstrapping)和用于优先处理这些指令的稀缺性感知奖励(scarcity-aware rewards)的两阶段框架,解决了基于强化学习的多指令遵循中对简单指令的探索偏差问题,从而显著提升了模型在可验证基准测试中的性能。

原作者: Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是驱动那些已成为日常生活一部分的聊天机器人和写作助手的引擎。这些系统的核心设计目标是遵循指令,将用户的请求转化为有用的响应。多年来,研究人员一直使用一种称为强化学习的训练方法,来教导这些模型如何更好地完成这项任务。在这种方法中,模型尝试解决一个问题,根据表现情况获得评分,并利用这些反馈来改进下一次尝试。这是一种精炼行为的强大方式,非常类似于用零食训练动物,只不过应用于复杂的数字推理。然而,一项新研究表明,当这些模型面临包含多个不同规则或约束条件的单一请求时,标准的训练方法往往会让它们失效。模型并没有学会满足请求的所有部分,而是倾向于忽略困难的部分,只专注于容易的部分,导致用户得到的响应只是部分正确。

这项研究背后的研究人员与德克萨斯州和加利福尼亚州的大学团队合作,旨在理解为什么会发生这种情况以及如何解决它。他们发现问题源于两个主要问题。首先,当模型开始训练时,它通常过于脆弱,无法解决复杂请求中最难的部分。因为它无法成功完成这些困难任务,所以永远无法获得学习所需的正向反馈,因此它干脆停止了尝试。其次,训练期间使用的评分系统将每条指令视为同等重要。如果一个模型满足了一条容易的规则和一条困难的规则,它获得的总体得分与满足两条容易规则的得分相同。这鼓励模型去追求容易获得的胜利以快速提升分数,而不是在需要更多努力的困难约束中苦苦挣扎。结果是,模型产生了偏向于简单路径的偏差,导致那些更具挑战性的领域未被探索。

为了解决这个问题,该团队提出了一个两步走的框架,旨在迫使模型关注困难的指令。第一步是他们称之为“行为引导”(behavioral bootstrapping)的准备阶段。在正式训练开始之前,研究人员识别出模型目前无法遵循的特定类型的指令。然后,他们生成一小组专门的示例,引导模型在这些特定的困难任务上取得成功。通过对这些精选数据进行短时间的训练,模型“唤醒”了处理这些困难约束的能力。这并不是要从头开始教模型一切,而是给它一个微小的推动,以确保在正式训练开始前,它有能力取得成功。这一步确保了模型在真正的训练开始时,不会立即放弃处理困难部分。

第二步涉及在主训练阶段改变模型的奖励机制。研究人员不再给予每条指令相同的权重,而是引入了一种新的评分方法,该方法会关注特定指令的稀有程度或难度。如果模型成功遵循了一条它很少能做对的指令,它会获得更高的奖励。如果它遵循了一条已经掌握得很好的指令,奖励则较小。这为模型创造了强烈的激励,去探索它之前回避的困难领域。研究人员还增加了成功组合指令的奖励。如果一个模型能够同时满足两条规则,特别是当这两条规则难以同时实现时,它会获得额外的加分。这鼓励模型寻找能够满足整套约束条件的解决方案,而不是仅仅挑选最简单的部分。

该团队使用两个不同版本的语言模型进行了测试,一个是拥有 17 亿参数的模型,另一个是拥有 70 亿参数的模型。他们在包含三到五个指令的提示词数据集上训练了这些模型。结果令人瞩目。使用这种新两步法训练的模型表现显著优于使用标准方法的模型。在一项旨在检查指令遵循能力的初级测试集中,表现最好的模型比标准方法提高了九个多点。这种提升非常显著,以至于经过这种新方法训练的较小的 17 亿参数模型,其表现竟然能媲美那些拥有数十倍计算能力的更大规模商业模型。研究人员还测量了模型的性能平衡,并发现新方法成功缩小了模型处理容易指令与困难指令之间的差距。

研究还观察了训练期间模型内部发生了什么。他们观察到,标准的训练方法会导致模型失去探索不同可能性的能力,即一种被称为“熵崩溃”(entropy collapse)的现象,即模型陷入了一个由安全、简单的答案组成的狭窄循环。相比之下,新方法保持了模型的探索活力,使其能够继续寻找复杂的解决方案。研究人员指出,当训练数据经过精心平衡时,该方法效果最好;如果初始准备阶段的数据过多,实际上可能会损害模型后期的灵活性。虽然该方法是在可以通过计算机程序检查的指令上进行的测试,但研究人员承认,将其应用于涉及风格或语调等更开放式的请求,仍需要进一步的工作。尽管如此,这些发现为如何让人工智能在面对复杂、多维度的请求时更加可靠提供了一条清晰的路径。通过解决对简单路径的偏差,这项工作有助于确保这些强大的工具能够真正遵循用户意图的全貌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →