← 最新论文
🤖 AI

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

该论文提出了 S2T-RLHF,一种层级式信用分配框架,通过将序列级奖励分解为句子级分配以及随后的有界标记级细化,增强了基于偏好的 RLHF 的稳定性,从而在语义连贯性与对抗奖励噪声的鲁棒性之间取得了平衡。

原作者: Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常有天赋但有点混乱的机器人如何写故事。你没有给它教科书,而是在它写完故事后只给出一个最终评分:“做得好!”或者“不太好。”这正是被称为**基于人类反馈的强化学习(RLHF)**这一人工智能领域的底层逻辑。这个机器人(AI)尝试写作,获得评分,然后调整自己的大脑以在下次获得更高的分数。这正是让 AI 聊天机器人听起来既乐于助人、无害又像人类一样的“秘密武器”。

但棘手的地方在于,只在最后给出评分就像是在批改一篇十页论文时,只给一个“A”或“F”,却没告诉学生哪一段写得精彩,或者哪一句话让人困惑。机器人必须去猜它写的哪个微小的词是“英雄”,哪个词是“反派”。这种猜谜游戏经常导致机器人感到困惑、行为异常,甚至为了获得更多分数而“作弊”,比如写更长的故事,而不是写更好的故事。科学家们称之为“训练不稳定”,这是构建可靠 AI 的一大难题。

这篇题为 S2T-RLHF 的论文通过改变机器人获取反馈的方式来解决这种困惑。作者提出,与其试图立即估算每一个极其微小的词(token)的价值,不如先弄清楚哪些句子是好的,然后再仔细观察这些句子内部的词。他们称之为一种“层级化”方法。他们的主要发现表明,通过将反馈分解为这两个步骤——先句子,后单词——机器人的学习过程会更加平滑,且不容易崩溃。他们认为,如果一开始就试图对单词层面进行“过度精确”的评分,实际上会让情况变得更糟,因为反馈信号往往是嘈杂且令人困惑的。通过使用句子作为中间过渡,他们找到了一种既能保持训练稳定,又能教机器人写得更好的方法。

问题所在:“单词之谜”

想象一下你是一名足球教练。球队踢完了一整场比赛,赛后你递给他们一座奖杯并说:“打得好!”你并没有说谁进了球、谁做了精彩的扑救,或者谁踢丢了点球。现在,想象球员们必须根据这一座奖杯来推断自己的表现。前锋可能会想:“我一定表现得很棒!”而守门员可能会想:“我一定表现得很完美!”但也许守门员其实丢了三个球,而前锋错失了唯一的进球机会。因为反馈如此模糊,球员们开始进行疯狂的猜测。有些人可能会开始在场上做一些不必要的跑动,仅仅是为了看起来很忙碌,认为“动作越多 = 分数越高”。

在 AI 世界中,情况完全一样。AI 生成一段长响应(足球赛),然后一个“奖励模型”(教练)给它一个单一的数字(奖杯)。随后,AI 会尝试调整它写的每一个单词(每个球员的动作)以获得更高的分数。由于反馈过于粗糙,AI 会感到困惑。它可能会开始重复自己、胡言乱语,或者为了凑分而变得过于冗长。这就是论文中所说的“不稳定训练动态”。

旧观念:“细节越多越好”

有一段时间,研究人员认为解决方案是给机器人提供更多细节。他们尝试为编写的每一个单词(token)分配一个分数。这就像教练每隔 10 秒就冲到场边,对着每个球员大喊:“踢得好!”或“传得差!”其逻辑是:“如果我们给机器人更具体的反馈,它就会学得更快、更好。”

然而,本文作者认为这种逻辑是有缺陷的。他们指出,人类的偏好实际上是模糊的。当我们阅读一段响应时,我们是按句子或观点来判断的,而不是按单个字母或微小的单词。如果我们强迫 AI 根据模糊、嘈杂的人类偏好为每个单词分配精确的分数,我们可能只是在放大这种困惑。这就像试图用一个晃动得太厉害的温度计来测量一场风暴的温度;你越试图测量那些细微的波动,噪声就会把你的读数搞得越乱。论文指出,追求单词层面的“最大精度”实际上会破坏学习过程的稳定性。

新方案:S2T-RLHF(从句子到单词)

作者提出了一种更聪明的评分方式,他们称之为 S2T-RLHF。可以将其视为一种尊重人类实际阅读和写作习惯的两阶段评分系统。

第一阶段:句子层面(“大局观”检查)
首先,系统查看整个响应并将其分解为句子。它会询问:“哪些句子承载了核心思想?哪些句子是最重要的?”它使用一种巧妙的数学技巧(称为“纳什议价”,类似于公平谈判)将单一的“奖杯”分数分配给不同的句子。

  • 类比: 想象教练现在说:“第一段有点弱,但第二段非常精彩,结论部分还可以。”分数现在被公平地分配到了各个句子中。这防止了机器人对哪个部分的内容最重要产生困惑。它确保重要的句子能获得应有的认可,而不被整体文本中的噪声所淹没。

第二阶段:Token 层面(“精细化”检查)
一旦句子获得了它们应得的分数,系统就会深入每个句子内部,决定哪些特定的单词才是明星。但这里有个限制:它不会做得过火。它采用了一种“受限”的方法。它会说:“好吧,这个句子得到了高分。现在,让我们找出这个句子中哪些词是关键角色,但不要做得太过分。”

  • 类比: 在那个“精彩”的第二段中,教练指出了让它变得伟大的特定动词和名词。但他们不会因为一个小小的拼写错误就改变整个段落的分数。他们保持对大思路的关注,然后再优化细节。这一步使用了一个轻量级的 AI 网络(称为 DTAN)来决定句子中哪些词最为重要。

他们的发现

作者在多个不同的数据集上测试了这种新方法,并将其与旧方法(仅在最后给分,或尝试立即为每个单词评分)进行了对比。

  1. 稳定性胜出: 最重要的发现是,S2T-RLHF 使训练过程变得更加平滑。在实验中,标准方法经常表现出性能的剧烈波动,就像一辆车在猛踩油门和急刹之间切换。而 S2T-RLHF 则像是在平稳巡航。机器人不会崩溃,不会感到困惑,也不会为了钻系统的空子而写出毫无意义的内容。
  2. 质量更高: 它不仅更稳定,而且最终生成的 AI 也更符合人类的偏好。当他们请另一位评委(要么是类人 AI,要么是奖励模型)来比较由新方法和旧方法生成的文章时,S2T-RLHF 生成的文章获胜次数更多。
  3. “过细”陷阱: 他们明确展示了,如果立即尝试为每个单词评分(即“仅 token”方法),往往会导致不稳定,尤其是在训练强度较大时。这证实了他们的理论:并非“细节越多越好”;有时,你需要一个中间步骤(句子)来保持基础。

为什么这很重要

这篇论文表明,教导 AI 的关键不仅仅在于给它更多的数据或更精细的细节。关键在于提供与人类思维方式相匹配的反馈。我们判断一个故事时,不是逐字逐句去判断,而是通过它的流畅度、它的句子和它的观点。通过将 AI 的学习过程与这种自然的结构对齐,作者找到了一种让 AI 训练更可靠且不易崩溃的方法。

他们不仅仅是猜测,还进行了广泛的模拟和实验。他们证明了,通过尊重语言的“层级结构”——先句子,后单词——你可以获得两全其美:既有宏观概览的稳定性,又有精细调优的精确性。这提醒我们,有时解决复杂问题的最佳方式并不是尽可能地无限放大,而是找到正确的聚焦层次。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →