← 最新论文
💬 NLP

REAR: Test-time Preference Realignment through Reward Decomposition

本文介绍了 REAR,这是一个无需训练的测试时框架,它通过分解奖励函数以选择性地重新缩放奖励组件,从而使大型语言模型与多样化的用户偏好保持一致,进而将高效的测试时扩展从可验证领域扩展到复杂的偏好对齐任务。

原作者: Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、训练有素的机器人助手(一个大语言模型)。这个机器人通过大量的训练数据,学会了如何变得乐于助人、礼貌且准确。然而,有时你会有一个非常具体、个人的请求。也许你想让机器人以一种“有趣但不像电子游戏”的方式来解释数学;或者你想让它扮演一个“脾气暴躁的老侦探”。

问题在于,机器人的默认设置可能并不完全符合你的特定情绪或偏好。通常,为了解决这个问题,你必须送机器人回“学校”(重新训练)并使用新数据,这既昂贵、缓慢,又需要大量资源。

这篇论文介绍了一个巧妙的技巧,叫做 REAR(通过奖励分解进行重对齐),它能让你在机器人与你交谈的当下就修正它的行为,而无需送它回学校。

以下是它的工作原理,通过简单的类比进行了拆解:

1. 问题所在:机器人的“默认设置” vs. 你的“愿望”

把机器人的大脑想象成有两个不同的声音在同时说话:

  • 声音 A(问题): “我该如何正确回答这个数学题?”
  • 声音 B(偏好): “我该如何在回答时表现得脾气暴躁,并且避免使用电子游戏的隐喻?”

当机器人接受训练时,它学习的是这两类声音的混合体。但当你提出一个特定的问题时,这种混合比例可能会出错。也许它太专注于“正确性”,而忽略了你要求它“脾气暴躁”的要求。

2. 解决方案:“音量旋钮”(奖励分解)

作者们意识到,他们可以用数学方法将这两个声音分离开来。他们将机器人的内部“奖励”(即完成得好的感觉)视为两种不同的成分:

  1. 问题成分: 它对提示词(Prompt)的回答有多好?
  2. 偏好成分: 它在多大程度上遵循了你特定的风格?

REAR 就像是一个你可以在对话过程中调节的音量旋钮

  • 如果你把旋钮调大,机器人会更多地听从你的“偏好”声音。
  • 如果你把旋钮调小,它会更多地听从“问题”的声音。

神奇之处在于,他们发现仅利用机器人自身的内部思维(其概率得分),就能计算出这个音量旋钮。你不需要新的老师,也不需要新的数据集;你只需要利用机器人现有的脑力来进行自我平衡。

3. 策略:“不断尝试,不断改进”(测试时缩放)

由于机器人无法瞬间知道哪个答案才是完美的,REAR 使用了一种名为 测试时缩放(Test-Time Scaling) 的策略。可以这样理解:

  • “N 选 1”法(Best of N): 想象你让机器人写一个故事。与其接受第一个草稿,不如要求它在通常写一个故事的时间内,写出 16 个不同的版本
  • 评分卡: 对于这 16 个版本中的每一个,REAR 都会充当评委。它利用那个“音量旋钮”数学公式来为它们评分。它会问:“这 16 个故事中,哪一个既最好地回答了问题,又遵循了‘脾气暴躁的侦探’这种风格?”
  • 优胜者: 机器人挑选得分最高的那个版本并将其呈现给你。

他们还使用了一种更高级的版本——树搜索(Tree Search)(就像侦探在迷宫中探索不同的路径一样)。机器人不仅仅是写出 16 个完整的句子,而是在每一步选择句子时进行探索,不断检查得分,以确保自己始终行驶在正确的轨道上。

4. 为什么这很重要

  • 无需训练: 你不需要重新训练机器人。这就像是在听广播时调节电台频率,而不是去买一台新收音机。
  • 适用于任何场景: 他们展示了这不仅适用于“脾气暴躁的侦探”,也适用于复杂的数学问题,甚至是视觉任务(例如观察一张图片并准确描述,而不凭空捏造)。
  • 高效: 因为它利用机器人自身的数学逻辑,所以不需要加载另一个沉重的“裁判”程序来检查答案。相比之前的各种方法,它更快、更便宜。

总结

REAR 是一个工具,它能让你在 AI 工作的过程中,即时定制其个性或关注点。它通过在数学上将“回答问题”与“遵循你的风格”分离,然后利用“尝试多种选项并挑选最佳项”的策略来找到完美的响应。这就像是一个可以即时控制 AI 个性的遥控器,而无需从头开始重建 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →