← 最新论文
💬 NLP

Three Models of RLHF Annotation: Extension, Evidence, and Authority

本文提出区分人类标注者在人类反馈强化学习中的三种概念模型——扩展、证据和权威——以通过针对模型对齐各个维度所需的特定规范角色定制数据收集与聚合策略,从而指导设计更有效的标注流程。

原作者: Steve Coyne

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Steve Coyne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一个非常聪明的机器人,它能够写故事、回答问题并与人聊天。你通过向它灌输数百万本书籍教会了它说话,但现在这个机器人有点失控。它有时会说粗鲁的话、撒谎或给出糟糕的建议。为了解决这个问题,你雇佣了一支人类“编辑”团队,告诉他们什么是好的、什么是坏的。这个过程被称为RLHF(基于人类反馈的强化学习)。

史蒂夫·科因(Steve Coyne)的论文指出,当我们雇佣这些人类编辑时,我们常常对“为什么要雇佣他们”感到困惑。他们是来复制我们的想法?是来告诉我们所不知晓的事实?还是来为我们制定最终的法律?

科因提出,看待这些人类编辑有三种截然不同的方式,如果将它们混淆,就会导致机器人困惑并表现不佳。

以下是这三种模式,辅以简单的类比进行解释:

1. 扩展模型:“影子克隆”

核心理念: 在这种模型中,人类编辑的存在是为了复制机器人的设计者
类比: 想象你是一位厨师,想教一位副厨师长烹饪你的招牌菜。你不希望副厨师长加入自己独特的风格或询问顾客喜欢什么。你希望他们品尝食物后说:“是的,这尝起来完全就像会做的那样。”如果副厨师长说:“我觉得需要多加点盐”,而你认为完美无缺,你就会忽略他们。
运作方式: 编辑们仅仅是设计团队大脑的延伸。当设计者太忙而无法检查每一个答案时,他们负责填补空白。

  • 适用于: 决定机器人的语气、风格或特定于公司的规则。
  • 陷阱: 如果你将他们视为此类,但当他们与“社区”意见不一致时却感到愤怒,那就是混淆了概念。

2. 证据模型:“专家证人”

核心理念: 在这种模型中,编辑的存在是为了提供设计者所不具备的事实或数据
类比: 想象你是一名法庭法官,但对某种特定的稀有鱼类一无所知。你聘请了一位海洋生物学家作为专家证人。你问:“这种鱼有毒吗?”生物学家回答:“是的,根据我的知识,它有毒。”即使你个人觉得它看起来很安全,你也必须听取他们的意见。他们的工作是为你提供关于真相的证据
运作方式: 编辑是专家或公众的代表,他们告诉设计者:“实际上,大多数人认为这具有冒犯性”或“这个事实是错误的”。设计者不应仅仅因为不同意就推翻他们的意见,因为编辑提供的是数据。

  • 适用于: 检查机器人是否在事实准确,或是否违反了一般社会标准(例如“这是否具有冒犯性?”)。
  • 陷阱: 如果你将他们视为专家,却因为他们不同意你的个人观点而解雇他们,你就失去了他们专业知识的价值。

3. 权威模型:“微型立法机构”

核心理念: 在这种模型中,编辑拥有制定规则的权力,无论他们在事实层面上是否“正确”。
类比: 想象一次城镇会议,一群随机挑选的公民就一项新法律进行投票。他们不需要是交通专家;他们只需要代表人民。如果他们投票降低限速,城市必须遵守,不是因为这些公民比市长“更聪明”,而是因为他们拥有为社区做决定的权威
运作方式: 编辑充当“微型立法机构”。他们的工作不是寻找真理或复制设计者,而是行使决定机器人该做什么的权利。他们的权力来自于作为具有代表性的公平人口样本。

  • 适用于: 决定有争议的政治问题或深层道德问题,在这些问题上没有唯一的“正确”答案,只有社区决定的结果。
  • 陷阱: 如果你将他们视为立法机构,却因他们的投票不符合你的个人观点而置之不理,你就破坏了该系统的“社会契约”。

为什么混淆它们会搞砸机器人?

该论文指出,目前大多数 AI 系统都是这三种模式的混乱混合,这导致了失效模式

  1. 自我挫败: 想象你雇佣编辑作为“微型立法机构”(权威)来代表公众。但随后,你解雇任何不同意你个人观点的编辑(扩展)。你摧毁了你所要求的东西:一个代表性的声音。你不能拥有一个允许领导解雇投反对票选民的民主制度。
  2. 碎片化: 想象你告诉编辑:“你们在这里是为了给我们提供事实”(证据),但你的指示含糊不清,导致他们以为你只是希望他们复制你的风格(扩展)。结果是一堆令人困惑的数据,其中一些编辑试图成为专家,而另一些则试图成为克隆体。机器人接收到混合信号,学不到任何有用的东西。
  3. 归因错误(“责任洗白”): 这种情况发生在一家公司声称:“我们让公众决定机器人说什么!”(权威),但实际上,他们秘密解雇任何不同意他们观点的人(扩展)。他们试图将机器人行为不佳的 blame 转嫁给“公众”,而实际上却保留所有控制权。

作者的重大建议

史蒂夫·科因建议我们停止试图构建单一管道来完成所有工作。相反,我们应该为不同的任务构建不同的管道

  • 针对风格: 使用扩展模型。让设计者决定机器人应该听起来是兴奋的还是严肃的。
  • 针对事实: 使用证据模型。聘请专家告诉机器人什么是真实的。
  • 针对有争议的价值: 使用权威模型。让一个具有代表性的人群投票决定机器人在棘手的道德情境中应该做什么。

核心结论:
构建一个有益的 AI 不仅仅是一个技术问题;它是一个哲学问题。在你雇佣人类编辑之前,你需要决定:他们是你的克隆体、你的专家,还是你的立法者? 如果你没有清晰地选择其中一种,你的机器人最终会变得困惑、不一致,甚至可能不公平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →