← 最新论文
🤖 AI

A Descriptive and Normative Theory of Human Beliefs in RLHF

本文提出了一个全新的理论框架并对其进行了验证,该框架表明人类对 AI 智能体能力的认知显著影响了 RLHF 中的偏好生成,并证明将这些认知与智能体的实际能力相匹配——而非假设其具有最优性——能够引导学习到性能更优的策略。

原作者: Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。你向它展示了两条路线:一条是沿着悬崖边缘的极速捷径,另一条是远离边缘的较慢但更安全的道路。在标准 AI 训练的世界里,人类教师被期望选择那条“如果机器人是一个从不出错的超级天才驱动者时”会是最好的路线。

但这里有一个转折:现实中的机器人并不完美。 它们可能会摇晃、可能会误解,也可能无法处理复杂的悬崖边缘。

这篇论文指出,当人类教导这些机器人时,他们不仅仅是在看地图;他们还在观察他们认为机器人具备什么样的能力。 如果人类认为:“这个机器人是个天才,”他们可能会选择危险的悬崖捷径。但如果机器人实际上有点笨拙,那条捷径可能会导致坠毁。如果人类认为:“这个机器人有点摇晃,”他们可能会选择安全、缓慢的道路,而这正是机器人取得成功所需要的。

核心理念:信念比你想象的更重要

作者们(来自马萨诸塞大学阿默斯特分校和德克萨斯大学奥斯汀分校的研究团队)提出了一种看待人类如何向 AI 提供反馈的新方式。他们称之为**“基于信念的偏好模型”(belief-based preference model)。**

把它想象成教练在指导一名新手运动员。

  • 旧的方法(“乐观派”教练): 教练假设新手已经是奥运冠军了。他们说:“去拿金牌吧!跑最快、风险最高的战术!”如果新手真的尝试这样做,他会摔倒,因为他还没准备好。
  • 新的方法(“现实派”教练): 教练观察新手的实际技能。他们说:“好吧,你不错,但你还在学习阶段。让我们坚持那个能让你保持安全并获得积分的战术。”

论文指出,为了让 AI 学习得好,人类标注员(教练)需要拥有与现实相匹配的关于 AI 技能的信念。如果人类认为 AI 比实际情况更好,AI 就会学到错误的教训,并在以后发生惨烈的失败。

他们的发现(证据)

该团队不仅是凭空猜测;他们通过三种不同的方式进行了测试:

  1. 数学(理论): 他们进行了严密的数学推导,证明如果人类对机器人技能的信念与机器人的实际技能不符,机器人将学习到一种“次优”策略。用通俗的话说:如果教练向球员撒谎关于他们的技能,球员就会打一场烂球。 他们表明,人类的信念与现实的偏差越大,机器人的表现就越差。

  2. 模拟实验(电子游戏测试): 他们构建了一个数字世界(网格),其中一个机器人必须从起点导航到终点,同时避开意味着失败的“悬崖”。他们将机器人程序设定为带有一定的“噪声”(即不完美)。

    • 当模拟中的人类“标注员”相信机器人是完美的(零噪声)时,机器人学会了紧贴悬崖行驶,并且经常掉下去。
    • 当人类相信机器人是不完美的(与机器人的实际噪声相匹配)时,机器人学会了采取更安全、更宽阔的路径,并取得了成功。
    • 结果: 最好的结果出现在人类的信念与机器人的实际能力相匹配时。如果人类认为机器人是完美的而实际上并非如此,机器人就会坠毁。
  3. 人类研究(真实人类测试): 这是最酷的部分。他们实际上邀请了 146 名真实的人观看自动驾驶汽车的视频,并选择更好的路线。

    • 设置: 在观看视频之前,他们对这些人进行了“启动”(priming)。
      • A 组(安全启动): 观看了一段汽车行驶完美、遵守所有法律且极其安全的视频。
      • B 组(不安全启动): 观看了一段汽车漂移、撞车和驾驶鲁莽的视频。
      • C 组(对照组): 没有进行特殊处理。
    • 结果: 看到“不安全”视频的人(B 组)开始相信这辆车的能力较低。因此,他们在选择中更倾向于更安全、更慢的路线。看到“安全”视频的人(A 组)认为这辆车是个天才,因此更倾向于风险更高、更快的路线
    • 统计数据: “安全”组和“不安全”组之间的差异具有统计学显著性(p 值等于 0.015)。这证明了人类认为 AI 能做什么,直接改变了他们告诉 AI 该做什么。

他们认为什么“不是”答案

论文非常明确地指出了哪些做法是无效的。

  • 仅仅假设 AI 是完美的并不够。 标准的 AI 训练方法假设人类会选择“最佳可能”的路径,仿佛 AI 是一个神一般的优化器。作者表明,如果 AI 是不完美的,这其实是一个坏主意。
  • 这不仅仅是人类在一般意义上的“非理性”或“偏见”。 虽然其他研究讨论了人类的锚定效应或群体思维等偏见,但这篇论文专门关注对智能体能力的信念。论文认为,人类在判断行为时并不假设最优性;相反,他们依赖于对智能体当前能力的特定信念。如果这些信念是错误的(例如,认为智能体是完美的而实际上并非如此),由此产生的偏好就会出现偏差,导致糟糕的结果。

对未来的启示

作者建议,如果我们想要更好的 AI,我们需要修复“人类认为机器人能做什么”与“机器人实际能做什么”之间的“失配”问题。

他们提出了两个简单的想法给这些系统的构建者:

  1. 说实话: 在标注员开始评分之前,向他们展示机器人的实际局限性。如果机器人不能急转弯,请告诉他们!
  2. 展示,而不只是说: 在要求提供反馈之前,先给标注员看一段机器人正在驾驶的视频。如果机器人很笨拙,就展示笨拙的驾驶;如果它很好,就展示优秀的驾驶。这种方式能“启动”人类产生正确的信念。

论文总结道,这仍然不是一个已解决的问题。他们证明了这在模拟和小组研究中有效,但也承认在完整的、真实的 AI 训练循环中实现这一点仍是下一个巨大的步骤。然而,信息很明确:为了更好地教导机器人,你必须知道机器人认为自己能做什么,并且要确保老师也知道同样的事情。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →