Procedural Fairness Failures in RLHF from Preference Averaging
本文指出标准的基于人类反馈的强化学习(RLHF)由于对异质偏好进行平均化处理,导致多数群体在奖励学习中占据主导地位,从而无法实现程序公平,并据此提出了偏好感知 RLHF(PA-RLHF),通过在不同偏好模式之间实现分离优化,显著提升了对齐准确度并缩小了公平性差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何成为一名得力的助手。为了做到这一点,你不仅仅是给它编程规则,而是向它展示人类喜欢什么以及不喜欢什么。这个过程被称为“基于人类反馈的强化学习”(RLHF)。这就像一位老师根据来自不同家长的各种笔记来给学生的作业评分。如果家长 A 喜欢长篇详尽的故事,而家长 B 讨厌长篇大论,那么老师必须决定谁的意见更重要。通常情况下,老师只是取所有笔记的平均值,假设每个人想要的东西大致相同。但如果家长们的品味完全不同呢?如果老师只是对笔记取平均值,那么那些想要简短、有力回答的沉默少数派可能会被忽视,而多数派则会得到他们想要的一切。这篇论文探讨了当 AI 以这种方式学习时会发生什么,特别是研究了这种“平均化”方法是否对每个人都公平,或者它是否在无意中让某些群体失声。
这项研究背后的研究人员正在进行一项名为“RLHF 中由于偏好平均导致的程序性公平失败”的项目,他们决定测试这个想法。他们创造了一个受控的模拟世界。他们设定了一个包含三个截然不同的“评分者”(模拟人)群体的场景,这些群体有着非常不同且一致的偏好:一组喜欢简短的回答,另一组喜欢长篇详尽的回答,还有第三组想要技术性、正式的回复。然后,他们使用标准方法训练了一个 AI,该方法只是简单地将所有这些不同的意见混合成一个大的“平均”奖励模型。结果发人深省:AI 在大多数情况下都能正确理解多数群体的偏好,但在面对少数群体时却表现得非常吃力。事实上,“公平差距”(即表现最好的群体与表现最差的群体之间满足程度的差异)竟然高达 15.9 个百分点。整体准确率仅为 46.9% 左右,这意味着 AI 在整个领域内几乎只能正确处理一半的偏好。
为了解决这个问题,团队引入了一种名为“偏好感知型 RLHF”(PA-RLHF)的新方法。与其将所有不同的意见统统丢进一个搅拌机,不如在学习阶段将各个群体分开。想象一下,不再是一个老师用一套规则给所有人评分,而是有三位不同的老师,每位老师只听取其代表的特定群体。一位老师只从“短回答”爱好者的那里学习,另一位从“长故事”爱好者那里学习,依此类推。当他们测试这种新方法时,结果有了显著的提升。整体准确率从 46.9% 跳升至 67.9%。更重要的是,公平差距从 15.9 个点缩小到了仅 9.6 个点。少数群体的满意度大幅提升,上升了 27 到 32 个百分点以上,而多数群体的满意度也有了小幅改善。
论文指出,问题不仅仅在于“噪声”或错误的数据,而在于学习目标构建中的结构性缺陷。通过将一切平均化,标准方法系统性地将少数派的偏好推向了一边。研究人员发现,仅仅通过分离不同偏好群体的学习过程,就可以在不需要改变 AI 底层大脑的情况下修复这一问题。然而,他们也谨慎地指出,这些结果来自受控的模拟实验,而非使用混乱人类数据的真实世界部署。虽然模拟实验表明分离学习路径是有效的,但作者建议,还需要更多研究来观察这在复杂的现实情况中(即偏好可能更难分类的情况)表现如何。尽管如此,这项研究提供了一个明确的警告:如果我们希望 AI 对每个人都公平,我们可能需要停止平均化我们的差异,而是开始分别倾听我们独特的声音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。