← 最新论文
📊 statistics

Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback

本文提出了一个统一的离线 RLHF 框架,用于实现多元化对齐,该框架在低秩线性模型下联合估计特定党派的奖励,并针对纳什(Nash)、功利主义(Utilitarian)和平均主义(Egalitarian)目标优化策略,同时通过一个悲观的冯·诺依曼赢家(von Neumann winner)来解决一般的循环偏好问题,且所有这些都具有已建立的非渐近性能保证。

原作者: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,人们正日益认识到,机器并不只拥有一种人类的声音。当我们要求计算机写一个故事、总结一篇新闻文章或提供建议时,不同的人往往有不同的需求。一个人可能看重简洁和直接,而另一个人则更喜欢细致入微的情感深度。第三个人可能将安全性置于首位,而第四个人则追求创造力。多年来,教导这些机器的标准方式是收集所有这些不同的意见,将它们混合成一大堆,并训练系统去满足那个“平均值”。这种方法假设人类的分歧只是噪声,是一种暂时的混乱,只要收集足够多的数据就会消失。但实际上,这些差异往往是深刻、持久且根本性的。它们代表了价值观的真实冲突,而非随机的错误。科学家面临的挑战不再仅仅是制造一台能取悦大多数人的机器,而是要构建一种能够从一群截然不同、有时甚至相互对立的观点中学习,并仍能得出一个尊重这种分歧结构的单一且公平决策的机器。

这正是由来自麻省理工学院、北卡罗来纳大学和卡内基梅隆大学等机构的研究人员组成的一个团队所解决的核心问题。他们致力于解决机器学习领域中一个被称为“多元对齐”(pluralistic alignment)的特定难题。想象一下,在一个房间里,人们试图就单一行动方案达成一致,但他们无法就什么才是最好的结果达成共识。在过去,计算机科学家只需让每个人对所有可能的选项进行投票,统计票数,然后选出获胜者。这项研究描述的新方法认为,这种方法丢弃了过多的信息。如果你把一群热爱辛辣食物的人和一群讨厌辛辣食物的人的投票混合在一起,你最终可能会得到一个平淡无味、无法令任何人满意的折中方案。相反,研究人员提出了一种方法,在学习过程中保持各组数据的独立性,准确理解每个群体的需求,然后应用一套特定的、透明的规则将这些需求合并为一个最终决策。

研究人员专注于一种从“离线”数据中学习的场景。这意味着机器并不是在与人进行实时对话,而是在观察海量的既有记录。在这些记录中,人们对两个不同的选项进行了比较,并说明了自己更倾向于哪一个。至关重要的是,研究人员确保了数据记录了每一次比较的来源。他们不仅仅记录了“选项 A 比选项 B 好”;他们还记录了“群体 A 偏好选项 A,而群体 B 偏好选项 B”。通过保留这些身份信息,计算机可以学习每个特定群体的偏好,而不是将它们模糊成一个单一且混乱的平均值。

为了处理这种复杂性,该团队开发了一个分为两个主要阶段的数学框架。首先,系统学习驱动每个群体偏好的隐藏规则。他们发现,尽管不同群体的需求各异,但他们的偏好通常共享一个共同的底层结构,就像不同的语言共享一种共同语法一样。通过识别这种共享结构,计算机可以使用比尝试孤立学习每个群体时少得多的数据,来学习许多不同群体的特定欲望。这一步至关重要,因为它使得系统即使在单个群体的数据稀缺或不完整时也能保持准确。

一旦系统理解了每个群体想要什么,它就会进入第二阶段:做出最终决策。在这里,研究人员测试了三种结合这些偏好的方式,分别代表了不同的公平理念。第一种被称为“功利主义”(Utilitarian)的方法,它简单地累加所有群体的总幸福感,并选择能创造整体最大利益的选项。另一种被称为“平等主义”(Egalitarian)的方法,它完全关注最不满意的那一个群体,确保处境最差的群体尽可能获得幸福。第三种方法被称为“纳什”(Nash),它寻求一种使所有人满意度乘积最大化的平衡,从而有效地防止任何单一群体被完全忽视,同时奖励整体的进步。研究人员从数学上证明,只要数据充足,他们的方法可以找到一个在所有这些公平定义下都表现良好的单一政策。

该研究的一个关键发现是,简单地将所有数据汇集在一起并忽略说话者的身份会导致糟糕的结果。当研究人员模拟一个由三个不同群体组成的场景时,传统的“汇集式”(pooled)方法未能识别出公平的折中方案。它往往会选择一个被一个群体喜爱但被其他群体厌恶的选项,导致一半的人口完全无法满意。相比之下,他们的新方法(在学习阶段保持了群体的独立性)成功识别出了一个中间立场,为每个人都提供了适度的满意度。这表明,对齐人工智能的难点不仅在于是否有足够的数据,而在于是否在做出明确且有意的选择之前,保留了人类分歧的结构。

研究人员还探索了一个更困难的场景,即人类的偏好无法轻易简化为简单的分数或排名。有时,人们的选择是不一致的;他们可能觉得 A 优于 B,B 优于 C,但随后又觉得 C 优于 A。在这种情况下,为每个选项分配单一数值的标准方法就会失效。为了处理这种情况,团队开发了一种基于“冯·诺依曼赢家”(von Neumann winner)概念的新策略。这是一种概率性的方法,系统不再试图寻找单一的最佳选项,而是寻找一种在与任何其他策略进行一对一比较时不太可能失败的策略。他们证明,即使在这些混乱、不一致的情况下,只要数据收集得足够细致,他们的方法也能找到一个稳定且公平的解决方案,尊重所有参与方的偏好。

通过计算机模拟,团队展示了其方法始终优于现有方法。当他们在具有不同人数和不同程度一致性的合成数据上测试算法时,新方法产生的决策更接近于每个群体的理想结果。模拟证实,通过保持群体身份的完整性并使用共享的学习结构,系统可以更高效地学习并做出更公平的选择。无论目标是最大化平均幸福感、保护最脆弱的群体,还是寻找平衡的折中方案,结果都保持一致。

这项工作代表了我们在思考如何训练人工智能以适应多样化人类社会方面迈出的重要一步。它不再认为存在一种必须让机器发现的单一“正确”行为方式。相反,它将人类观点的多样性视为一种需要管理的特征,而非需要修复的缺陷。通过使结合不同观点的过程变得明确且具有数学严谨性,研究人员为构建能够驾驭冲突而不抹杀创造冲突的独特声音的系统提供了蓝图。这项研究并不声称已经解决了人类与 AI 交互中的所有问题,但它提供了一种经过验证、可靠的方法,可以从一群持有异议的人群中学习,并产生一个在统计学上成立且在伦理上透明的集体决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →