← 最新论文
🤖 AI

AI Alignment From Social Choice Perspectives

本文综述了近期将社会选择理论应用于基于人类反馈的 AI 对齐的研究,展示了这一视角如何识别聚合冲突的人类判断中的失效模式,并揭示了一个处理此类分歧的更广泛且具有原则性的设计空间。

原作者: Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明、但有些白纸一样的机器人如何写故事、给出建议或回答问题。你无法为每种可能发生的情况都编写一本完美的规则手册,因为人类的价值观太复杂且微妙。相反,你请了一组人类评委来看机器人的回答,并对他们说:“我更喜欢这一个,而不是那一个。”

这篇论文认为,我们目前将所有这些人类意见组合成一套单一指令的方式是有缺陷的。它建议我们应该通过**社会选择理论(Social Choice Theory)**的视角来看待这个过程——这正是用于研究如何进行公平选举的数学理论。

以下是使用简单类比对该论文核心思想进行的拆解:

1. 问题所在:“一刀切”的投票

目前,当人类产生分歧时(例如,一个人觉得某个笑话很有趣,而另一个人觉得它具有冒犯性),标准方法(称为 RLHF)会将这些分歧视为“噪声”。它试图通过平均化这些分歧来寻找一个单一的“正确”答案。

  • 类比: 想象一个小镇正在决定建设一座新公园。有些人想要游乐场,有些人想要花园,还有一些人想要滑板公园。目前的 AI 方法就像是一场投票,它强迫每个人只能选出一个赢家。如果“游乐场”以微弱优势胜出,小镇就只会建造一个游乐场,从而完全忽略了花园爱好者的需求。论文指出,这是处理多样化人群的一种糟糕方式。它将一场复杂的辩论变成了一个单一且僵化的分数。

2. 隐藏的投票规则:“博达计数法”(Borda Count)

作者们发现,目前用于训练这些机器人的数学模型(称为 Bradley-Terry 模型)不仅仅是一个统计技巧;它在秘密地运用一种特定的投票规则,即博达计数法

  • 类比: 在博达计数法中,你不仅要选出你的最爱,还要对所有选项进行排序。如果你有 5 个选项,你的第一选择得 5 分,第二选择得 4 分,依此类推。最终的赢家是总分最高的那个。
  • 缺陷: 这种规则偏向于“安全”和“平庸”的选项。一个对所有人来说都“还可以”但无人热爱的回答,可能会战胜一个对一半人来说“极好”但被另一半人“厌恶”的回答。AI 因此学会了变得乏味且不具攻击性,而不是真正卓越或出类拔萃。

3. “克隆”问题:复读机改变了结果

论文指出这种投票系统中存在一个奇怪的漏洞:克隆敏感性(Clone Sensitivity)

  • 类比: 想象一场“红车”与“蓝车”之间的选举。如果红车获胜,那没问题。但如果红车制造商突然发布了 100 辆略有不同的红车版本(红车 1.0、红车 1.1、红车 1.2……)会怎样?在博达计数式的投票中,这些“克隆体”会以一种方式分散选票,从而导致即使选民的实际偏好没有改变,也会意外地让蓝车落败。
  • 在 AI 中: 大型语言模型经常生成许多略有不同的相同答案(释义/改写)。如果训练数据中有 10 个“稳妥”答案的版本,而只有一个“大胆”答案的版本,AI 可能会认为那个“稳妥”的答案在客观上更好,仅仅是因为它在训练列表中出现的次数更多,而不是因为人类真的更喜欢它。

4. “线性”陷阱:当数学失效时

论文还表明,当我们强迫 AI 使用简化的数学结构(为了更快或更容易)进行学习时,它可能会破坏公平规则。

  • 类比: 想象一位本应听取每种论点的法官。但如果这位法官被迫使用一份非常简短、僵化的清单(“线性”模型),他可能会错过其中的细微差别。即使房间里的每一个人都一致认为选项 A 比选项 B 好,这个僵化的数学模型也可能意外地得出选项 B 更好的结论。这是工具的失败,而不是人的失败。

5. 解决方案:停止平均,开始博弈

作者提出了一种更好的处理分歧的方法,其灵感来自博弈论。与其尝试将所有人类意见压缩成一个单一的“分数”,我们不如让 AI 在与自己进行的博弈中学习。

  • 类比: 与其问“什么是最好的一个答案?”,不如问:“如果我让两种不同的策略相互对抗,哪一个会赢得更多次?”
  • “最大化彩票”(Maximal Lottery): 论文建议 AI 应该学习一种策略的混合。如果一半的人想要花园,一半的人想要滑板公园,AI 不应该只选其一。它应该学会成为 50% 的花园和 50% 的滑板公园。这样做保留了分歧,并确保没有任何群体被完全噤声。
  • 益处: 这种方法(称为纳什学习,Nash Learning)在数学上被证明是处理有限信息时最“公平”的方式。它保证了 AI 不会仅仅因为数据稀缺或选民意见分歧就做出极其糟糕的错误判断。

总结

论文认为,我们目前的做法是在把 AI 教成一台“折中机器”,通过平均化人类价值观,往往导致乏味或有偏见的结果。通过使用公平选举的数学,我们可以构建出能够:

  1. 识别出“安全”并不总是等于“最好”的 AI 系统。
  2. 忽略会扭曲选票的复读机式答案。
  3. 通过提供多种选择的混合方案而非强迫单一、僵化的答案,来保留多样化的观点。

这关乎从询问“大多数人想要什么?”转向“我们如何公平地代表每个人的价值观?”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →