What Do People Actually Want From AI? Mapping Preference Plurality
通过分析来自75个国家的1,500条开放式回答,本文揭示了当前的AI对齐方法(如RLHF)无法捕捉人类偏好的深刻多样性与语境细微差别,这一点从即使是像“真实性”这样被广泛追求的特质,在不同用户眼中也被定义为迥异且往往互不兼容的方式中得到了证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图烘焙一个巨大的、能让全世界每个人都觉得味道完美的单体巨型蛋糕。你询问了来自 75 个不同国家的 1,500 人,想让他们在每一块蛋糕里加入什么。你得到了一座由答案堆成的大山。有些人想要甜的,有些人想要辣的,有些人希望它看起来像一朵花,而另一些人则希望它看起来像个机器人。
现在,想象一下这位烘焙师(AI 公司)决定忽略所有的个人笔记。相反,他们采取了“多数票决制”,将所有冲突的欲望搅拌成一种单一的口味剖面,然后烤出了这个巨大的蛋糕。他们称之为“对齐”(alignment)——即让 AI 符合人类的价值观。
这篇论文,《人们到底想要什么样的 AI?绘制偏好多样性图谱》("What Do People Actually Want From AI? Mapping Preference Plurality"),认为这种“一刀切”的蛋糕是一场灾难。作者 Julia Sepúlveda Coelho 和 Scott A. Hale 通过观察人们真实的、开放式的对话来研究人们究竟想要什么,他们发现目前的 AI 蛋糕烘焙方法从根本上就是破碎的。
以下是他们研究结果的拆解,使用了简单的类比:
1. “真相”陷阱:每个人都想要它,但没人能就它达成共识
人们最常要求的词是**“真实性”(Truthfulness)**。大约一半的受访者说:“我希望 AI 说实话。”
- 论文的发现: “真相”这个词是一个变色龙。对某些人来说,它意味着“给我教科书里的事实”;对另一些人来说,它意味着“展示争论的所有方面,即使是不受欢迎的观点”;对另一些人来说,它意味着“像记者一样引用你的来源”,而另一些人仅仅是想要“没有偏见”。
- 类比: 想象一下,大家都同意想要“新鲜水果”。但当你询问这意味着什么时,一个人想要苹果,另一个人想要芒果,第三个人想要一份水果沙拉。如果烘焙师在配方中只写了“水果”而没有询问具体是哪种水果,结果就会一团糟。论文指出,由于 AI 公司将“真相”视为一个单一、简单的指令,他们忽略了人们对什么是“真”有着完全不同的定义这一事实。
2. “人类”之辩:有人想要朋友,有人想要工具
关于 AI 是否应该表现得像个“人”,存在着主要的争议。
- 分歧: 约 33% 的人说:“不!不要表现得像个人。我想要一个清晰的、机器人的工具。”但 57% 的人说:“是的!要温暖、友好且富有同理心。不要听起来像个冰冷的机器。”
- 类比: 这就像是在询问一群人,他们希望导游是一个爱聊天、友好的当地人并会讲笑话,还是一个沉默、高效的机器人,只负责指路。目前的 AI “烘焙师”试图同时兼顾两者,这往往导致 AI 显得虚假、令人毛骨悚然,或者讨好过度(仅仅为了表现得友好而盲目附和)。
3. “护栏”问题:安全 vs. 审查
人们对于 AI 应该被“监管”或限制到什么程度也持有异议。
- 分歧: 有些人希望有严格的护栏来防止 AI 说出任何有害或冒犯性的内容。另一些人则认为这些护栏只是“审查”,认为 AI 应该被允许表达令人不安的真相,即使这些真相具有争议性。
- 类比: 想象一座图书馆。一组人希望有一位图书管理员来阻止你借阅带有“坏想法”的书籍。另一组人则想要一个没有任何管理员的图书馆,这样你可以阅读任何东西,即使是危险的东西。论文发现,当 AI 公司对这些观点进行取平均值时,最终得到的系统对某些人来说过于谨慎,而对另一些人来说则限制过重。
4. “平均值”是一个谎言
作者识别出的最大问题是目前用于训练这些 AI 的方法,即 RLHF(基于人类反馈的强化学习)。
- 现状: AI 会看到两个答案(A 和 B),然后人类挑选胜出者。AI 学习去选择那个“平均”的胜出者。
- 缺陷: 论文认为,你不能通过取平均值来获得人类的价值观。如果 50% 的人想要“不受欢迎的观点”,而 50% 的人想要“安全性”,那么两者的平均值并不是一个完美的平衡;它是一个模糊、混乱的信号,无法满足任何人。
- 结果: AI 最终会产生“幻觉”(编造事实)或变得过度谨慎,这并不是因为它坏掉了,而是因为它接收到的指令是冲突欲望的混乱混合物。论文称之为**“认识论暴力”(epistemic violence)**——这是一个高级说法,意指通过将每个人独特、复杂的观点强行塞进一个单一、简单的框框里,我们正在抹杀人们真正关心的细微差别。
5. 环境很重要(“视情况而定”因素)
人们经常说类似这样的话:“保持友好,除非 我要求进行严肃的法律分析”;或者“保持严谨,除非 我在讲故事”。
- 问题: 目前的 AI 训练方法就像一个二进制开关(开/关)。它们难以理解人类语境中的“调光开关”。它们很难学习到某个规则应该是“默认适用”但在“被请求时”关闭。
核心结论
论文得出结论,科技行业正试图用一个数学问题来解决一个政治和文化问题。他们试图创造一个代表所有人的“通用”AI,但在这样做时,他们实际上正在使他们声称要代表的多样性失声。
简而言之: 我们正试图通过让一小群不具代表性的人针对一套统一的规则进行投票,来构建一个全球性的 AI。其结果是一个并不真正理解任何人想要什么的 AI,因为它被迫选择了一个在现实世界中并不存在的“中间地带”。作者建议,我们不应该再试图为每个人打造一个完美的 AI,而应该开始思考如何让不同的群体拥有符合其特定价值观的版本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。