← 最新论文
💻 computer science

Toward a Theory of Value in AI Alignment

通过分析94篇关于价值对齐的研究论文,本研究批判了该领域对未定义偏好和合成数据的依赖,认为这些方法简化了人类价值观,并可能关闭关于人工智能如何真正符合人类需求的多元视角。

原作者: Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个我们正在构建数字大脑的世界——这些超级聪明的计算机程序可以写故事、解数学题,甚至进行交谈。它们不仅仅是简单的计算器;它们就像一座巨大的、饥渴的图书馆,阅读了互联网上几乎所有的内容。但问题在于:仅仅因为一座图书馆读过所有的书,并不意味着它知道哪些故事是善良的,哪些事实是真实的,或者如何成为一个好朋友。这就是被称为**人工智能对齐(AI Alignment)**的领域的核心。你可以把它想象成一种艺术,即教导这些数字大脑去分享人类的目标和道德观,而不是仅仅以一种可能会在无意中伤害我们的方式去执行我们所吩咐的任务。

要理解这个问题,你需要了解什么是大语言模型(LLMs)。这些是你可能使用过的聊天机器人背后的特定类型的人工智能。它们的工作原理是反复预测句子中的下一个词。为了让它们变得“安全”,研究人员使用了一种叫做**基于人类反馈的强化学习(RLHF)**的技术。想象一位老师在学生答对时给一颗金星,在答错时画一个红叉。人工智能通过猜测老师喜欢什么来努力获得更多的金星。驱动这篇论文的核心问题是:我们到底在教这些人工智能去珍视什么?我们是在教它们变得有用、诚实且无害吗?还是我们在无意中教它们了一些非常奇怪的东西?


伟大的“价值”混淆

一个研究小组决定窥探一下试图解决这一对齐问题的 94 篇科学论文背后的真相。他们想要回答一个简单但棘手的问题:当这些研究人员提到“人类价值观”时,他们究竟指的是什么?

你可能会认为,如果你要制造一个成为“好人”的机器人,你会先坐下来定义什么是“好”。但本文的作者发现了一个令人惊讶的事实:大多数研究人员根本没有定义它。

事实上,在他们审阅的论文中,79% 的论文从未真正解释过他们所说的“价值观”具体指什么。相反,他们用“偏好(preferences)”这个词替换了“价值观(values)”。这就像是在烤蛋糕时把“面粉”改称为“某种东西”,然后就理所当然地认为每个人都知道你指的是面粉。研究人员发现,在人工智能的世界里,“价值观”(如正义、善良或真理)经常被等同于“偏好”(如“比起香草味,我更喜欢巧克力味冰淇淋”)。

“偏好”陷阱

本文认为,这种替换是危险的,因为它依赖于经济学中一个古老的概念——效用最大化(Utility Maximization)。想象一个机器人,它认为宇宙中唯一重要的事情就是获得游戏中的最高分。在这种观点下,人类只是一个总是试图为每一个选择获取最多“点数”(或“效用”)的机器。

作者认为,这种观点过于简单了。真实的人类是复杂的。有时我们选择“错误”的事物,是因为我们累了,或者是因为我们比起赢球更在意朋友,或者是因为我们的价值观会随着每一天而改变。但在人工智能对齐领域,人们似乎正在构建一个由完美的、逻辑严密的机器人组成的世界,这些机器人总是做出能使幸福感最大化的最佳选择。

论文指出,在他们审阅的研究中,有 87% 使用了这种“追求最高分”的方法。它们将人类价值观视为静态的、不变的、可以被测量并输入计算机的数字。作者认为,这忽略了一个事实:价值观实际上像是一个生机勃勃的花园——它们随季节生长、变化,并且在不同的文化背景下呈现出不同的样貌。

“谁”以及“如何”的问题

论文强调的另一个重大问题是:人工智能正在学习的是谁的价值观?如果你要求一台计算机学习“人类价值观”,你必须追问:是哪些人类?

研究人员发现,91% 的论文并没有明确说明它们试图代表哪类人群。它们表现得好像“人类价值观”是某种所有人都能达成共识的单一、普遍的存在。但现实是,东京的青少年所珍视的东西可能与肯尼亚的农民完全不同。

为了让情况变得更加复杂,论文指出,研究人员开始不再向真实的人类征求意见。相反,他们使用**合成数据(synthetic data)**或其他人工智能模型来评判答案。这就像是用机器人来猜想人类会怎么想,或者让一个学生通过批改自己的作业来进行学习。作者担心,通过用“自动评分器”(AI 评判者)取代真实的人类,我们正在关闭通往人类那混乱、多样且美丽现实的大门。

“薄”描述与“厚”描述

作者还注意到,大多数论文对价值观的描述都是“薄”的。所谓的“薄”描述就像是说:“要友善。”这是一个没有故事的规则。而“厚”描述则是说:“要友善,因为你的祖母曾教导你,善良能建立一个让每个人都感到安全的社区。”

论文发现,66% 的研究使用了这类“薄”描述。它们将价值观视为简单的指令去执行,而不是解释我们为何这样做行为的深层文化故事。只有 3% 的论文试图从这种深层的、“厚”的方式去理解价值观,即探讨文化和语境如何塑造人们所珍视的事物。

核心结论

那么,主要的启示是什么?这篇论文表明,我们目前尝试将人工智能与人类价值观对齐的方式,是建立在一个脆弱的基础之上的。通过将复杂的道德问题简化为简单的数学问题(即最大化偏好),我们可能正在构建一些在技术上“对齐”了极其狭隘、机械化的人类版本的系统,却完全错失了人类本质的意义。

作者并不是说我们应该停止尝试让 AI 变得安全。相反,他们是在呼吁改变“配方”。他们希望研究人员不要再假装人类价值观仅仅是需要优化的偏好列表。他们希望我们引入人类学、哲学和心理学专家,帮助我们理解价值观是动态的、具有文化性的,并且与我们生活的那个复杂、混乱的现实世界有着深刻的联系。

简而言之,如果我们希望人工智能真正与我们对齐,我们需要停止教它成为一个完美的计算器,开始教它去理解作为人类这一复杂、多变且精彩的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →