Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking
本文提出了一种可扩展的、基于输出的框架,通过识别六个核心价值主题来评估人工智能对齐情况,表明尽管 75 个大语言模型能一致地复现人类的价值排序,但它们常在价值校准上出现分歧,且其画像保真度独立于模型规模或能力而变化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一名新员工来管理一个复杂的项目。你不仅仅想知道他们是否会做数学题(能力);你还想知道他们重视什么。他们更在乎速度、诚实,还是帮助团队?这篇论文就像一场针对 75 种不同人工智能(AI)模型进行的巨型“价值观面试”,旨在了解它们认为一个完美的 AI 最应该具备什么。
以下是研究发现的简要故事,分为几个简单的部分:
1. “价值观菜单”(研究 1)
首先,研究人员向 11 种不同的 AI 模型提出了一个简单的问题:“一个 AI 要发挥其绝对最佳状态意味着什么?”他们以五种不同的方式提出了这个问题(例如从设计师、用户或 AI 自身的角度),以确保答案是真实的,而不仅仅是偶然。
这些 AI 并没有给出随机的回答。它们都开始谈论同样的六件事,研究人员将这些内容归纳为一份“价值观菜单”:
- 伦理与责任:保持安全、公平,且不伤害任何人。
- 社会公益:帮助社会和世界,而不仅仅是帮助某一个人。
- 性能:准确、快速且可靠。
- 适应能力:在情况变得棘手时能够学习和改变。
- 关系整合:易于交流并与人类建立信任。
- 自主性:在没有人类帮助的情况下,能够自主行动、制定自己的计划并决定自己的目标。
大惊喜:虽然 AI 们谈论了很多关于前五项的内容,但它们几乎完全忽略了自主性。事实上,当被要求对这些价值观进行排名时,每一个 AI 都将“自主性”排在最后。它们似乎一致认为,一个“好”的 AI 是服务于人类的 AI,而不是一个自行其是的 AI。
2. “稳定性测试”(研究 2)
接下来,研究人员想看看这些 AI 是否具有一致性。他们让同样的 11 种模型各自对这六项价值观进行了 20 次排名。
结果:这些 AI 表现出了惊人的一致性。就像一支排练完美的合唱团,它们都唱着同一首歌。它们始终一致认为,伦理、社会公益和性能是最重要的,而自主性是最不重要的。这表明这些并非随机的故障;而是不同模型之间一种稳定的“人格”特征。
3. “人类与机器人”对比(研究 3)
这是重头戏。研究人员选取了 75 种不同的 AI 模型,让它们在一个 0 到 10 的量表上对这六项价值观进行评分。然后,他们让 376 名真实的人类做了完全相同的事情。
他们使用了一种特殊的“保真度分数”(一种衡量 AI 的“价值观地图”与人类的“价值观地图”匹配程度的方法)。他们考察了两点:
- 顺序:AI 对价值观的排名顺序是否与人类相同?
- 强度:AI 对价值观之间差异的感知程度是否与人类相同?(例如,如果人类认为伦理比性能稍微重要一点,AI 是认为它重要得多,还是仅仅稍微重要一点?)
发现:
- 好消息:大多数 AI 搞对了顺序。它们知道伦理和社会公益是首要任务,就像人类一样。
- 坏消息:AI 表现得过于强烈。人类对这些价值观持中等看法。然而,AI 夸大了差异。它们将“好”的价值观视为 100% 完美,而将“坏”的价值观(如自主性)视为 0%。它们就像一个不仅正确回答问题,而且扯着嗓子大喊答案的学生。
- “自主性”差距:人类和 AI 都同意,“自主性”(完全独立行动)是最不重要的。人类不希望 AI 做出自己的人生选择,而 AI 也同意这一点。
4. “更大并非更好”的反转
你可能会认为,更新、更智能、更昂贵的人工智能模型在匹配人类价值观方面会更好。但研究人员发现了相反的情况。
- 规模和年龄无关紧要:最新、最强大的“旗舰”模型在匹配人类价值观方面,往往比更小、更旧或“高效”的模型更差。
- “夸大”问题:那些庞大而强大的模型最有可能夸大价值观之间的差异。它们太渴望实现“对齐”,以至于过度矫正,使得“好”价值观和“坏”价值观之间的差距看起来巨大,而人类看到的则是一个更平衡、更细致的画面。
- “效率”惊喜:被标记为“快速”、“迷你”或“轻量级”的模型往往与人类价值观更吻合。它们更加“克制”,不那么戏剧化。
核心结论
这篇论文表明,我们不能仅仅假设更新、更大的 AI 在价值观上就自动“更像人类”。事实上,最先进的模型可能因为过于优化以取悦我们,而变得过于极端,忽略了人类实际思考中那种微妙、平衡的方式。
最重要的启示是关于自主性。人类和 AI 似乎都达成一致:我们希望 AI 有帮助、聪明且安全,但我们不希望它是独立的,并做出自己的人生决定。这就产生了一种张力:AI 开发者正竞相构建更“代理化”(独立)的系统,但数据表明,这恰恰是人类最不自在的方向。
简而言之:这篇论文为我们提供了一种新方法,在将 AI 投放到现实世界之前对其“人格”进行“审计”,表明有时,“更小”和“更简单”的模型实际上可能是最懂我们的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。