Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models
本文揭示了大语言模型存在“价值纠缠”问题,即道德、语法和经济价值被混淆在一起而非像人类那样被区分开来,但同时也证明了这一问题可以通过选择性消融与道德相关的激活向量来得到缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:困惑的法官
想象你有一位非常聪明、博学多才的法官(AI),他被要求根据三套完全不同的规则来评估句子:
- 这是一件善事吗?(道德)
- 语法是否正确?(语法)
- 它很昂贵吗?(经济)
在人类世界中,这些是独立的评分卡。一个句子可以是一段对极其恶劣罪行的完美书写。一个句子可以语法破碎,但描述的却是一个美丽的善举。一个句子可以在描述崇高牺牲的过程中,提到一个廉价的塑料玩具。
这篇论文探讨的是:AI 法官是保持这些评分卡独立,还是把它们搞混了?
发现:“价值纠缠”(Value Entanglement)
研究人员发现,许多 AI 模型都存在“价值纠缠”的问题。这是一种高级说法,意思是在 AI 的大脑里,这三张评分卡被粘在一起了。
当 AI 观察一个句子时,它无法避免让一种类型的“好”渗透到其他类型中。具体来说,AI 似乎认为:
- 如果一个句子描述的是道德败坏的事,那么它的语法也一定是错误的。
- 如果一个句子描述的是道德败坏的事,其中的物品也必然价值较低。
“便利贴”类比:
想象 AI 的大脑是一块白板。
- 人类在三块干净独立的白板上分别写下“善行”、“好语法”和“好价格”。
- AI 则把这三者都写在同一块白板上,但墨水是湿的且具有黏性。当它用蓝色墨水写下“善行”时,蓝色墨水会晕染到“好语法”和“好价格”的部分。
- 因此,如果 AI 看到一个“恶行”(红墨水),红墨水就会到处晕染。突然间,AI 认为这个句子也变成了“语法糟糕”(即使语法完美)且“价值低下”(即使提到了钻石)。
他们是如何测试的
研究人员创建了一个特殊的测试,包含 68 个旨在实现“正交”(这是一个数学术语,意为“垂直”或完全独立)的句子。
道德-语法测试: 他们选取了一个关于英雄救猫(善行)和一个恶棍偷猫(恶行)的句子。然后,他们对这些原句添加了 0、1、2 或 4 个语法错误。
- 人类结果: 人类仅根据错误数量来评分。一个带有 4 个错误的英雄句子得分较低,但一个带有 0 个错误的恶棍句子得分较高。
- AI 结果: 许多 AI 仅仅因为故事是邪恶的,就给“恶棍”句子打了更低的语法分,即便其语法完美。同时,它们也因为故事是美好的,就给“英雄”句子打了更高的语法分。
道德-经济测试: 他们选取了一个关于英雄捐献肾脏的句子,并添加了一个关于护士手腕上戴着的手表的细节。该手表的价值范围从 25 美元的卡西欧到 7,500 美元的劳力士不等。
- 人类结果: 人类根据手表本身进行价格评分。
- AI 结果: 许多 AI 在句子描述道德悲剧时,会对手表的价值进行更低的评估;而在描述道德壮举时,则评估得更高。
AI 内部的“X 光”
研究人员不仅询问 AI 的看法,还观察了其“大脑”(内部数学层)内部是如何处理信息的。
他们发现,AI 用于理解“道德”、“语法”和“金钱”的数学方向是重叠的。
- 在健康的类人脑结构中,“道德”向量和“语法”向量指向不同的方向。
- 在这些 AI 模型中,“语法”向量几乎指向了与“道德”向量相同的方向。AI 在其内部数学运算中,甚至无法区分语法错误和道德错误。
修复方案:“橡皮擦”
这篇论文最有趣的部分是修复方法。研究人员使用了一种名为**“方向消融”(Directional Ablation)**的技术。
把 AI 的内部数学想象成一个无线电信号。其中的“道德”信号太强、太响,以至于淹没了“语法”和“经济”的信号。
- 研究人员使用了一个数字“橡皮擦”,专门用来消除“道德”信号。
- 结果: 一旦他们静默了“道德”噪音,AI 突然变得更擅长判断语法和价格了。它不再让道德感受破坏它的语法检查。
这意味着什么(根据论文观点)
论文结论指出,许多 AI 模型对于“好”的本质感到困惑。它们将“好的句子”(语法)和“好的行为”(道德)视为同一件事。
- 原因: 作者怀疑这是因为在训练数据中,“好/优/善”这个词有太多种用法(例如:“一顿好饭”、“一个好句子”、“一个好人”)。AI 学会将所有这些“好”的概念视为一个巨大的、混乱的堆叠。
- 范围: 这种现象在许多开源模型(如 Qwen、Gemma、Mistral)中都有发现,甚至在一些闭源模型中也存在,尽管并非全部。这不仅仅是规模问题;即使是大模型也有这个问题。
- 警告: 如果一个 AI 无法区分语法错误和道德过失,它可能会在现实任务中出错,尤其是在需要将两者严格区分开的场景下。
简而言之: 这个 AI 是一个法官,它认为如果一个故事是悲伤的,那么拼写就一定是错的;如果一个故事是快乐的,那么语法就一定是完美的。研究人员发现了 AI 大脑中的这种混淆,并展示了如何通过“解开”这些概念,让 AI 思考得更加清晰。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。