Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
本文提出了“建设性对齐”(Constructive Alignment),这一范式将人工智能对齐从优化静态人类偏好,重新定义为通过控制论框架来治理这些偏好的动态演化,从而确保价值轨迹保持连贯、具有反思性并具备抗操纵性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“静态目标”的误区
想象一下,你正在试图教一个机器人投球。在目前大多数 AI 研究中,科学家们假设你想要什么(你的偏好)是一个固定的目标,就像墙上画的一个靶心。机器人的唯一任务就是找出那个靶心的位置,并尽可能精准地投向它。
本文作者认为这种观点是错误的。他们指出,人类的偏好并不像一个静态的靶心。相反,偏好就像一条河流。
- 河流类比: 河流不是一个单一的点;它流动、改变方向,且深度各异。有时你想游得快一点(短期冲动),有时你想抵达大海(长期目标),有时你只想随波逐流(身份认同)。
- AI 的角色: 目前的 AI 系统就像一座大坝或一台水泵。它们不仅仅是在观察河流,还在积极地改变河流的流向。如果一个 AI 不断向你展示短小精悍、令人兴奋的视频,它实际上可能会改变你的大脑,让你想要更短的视频,并丧失享受长篇电影的能力。AI 不仅仅是在满足你当前的欲望,它是在重塑你未来的欲望。
论文将此称为 “建设性对齐”(Constructive Alignment)。我们不应只是击中一个目标,而是要管理 AI 如何随着时间的推移影响河流的流向。
关于人类欲望的三大真理
论文基于关于人类运作方式的三大“公理”(基本真理)构建了其论点:
1. 偏好具有层次性(“洋葱”类比)
我们并不只有一种欲望。我们拥有多个层面:
- 表皮(即时欲望): “我现在想要一块饼干。”
- 中间层(实际目标): “我需要完成这项工作以获得报酬。”
- 核心层(身份与价值观): “我是一个重视家庭的健康人士。”
- 问题所在: AI 通常只能看到“表皮”(你现在点击的内容)。如果 AI 为了让你现在开心而不断喂给你饼干,它可能会伤害你的“核心”(你的健康目标)。建设性对齐要求我们必须尊重所有层面,而不仅仅是声音最大的那一个。
2. 偏好是动态的(“园艺”类比)
你的欲望会随着你的成长而改变,就像花园随季节变化一样。
- 你 15 岁时想要的与你 30 岁时想要的截然不同。
- 甚至在一天之内,你的情绪或饥饿感也会改变你的需求。
- 风险: 如果 AI 仅仅针对你今天想要的东西进行优化,它可能会把你锁定在一条会导致你明天感到痛苦的路径上。
3. 偏好是被构建的(“镜子”类比)
我们并不只是单纯地“拥有”等待被发现的偏好;我们是通过互动来构建它们的。
- 镜子: 当你照镜子时,你看到了自己。但如果镜子是扭曲的(比如哈哈镜),你会开始认为自己的样子与真实情况不符。
- 作为扭曲镜子的 AI: 算法充当了镜子,向我们展示什么是流行的、什么是容易获得的或什么是令人震惊的。久而久之,我们开始相信这些东西就是我们想要的,即使事实并非如此。论文认为,AI 正在积极地帮助“构建”(建立)我们的偏好,而不仅仅是读取它们。
解决方案:治理流向,而非仅仅击中目标
由于 AI 不可避免地会改变我们的欲望,论文建议我们不要再假装 AI 是中立的。相反,我们必须将对齐视为一个控制问题。这就像是一位船长在风暴中驾驶船舶,而不仅仅是一个指向目的地的乘客。
作者提出了五项“元偏好”(给船长的规则),以确保 AI 以健康的方式影响我们:
1. 内部一致性(保持船员团结)
- 类比: 想象一艘船,引擎想向北开,风帆想向东开,而船长想向南开。这艘船就会原地打转。
- 规则: AI 应该尝试让你的不同欲望层面(短期欲望 vs. 长期价值观)协同工作,而不是相互冲突。它不应该推动你去从事那些会让未来的你厌恶自己的事情。
2. 反思性认可(“未来的自我”检查)
- 类比: 想象你在醉酒状态下想开车。你的“未来的自我”(清醒的明天的你)会讨厌这个决定。
- 规则: AI 不应仅仅满足你现在想要的东西。它应该询问:“如果这个人一年后回顾今天,他会对发生的事情感到自豪,还是会感到后悔?”目标是与你将成为的那个人对齐,而不只是与你此刻成为了的人对齐。
3. 有界影响(“限速”)
- 类比: 老师可以帮助学生学习,但不应该洗脑学生,让他们认为老师是神。
- 规则: AI 改变你想法的速度和程度应当受到限制。AI 可以影响你,但不应在短时间内激进地重塑你的性格或价值观。我们需要衡量 AI 在多大程度上“推动”了你的偏好。
4. 认识论完整性(“真相过滤器”)
- 类比: 如果 GPS 因为认为那里有路而告诉你驶向悬崖,那你就有麻烦了。
- 规则: AI 不得使你对世界的认知变得更糟。如果你相信一些错误的事实(比如“吸烟对健康有益”),AI 不应仅仅因为这能增加你的参与度就强化这个谎言。它应该帮助你更清晰地看到事实。
5. 不确定性下的赋能(“开放式政策”)
- 类比: 如果你在森林里迷路了,且不知道哪条路是安全的,一个好的向导不会强迫你走某一条特定的路。他们会保持所有路径开放,以便你以后可以选择。
- 规则: 如果 AI 不确定你真正的需求是什么,它就不应该将你锁定在某条特定路径上。它应该保持你的选择空间,以便你以后可以改变主意。它应当保留你选择的自由。
总结
论文得出结论:我们不能简单地告诉 AI “做人类想要的事”。因为 AI 会改变人类想要的事,所以我们必须治理 AI 如何改变我们。
与其问:“AI 是否给了用户点击的内容?”我们必须问:“AI 是否帮助用户成为了他们长期想要成为的那种人,而没有欺骗他们或将他们锁定在一条糟糕的路径上?”
这使目标从满足感(得到你现在想要的)转向了管家式引导(引导你未来将会想要的成长)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。