Optimal Use of Preferences in Artificial Intelligence Algorithms
本文确立了将无偏好训练与后处理分离在通过保留信息价值来最大化各类决策问题的福利方面在理论上是最优的,尽管当用户面临阻碍最优下游决策制定的认知约束时,将偏好直接嵌入训练中可能更为优越。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在构建一个智能助手,旨在帮助你做出重要的决策,例如决定是否批准贷款、雇用一名候选人或诊断一种医疗状况。这篇论文探讨的核心问题是:在训练 AI 时,你应该是在训练过程中教给它你特定的规则和偏好,还是仅仅教给它原始的事实,然后让你在它给出答案后应用你的规则?
作者约书亚·甘斯(Joshua Gans)认为,在大多数情况下,保持 AI 在训练期间处于“中立”状态,并在之后应用你的偏好是更好的选择。以下是使用简单类比进行的详细说明。
两种方法
1. “嵌入式”方法(将你的偏好植入 AI)
想象你正在训练一位厨师做汤。你告诉厨师:“我讨厌盐,所以每当你品尝汤时,请多加点胡椒粉来补偿。”你将自己的特定偏好(少盐,多胡椒)直接植入到厨师的训练中。
- 风险: 厨师不再学习汤实际的味道是什么。他们只学习如何制作“你版本的”汤。如果明天你决定想要一碗咸味的汤,这位厨师就没用了,因为他们从未学习过真实的口味特征。他们为了专注于你的规则而忘记了真相。
2. “分离式”方法(模块化流水线)
相反,你训练厨师成为品尝大师。你教他们准确识别汤有多咸、多酸或多甜,而不告诉他们如何处理这些信息。他们给你一份精确的报告:“这碗汤有 80% 的咸度。”
- 益处: 一旦你有了那份准确的报告,你再决定该怎么做。如果你想要淡一点,你可以加水;如果你想要更辣一点,你可以加胡椒。如果下周你的口味变了,你不需要重新训练厨师;你只需要更改你的食谱。
核心发现:为什么“中立性”胜出
论文通过数学证明,分离式方法几乎在所有情况下都更好。其逻辑用通俗易懂的话来说如下:
“扁平化”效应
当你强迫 AI 在训练期间学习你的特定偏好(例如“虚假警报比错失机会更糟糕”)时,它会改变 AI 的学习方式。它实际上“扁平化”了 AI 区分不同场景的能力。
- 类比: 想象一张地图。一张好的地图能清晰显示山脉和山谷的区别。如果你告诉制图师:“我只关心山谷,忽略山脉”,制图师可能会模糊两者的界限,让山谷看起来更突出。突然间,这张地图变得没那么好用了,因为它无法再清晰地分辨高耸的山峰和低矮的小丘。
- 结果: AI 变得信息量减少。它给你的信号是“模糊”的。一旦 AI 失去了这种清晰度,无论你之后的决策规则多么聪明,你也无法将其找回。
“期权价值”(Option Value)
通过保持 AI 的中立(训练它给出尽可能准确的概率),你保留了期权价值。你保留了所有的选择权。你可以今天使用同一个 AI 来执行严格的安全政策,明天使用宽松的效率政策。如果你把严格的政策直接刻进 AI 里,你就失去了以后变得宽松的能力,除非重新训练整个系统。
何时“嵌入式”方法会胜出?
论文承认有一种特定情况,将你的偏好植入 AI 会更好:当用户感到疲劳、困惑或不堪重负时。
- 类比: 想象你是一名医生。AI 给出了一个复杂的、包含每种疾病概率的 50 页报告。你精疲力竭,只有 5 分钟时间看下一位病人。阅读并理解那份复杂的报告太难了(认知成本很高)。
- 解决方案: 在这种情况下,让 AI 为你完成繁重的工作更好。你训练 AI 直接说:“给这个病人使用抗生素”,而不是“有 72% 的感染概率”。AI 将信息“压缩”成了简单的行动,节省了你的脑力。
- 权衡: 你失去了一些精确度(AI 可能会稍微不够准确),但你获得了速度和简洁性。如果用户无法处理复杂的数据,那么“嵌入式”方法就会胜出。
论文中提到的现实世界案例
论文将这些思想应用于两个主要领域:
标准 AI 流水线(如招聘或贷款):
- 建议: 训练 AI 成为一个完美的“概率计算器”(例如,“该申请人有 65% 的成功率”)。不要训练它去决定谁被录取。让一个人类或一套单独的规则根据这 65% 的概率来决定谁被录取。这允许你在不重新训练 AI 的情况下更改招聘规则。
大型语言模型(如聊天机器人):
- 问题: 我们经常使用一种叫做 RLHF(基于人类反馈的强化学习)的技术,来教 AI 什么才是“有帮助的”或“无害的”。这就像是将“有帮助”的规则直接植入 AI 的大脑中。
- 警告: 如果我们今天植入了一个特定的“有帮助”的定义,如果未来的优先级发生变化,AI 可能会变得不再“无害”或不再“真实”。这就像是训练一个只会做辣味食物的厨师;如果要求做清淡的菜,他们就会失败。
- 修正方案: 论文建议保持 AI 的基础知识广泛且中立,并使用“后处理”(如过滤器或规则)来决定向用户展示什么。这能保持 AI 的灵活性。
总结
黄金法则:
除非你的用户因为无法理解复杂数据而感到不堪重负,否则不要将你的偏好植入训练过程。
- 训练 AI 去讲述真相(给出准确的概率)。
- 让人类(或简单的规则)根据这些真相来决定做什么。
这能让你的 AI 保持灵活、准确,并随时准备应对你未来可能拥有的规则或目标。只有当你绝对需要为疲惫或困惑的用户简化决策时,才去“植入”偏好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。