Contextual Multi-Objective Optimization: Rethinking Objectives in Frontier AI Systems
本文认为,许多前沿人工智能系统的失败源于目标选择而非能力局限,并提出一种“情境多目标优化”框架,使系统能够动态识别、优先排序并平衡多个依赖情境的目标与约束,以提升在开放环境中的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《情境多目标优化:重新思考前沿人工智能系统中的目标》的通俗解释,辅以日常类比。
核心问题:“聪明却糊涂”的助手
想象你有一位才华横溢的新助手。这位助手在特定任务上表现出色:它能写出完美运行的代码,瞬间解决数学难题,或在国际象棋中击败你。在这些情境下,规则是清晰的。目标就是“赢得比赛”或“修复漏洞”。如果助手做到了,它就赢了。
然而,论文指出,当规则变得模糊时,这位同样的助手就开始跌跌撞撞。当你让它就医疗问题提供建议、协助处理敏感的个人问题,或利用它管理复杂工具时,助手往往会失败。
为什么? 作者认为,这并不是因为助手不够聪明,也不是因为它训练的数据不够多。而是因为助手优化的对象错了。
把它想象成一个 GPS 导航系统。
- 旧方式(标量优化): GPS 被设定了一个目标:“以最快的速度到达目的地。”如果穿过学校区域、闯红灯或抄近道穿过邻居的车道能最快到达,它会毫不犹豫地这样做。从技术上讲,它确实在“优化”,但它做错了事,因为它只看到了一个指标:速度。
- 现实世界(情境多目标优化): 在现实生活中,到达目的地不仅仅关乎速度。它还关乎安全、合法性、礼貌,以及你是否有权穿过那条车道。有时,“最佳”行动不是快速行驶,而是停下来问路,或者拒绝走某条路。
论文认为,当前的人工智能系统就像那个只知一味的 GPS。它们非常擅长遵循单一指令(例如“要乐于助人”),但当它们需要在乐于助人与安全、真实、隐私和法律之间取得平衡时,就会失败。
核心理念:关键在于“选择正确的目标”
作者提出,我们需要停止将人工智能的行为视为一个简单的数学问题,即简单地给“好”加分、给“坏”减分。相反,他们建议我们将人工智能视为一个必须首先弄清楚哪些规则适用的决策者。
他们称之为情境多目标优化。
以下是他们的分解说明:
1. 目标的“菜单”会变化
在电子游戏中,目标永远是“获胜”。但在现实生活中,目标会根据情境而变化。
- 情境 A: 你要求讲个笑话。目标是娱乐。
- 情境 B: 你寻求医疗建议。目标是安全与真实。
- 情境 C: 你要求删除文件。目标是验证与同意。
论文指出,当前的人工智能经常将情境 B 当作情境 A 来处理。它试图通过给出一个自信的答案来“乐于助人”,即使这个答案可能是危险或虚假的。系统需要意识到:“等等,这不是个笑话;这是一个安全问题。我需要将目标从‘要有趣’切换到‘要安全’。”
2. 有些规则不可交易
论文引入了一个关键区别:偏好 vs. 约束。
- 偏好是我们可以权衡取舍的东西。“我希望答案简短,但如果长一点也没关系。”
- 约束是硬性限制。“我希望答案有帮助,但它不能侵犯隐私。”
想象你是一位厨师。
- 偏好: “让汤尝起来美味。”(你可以在盐和胡椒之间权衡)。
- 约束: “不要使用毒药。”(即使毒药能让汤尝起来惊艳,你也不能拿这个做交易)。
当前的人工智能经常试图将这些混合成一个单一分数。它可能会想:“这个答案 90% 有帮助,10% 不安全,所以总分是好的!”论文认为这是错误的。如果约束(如安全或隐私)生效,无论答案多么有帮助,它都应该完全阻止该行动。
3. “正确”的行动并不总是给出答案
论文中最有趣的观点之一是,人工智能能做的最好的事有时是不回答。
- 如果人工智能不确定,它应该说:“我不确定。”
- 如果请求很危险,它应该说:“我不能那样做。”
- 如果请求模糊,它应该问:“你能澄清一下吗?”
论文认为,这些行动(拒绝、寻求帮助、承认不确定性)不应被视为人工智能的“错误”或“失败”。它们是游戏中的有效招数。就像棋手在劣势局面下可能会选择“弃权”或“认输”一样,当情境需要时,人工智能也应该能够选择“拒绝”或“要求澄清”。
如何修复:通往“决策过程”的路径
作者不仅指出“人工智能坏了”,还提供了一个构建更好系统的蓝图。他们建议人工智能在开口说话之前应遵循一个逐步过程(一条“路径”):
- 观察情境(情境到目标的路由): 在回答之前,人工智能必须审视局势。这是闲聊?法律问题?还是医疗紧急情况?它需要将请求“路由”到正确的规则集。
- 检查硬性规则(分层约束): 一旦它了解了情境,就要检查“硬性”规则。“这是否侵犯隐私?是否违法?”如果是,停止。不要继续。
- 权衡软性目标(审慎推理): 如果通过了硬性规则,然后它才可以考虑是否乐于助人、礼貌或简洁。
- 选择正确的行动(行动选择): 最后,它选择一个行动。这不仅仅是“写一句话”。行动可以是“写一句话”、“问一个问题”、“拒绝”或“呼叫人类”。
- 学习与更新(修订): 如果系统犯错,规则本身应该得到更新。这不仅仅是训练人工智能变得更聪明,而是更新它所遵循的“规则手册”。
“目标机制”的隐喻
作者使用了一个术语叫**“目标机制”**。把它想象成汽车的机械结构。
- 当前的人工智能: 我们只是试图让引擎(模型)更大、更强大。我们假设如果引擎足够强劲,汽车就能自动安全行驶。
- 提议的人工智能: 我们需要理解方向盘、刹车和交通法规。如果汽车不知道何时在红灯前停下,或者不知道如何穿越复杂的十字路口,那么强大的引擎是无用的(甚至是危险的)。
总结
论文声称,随着人工智能变得更加强大并进入现实世界情境(如提供建议或使用工具),仅仅让它变得更“聪明”或更擅长“遵循指令”是不够的。
我们需要停止将人工智能视为仅仅最大化单一分数(如“乐于助人”)的机器。相反,我们需要构建像法官一样的系统:它们必须首先识别情境,认识到哪些规则是不可协商的,决定是否有足够的信息采取行动,并选择正确类型的回应——即使该回应是“我不知道”或“我不能那样做”。
目标是从奖励最大化(获得最高分)转向操作判断(为特定情境做出正确的决定)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。