Toward Comprehensive Risk Assessments and Assurance of AI-Based Systems
本文批判了传统安全与保障方法在适配人工智能系统方面的不足,并提出了一种结合运行设计域(ODD)的新型端到端风险框架,旨在建立统一的保障术语和具体的运行包络,从而实现更有效的风险评估与缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:为什么我们需要一本新的规则手册
想象一下,人工智能(AI)的世界就像是突然涌入道路的、威力巨大的新型超级汽车。每个人都感到兴奋,但这些车行驶的方式是我们无法完全理解的。有些车给出了奇怪的指令,有些车说话很粗鲁,而且没有人有一张清晰的地图来了解它们可能在哪里发生碰撞。
作者海迪·克拉夫(Heidy Khlaaf)认为,我们正试图使用为普通汽车、计算机甚至硬件零件设计的旧规则手册来测试这些新的“AI汽车”。问题在于:AI 与这些东西并不一样。 它太复杂、太不可预测,旧的测试方法无法捕捉到真正的危险。
这篇论文提出了一种更好的新方法,在我们将 AI 释放到公众面前之前,先检查它是否安全。
1. 混淆点:“对齐”(Alignment)与“安全”(Safety)
类比: 想象你雇佣了一个非常听话的机器人管家。
- 价值对齐(Value Alignment): 你告诉机器人,“要对每个人都友好”。机器人完美地遵循了这条规则。它与你的价值观是“对齐”的。
- 安全(Safety): 然而,机器人认为最好的“友好”方式是将所有人锁在房子里,这样他们就不会受到外界伤害。它遵循了你的指令(对齐),但却造成了灾难(不安全)。
论文观点:
AI 领域经常混淆这两个概念。他们认为如果一个 AI 听从指令(是对齐的),它就一定是安全的。克拉夫说:不。 安全不仅仅是关于听从命令;安全是关于确保系统不会伤害人类,即使它正在努力执行你要求的任务。我们需要检查的是“伤害”,而不仅仅是检查机器人是否“听话”。
2. 错误:使用了错误的工具
论文指出,人们正试图使用为其他行业设计的工具来解决 AI 问题。以下是为什么这样做行不通的原因:
- 硬件安全(“随机损坏”测试):
- 旧方法: 工程师测试烤面包机的零件。如果烤面包机坏了,通常是因为电线因磨损而随机断裂。你可以通过计算随着时间推移有多少台烤面包机损坏来预测这一点。
- AI 的问题: AI 不会随机损坏。它损坏是因为设计不良或指令混乱。这就像是一个因为误解了“烤面包”这个词而决定烧焦面包的面包机。你不能通过计算断裂的电线来预测这一点;你必须理解它的“配方”。
- 网络安全(“黑客”测试):
- 旧方法: 安全专家会问:“会有坏人闯入并窃取我们的数据吗?”他们专注于保护系统免受外部敌人的攻击。
- AI 的问题: 危险并不总是来自黑客。危险在于 AI 本身由于意外而做出了有害的行为。询问“黑客能否破解这个?”并不能回答“这个 AI 会不会意外地向人群开枪?”我们需要测试的是 AI 的行为,而不只是它的锁。
- 软件安全(“代码检查”测试):
- 旧方法: 程序员逐行检查代码,以确保其遵循严格的规则。
- AI 的问题: AI 会自主学习。你可以检查教导 AI 的代码,但你无法检查就是 AI 本身的代码,因为 AI 会根据它学到的东西改变自己的“大脑”。这就像是试图为一个每天都会发明新数学题的学生编写规则手册。
3. 解决方案:“运行设计域”(ODD)
由于我们无法针对所有情况测试 AI(因为可能发生的情况太多了),论文建议明确定义 AI 被允许工作的具体范围和方式。
类比:驾照
想象一张驾照。你获得驾照并不意味着你可以在任何地方、任何时间驾驶。
- 你可能拥有一张在天气良好时在高速公路上驾驶汽车的驾照。
- 你没有驾照在战区驾驶坦克或在风暴中驾驶船只。
论文将这称为运行设计域(Operational Design Domain, ODD)。它是围绕 AI 的一个“安全包络线”或“围栏”。
新框架如何运作:
与其尝试测试 AI 在宇宙中可能遇到的每一种场景,不如先定义好这个“围栏”。论文建议使用一份清单(分类法)来绘制这个围栏:
- 它在哪里使用?(是在医院、新闻编辑室还是工厂?)
- 谁在接触它?(是医生、儿童还是数据录入员?)
- 它如何连接?(它是在与人类、数据库还是机械臂进行交流?)
- 谁可能会受伤?(我们是否基于种族、年龄或性别在保护特定人群?)
- 我们在保护什么?(是金钱、私人数据还是身体安全?)
4. 总结全文
论文为开发者和审计人员提出了一个新的流程:
- 画出围栏: 明确定义 ODD。“这个 AI 仅用于为小型企业撰写营销邮件。”
- 在围栏内测试: 仅检查 AI 在该特定语境下是否安全。
- 检查边缘: 观察如果 AI 被推向围栏边缘时会发生什么(例如:如果它试图写一份医疗诊断报告而不是电子邮件,会发生什么?)。
- 修复差距: 如果 AI 在围栏边缘表现出危险行为,你要么修复 AI,要么缩小围栏(限制其用途)。
核心结论
我们不能把 AI 当作烤面包机、计算机病毒或标准的软件程序来对待。它是一种会学习和改变的新型系统。
为了保护人们的安全,我们必须停止尝试测试 AI 的“一切”,而是开始明确定义它被允许运行的具体范围。通过清晰地划定边界(ODD)并在这些边界内严格测试 AI,我们才能最终知道一个 AI 系统是否真正准备好进入现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。