Generative AI in Systems Engineering: A Framework for Risk Assessment of Large Language Models
本文介绍了大语言模型风险评估框架(LRF),这是一种基于自主性和影响程度对系统工程中的大语言模型应用进行分类的结构化方法,旨在实现一致的风险评估、适当的验证策略以及人工智能技术的安全集成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚为你的工程团队聘请了一位才华横溢、语速极快的全新助手。这位助手由大语言模型(LLM)驱动,可以在几秒钟内撰写报告、检查代码,甚至设计系统的部分组件。这就像拥有了一个永不疲倦的超级聪明实习生。
但问题在于:这个实习生也有些难以捉摸。有时它会编造事实(幻觉),有时它会被冗长的指令搞糊涂,有时它可能会给出一个看起来很棒但实际上非常危险的设计方案。
你所询问的这篇论文本质上是一本雇佣这位实习生的安全手册。它被称为LLM风险评估框架(LRF)。其目标是帮助工程公司弄清楚:“让这个AI去做这项特定的工作是否安全,还是我们需要给它套上紧紧的缰绳?”
以下是该框架的工作原理,通过简单的概念进行拆解:
1. 两个旋钮:“谁在驾驶?”以及“后果有多严重?”
作者指出,你不能仅仅通过观察AI本身来判断它是否有风险。你必须观察两个特定的维度,就像在控制面板上旋转两个旋钮一样:
旋钮 A:自主性(谁在驾驶座上?)
这可以类比为自动驾驶汽车的分级。- 等级 0(副驾驶): AI 只提供建议。你必须输入最终指令。这就像 GPS 给你提供路线,但你仍在掌控方向盘。
- 等级 1(向导): AI 建议一条路线,但你必须说“是的,请继续”之后它才会移动。
- 等级 2(受监督的驾驶员): AI 自行驾驶,但你坐在副驾驶位上,手放在刹车附近,准备在它偏离航线时随时接管。
- 等级 3(全自动驾驶): AI 驾驶、决策并完成停车。你甚至不在车里,只需告诉它目的地即可。
旋钮 B:影响(如果撞车了会怎样?)
这衡量了错误的严重程度。- 低影响: 如果 AI 出错了,这只是令人恼火但可以修复的。例如:它在草拟邮件时拼错了一个单词,或者对会议内容的总结略有偏差。
- 中影响: 这里的错误会导致延误或额外成本。例如:它建议了一个尺寸不匹配的零件,导致你不得不重新订购。
- 高影响: 这里的错误是灾难性的。例如:它设计了一个失效的制动系统,或者批准了一份会让公司损失数百万美元的法律合同。
2. 风险图谱:混合旋钮
论文将这两个旋钮结合成一个巨大的网格(矩阵)。它能告诉你任何任务的“风险等级”。
- 绿色区域(极低风险): 低自主性 + 低影响。
- 类比: 使用 AI 来检查一篇非关键性博客文章中的拼写。
- 规则: 请继续!只需让人类扫一眼即可。
- 黄色区域(低风险): 中等自主性 或 低影响。
- 类比: 使用 AI 起草一份会议议程。
- 规则: 可以,但要保持关注。确保你理解它为什么那样写。
- 橙色区域(中等风险): 中/高自主性 + 中/高影响。
- 类比: AI 正在撰写一份安全手册的初稿。
- 规则: 你需要严格的人类监督。人类必须在每一行内容被使用前进行逐行检查。
- 红色区域(高风险): 高自主性 + 高影响。
- 类比: AI 正在设计火箭发动机,或独立做出法律判决。
- 规则: 停止。 这太危险了。如果你必须这样做,你需要庞大的安全网、备份计划以及人类专家的双重检查。你不能让 AI 在这里横冲直撞。
3. 论文中的现实案例
作者提供了两个例子来展示其运作方式:
案例 1:需求检查器(低风险)
想象一个 AI 阅读了一份关于新车的规则列表,并说:“嘿,这条规则缺少细节。”- 自主性: 等级 1(它建议修改,但你必须点击“批准”)。
- 影响: 中等(如果它错了,你可能需要重写一条规则,但车不会爆炸)。
- 结论: 低风险。 只要人类批准更改,使用它是安全的。
案例 2:法律案件评估器(高风险)
想象一个 AI 查看了一个法律情况并判定:“是的,这项法律适用,你有罪。”- 自主性: 等级 3(它在没有人类查看的情况下做出最终决定)。
- 影响: 高(如果它错了,你会入狱或损失巨额财富)。
- 结论: 高风险。 让 AI 单独做决定太危险了。你需要人类律师来核实每一个结论。
核心结论
论文认为,我们不能在工程领域任由 AI 肆意妄为,因为其中的代价太高。与其禁止 AI 或任其自由,不如使用这种风险框架,将 AI 的能力与合适程度的人类监督相匹配。
- 如果工作枯燥且风险较低,就让 AI 做更多。
- 如果工作关键且风险较高,请让把人类牢牢地留在驾驶座上。
这种方法有助于公司在使用酷炫新技术的同时,避免意外搞砸他们的项目。这是在速度与安全之间寻找平衡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。