TrustX Agent Risk Classification Framework (ARC): Risk-Tiering Internally Created Agentic AI Systems
本文介绍了 TrustX 智能体风险分类框架 (ARC),这是一个利用十二维评分量表和现有自主性模型,将七种类型的智能体 AI 系统划分为三个风险等级及其相应的治理控制措施的结构化工具,专门为从业者、开发者和监管机构设计,用于管理内部创建的智能体 AI 所带来的独特风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一座繁忙的城市。很长一段时间以来,这些“AI公民”大多像是乐于助人的图书管理员或计算器:它们坐在书架上,等待提问,然后给出答案。但最近,一种新型公民来到了这里:代理式人工智能(Agentic AI)。它们不仅仅是图书管理员,更像是超级聪明的小型实习生,不仅能寻找信息,还能“做事”——预订机票、编写代码、操控机器人,甚至管理银行账户。它们可以进行规划、采取行动,并且无需人类每秒钟都手把手地指导。
问题在于,城市的旧规则手册(如 NIST 框架或欧盟《人工智能法案》)是为图书管理员编写的。它们不知道如何处理这些精力充沛的新型实习生,因为这些实习生可能会不小心删除文件、窃取机密,或者引发连锁反应式的错误。
于是,来自负责任人工智能研究所(Responsible AI Institute)的 Hannah Liu、Rhea Saxena 和 Shiv Asthana 登场了。他们开发了一种名为 TrustX 代理风险分类框架(ARC) 的新工具。你可以将 ARC 视为一种高科技的“风险雷达”,专门设计用于扫描这些新型 AI 实习生,并将它们划分为三个安全等级:低、中、高。
12 点安全扫描
为了判断一个 AI 实习生可能有多危险,ARC 不仅仅是靠猜测。它运行一个 12 维评分量表。想象一下一个包含 12 个问题的清单,例如:
- 自主性(Autonomy): 这个 AI 是每走一步都需要人类说“开始”,还是会自行其是?
- 影响范围(Blast Radius): 如果这个 AI 搞砸了,它只是让一个人感到困扰,还是会瘫痪整个公司的网络?
- 可逆性(Reversibility): 如果 AI 破坏了某些东西,你能点击“撤销”吗,还是说造成的损害是永久性的?
- 数据敏感性(Data Sensitivity): 这个 AI 是在阅读公开的天气报告,还是在挖掘顶级的“核心机密”文件?
每个问题都会得到 1 分(低)、2 分(中)或 3 分(高)的评分。
“关键维度”原则:无法隐藏危险
这是他们发现中最重要的一部分,有点像火警报警器。在许多风险系统中,如果你有一个巨大的问题和十个微小的问题,系统可能会通过平均值来处理,并说:“额,总体来说还行。”
该论文的作者明确拒绝了这种想法。他们认为,你不能通过平均值来抹平灾难。他们的框架采用了**“关键维度”方法**。这意味着,如果这 12 个问题中的任何一个得到了“3”(高风险),那么整个系统就会被提升到最高危险等级,无论其他 11 个问题有多安全。
例如,在他们的说明性示例中,他们观察了一个“决策支持系统”(比如协助医生的医疗 AI)。尽管它的绝大多数得分都很低(1 分),但因为它处理敏感且受监管的医疗数据,所以它得到了一个“3”。由于这一个“3”,该框架建议必须将其视为 Tier 3:高风险 系统。简单的平均值会掩盖这一危险,但 ARC 捕捉到了它。
七种类型的 AI 实习生
该框架将这些代理分为七个类别,结果令人惊讶:
- 自主代理(Autonomous Agents): 这些是“老板”。它们设定目标并独立完成一切。在论文的模拟中,它们的平均分是 2.33,并被归类为 Tier 3(高风险)。它们就像是一辆从不停车询问方向的自动驾驶汽车。
- 编程助手(Coding Assistants): 这些是“程序员”。论文指出一个特殊问题:因为它们编写的代码会在计算机上运行,所以它们需要一套特殊的“扩展规则”。即使是一个简单的“自动补全”工具(仅提供代码建议),也被评为 Tier 2(中风险),因为它处理的是内部机密代码。
- 决策支持系统(Decision Support Systems): 如前所述,即使它们主要只是进行对话,但只要触及私密数据,就会跃升至 Tier 3。
- 嵌入式/物理代理(AI Embedded/Physical Agents): 这些是机器人和自动驾驶汽车。因为它们可能会伤害人类或损坏物理实体,且你无法在车祸发生后“撤销”操作,所以它们属于 Tier 3。
- 知识助手(Knowledge Assistants): 这些是“研究员”(如聊天机器人)。它们通常属于 Tier 2,但如果它们记忆过多或接触秘密数据,就会变成 Tier 3。
- 工具使用型代理(Tool-Using Agents): 这些是与其他应用通信的“连接者”。因为它们可能会意外地将数据泄露给外界,所以属于 Tier 3。
- 交易/商务代理(Transaction/Commerce Agents): 它们处理金钱。令人惊讶的是,在论文的示例中,它们落在 Tier 2(中风险),因为它们通常仍需人类审批。然而,作者警告说,如果这些代理获得更多自由,它们很容易变成高风险。
该论文排除的内容
作者非常明确地说明了他们的工具不是什么。
- 它不是解决所有 AI 问题的万灵药。
- 它不是最终的、不可更改的法律。论文承认该框架是一个“结构化的、可重复的工具”,随着 AI 变得更加聪明,它需要不断更新。
- 它不是人类判断的替代品。评分基于用户如何回答问题,作者也承认“评分的主观性”是一个局限性。
- 它并不声称高风险 AI 不应该被开发。相反,它认为如果你要开发高风险 AI,你需要“严格”的控制措施(如第三方验证和董事会级审批)来确保安全。
他们的确定程度如何?
论文将此呈现为一个提议的框架,它是基于现有规则和现实世界事件(例如 2025 年编程工具出现漏洞的“IDEsaster”)而提出的。他们使用说明性示例和模拟评分来展示其运作方式。他们并未声称已经对世界上所有的 AI 进行了测试;相反,他们认为这种方法是必要的进步,因为当前的规则在 AI 增长的速度面前已经“落后”了。
总结
作者认为,通过使用这种“风险雷达”,公司和监管机构可以停止猜测。与其寄希望于他们的 AI 实习生是安全的,不如让他们通过 12 点扫描。如果 AI 在任何一个类别中得到了“3”,警报灯就会变红,严格的规则就会生效。这是一种确保随着 AI 变得越来越强大,我们的安全网也能变得同样强大的方式。
正如论文结论所言,这个框架旨在成为一个“实用的阶梯”。它不是终点,但比起我们之前的地图,它是一张好得多的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。