← 最新论文
💻 computer science

Coverage and Complementarity of Three Agentic AI Risk Taxonomies Across 131 Real World Incidents

本文通过对 131 起真实世界事件的实证评估,分析了三种主流智能体 AI 风险分类法(OWASP-ASI、MSFT-AIRT 和 NIST AI RMF)的覆盖范围与互补性,旨在为从业者提供基于证据的指导,并识别未来框架修订中的具体空白。

原作者: Shivaraman Parthasarathy

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivaraman Parthasarathy

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个人工智能已经从仅仅回答问题进化到能够采取行动的世界。这些不再是等待指令的简单聊天机器人,而是能够规划一系列步骤、使用数字工具、记忆过往交互,并能与其他软件协作以在极少人工干预下实现目标的自主智能体。这种转变创造了一个全新的风险图景。当一个简单的聊天机器人犯错时,它可能只是说了一些奇怪的话;但当一个自主智能体犯错时,它可能会删除公司的数据库、将资金转入错误的账户,或者在扮演受信任顾问的角色时传播危险的虚假信息。为了管理这些风险,专家们构建了三种不同的“规则书”或分类法,用于对这些系统的失效进行分类。其中一份清单侧重于失效的可视化结果,另一份侧重于发生的具体机械方式,而第三份则侧重于错误发生在项目生命周期的哪个阶段。长期以来,组织不得不猜测哪本规则书最适用,却没有任何证据证明它们在面对现实世界的灾难时表现如何。

一位研究人员试图通过将这些规则书视为需要校准的科学仪器来消除这种不确定性。研究者并没有建立一个新的失效列表,而是选取了目前正在使用的三个最著名的框架,并针对 131 起涉及自主智能体的真实事件对其进行了测试。这些事件取自一个记录 AI 失效情况的公开数据库,时间跨度从 2014 年到 2026 年,涵盖了从自动驾驶车辆事故到 AI 编程助手意外删除生产服务器等各种案例。研究人员仔细阅读了每个事件的细节,并尝试独立地将它们归入这三个框架所提供的类别中。其目标是观察这些框架是否能够捕捉到这些失效,它们在描述发生的事情时是否达成一致,以及它们在哪些地方可能完全脱离了实际。

研究发现,虽然没有哪一本规则书能捕捉到每一个事件,但将三者结合使用可以覆盖近 97% 的记录在案的失效情况。这种高度的综合覆盖率表明,这三个框架并非相互竞争,而是互为补充。它们只是从不同的角度看待同一个问题。其中一个专为安全高管设计的框架侧重于结果:可见的损害是什么?另一个由安全工程师团队构建的框架侧重于机制:系统究竟是如何损坏的?第三个由政府制定的标准则侧重于流程:管理者应该在项目的生命周期中的哪个阶段介入以阻止这种情况?研究表明,这些视角是截然不同的。例如,对于一起 AI 智能体被诱导窃取数据的单一事件,第一个框架可能会将其描述为“信任利用”失效,第二个框架会将其描述为“提示词注入”攻击,而第三个框架则会将其描述为项目生命周期中的“管理”阶段失效。这些描述都没有错,它们只是在回答不同的问题。

然而,研究也揭示了现有规则书存在不足的具体领域。大约 20% 的事件无法被清晰地归入安全侧重型框架中的任何类别。这些缺失的案例集中在三个明确的主题中。第一个主题涉及作为顾问的智能体提供了看似确凿实则错误的信息,例如聊天机器人捏造了针对某位真实教授的性骚扰指控,或金融机器人给出了危险的投资建议。第二个主题涉及人类滥用技术,例如学生利用 AI 在考试中获取不当优势,或骗子利用 AI 进行身份冒充,在这些案例中,AI 本身按设计运行,但人类用户造成了伤害。第三个主题涉及更广泛的社会性失败,例如一个用于收集私人 AI 对话的浏览器扩展程序,或一家公司使用 AI 监控的方式威胁到了公民权利。在这些案例中,失效不在于代码本身,而在于技术如何嵌入社会或被人类使用。

研究人员得出结论,该领域并不需要第四或第五本规则书来解决这些问题。相反,解决方案在于理解现有的工具是为不同的任务而设计的。向董事会汇报时,安全领导人应使用侧重于结果的清单来解释业务影响;在调查违规行为时,技术团队应使用侧重于机制的清单来寻找根本原因;监管者和审计员则应使用侧重于流程的清单来检查是否在正确的时刻采取了正确的防护措施。研究还建议,这些框架的创建者可以通过增加针对上述缺口的特定类别来改进它们,例如设立专门的“顾问角色中的幻觉”部分,或更清晰地界定智能体失效与人类滥用之间的区别。通过将这些工具映射到不同专业人员的具体需求上,这项研究为应对复杂的自主 AI 安全领域提供了一份实用的指南,将混乱的多样化选择转化为清晰且基于证据的策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →