← 最新论文
💻 computer science

Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning

本文介绍了跨厂商 Sola ISPM 基准测试,用于评估智能体 AI 在碎片化的多云身份系统进行推理的能力,并证明提供显式的关系上下文能显著提高答案的正确性并降低跨厂商安全分析中的失败率。

原作者: Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座规模宏大、现代化的办公大楼,其中每个部门都使用不同的语言和不同的归档系统。人力资源(HR)部门将员工记录保存在一本账本中,IT 安全团队使用数字分类账,云存储团队使用另一份独立的地图,而市场营销团队则使用完全不同的应用程序。

在过去,如果你想知道“谁有权进入保险库?”,你只需要问一个人即可。但今天,“保险库”是数字化的,而钥匙散落在所有这些不同的系统中。为了找到答案,你必须将 HR 账本、IT 分类账和云地图中的点连接起来。

这篇论文介绍了一种新方法,用于测试 AI 侦探 是否足够聪明,能够解决这些谜题。

问题所在:“翻译丢失”的鸿沟

作者将其称为 “关联差距”(Correlation Gap)

想象你是一名正在寻找嫌疑人的侦探。你有一张嫌疑人的面部照片(他们在 HR 系统中的姓名)和一辆车的描述(他们在云系统中的 ID)。但警察数据库并不知道 HR 账本中的“John Doe”就是汽车登记系统中“J. Doe”的同一个人。

目前的 AI 模型就像是那种非常擅长阅读单本书籍,却极不擅长跨越不同语言连接线索的侦探。它们可能会猜出答案,但由于无法弄清楚这些系统是如何相互通信的,它们经常会迷失方向。

解决方案:“Sola 基准测试”

研究人员构建了一个训练场(基准测试),专门测试 AI 智能体在这一特定问题上的表现。

  • 设置: 他们利用 8 个不同的真实世界平台(如 AWS、Google、Microsoft 和 HR 软件)创建了一个真实的、混乱的环境。
  • 测试: 他们给出了 50 个复杂的问题,例如:“找出上个月被解雇但仍保留云服务器访问权限的所有员工。”
  • 挑战: 要回答这个问题,AI 必须:
    1. 查看 HR 名单以找到被解雇的人。
    2. 将该名单翻译成身份提供商(如 Okta)的语言。
    3. 将其与云服务提供商(如 AWS)进行交叉引用,以查看谁还持有钥匙。
    4. 在不产生混淆的情况下连接所有这些点。

实验:给侦探一张地图

研究人员在五种不同的条件下测试了 AI,以观察什么对它的帮助最大:

  1. 无上下文(No Context): 侦探被蒙着眼睛扔进大楼,没有任何地图或清单。他们只能靠猜测并不断敲门来摸索。
  2. 仅有架构(Schema Only): 侦探得到了一份房间编号及其内部物品的清单,但没有关于房间如何连接的地图。
  3. 架构 + 图谱(Schema + Graph): 侦探得到了房间清单,外加一张地图,清晰展示了哪些门连接到哪些门(例如:“HR 大楼的 A 门直接通向云大楼的 B 门”)。
  4. 架构 + 示例(Schema + Examples): 侦探得到了房间清单,以及其他侦探解决类似谜题的几个案例。
  5. 全上下文(Full Context): 侦探得到了房间清单、地图、示例以及一本指南。

结果:地图起到了决定性作用

研究结果清晰且令人惊讶:

  • 盲目猜测失败: 当 AI 没有帮助时(无上下文),它表现得很挣扎。它犯了很多错误,并且必须询问大量问题才能弄清楚情况。
  • “图谱”是神奇的成分: 当 AI 被给予 安全图谱(显示系统如何连接的地图)时,性能出现了最大的飞跃。
    • 准确率提升: 在拥有完整的地图和示例时,AI 获取正确答案的能力提升了约 34%
    • 效率提升: AI 不再瞎猜和进行不必要的提问。它减少了大约 70% 的“往返次数”。
  • 聪明但迷失: 论文发现 AI 模型其实非常聪明。即使没有帮助,它们通常也能猜出答案的大致方向(例如:“是的,存在风险”)。但如果没有地图,它们就无法找到具体的证据来证明这一点(例如:“这里是处于风险中的确切 12 个人”)。

核心启示

论文结论认为,AI 并非在安全推理方面“笨”,而是在没有正确上下文的情况下处于“盲视”状态。

这就像给司机一个 GPS。司机(AI)知道如何驾驶以及要去哪里,但如果没有 GPS(连接各系统的结构化地图),他们就会迷路、走错路并浪费时间。一旦你给了他们 GPS,他们就能完美驾驶,到达更快,并且清楚地知道该走哪条街道。

作者构建这个基准测试是为了证明,要让 AI 在现实世界的安全领域发挥作用,我们不能仅仅向它提问;我们必须给它那张连接了数字世界各个部分的关系地图

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →