Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning
이 논문은 파편화된 멀티 클라우드 ID 시스템 전반에 걸쳐 추론하는 에이전틱 AI(Agentic AI)의 능력을 평가하기 위한 Cross-Vendor Sola ISPM 벤치마크를 소개하며, 명시적인 관계적 맥락을 제공하는 것이 교차 벤더 보안 분석의 정답률을 유의미하게 향상시키고 실패율을 낮춘다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
모든 부서가 서로 다른 언어와 파일 시스템을 사용하는 거대하고 현대적인 사무실 건물을 상상해 보십시오. 인사팀은 직원 기록을 한 권의 책에 보관하고, IT 보안팀은 디지털 장부를 사용하며, 클라우드 스토리지 팀은 별도의 지도를 가지고 있고, 마케팅 팀은 완전히 다른 앱을 사용합니다.
과거에는 "누가 금고에 접근 권가 있는가?"를 알고 싶다면 단 한 명에게 물어보면 그만이었습니다. 하지만 오늘날 "금고"는 디지털이며, 열쇠는 이 모든 서로 다른 시스템에 흩어져 있습니다. 답을 찾으려면 HR 책, IT 장부, 그리고 클라우드 지도를 연결하여 점들을 이어야 합니다.
이 논문은 AI 탐정이 이러한 퍼즐을 풀 수 있을 만큼 똑똑한지 테스트하는 새로운 방법을 소개합니다.
문제점: "번역 오류"의 간극
저자들은 이를 **"상관관계의 간극(Correlation Gap)"**이라고 부릅니다.
당신이 용의자를 찾는 탐정이라고 상상해 보십시오. 당신은 용의자의 얼굴 사진(HR 시스템의 이름)과 그들의 차량 설명(클라우드 시스템의 ID)을 가지고 있습니다. 하지만 경찰 데이터베이스는 HR 책의 "John Doe"가 자동차 등록부의 "J. Doe"와 동일 인물이라는 사실을 알지 못합니다.
현재의 AI 모델은 한 권의 책을 읽는 데는 매우 뛰어나지만, 서로 다른 언어 사이에서 단서들을 연결하는 데는 서툰 탐정과 같습니다. 그들은 답을 추측할 수는 있지만, 시스템들이 서로 어떻게 소통하는지 파악하지 못해 길을 잃는 경우가 많습니다.
해결책: "Sola 벤치마크"
연구진은 이 특정 문제를 대상으로 AI 에이전트를 테스트하기 위한 **훈련장(벤치마크)**을 구축했습니다.
- 설정: 그들은 8개의 서로 다른 실제 플랫폼(AWS, Google, Microsoft, HR 소프트웨어 등)을 사용하여 현실적이고 복잡한 환경을 만들었습니다.
- 테스트: 그들은 AI에게 다음과 같은 복잡한 질문 50개를 던졌습니다: "지난달에 해고되었지만 여전히 우리 클라우드 서버에 접근 권한이 있는 직원을 모두 찾아내시오."
- 도전 과제: 이 질문에 답하기 위해 AI는 다음 과정을 거쳐야 합니다:
- HR 리스트를 확인하여 해고된 사람들을 찾는다.
- 그 리스트를 ID 제공업체(예: Okta)의 언어로 번역한다.
- 클라우드 제공업체(예: AWS)와 교차 참조하여 누가 여전히 열쇠를 가지고 있는지 확인한다.
- 혼란에 빠지지 않고 이 모든 점들을 연결한다.
실험: 탐정에게 지도를 주는 것
연구진은 무엇이 AI에게 가장 도움이 되는지 알아보기 위해 다섯 가지 조건에서 AI를 테스트했습니다:
- 컨텍스트 없음 (No Context): 탐정이 눈을 가린 채 건물에 던져진 상태입니다. 그들은 추측하며 모든 문을 두드려야 합니다.
- 스키마만 있음 (Schema Only): 탐정이 방 번호와 그 안에 무엇이 들어있는지에 대한 목록은 받았지만, 방들이 어떻게 연결되는지에 대한 지도는 받지 못한 상태입니다.
- 스키마 + 그래프 (Schema + Graph): 탐정이 방 목록과 더불어 어떤 문이 어떤 문으로 연결되는지 보여주는 지도를 받은 상태입니다. (예: "HR 건물의 A 문은 클라우드 건물의 B 문으로 직접 연결된다").
- 스키마 + 예시 (Schema + Examples): 탐정이 방 목록과 함께 다른 탐정들이 유사한 퍼즐을 어떻게 풀었는지에 대한 몇 가지 사례를 받은 상태입니다.
- 전체 컨텍스트 (Full Context): 탐정이 방 목록, 지도, 예시, 그리고 가이드북을 모두 받은 상태입니다.
결과: 지도가 모든 차이를 만든다
결과는 명확하고 놀라웠습니다:
- 맹목적인 추측은 실패한다: AI에게 아무런 도움도 주지 않았을 때(No Context), AI는 고전했습니다. 많은 실수를 저질렀고, 상황을 파악하기 위해 수많은 질문을 던져야 했습니다.
- "그래프"가 마법의 재료다: AI의 성능이 가장 크게 도약한 지점은 **보안 그래프(시스템 간의 연결을 보여주는 지도)**가 주어졌을 때였습니다.
- 정확도 향상: 전체 지도와 예시가 주어졌을 때, AI의 정답률은 약 34% 상승했습니다.
- 효율성 향상: AI는 더 이상 추측하거나 불필요한 질문을 하지 않았습니다. AI가 수행해야 하는 "이동(trips)" 횟수를 약 70% 줄였습니다.
- 똑똑하지만 길을 잃다: 논문은 AI 모델들이 실제로 꽤 똑똑하다는 것을 발견했습니다. 도움 없이도 AI는 종종 정답의 일반적인 개념(예: "네, 위험 요소가 있습니다")은 맞출 수 있었습니다. 하지만 지도가 없으면 구체적인 증거(예: "위험에 처한 정확한 인원은 12명입니다")를 찾아내지는 못했습니다.
시사점
이 논문은 AI가 보안 추론에 있어 반드시 "멍청한" 것이 아니라, 적절한 컨텍스트가 없으면 "눈이 먼" 상태라고 결론짓습니다.
이것은 운전자에게 GPS를 주는 것과 같습니다. 운전자(AI)는 운전하는 법과 목적지를 알고 있지만, GPS(시스템들이 어떻게 연결되는지에 대한 구조화된 지도)가 없다면 길을 잃고, 잘못된 길로 들며, 시간을 낭비할 것입니다. 일단 GPS를 주면, 그들은 완벽하게 운전하고, 더 빠르게 도착하며, 어떤 길로 가야 할지 정확히 알게 됩니다.
저자들은 AI가 실무 보안에서 유용해지기 위해서는 단순히 질문을 던지는 것이 아니라, 디지털 세계의 서로 다른 부분들을 연결하는 **관계적 지도(relational map)**를 제공해야 한다는 것을 증명하기 위해 이 벤치마크를 구축했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.