← 최신 논문
💻 computer science

Coverage and Complementarity of Three Agentic AI Risk Taxonomies Across 131 Real World Incidents

이 논문은 실무자들에게 근거 기반의 지침을 제공하고 향후 프레임워크 개정을 위한 구체적인 격차를 식별하기 위해, 131건의 실제 사례를 바탕으로 세 가지 주요 에이전틱 AI 위험 분류 체계(OWASP-ASI, MSFT-AIRT, NIST AI RMF)의 포괄성과 상호 보완성을 실증적으로 평가한다.

원저자: Shivaraman Parthasarathy

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shivaraman Parthasarathy

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 단순히 질문에 답하는 수준을 넘어 실제로 행동을 취하는 단계로 진화한 세상을 상상해 보십시오. 이들은 더 이상 프롬프트를 기다리는 단순한 챗봇이 아닙니다. 인간의 도움을 거의 받지 않고도 목표를 달성하기 위해 일련의 단계를 계획하고, 디지털 도구를 사용하며, 과거의 상호작용을 기억하고, 다른 소프트웨어와 협력할 수 있는 자율적인 에이전트입니다. 이러한 변화는 새로운 위험의 지형을 만들어냈습니다. 단순한 챗봇이 실수를 하면 이상한 말을 할 뿐이지만, 자율 에이전트가 실수를 하면 회사의 데이터베이스를 삭제하거나, 돈을 잘못된 계좌로 송금하거나, 신뢰받는 조언자로서 행동하며 위험한 허위 정보를 퍼뜨릴 수 있습니다. 이러한 위험을 관리하기 위해 전문가들은 이 시스템들이 어떻게 실패하는지를 분류하기 위해 세 가지 서로 다른 '규칙집(rulebooks)' 또는 분류 체계(taxonomies)를 구축했습니다. 한 목록은 실패의 가시적인 결과에 초점을 맞추고, 다른 하나는 그것이 발생한 구체적인 기계적 방식에 초점을 맞추며, 세 번째는 프로젝트 생애 주기 중 오류가 발생한 단계에 초점을 맞춥니다. 오랫동안 조직들은 이 규칙집들이 실제 재난에 대해 얼마나 잘 작동하는지에 대한 증거 없이, 어떤 규칙집을 사용하는 것이 최선인지 추측해야만 했습니다.

한 연구자는 이 규칙집들을 교정(calibration)이 필요한 과학적 도구처럼 취급함으로써 이러한 불확실성을 해결하고자 했습니다. 새로운 실패 목록을 만드는 대신, 현재 사용되는 가장 저명한 세 가지 프레임워크를 가져와 131건의 실제 자율 에이전트 관련 사건에 대해 테스트했습니다. 이 사건들은 2014년부터 2026년까지 기록된 AI 실패 사례의 공개 데이터베이스에서 추출되었으며, 자율 주행 차량 사고부터 운영 서버를 실수로 삭제한 AI 코딩 어시스턴트에 이르기까지 모든 것을 포함했습니다. 연구자는 각 사건의 세부 사항을 주의 깊게 읽고, 세 가지 프레임워크 각각이 제공하는 범주에 독립적으로 대입해 보았습니다. 목표는 프레임워크가 실패를 포착할 수 있는지, 그들이 일어난 현상에 대해 서로 동의하는지, 그리고 어디에서 완전히 빗나가는지를 확인하는 것이었습니다.

연구 결과, 단 하나의 규칙집도 모든 사건을 포착하지는 못했지만, 세 가지를 함께 사용했을 때는 기록된 실패의 거의 97%를 커버할 수 있다는 것이 밝혀졌습니다. 이 높은 결합 커버리지는 세 프레임워크가 서로 경쟁하는 것이 아니라 오히려 서로를 보완하고 있음을 시사합니다. 그들은 단지 동일한 문제를 서로 다른 각도에서 바라보고 있을 뿐입니다. 보안 경영진을 위해 설계된 한 프레임워크는 결과, 즉 눈에 보이는 피해가 무엇인지에 초점을 맞춥니다. 보안 엔지니어 팀이 만든 다른 하나는 메커니즘, 즉 시스템이 정확히 어떻게 고장 났는지에 초점을 맞춥/니다. 정부 표준인 세 번째는 프로세스, 즉 프로젝트 생애 주기의 어느 단계에서 관리자가 개입하여 이를 막았어야 했는지에 초점을 맞춥니다. 연구는 이러한 관점들이 별개라는 것을 보여주었습니다. 예를 들어, AI 에이전트가 데이터를 훔치도록 속임을 당한 단일 사건에 대해, 첫 번째 프레임워크는 '신뢰 착취(trust exploitation)' 실패로, 두 번째는 '프롬프트 인젝션(prompt injection)' 공격으로, 세 번째는 프로젝트 생애 주기의 '관리(management)' 단계에서의 실패로 설명할 수 있습니다. 이 중 어떤 설명도 틀린 것이 아니라, 단지 서로 다른 질문에 답하고 있는 것입니다.

그러나 이 연구는 현재의 규칙집들이 미치지 못하는 구체적인 공백도 밝혀냈습니다. 약 20%의 사건은 보안 중심 프레임워크의 어떤 범주에도 깔끔하게 할당될 수 없었습니다. 이러한 누락된 사례들은 세 가지 명확한 주제로 모였습니다. 첫 번째는 에이전트가 조언자 역할을 수행하면서 자신 있게 틀린 정보를 제공한 경우로, 예를 들어 챗봇이 실제 교수에게 성희롱 혐의를 조작하여 주장하거나 금융 봇이 위험한 투자 조언을 하는 경우가 있었습니다. 두 번째 주제는 인간이 기술을 오용하는 경우로, 학생들이 시험에서 부당한 이득을 취하기 위해 AI를 사용하거나 사기꾼들이 타인을 사칭하기 위해 AI를 사용하는 것처럼, AI 자체는 설계된 대로 작동했으나 인간 사용자가 해를 끼친 경우입니다. 세 번째는 더 넓은 사회적 실패로, 브라우저 확장 프로그램이 개인적인 AI 대화를 수집하거나 기업이 시민권을 위협하는 방식으로 AI 감시를 사용하는 것과 같은 사례입니다. 이 경우, 실패는 코드 자체에 있는 것이 아니라 기술이 사회에 어떻게 내재되어 있는지 또는 사람들이 기술을 어떻게 사용하는지에 있었습니다.

연구자는 이 문제를 해결하기 위해 네 번째나 다섯 번째 규칙집이 필요한 것이 아니라고 결론지었습니다. 대신, 해결책은 기존의 도구들이 서로 다른 직무를 위해 만들어졌음을 이해하는 데 있습니다. 이사회와 소통하는 보안 리더는 비즈니스 영향을 설명하기 위해 결과 중심의 목록을 사용해야 합니다. 침해 사고를 조사하는 기술 팀은 근본 원인을 찾기 위해 메커니즘 중심의 목록을 사용해야 합니다. 규제 기관과 감사관은 적절한 시점에 적절한 안전장치가 마련되었는지 확인하기 위해 프로세스 중심의 목록을 사용해야 합니다. 연구는 또한 이 프레임워크의 제작자들이 '조언 역할에서의 환각(hallucinations in advisory roles)'을 위한 전용 섹션을 추가하거나, 에이전트의 실패와 인간의 오용을 더 명확히 구분하는 등 식별된 공백을 위한 특정 범주를 추가함으로써 이를 개선할 수 있다고 제안했습니다. 이러한 도구들을 다양한 전문가들의 구체적인 필요에 매핑함으로써, 이 연구는 복잡한 자율 AI 안전의 세계를 항해하기 위한 실질적인 가이드를 제공하며, 혼란스러운 옵션의 확산을 명확하고 증거에 기반한 전략으로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →