A Theory of Least Autonomy in AI
이 논문은 구성적 폭발 반경 메트릭, 유향 에이전트 영향력 그래프, 그리고 공모 술어(collusion predicates)를 결합하여 복잡한 권한 구성 및 도메인 간 역량 조작을 탐지하고 제어하는 정식 이론을 도입함으로써, 에이전트형 AI 시스템을 위한 최소 권한 원칙의 필수적인 일반화로서 "최소 자율성"을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 첨단 기술의 오피스 빌딩을 상상해 보십시오. 과거 보안 요원들은 "필요하지 않은 방의 열쇠는 누구에게도 주지 않는다"라는 단순한 규칙을 가지고 있었습니다. 이것을 **최소 권한 원칙(Least Privilege)**이라고 부릅니다. 수십 년 동안 이 방식은 인간과 단순한 로봇들에게 매우 효과적이었습니다. 청소부가 화장실을 청소해야 한다면, 그에게 화장실 열쇠를 주었습니다. 만약 금고 열쇠가 필요 없다면, 주지 않았습니다. 간단하죠?
하지만 이제 우리는 **에이전틱 AI(Agentic AI)**를 구축했습니다. 이들은 단순히 문을 여는 것을 넘어, 다른 문을 두드리고, 다른 작업자에게 무언가를 열어달라고 요청하며, 자신들이 가진 작은 열쇠들을 조합하여 혼자서는 결코 접근할 수 없었던 거대하고 비밀스러운 문을 열 수 있는 똑똑하고 자율적인 디지털 작업자들입니다. 기존의 "하나의 열쇠, 하나의 방"이라는 규칙은 더 이상 충분하지 않습니다.
여기, 크리스토프 파리젤(Christophe Parisel) 연구원이 2026년 7월 14일 자 논문에서 제안한 새로운 이론인 **최소 자율성(Least Autonomy)**이 등장합니다. 이것은 보안 시스템을 "누가 열쇠를 가지고 있는가?"를 확인하는 수준에서 "누가 팀을 이루어 건물 전체를 무너뜨릴 수 있는가?"를 묻는 수준으로 업그레이드하는 것과 같습니다.
새로운 위험: "폭발 반경(Blast Radius)"
이 논문은 **구성적 폭발 반경(Compositional Blast Radius)**이라고 불리는 것을 측정해야 한다고 제в제안합니다. 이것을 "위험 거리" 미터기라고 생각해 보십시오.
오피스 빌딩이 거대한 나무라고 상상해 봅시다. 뿌리는 CEO이고, 가지는 부서(재무 또는 엔지니어링 등)이며, 잎은 특정 파일이나 도구입니다. 논문은 이 트리(tree)에서 두 동작 사이의 거리를 측정하기 위해 특별한 수학적 기법(울트라메트릭 트리, ultrametric tree)을 사용합니다.
- 만약 두 동작이 같은 작은 방 안에서 일어난다면, 거리는 0입니다.
- 만약 한 동작은 "재무" 가지에 있고 다른 하나는 "엔지니어링"에 있다면, 거리는 더 커집니다.
- 만약 두 동작이 완전히 다른 건물(예: "운영" 대 "기업")에 있다면, 거리는 매우 큽니다.
하지만 단순히 거리만이 문제가 아닙니다. 논문은 모든 방에 "민감도 라벨(sensitivity label)"을 추가합니다. 어떤 방은 "표준"(저위험)인 반면, 어떤 방은 "높은 무결성"(숫자를 건드리지 마시오) 또는 "높은 기밀성"(비밀 유출 금지)을 가집니다. 이 이론은 거리와 민감도 라벨을 결합하여 배수(multiplier)(1.00에서 2.00 사이)를 계산합니다.
따라서 "폭발 반경"은 단순히 동작들이 얼마나 떨어져 있는가가 아니라, 얼마나 위험한지에 따라 가중치가 부여된 거리입니다. 만약 재무 부서의 저위험 동작이 엔지니어링 부서의 고위험 동작과 결합한다면, 이 결합의 "폭발 반경"은 높은 점수를 받게 됩니다.
"만남(Meeting)"과 "영향력 그래프(Influence Graph)"
여기서부터 까다로워집니다. 논문은 우리가 AI 에이전트가 단독으로 무엇을 할 수 있는지뿐만 아니라, 그들이 누구와 대화할 수 있는지를 반드시 봐야 한다고 주장합니다.
저자들은 **만남(Meeting)**이라는 개념을 도입합니다.
- 리소스 만남(Resource Meeting): 에이전트 A가 화이트보드에 메모를 남기고, 에이전트 B가 그 화이트보드를 읽습니다. 그들은 화이트보드에서 "만났습니다".
- 에이전트 간(A2A) 만남: 에이전트 A와 에이전트 B가 직접적인 채팅 채널을 가집니다. 논문은 매우 보수적으로 접근하는데, 설령 채팅이 일방적인 것처럼 보이더라도, 저자들은 에이전트 B가 어떤 방식으로든 에이전트 A에게 영향을 미칠 수 있다고(예: 까다로운 메시지나 도구 출력값을 보냄으로써) 가정합니다. 따라서 이를 양방향 통행으로 취급합니다.
누가 "만났는지"를 알게 되면, **영향력 잠재력(Influence Potential)**을 계산합니다. 이것은 그들의 결합된 동작이 얼마나 많은 "구조적 범위(structural span)"를 커버하는지에 대한 점수입니다. 만약 에이전트 A가 민감한 금고에 글을 쓰고, 에이전트 B가 민감한 보고서를 읽으며, 두 사람이 만났다면, 그들의 영향력 잠재력은 높습니다.
그런 다음, **영향력 그래프(Influence Graph)**라는 지도를 그립니다. 두 에이전트 사이에 선(호, arc)을 긋는 경우는 오직 다음 두 조건을 만족할 때뿐입니다:
- 그들이 "만남"을 가졌을 것.
- 그들의 영향력 잠재력이 특정 **임계값()**보다 높을 것.
논문은 이 임계값()이 컴퓨터가 찾아내는 마법의 숫자가 아니라는 점을 명시합니다. 이는 회사의 모든 가능한 동작 조합에 대한 "카탈로그"를 바탕으로 인간 보안 책임자가 결정하는 정책적 선택입니다.
"공모(Collusion)"의 함정
이 이론에서 가장 무서운 부분은 **공모 술어(Collusion Predicate)**입니다. 이것은 개별 에이전트는 아무런 잘못을 저지르지 않더라도, 에이전트 그룹이 힘을 합쳐 나쁜 일을 저지를 수 있는지 확인하는 테스트입니다.
논문은 에이전트들이 이 그래프에서 "공모"할 수 있는 세 가지 방법을 식별합니다:
- 권한 구성(Authorization Composition): 에이전트 A는 요청을 승인할 권한이 있고, 에이전트 B는 그것을 실행할 권한이 있습니다. 만약 A가 B에게 영향을 미치거나 그 반대의 경우라면, 이들은 규칙을 우회할 수 있습니다.
- 의사결정 조작(Decision Manipulation): 에이전트 A가 에이전트 B에게 영향을 미칠 수 있고, 에이전트 B는 무언가를 승인할 권한이 있습니다. A는 B를 속여서 잘못된 결정을 승인하게 만들 수 있습니다.
- 교차 도메인 노출(Cross-Domain Exposure): 에이전트 A는 "재무" 도메인에 접근할 수 있고, 에이전트 B는 "엔지니어링" 도메인에 접근할 수 있습니다. 만약 두 에이전트가 그래프에서 연결되어 있다면, 그들은 규칙이 금지했던 방식으로 두 세계를 의도치 않게(혹은 악의적으로) 섞어버릴 수 있습니다.
이 논문이 배제하는 것들 ("금지 구역")
이 이론이 무엇을 하지 않는지 이해하는 것이 매우 중요합니다.
- 이것은 런타임 모니터링(runtime monitor)이 아닙. 논문은 이것이 설계 시점의 정적(static design-time) 분석임을 명시합니다. 이는 건물을 짓기 전에 설계도를 검토하는 것과 같습니다. 에이전트들이 실제로 대화를 나누고 있는지 실시간으로 감시하는 것이 아닙니다. 단지 "설계도가 이렇다면, 위험이 존재한다"라고 말하는 것입니다.
- 이것은 범죄가 발생했음을 증명하는 것이 아닙. 그래프에서 "공모 목격자(collusion witness)"를 발견했다고 해서 에이전트들이 실제로 잘못을 저질렀다는 뜻은 아닙니다. 단지 그 설정이 그러한 일을 가능하게 한다는 의미입니다. 이는 보안 엔지니어가 권한을 검토하도록 하는 "레드 플래그(경고 신호)" 역할을 합니다.
- 이것은 동작의 "방법"에는 관심이 없습니다. 논문은 동일한 파일에 대한 "읽기" 동작과 "삭제" 동작이 수학적으로 동일한 "구조적 거리(0)"를 가진다는 점을 인정합니다. 이 이론은 특정 작업의 유형(예: 파괴적인 삭제인지 무해한 읽기인지)이 아니라 권한의 구조에 집중합니다.
결론: 새로운 안전망
논문은 최소 권한 원칙이 여전히 필요하지만, 이러한 똑똑하고 연결된 AI 에이전트들에게는 불충분하다고 결론짓습니다. 당신은 에이전트에게 "최소한의" 권한을 줄 수 있지만, 그 에이전트가 다른 "최소한의" 권한을 가진 에이전트와 대화할 수 있다면, 그들은 아무도 의도하지 않았던 "최대의" 권한을 만들어낼 수 있습니다.
저자들은 **최소 자율성(Least Autonomy)**을 보완적인 규칙으로 제안합니다. 이것은 다음과 같이 묻습니다: "이 에이전트가 친구들의 연결 고리를 통해 도달할 수 있는 권한의 최대 '폭발 반경'은 어디까지인가?"
논문은 보안 엔지니어가 이 모델을 구축하기 위한 단계별 가이드를 제공합니다:
- 회사의 트리를 작성하고 모든 노드에 민감도를 라벨링합니다.
- 가능한 모든 동작을 나열합니다.
- 회사의 위험 허용도에 따라 임계값()을 설정합니다.
- 영향력 그래프를 그립니다.
- "공모 목격자"를 확인합니다.
만로 그래프에서 공모 위험이 나타나면, 엔지니어는 워크플로우를 재설계하거나, 권한을 변경하거나, 임계값을 낮추어야 합니다. 이 논문은 이것이 표준적인 권한 체크가 놓치는 "보이지 않는" 위험을 포착하는 방법이라고 제안하지만, 모델이 입력값(트리, 라벨, 만남의 정의)의 정확성에 크게 의존한다는 점 또한 인정합니다.
요약하자면, 이 논문은 AI 에이전트의 세상에서는 단순히 누가 열쇠를 쥐고 있는지만 확인해서는 안 된다고 말합니다. 우리는 누가 누구의 문을 두드릴 수 있는지, 그리고 그들의 두드림이 결합될 때 어떤 일이 벌어지는지를 확인해야 합니다. 이것은 전체 네트워크를 하나의 잠재적으로 위험한 유기체로 취급하여 통제하는, 안전에 대한 새로운 사고방식입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.