Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems
본 논문은 정적 신원 기반 권한 부여를 암호학적으로 검증 가능한 정당성 증명과 불변의 증거 체인에서 엄격히 파생된 실행 권한을 갖는 동적 합의 주도 모델로 대체함으로써 주권 AI 시스템을 보호하는 검증 아키텍처인 분산 신뢰 프레임워크 (DTF) 를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 고보안 은행을 운영한다고 상상해 보세요. 과거에는 보안 요원 (AI 에이전트) 에게 모든 문을 여는 마스터 키를 주었습니다. 올바른 신분증을 소유했기 때문에 그들을 신뢰했습니다. 하지만 여기서 문제가 발생합니다. 이 보안 요원들은 이제 AI 입니다. 그들은 빠르고 똑똑하지만, 때로는 혼란을 겪거나 환각을 경험하거나 속아 넘어가기도 합니다. 그들은 필요가 없을 때조차 금고 문을 열려고 시도하거나, 건드리지 말아야 할 돈을 이동시키려 할 수 있으며, 이 모든 과정에서 완벽하게 유효한 신분증을 들고 있습니다.
구식 시스템은 "신분증이 있으면 출입 가능하다"고 말했습니다. 이 논문에서 설명하는 새로운 시스템은 "신분증만으로는 부족하다. 한 치도 움직이기 전에 판사 패널의 승인을 받아, 정확히 이 한 가지 업무에 대한 구체적이고 서명된 허가증이 있어야 한다"고 말합니다.
이 논문은 이러한 문제를 해결하기 위해 DTF(분산 신뢰 프레임워크) 라는 시스템을 소개합니다. 작동 원리를 간단한 부분으로 나누어 설명하면 다음과 같습니다:
1. 문제: "상시 권한 (Standing Privilege)"의 함정
현재 AI 에이전트가 서버를 삭제하거나 금융 설정을 변경하고 싶다면, 영구 로그인 자격 증명을 사용할 뿐입니다. 해당 자격 증명이 유효하다면 시스템은 "예"라고 말합니다.
- 위험 요소: AI 가 실수를 할 수 있습니다 (예: 서버가 실제로는 회사의 웹사이트를 운영 중인데 비어 있다고 생각하여 삭제하는 경우). AI 가 "올바른" 신분증을 소유했기 때문에 시스템은 이를 허용합니다.
2. 해결책: "허가증 (Permission Slip)" 시스템
AI 가 영구 신분증에 기반하여 행동하도록 내버려 두는 대신, DTF 시스템은 새로운 프로세스를 강제합니다. 이를 고위험 건설 프로젝트로 생각해 보세요:
- 1 단계: 의도 (청사진)
AI 에이전트는 단순히 행동을 "수행"하지 않습니다. 먼저 제안을 제출합니다. "서버 X 를 끄고 싶습니다." - 2 단계: 정당성 증명 (안전 보고서)
누군가 이를 승인하기 전에 시스템이 자동으로 정당성 증명 (Justification Proof) 을 생성합니다. 이는 AI 의 생각 과정을 기록한 채팅 로그가 아닙니다. 다음과 같은 구조화된 기계 판독 가능 문서입니다:- 무엇을 하는가? (서버 X 끄기)
- 왜 안전한가? (서버 X 에는 트래픽이 없으며, B 팀 소유이고 중요한 의존 관계의 일부가 아님)
- 제한 사항은 무엇인가? (이 서버만, 5 분 동안만)
- 3 단계: 합의 (판사 패널)
이 증명은 한 사람이나 한 대의 컴퓨터가 승인하는 것이 아닙니다. 평가자 군집 (Swarm of Evaluators) 으로 전송됩니다. 서로 다른 전문가 패널을 상상해 보세요:- 한 명은 규칙 (정책) 을 확인합니다.
- 한 명은 서버가 실제로 비어 있는지 (상태) 확인합니다.
- 한 명은 위험도가 너무 높은지 (위험) 확인합니다.
- 큰 결정의 경우 한 명은 인간일 수 있습니다.
그들은 모두 동일한 증명을 검토합니다. 그들이 모두 동의하거나 (또는 특정 합의에 도달하면) 행동이 승인됩니다. 한 명이 "잠시만요, 그 서버는 실제로 중요합니다"라고 말하면 전체 과정이 중단됩니다.
- 4 단계: 실행 신원 (임시 패스)
패널이 증명을 승인하면 시스템은 일회성 임시 패스를 생성합니다. 이 패스는 엄격하게 제한됩니다. "당신은 오직 서버 X 만, 그리고 오직 향후 5 분 동안만 끌 수 있습니다"라고 명시합니다. 다른 어떤 것도 건드릴 수 없습니다. - 5 단계: 증거 체인 (블랙박스)
제안, 증명, 판사들의 투표, 임시 패스, 최종 결과 등 모든 단계는 변경 불가능한 영구 원장에 기록됩니다. 나중에 문제가 발생하면 감사관이 전체 이야기를 재생하여 결정이 내려진 정확한 이유를 확인할 수 있습니다.
3. 왜 이것이 중요한가
이 논문은 이 시스템이 신뢰의 규칙을 바꾼다고 주장합니다:
- 구식 방식: 에이전트(신분증을 가진 사람) 를 신뢰합니다.
- 신식 방식: 프로세스(증명, 판사, 기록) 를 신뢰합니다.
AI 에이전트가 혼란을 겪거나 해킹당하더라도 패널의 승인 없이 "허가증"을 얻을 수 없으므로 피해를 입힐 수 없습니다. 그리고 설령 허가증을 얻더라도 허가증에 명시된 한 가지 특정 작업만 수행할 수 있습니다.
4. 결과 (논문의 발견)
저자들은 10,000 개의 행동이 포함된 시뮬레이션 클라우드 환경에서 이 시스템을 테스트했습니다.
- 안전성: "위험한" 행동 (실제로 사용 중인 서버를 삭제하려는 시도 등) 의 100% 를 차단했습니다. 구식 시스템은 이러한 위험한 실수의 약 14% 를 통과시켰습니다.
- 제한: "폭발 반경"을 줄였습니다. AI 가 450 개의 서버에 접근할 수 있었던 대신, 승인된 단 하나의 서버에만 접근할 수 있었습니다.
- 속도: 전체 프로세스 (증명 확인, 판사 투표 획득, 패스 발급) 는 평균 약 58 밀리초가 걸렸습니다. 이는 비즈니스 속도를 늦출 만큼 빠르지 않습니다.
- 감사 가능성: 기록만으로도 결정의 99.9% 를 완벽하게 재생할 수 있었으며, 구식 시스템은 이야기에서 큰 공백을 남겼습니다.
요약 비유
금고의 상황을 상상해 보세요.
- 구식 시스템: 보안 요원에게 마스터 키가 있습니다. 그가 "금고를 열어야 합니다"라고 말하면 문을 엽니다. 그가 나쁜 날을 보내거나 속아 넘어가면 금고가 열립니다.
- DTF 시스템: 보안 요원은 양식을 작성해야 합니다. 세 명의 서로 다른 관리자 팀이 금고가 열릴 필요가 있는지 그리고 안전한지 확인하기 위해 양식을 검토합니다. 그들이 동의하면 기계가 해당 금고 문에만 5 분 동안만 맞는 일회성 레이저 컷 키를 인쇄합니다. 보안 요원은 그 키를 사용하며 카메라가 과정의 모든 초를 기록합니다. 보안 요원이 그 키로 다른 문을 열려고 시도하면 잠금장치는 단순히 돌아가지 않습니다.
이 논문은 은행, 전력망, 클라우드 서버와 같은 중요한 시스템을 운영하는 AI 에이전트에게 있어, "보안 요원"을 신뢰하는 것을 멈추고 "프로세스"를 신뢰하기 시작해야 한다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.