CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents
CAGE는 이산적 바인딩 결함과 연속적 수치 드리프트가 결합된 상황에서도 승인된 동작이 유효함을 보장하기 위해 결합된 근방을 직접 인증함으로써, 범주형 채널과 수치형 채널을 별개로 취급할 때 발생하는 거짓 양성을 제거하는 도구 사용 LLM 에이전트를 위한 인증 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: CAGE (Typed-Return 불확실성 하에서의 인증된 권한 부여)
1. 문제 정의
본 논문은 도구 사용 LLM(Large Language Model) 에이전트의 치명적인 취약점을 다룹니다. 배포된 에이전트 하네스(harness)들은 실행 시점의 권한 게이트를 사용하여 도구 호출을 승인하는 방식을 점점 더 많이 채택하고 있지만, 이러한 게이트들은 대개 관찰된 도구 반환값()과 제안된 동작을 단일 시점에서 평가합니다. 이는 **잔류 바인딩 불확실성(residual binding uncertainty)**을 고려하지 못합니다. 즉, 에이전트가 관찰한 검증된 레코드()가 미세한 어셈블리 결함(예: 오래된 프로비넌스 태그, 스키마 불일치, 또는 레이스 컨디션)이나 유계된 수치적 드리프트(bounded numerical drift)로 인해 "올바르게 바인딩된" 반환값()과 다를 가능성을 간과합니다.
핵심 문제는 어떤 동작이 관찰된 레코드 하에서 안전해 보이고, 심지어 이산적(범주형) 및 연속적(수치적) 섭동에 대한 개별적인 검사에서도 안전해 보일지라도, 이러한 섭동이 결합되어(jointly) 발생할 경우 안전하지 않게 될 수 있다는 점입니다. 저자들은 이를 **결합 격차 공격(joint-gap attack)**이라고 명명합니다. 텍스트를 정화하거나 포인트 단위의 동작을 평가하는 데 집중하는 기존의 방어 기제들은 이러한 특정 의미론적 불확실성에 대해 결정 경계(decision boundary)를 보호하지 못합니다.
2. 방법론: CAGE
저자들은 관찰된 지점 에서 결합 이웃(joint neighborhood) 로 권한 부여의 대상을 전환하는 런타임 모니터인 CAGE(Certified Authorization Gate for Execution)를 제안합니다. 동작 는 이 이웃 내의 모든 가능한 '올바르게 바인딩된' 반환값에 대해서도 안전할 때만 승인됩니다.
결합 이웃 (The Joint Neighborhood)
이웃은 두 가지 예산(budget)에 의해 정의됩니다:
- 이산 예산 (): 최대 개의 허용 가능한 바인딩 결함(예: 단일 프로비넌스 교체 또는 정책 팩 혼동)을 허용합니다.
- 연속 예산 (): 표준 검증 후 발생하는 수치 필드의 유계된 드리프트(예: 리스크 점수, 금액)를 허용합니다.
비구성 정리 (The Non-Composition Theorem)
본 논문의 핵심적인 이론적 기여는 채널의 개별적 인증은 구성(compose)되지 않는다는 증명입니다.
- 정리 1: 안전 술어(safety predicate)가 원래의 이산 상태에 대한 모든 연속적 섭동 하에서 안전하고, 원래의 연속 값에 대한 모든 이산적 교체 하에서 안전하더라도, 결합된 이산적 교체와 연속적 이동 하에서는 안전하지 않을 수 있습니다.
- 시사점: 한계적 인증(marginal certificates, 즉 텍스트와 숫자를 별도로 확인하는 것)은 건전하지 않습니다(unsound). 방어 기제는 반드시 이산적 섭동과 연속적 섭동의 데카르트 곱(Cartesian product)을 인증해야 합니다.
CAGE 알고리즘
CAGE는 **이산 이웃의 정확한 열거(exact enumeration)**와 이어서 **연속 분기에 대한 건전한 인증(sound certification)**을 통해 작동합니다:
- 열거(Enumerate): 유한한 이산 이웃 집합 를 계산합니다.
- 분기 인증(Certify Branches): 각 이산 이웃 에 대해, -볼(ball) 내의 모든 연속적 섭동 에 대해 동작이 안전한지 인증합니다.
- 결정(Decision): 모든 분기가 연속적 인증 테스트를 통과하는 경우에만 동작을 허용합니다.
가설 사다리 (Assumption Ladder - 백엔드)
CAGE는 정책의 성격(실행 가능 여부 또는 학습 여부)에 따라 다양한 백엔드를 지원합니다:
- CAGE-Exact (Rung 1): 정책이 실행 가능한 술어(예: Rego의 아핀 제약 조건 또는 결정 테이블)인 경우 사용됩니다. 이는 -볼에 대한 제약 조건의 수학적 정밀 검증을 수행하며, 이는 정책 인증(policy-certified) 방식입니다.
- CAGE-Lip (Rung 2): 학습된 게이트(암묵적 정책)에 사용됩니다. 1-립시츠(1-Lipschitz) 신경망 구조를 채택합니다. 이는 립시츠 마진()을 기반으로 게이트의 결정을 인증합니다. 이는 게이트 인증(gate-certified) 방식이며, 측정된 게이트-정책 충실도 가정 하에서 건전합니다.
- CAGE-RS (Rung 3): 블랙박스 게이트에 사용됩니다. **무작위 평활화(Randomized Smoothing)**를 적용하여 연속적 볼에 대한 확률적 보증을 제공합니다. 이 역시 게이트 인증 방식입니다.
3. 주요 기여
- 강건한 권한 부여의 형식화: 본 논문은 도구 반환값에 따른 결정으로서의 사후 권한 부여를 유계된 의미론적 불확실성 하의 결정으로 형식화하며, 반환값에 의존하는 안전성에는 실제 반환값을 조사해야 함을 증명합니다(Proposition 1).
- 비구성 증명: 저자들은 범주형 및 수치적 채널에 대한 한계적 인증이 그 결합 곱에 대한 안전성을 보장하지 않음을 증명하여, "결합 격차 목격자(joint-gap witnesses)"의 존재를 식별하였습니다(Theorem 1).
- 가설 사다리를 갖춘 인증된 모니터: CAGE는 이산 공간을 정확하게 열거하고, (Exact, Lip, RS) 계층 구조의 백엔드를 사용하여 연속 공간을 인증함으로써, 학습된 게이트에 대해서도 명시적인 충실도 조건 하에서 건전한 하한선을 보장하는 통합 프레임워크를 제공합니다.
- 측정된 안전 사례(Measured Safety Case): 주입된 결함에 따라 보정된 실험을 통해, CAGE가 유용한 자율성을 유지하면서도 'in-budget' 오허용(false allows)을 제거함을 입증했습니다.
4. 실험 결과
평가는 합성 설정, 정책-코드-애즈-코드(Open Policy Agent, GoRules), 규제 프레임워크(PSD2/AML), 그리고 실제 트랜잭션 데이터(IEEE-CIS)를 아우릅니다.
- 결합 격차 목격자의 존재: 연구는 합성 설정에서 결합 격차 목격자가 **3.5% ~ 12%**의 자연스러운 빈도로 존재함을 확인했습니다.
- 건전성(Soundness): 모든 설정에서 CAGE는 인증된 오허용(Certified False Allow, CFA) 비율 0을 달 달성했습니다. 반면, 포인트 단위 게이트 및 한계적 구성 베이스라인은 이러한 안전하지 않은 목격자들을 높은 비율(종종 목격자 집합의 100%)로 허용했습니다.
- 자율성(Autonomy): 엄격한 안전 보증에도 불구하고, CAGE는 상당한 자율성을 유지합니다:
- CAGE-Exact는 정책-코드-애즈-코드 설정에서 견고하게 안전한 결정의 **22~34%**를, 자연스러운 트래픽에서는 **57%**를 자율적으로 통과시킵니다.
- **학습된 백엔드(Lip/RS)**는 운영 지점의 엄격함에 따라 **6.5~37%**의 자율성을 유지합니다.
- 엔드-투-엔드 검증: 라이브 시스템 테스트(Kubernetes, MCP 쓰기 경로, AML 엔진)에서 CAGE는 게이트가 없거나 포인트 게이트만 있는 에이전트가 허용했던 안전하지 않은 부작용(예: 승인되지 않은 배포, 할당량 초과 쓰기)을 성공적으로 차단했습니다.
- 적응형 공격(Adaptive Attacks): CAGE는 정책과 예산을 알고 있는 적응형 공격자에게도 건전성을 유지하는 반면, 학습된 포인트 게이트는 높은 오허용율(일부 합성 공격에서 최대 98%)을 보였습니다.
5. 의의 및 주장
본 논문은 CAGE가 타입ed-반환의 불확실성이 존재하는 결정에 대해 보정된 권한 부여 메커니즘을 제공한다고 주장합니다. 그 의의는 다음과 같습니다:
- 논리적 격차 해소: 타입ed-반환의 결합 이웃을 공식적으로 인증하는 최초의 시스템으로서, 포인트 단위 및 한계적 방어가 놓치는 취약점을 해결합니다.
- 실용적 배포 가능성: "가설 사다리"를 제공함으로써, 이론적으로 완벽한 실행 가능 정책과 실용적인 학습된 게이트 사이의 간극을 메우며, 명시적인 충실도 조건 하에서 학습된 게이트에 대해서도 공식적인 보증을 제공합니다.
- 운영적 현실성: 본 연구는 공식적인 보증을 데이터의 신선도나 생성자의 무결성과 같은 운영적 전제 조건과 명확히 분리합니다. 절대적인 면역을 주장하기보다, 이러한 전제 조건이 실패할 때(예: 데이터 신선도가 선언된 예산을 초과할 때)의 "잔류 위험"을 정량화합니다.
저자들은 외부 타당성 주장에 대해 겸허한 태도를 취합니다. 이들은 배포된 형태의 파이프라인에서 이러한 유형의 결함이 발생하는 존재성, 실현 가능성, 그리고 메커니즘을 입증한 것이지, 모든 실제 세계의 에이전트 시스템에서 이러한 특정 결함의 빈도를 측정했다고 주장하지는 않습니다. 결론적으로, 타입ed-반환의 불확실성을 측정하고 강제할 수 있는 곳이라면 어디든 CAGE가 필수적인 런타임 제어 장치라고 강조합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.