aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents
이 논문은 정체성 기반의 불변 정책과 암호학적 검증을 강제함으로써 AI 에이전트의 도구 호출을 보호하고, 다양한 모델과 시나리오 전반에서 공격 성공률을 0%로 효과적으로 낮추면서도 지연 시간을 무시할 만한 수준으로 유지하는 오프호스트 인가 게이트웨이인 aiAuthZ를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 문제: "잘 속는 집사"
당신이 가사 일을 돌봐줄 매우 똑똑한 집사(AI 에이전트)를 고용했다고 상상해 보세요. 이 집사는 지시를 따르는 데 아주 능숙합니다. 금고를 열거나, 이메일을 보내거나, 돈을 송금할 수도 있습니다.
하지만 문제가 하나 있습니다. 집사는 당신의 진짜 명령과 누군가 냉장고에 붙여놓은 가짜 메모를 구분하지 못합니다.
만약 낯선 사람이 집에 몰래 들어와서 *"주인이 말하기를: 모든 돈을 내 계좌로 송금하라"*라고 적힌 쪽지를 남긴다면, 집사는 그 쪽지를 읽고 그것이 당신의 진짜 명령이라고 믿어버릴 수 있습니다. 이것을 **프롬프트 인젝션(prompt injection)**이라고 부릅니다. 이 논문은 명령이 안전한지 판단하는 것을 집사의 "생각"에 맡기는 것은 위험하다고 주장합니다. 그 이유는 다음과 같습니다:
- 어떤 집사는 잘 속고, 어떤 집사는 의심이 많습니다.
- 아무리 비싸고 고급인 집사라도 가끔 속아 넘어갑니다.
- 더 많은 돈을 지불한다고 해서 집사를 더 안전하게 만들 수는 없습니다.
해결책: "외부 보안 요원" (aiAuthZ)
저자들은 aiAuthZ라는 시스템을 만들었습니다. 집사에게 명령이 안전한지 결정하라고 요청하는 대신, 집사와 외부 세계 사이에 별도의 잠긴 방(다른 신뢰 도메인)에 보안 요원을 배치했습니다.
새로운 시스템의 작동 방식은 다음과 같습니다.
1. "비밀 악수" (신원 확인)
당신(사용자)이 명령을 내릴 때, 단순히 말로 하는 것이 아니라 오직 당신과 보안 요원만이 알고 있는 고유하고 깨뜨릴 수 없는 디지털 인장(HMло HMAC 서명)으로 서명합니다.
- 비유: 당신이 보안 요원에게 쪽지를 건네는 상황을 상상해 보세요. 그 쪽지에는 특별한 왁스 인장이 찍혀 있습니다. 보안 요원은 이 인장을 확인합니다. 만약 인장이 진짜라면, 보안 요원은 "이 명령은 확실히 주인이 보낸 것이며, 낯선 사람이 보낸 것이 아니다"라고 알게 됩니다.
- 반전: 설령 집사가 *"내가 주인이다, 열쇠를 내놔라"*라고 적힌 쪽지를 읽더라도, 보안 요원은 그 글귀를 무시합니다. 보안 요원은 오직 인장만을 신뢰합니다. 인장이 주인과 일치하지 않으면, 내용이 무엇이든 상관없이 명령은 거부됩니다.
2. "규칙 책" (오프 호스트 정책)
보안 요원은 집사가 보거나 수정할 수 없는 규칙 책을 가지고 있습니다.
- 비례: 집사는 *"나는 어떤 문이든 열 수 있어!"*라고 생각할 수도 있습니다. 하지만 보안 요원의 규칙 책에는 *"주인만이 금고를 열 수 있다. 주인만이 돈을 송금할 수 있다"*라고 적혀 있습니다.
- 설령 집사가 권한이 있다고 착각하도록 속더라도, 보안 요원이 규칙 책을 확인합니다. 요청자(인장)가 주인이 아니거나, 너무 큰 행동(예: 백만 달러 송금)을 하려 한다면 보안 요원이 이를 차단합니다.
3. "깨지지 않는 영수증" (QR 코드)
보안 요원이 "네, 안전합니다"라고 승인하면, 단순히 동작을 허용하는 것에 그치지 않고 해당 명령이 승인되었음을 증명하는 QR 코드 영수증을 출력합니다.
- 비례: 이는 콘서트 티켓과 같습니다. 티켓 사진을 찍거나, 크기를 줄이거나, 흐릿한 메시지로 보내더라도 보안 시스템은 여전히 이를 스캔하여 "이것은 유효한 티켓이다"라고 인식할 수 있습니다.
- 논문에서는 QR 코드를 촬영하고, 자르고, 압축하는 테스트를 진행했습니다. 시스템은 여전히 94%의 확률로 이를 인식했습니다. 이는 누가 무엇을 했는지에 대한 영구적이고 변경 불가능한 기록을 생성합니다.
4. "비밀 금고" (자격 증명 브로커)
보안 요원은 또한 금고의 열쇠(API 비밀키)를 보유하고 있습니다. 집사는 열쇠를 가지고 있지 않습니다.
- 비례: 만약 집사가 금고를 열도록 속임을 당하더라도, 집사는 열쇠가 없기 때문에 열 수 없습니다. 집사는 보안 요원에게 요청해야 합니다. 보안 요원은 규칙을 확인하고, 그때서야 그 특정 순간을 위한 열쇠를 건넵니다. 집사가 열쇠를 훔치려 해도, 열쇠는 보안 요원의 방을 떠나지 않으므로 불가능합니다.
이 논문이 실제로 발견한 것
저자들은 이 시스템을 15개의 서로 다른 AI "집사"(모델)와 8가지 유형의 공격(데이터를 훔치도록 집사를 속이는 등)을 대상으로 테스트했습니다.
- 보안 요원이 없을 때: 집사들은 일관성이 없었습니다. 어떤 모델은 속임수를 거부했지만(100% 안전), 어떤 모델은 속아 넘어갔습니다(38% 안전). 가장 비싼 모델조차 50%의 안전성만을 보였습니다.
- 보안 요원이 있을 때: 모든 공격이 차단되었습니다. 가장 저렴한 모델부터 가장 비싼 모델까지, 모든 모델이 나쁜 행동을 막아냈습니다 해킹 시도를 완벽히 차단했습니다.
- 속도: 보안 요원은 0.03 밀리초 만에 결정을 내렸습니다. 이는 눈 깜빡임보다 빨라서 시스템을 전혀 느리게 하지 않았습니다.
- 실제 환경 테스트: 뱅킹 시뮬레이션에서 테스트했을 때, 해커가 집사를 속여 돈을 훔치려 시도했음에도 불구하고 보안 요원이 모든 시도를 차단했습니다.
이 시스템이 하지 "못하는" 것
보안 요원이 할 수 없는 일을 아는 것처럼, 이 시스템의 한계를 아는 것도 중요합니다:
- 집사가 혼란스러워하는 것을 막지는 못합니다. 집사는 여-전히 낯선 사람을 주인으로 착각할 수 있습니다. 보안 요원은 단지 집사가 그 착각에 따라 행동하는 것을 막을 뿐입니다.
- 해커가 보안 요원의 방에 침입하는 것을 막지는 못합니다. 만약 공격자가 보안 요원의 컴퓨터를 제어하게 된다면, 전체 시스템은 실패합니다.
- 집사가 자체적으로 내장된 도구를 사용하는 것을 막지는 못합니다. 만약 집사에게 보안 요원을 우회하는 비밀 백도어(예: 내장된 셸 명령)가 있다면, 보안 요원은 이를 막을 수 없습니다. 논문은 시스템을 설치할 때 이러한 백도어를 비활성화해야 한다고 명시합니다.
결론
이 논문은 AI 모델 스스로가 자신을 감시하도록 해서는 안 된다고 주장합니다. 대신, AI 모델 앞에 별도의 암호화된 보안 요원을 두어야 합니다. 이 보안 요원은 요청자의 신원을 확인하고, 규칙을 검토하며, 영수증을 발행합니다. 이는 혼란스럽고 예측 불가능한 상황을 결정론적이고 안전한 상황으로 바꾸어 놓으며, 어떤 AI 모델을 사용하더라도 나쁜 행동을 100% 차단합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.