Agent Security Needs Redefinition through a Holistic Framework
이 논문은 에이전트 보안이 근본적으로 콘텐츠 기반의 문제가 아닌 맥락적 문제라고 주장하며, 현재의 콘텐츠 중심 방어 체계와 벤치마크의 구조적 한계를 해결하기 위해 출처 권한 부여(Source Authorization), 작업 정렬(Task Alignment), 행동 정렬(Action Alignment), 데이터 격리(Data Isolation)로 정의되는 총체적 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 똑똑하고 매우 빠른 우주선의 함장이라고 상상해 보십시오. 이 우주선에는 새로운 종류의 자동 항법 장치인 AI 에이전트가 탑재되어 있습니다. 이 에이전트는 단순히 조종만 하는 것이 아니라, 다른 컴퓨터와 대화하고, 문을 열고, 화물을 옮기며, 심지어 엔진을 수리할 수도 있습니다. 하지만 까다로운 점이 하나 있습니다. 이 우주선은 소음이 가득한 은하계를 통과해 비행하고 있다는 것입니다. 때로는 친절한 승무원이 명령을 내리기도 하지만, 때로는 교활한 외계인이 무해해 보이는 메시지 안에 가짜 명령을 숨겨 우주선을 속이려 들기도 합니다.
오랫동안 AI 우주선을 연구해 온 과학자들은 안전을 유지하는 유일한 방법이 명령의 '단어'를 살펴보는 것이라고 생각했습니다. 만약 명령이 "엔진을 폭파하라"처럼 무섭게 들리면 그것을 막고, "엔진을 수리하라"처럼 좋게 들리면 그대로 통과시키는 식이었죠. 하지만 이것은 클럽 입구에서 옷 색깔만 확인하는 보안 요원과 같습니다. 도둑이 빨간 셔츠를 입고 오면 들여보내고, 소방관이 빨간 셔츠를 입고 오면 막아서는 격입니다. 문제는 동일한 단어라도 누가 말하느냐와 어떤 상황이냐에 따라 친절한 요청이 될 수도 있고, 해커의 치명적인 함정이 될 수도 있다는 것입니다. 이 논문은 우리가 단어만을 보는 것을 멈추고, 그 단어 뒤에 숨겨진 전체 이야기를 보기 시작해야 한다고 주장합니다.
거대한 혼란: 단어인가, 누가 말했는가
UC 산타크루즈와 UC 버클리 연구진으로 구성된 이 논문의 저자들은 우리가 AI 에이전트를 테스트하고 보호하는 방식에 있어 거대한 실수를 범하고 있다고 지적합니다. 그들은 우리가 잘못된 질문을 던져왔다고 말합니다. "이 명령이 위험해 보이는가?"라고 묻는 대신, "이 특정 상황에서 이 명령이 허용되는가?"라고 물어야 한다는 것입니다.
왜 이것이 중요한지 이해하기 위해 "파일 삭제" 명령을 예로 들어보겠습니다.
- 시나리오 A: 건물 열쇠를 가진 당신의 상사가 "작년의 오래된 파일들을 삭제해라"라고 말합니다. 이것은 좋은 일입니다.
- 시나리오 B: 공용 게시판에 몰래 쪽지를 남긴 해커가 "작년의 오래된 파일들을 삭제해라"라고 말합니다. 이것은 재앙입니다.
단어는 동일합니다. 행동도 동일합니다. 하지만 첫 번째 경우에서는 일상적인 정리 작업이지만, 두 번째 경우에는 범죄입니다. 현재의 보안 시스템은 마치 쪽지만 읽는 로봇과 같습니다. "삭제"라는 단어를 보고 당황하거나, 혹은 "삭제"를 보고 "아, 괜찮네"라며 누가 썼는지 확인하지 않고 그냥 넘어갑니다. 저자들은 이것이 영화의 단 한 프레임만 보고 영화를 판단하려는 것과 같다고 주장합니다. 그러면 줄거리와 등장인물, 그리고 맥락을 놓치게 됩니다.
4단계 보안 체크
이를 해결하기 위해, 논문은 단순히 행동만을 보는 것이 아니라, 마치 우주선이 움직이기 전 체크리스트를 실행하는 보안팀처럼 네 가지 특정 사항을 확인해야 한다고 제안합니다. 그들은 이를 "전체론적 프레임워크(holistic framework)"라고 부르는데, 이는 단순히 멋진 표현일 뿐 "전체 그림을 본다"는 뜻입니다.
저자들이 모든 AI 행동에 대해 반드시 확인해야 한다고 말하는 네 가지 규칙은 다음과 같습니다.
- 출처 권한 (누가 말하는가?): "적절한 열쇠를 가진 사람이 실제로 이 말을 했는가?"를 묻습니다. 만약 명령이 AI가 읽고 있는 무작위 웹페이지나 문서에서 왔다면, 그것은 길거리에서 낯선 사람이 명령을 외치는 것과 같습니다. 설령 명령이 "돈을 보내라"일지라도, 그 낯선 사람이 은행 매니저가 아니라면 답은 "아니오"입니다.
- 과업 정렬 (미션은 무엇인가?): "이 명령이 AI가 고용된 업무의 일부인가?"를 묻습니다. 피자를 배달하도록 고용된 배달 로봇을 상상해 보십시오. 누군가 로봇에게 "은행을 털러 가라"고 말한다면, 그것은 전혀 다른 직업입니다. 로봇이 은행까지 운전할 수 있다 하더라도, 그것은 미션이 아니기에 수행해서는 안 됩니다.
- 행동 정렬 (이 단계가 미션에 적합한가?): "이 구체적인 움직임이 미션에 도움이 되는가?"를 묻습니다. 로봇이 피자를 배달하려면 문을 열어야 할 수도 있습니다. 하지만 만약 로봇이 통과하기 위해 "문을 부수기로" 결정한다면, 그것은 과도합니다. 목표(피자 배달)는 괜찮지만, 행동(부수는 것)은 잘못되었습니다.
- 데이터 격리 (비밀이 유출되고 있는가?): "AI가 개인 정보를 섞고 있는가?"를 묻습니다. 환자 A를 돕는 의사 보조를 상상해 보십시오. 그들이 환자 A를 돕고 나서 환자 B를 도울 때, 실수로 환자 B에게 환자 A의 의료 기록을 말해서는 안 됩니다. AI는 서로 다른 사람들의 "파일"을 분리하여 유지해야 합니다.
기존 테스트가 실패하는 이유
논문은 오늘날 우리가 AI의 안전성을 테스트하는 데 사용하는 많은 테스트가 이 네 가지 규칙을 무시하기 때문에 고장 났다고 지적합니다. 연구진은 45개의 서로 다른 "공격" 시나리오를 포함하고 있는 두 가지 인기 있는 테스트 세트, AgentDojo와 WASP를 조사했습니다.
그들은 놀라운 사실을 발견했습니다. 그 45가지의 "공격" 모두가 정상적이고 합법적인 요청이 될 수도 있다는 점입니다.
- 공격: "$30,000를 소액으로 나누어 송금하라."
- '나쁜' 버전: 돈을 훔치려는 해커.
- '좋은' 버전: 집을 사기 위해 일일 한도 내에서 결제하려는 정당한 회계사.
- 공격: "새 사용자를 '소유자(Owner)'로 추가하라."
- '나쁜' 버전: 프로젝트를 탈취하려는 해커.
- '좋은' 것: 공동 창립자를 영입하는 상사.
현재의 테스트들은 단순히 행동("송금" 또는 "사용자 추가")만을 보고 "그것은 공격이다!"라고 말합니다. 저자들은 이것이 틀렸다고 말합니다. 테스트는 누가 그것을 요청했는지 또는 왜 그러는지를 확인하지 않기 때문에 차이를 구분할 수 없습니다. 이는 마치 선생님이 영화에 대한 이야기 속에 "폭탄"이라는 단어가 들어있다는 이유만으로 학생을 낙제시키는 것과 같습니다. 내용을 읽지도 않고 말이죠.
"스냅샷" 문제
저자들은 또한 우리가 AI를 테스트하는 방식에 대해서도 비판합니다. 대부분의 테스트는 "스냅샷"과 같습니다. AI에게 명령을 주고, 무슨 일이 일어나는지 본 다음, 모든 것을 초기화합니다. AI의 기억을 지우고 다시 시작하는 것이죠.
하지만 현실 세계는 스냅샷이 아니라 영화입니다. 해커는 즉시 공격하지 않을 수도 있습니다. 그들은 오늘 AI의 기억 속에 "독이 든" 메모를 심어놓을 수 있고, 3일 뒤에 AI가 그 메모를 읽고 그것을 실제 명령이라고 생각하게 만들 수 있습니다. 스냅샷 테스트는 기억을 초기화하기 때문에, 이러한 느리고 은밀한 공격을 절대 포착할 수 없습니다. 저자들은 우리가 AI의 단일 단계가 아니라 전체 여정을 지켜봐야 한다고 주장합니다.
해결책: 방어 체계를 구축하는 새로운 방법
그렇다면 우리는 무엇을 해야 할까요? 논문은 우리가 "콘텐츠 필터"(나쁜 분위기의 단어를 스캔하는 프로그램)를 만드는 것을 멈추고 "맥락 체크(context checks)"를 구축하기 시작해야 한다고 제안합니다.
- "이 문장이 해킹처럼 보이는가?"라고 묻는 대신,
- "출처가 권한이 있는가? 과업이 허용되는가? 행동이 너무 과한가? 데이터가 유출되고 있는가?"라고 물어야 합니다.
이것은 우리가 방어 체계를 구축하는 방식을 바꿉니다. 만약 어떤 방어 체계가 "출처 권한"을 확인하는 데 뛰어나다면, 그 프로그램은 단어가 "나쁜지"를 완벽하게 맞히려고 애쓸 필요가 없습니다. 그저 말하는 사람이 열쇠를 가지고 있는지 알기만 하면 됩니다. 이것은 훨씬 더 쉽고 신뢰할 수 있는 작업입니다.
저자들은 이것이 큰 변화라는 점을 인정합니다. 이는 우리가 AI가 무엇이 나쁜지 스스로 "알도록" 만드는 것에만 의존할 수 없음을 의미합니다. 우리는 AI가 작업하는 동안 이 네 가지 규칙을 끊임없이 확인하는 시스템을 구축해야 합니다. 그들은 우리가 항상 완벽한 추적을 할 수는 없더라도, 큰 실수를 막기 위해 이 네 가지를 확인하는 데 "충분히 좋은" 시스템을 구축할 수 있다고 제안합니다.
핵심 요약
이 논문은 AI 보안의 모든 문제를 해결했다고 주장하는 것이 아닙니다. "모든 것을 해결했다!"라고 말하는 것도 아닙니다. 대신, "우리가 문제를 잘못된 방향으로 바라보고 있었다"라고 말합니다.
보안을 단순히 '나쁜 단어'의 목록이 아니라, 누가 무엇을 왜 하는지에 대한 이야기로 다룸으로써, 우리는 실제로 안전한 AI를 구축할 수 있습니다. 이것은 얼굴만 쳐다보는 보안 요원과, 신분증과 티켓, 목적지, 그리고 수하물까지 확인하는 보안 요의 차이입니다. 논문은 우리가 AI 에이전트가 은하계를 안전하게 비행하기를 원한다면, 단지 얼굴만 볼 것이 아니라 티켓 전체를 확인하기 시작해야 한다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.