Observability for Delegated Execution in Agentic AI Systems
이 논문은 동적인 LLM 기반 에이전트 시스템에서 표준 감사 로그가 위임 범위를 고유하게 식별하지 못하는 문제를 해결하기 위해, 신뢰할 수 있고 휴리스틱이 필요 없는 포렌식 재구성을 가능하게 하도록 실행 시점에 위임 컨텍스트를 결합하는 에이전트 인지 관측 기질(agent-aware observability substrate)을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 복잡한 프로젝트를 처리하기 위해 고도로 숙련되고 자율적인 비서들(AI 에이전트)로 구성된 팀을 고용했다고 상상해 보십시오. 당신은 다음과 같은 광범위한 목표를 부여합니다: "우리의 판매 데이터를 정리하고 팀원들과 요약본을 공유해 줘."
과거에 인간 직원을 고용했을 때라면, 그가 파일을 열고, 이메일을 보내고, 보고서를 출력하는 등의 일과를 쉽게 추적할 수 있었습니다. 하지만 이 AI 에이전트들은 다릅니다. 이들은 단순히 직선적인 경로를 따르지 않습니다. 이들은 다음과 같은 행동을 할 수 있습니다:
- 업무를 더 작은 작업으로 나누어 다른 AI 하위 비서들에게 보냅니다.
- 도구를 시도했다가 실패하면, 다른 도구를 시도합니다.
- 여러 대의 컴퓨터에서 여러 작업을 동시에 실행합니다.
- 까다로운 문서 때문에 혼란을 겪어, 당신의 원래 허가 범위 내에서 움직이고 있음에도 불구하고 의도치 않은 행동을 할 수도 있습니다.
문제점: 위임의 "유령" (The "Ghost" of Delegation)
이 논문의 저자들은 이러한 에이전트들을 추적하는 현재의 방식이 망가져 있다고 주장합니다. 우리에게는 '감사 로그(audit logs)'(보안 카메라와 같은 것)와 '트레이스(traces)'(경로를 나타내는 지도와 같은 것)가 있습니다.
하지만 이 논문은 단순히 로그를 보는 것만으로는 특정 위임에 속한 행동이 무엇인지 파악할 수 없다고 주장합니다.
여기 비유가 있습니다: 서로 다른 두 명의 배달 기사(위임 A와 위임 B)가 같은 도시에서 일하고 있다고 가정해 봅시다. 두 기사는 모두 같은 도로(도구)를 사용하며 때때로 서로 스쳐 지나갑니다.
- 과거의 방식: 우리는 특정 교차로를 통과한 모든 차량의 기록과 그 시간을 알고 있을 뿐입니다.
- 문제점: 만약 기사 A와 기사 B가 오후 2시에 동시에 교차로를 통과했고 그들의 경로가 비슷해 보인다면, 교통 로그만 보고는 어떤 기사가 무엇을 했는지 구분할 수 없습니다. 그들이 근처에 있었기 때문에 함께 움직였다고 추측할 수는 있겠지만, 그것은 단지 추측일 뿐입니다. 만약 그들의 경로가 겹치거나, 재시도하거나, 갈라진다면, 그 추측은 불가능해집니다.
이 논문은 권한 자체에 특정 라벨이 붙어 있지 않으면, 당신이 위임한 권한이 정확히 무엇을 했는지 재구성하는 것이 수학적으로 불가능하다는 것을 증명합니다. 즉, "권한"(누가 명령을 내렸는가)은 "인과관계"(어떤 순서로 일이 일어났는가)와 완전히 분리되어 있습니다.
해결책: "스마트 게이트웨이"와 "유니버설 배지"
이를 해결하기 위해 저자들은 **CIM (Common Information Model)**과 **게이트웨이(Gateway)**라고 불리는 새로운 시스템을 제안합니다.
- 게이트웨이 (보안 요원): AI가 사용하고자 하는 모든 도구(파일 서버, 채팅 앱, 데이터베이스 등)의 문 앞에 서 있는 보안 요원을 상상해 보십시오.
- 유니버설 배지 (위임 ID): 특정 위임이 시작되면, 시스템은 해당 위임만을 위한 고유하고 변경 불가능한 "배지 ID(Badge ID)"를 발급합니다.
- 규칙: AI가 무엇인가에 접촉할 때마다, 게이트웨이는 배지를 확인합니다. 만약 AI가 당신의 허가 하에 행동하고 있다면, 게이트웨이는 해당 행동이 일어나기 전 단계에서 그 행동에 당신의 배지 ID를 낙인찍습니다.
이것은 단순히 "세션 ID"(단일 여정을 위한 티켓 번호와 같은 것)를 추가하는 것과는 다릅니다. 세션 ID는 AI가 업무를 하위 팀으로 나누거나 작업을 재시도할 때 깨지기 쉽습니다. 반면 배지 ID는 AI가 하위 에이전트를 생성하든, 작업을 병렬로 실행하든, 혹은 앞뒤로 왔다 갔다 하든 상관없이 그 권한과 함께 계속 유지됩니다.
이를 통해 우리가 할 수 있는 것들
이 새로운 시스템을 사용하면, 질문을 던지는 것이 마치 문 근처에 누가 서 있었는지를 보고 추측하는 것이 아니라, 데이터베이스에서 특정 고객을 검색하는 것처럼 쉽고 정확해집니다.
- "폭발 반경(Blast Radius)" 질문: "AI가 2시에서 2시 30분 사이에 어떤 파일에 접근했는가?"(이 과정에서 다른 사람의 작업이 포함될 수 있음)라고 추측하는 대신, "어떤 도구를 사용했든, 언제 발생했든 관계없이 배지 #123에 의해 접촉된 모든 파일을 보여줘"라고 물을 수 있습니다.
- "하위 에이전트" 질문: 만약 메인 AI가 궂은일을 하기 위해 하위 에이전트를 고용했다면, 배지는 그 하위 에이전트의 행동 역시 당신의 원래 위임과 명확하게 연결되도록 보장합니다.
- "드리프트(Drift)" 질문: AI가 안전한 파일을 읽다가 갑자기 비밀 파일을 읽기 시작했다면, 시스템은 AI가 권한 변경을 요청하지 않았더라도 배지의 활동 로그에서 이러한 "드리프트" 현상을 포착할 수 있습니다.
중요한 한계점 (이 논문이 주장하지 않는 것)
- 마음을 읽지는 못합니다: 이 시스템은 AI가 무엇을 의도했는지 또는 속임을 당했는지(예: 프롬프트 인젝션) 알지 못합니다. 시스템은 단지 그 행동이 당신의 위임 하에 일어났다는 사실만을 기록합니다. 만약 AI가 속아서 파일을 훔쳤다면, 시스템은 "당신의 위임이 이 일을 했다"라고 말할 뿐, "AI가 해킹당했다"라고 말하지 않습니다.
- 문(Door)이 필요합니다: 이 시스템은 AI가 "게이트웨이"를 통할 때만 작동합니다. 만약 AI가 게이트웨이가 감시하지 않는 백도어를 찾아내거나 도구를 사용한다면, 그 행동들은 보이지 않습니다.
- 예방 도구가 아닙니다: 이 시스템은 AI가 나쁜 짓을 하는 것을 막는 것이 아니라, 사후에 정확히 무슨 일이 일어났는지 볼 수 있게 해주는 것입니다.
요약하자면
이 논문은 AI 에이전트가 점점 더 무질서하고 복잡해짐에 따라, 경로와 시간만을 보는 기존의 추적 방식은 실패할 것이라고 주장합니다. 우리는 단순히 경로를 따르는 것이 아니라 권한 자체를 따르는 새로운 추적 방식이 필요합니다. 모든 행동이 발생하는 순간에 영구적인 "배지"를 부착함으로써, 우리는 AI가 루프를 돌거나, 팀을 나누거나, 여러 시스템을 넘나들며 작업하더라도 우리가 위임한 데가 정확히 무엇을 했는지 마침내 재구성할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.