A Policy Algebra for Trust-Preserving Agentic AI Execution
이 논문은 보안 제약 조건과 실행 시 의무 사항을 형식적으로 합성함으로써 에이전트형 AI를 위한 신뢰 보존형 신뢰성 엔벨로프(reliability envelope)를 정의하는 정책 대수를 소개하며, 이를 통해 높은 작업 완수율을 유지하고 감사 완결성을 보장하면서 거의 모든 정책 위반에 대해 시스템이 개입할 수 있도록 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 세계에서 중대한 변화가 일어나고 있습니다. 수년 동안 초점은 텍스트를 생성하거나, 질문에 답하거나, 문서를 요약할 수 있는 시스템을 구축하는 데 맞춰져 있었습니다. 이러한 시스템은 무엇이든 읽을 수는 있지만 책을 만지거나 가구를 옮기는 것은 금지된, 매우 박식한 사서와 같았습니다. 오늘날, 흔히 "에이전트"라고 불리는 새로운 세대의 소프트웨어는 건물 열쇠를 부여받았습니다. 이 에이전트들은 단순히 말만 하는 것이 아니라 행동합니다. 이들은 회사의 개인 파일을 검색하고, 이메일을 보내고, 데이터베이스를 업데이트하며, 외부 서비스를 호출하고, 심지어 다른 소프트웨어 프로그램에 작업의 일부를 넘겨줄 수도 있습니다. 생각에서 실행으로 넘어가는 이러한 능력은 기업들에게 엄청난 힘을 실어주지만, 동시에 새로운 종류의 위험을 초ti적으로 도입합니다. 실수는 더 이상 잘못된 문장 하나가 아니라, 삭제된 파일, 유출된 비밀, 또는 완료되지 않은 작업에 소비된 예산이 됩니다.
핵심적인 문제는 에이전트가 규칙을 어기면서까지 목표를 달성할 수 있다는 점입니다. 어떤 직원이 잠긴 방을 부수고 들어가서라도 물건을 배달하는 데 성공했다고 가정해 보십시오. 과거의 보안 시스템은 주로 사람이 건물에 들어갈 수 있는 출입증을 가졌는지 확인했습니다. 하지만 이러한 지능형 에이전트의 경우, 보안 점검은 단지 정문에서 한 번이 아니라 여정의 매 단계마다 이루어져야 합니다. 에이전트가 결정을 내릴 수 있도록 허용된다면, 그 결정은 요청자가 누구인지, 어떤 도구를 사용하는지, 남은 예산이 얼마인지, 그리고 인간의 승인을 받았는지에 따라 검증되어야 합니다. 이러한 지속적인 감독이 없다면, 강력한 도구는 시작한 사람의 의도가 좋았더라도 쉽게 해를 끼칠 수 있습니다.
폭스바겐 디지털 서비스(Volkswagen Digital Services)와 스카니아(Scania CV AB)의 연구진은 이 위험을 관리하기 위한 새로운 방법인 '정책 대수(policy algebra)'를 개발했습니다. 이것을 단순한 규칙 목록이 아니라, 서로 다른 보안 요구 사항들을 하나의 깨지지 않는 결정으로 결합하는 수학적 체계라고 생각하십시오. 연구진은 에이전트를 신뢰하기 위해서는 에이전트가 만들어낸 최종 결과물만을 봐서는 안 되며, 그 결과에 도달하기 위해 거친 전체 경로를 살펴봐야 한다는 점을 깨달았습니다. 그들의 시스템은 에이전트가 수행하려는 모든 행동을 일련의 관문을 통과해야 하는 '전이(transition)'로 취급합니다. 이 관문들은 에이전트의 신원, 역할, 접촉하는 데이터의 민감도, 사용하는 도구, 남은 예산, 그리고 인간의 승인 여부를 확인합니다. 단 하나의 관문이라도 실패하면 그 행동은 중단됩니다.
이 접근 방식의 탁월함은 복잡성, 특히 한 에이전트가 다른 에이전트에게 작업을 요청할 때 발생하는 상황을 처리하는 방식에 있습니다. 현재의 많은 시스템에서는 작업이 하위로 전달될 때 보안 규칙이 의도치 않게 약해져서, 하위 에이전트가 원래의 에이전트가 할 수 없었던 일을 할 수 있게 되는 경우가 있습니다. 새로운 시스템은 권한이 체인 아래로 내려가면서 확장되지 않도록 보장함으로써 이를 방지합니다. 대신, 보안 프로필은 더 엄격해지거나 동일하게 유지됩니다. 고위 관리자가 주니어 직원에게 도움을 요청한다고 해서, 주니어 직원이 갑자기 관리자의 개인 파일에 접근할 수 있는 것은 아닙니다. 또한 이 시스템은 돈을 신중하게 관리합니다. 에이전트가 많은 컴퓨팅 파워나 비용을 소비한다면, 반드시 저장된 문서나 완료된 기록과 같은 가시적인 결과를 만들어내야 합니다. 만약 에이전트가 유용한 결과물을 남기지 못한 채 예산을 모두 써버린다면, 시스템은 이를 중단시켜 회사가 아무런 성과 없이 자원을 낭비하는 것을 방지합니다.
이 방식이 얼마나 잘 작동하는지 테스트하기 위해, 연구진은 에이전트들이 다양한 작업을 완수하려고 시도하는 수천 개의 시뮬레이션 시나리오를 실행했습니다. 그들은 이 새로운 시스템을 허용된 도구와 사용자 역할에 의존하는 기존 방식과 비교했습니다. 결과는 안전성 면에서 명확한 차이를 보여주었습니다. 새 시스템은 기존 시스템이 놓쳤던 위험한 행동의 94.8%를 차단했습니다. 여기에는 에이전트가 접근해서는 안 될 데이터에 접근하거나, 만져서는 안 될 도구를 사용하거나, 보안 규칙을 우회하는 방식으로 다른 에이전트에게 작업을 전달하는 것을 방지하는 것이 포함되었습니다. 또한 시스템은 에이전트가 모든 돈을 쓰고도 유용한 결과물을 남기지 못하는 특정 유형의 실패를 제거했습니다. 추적 측면에서, 새 시스템은 감사에 필요한 세부 정보를 98.6% 기록한 반면, 기존 방식은 71.9%를 기록하여 문제가 발생했을 때 무엇이 일어났는지 이해하기 훨씬 쉽게 만들었습니다.
이러한 추가적인 안전에는 비용이 따릅니다. 새 시스템은 의사 결정을 내리는 데 평균 약 71밀리초가 걸려, 기존 방식의 38밀리초보다 약간 느립니다. 또한 안전한 행동을 실수로 차단하는 경우도 약 4.2% 발생하여, 기존 시스템의 2.1%보다 높았습니다. 이러한 추가 점검 때문에 에이전트가 작업을 성공적으로 완수하는 전체 비율은 90.7%에서 86.9%로 약간 감소했습니다. 그러나 연구진은 이러한 트레이드오프(trade-off)가 필요하다고 주장합니다. 목표는 가장 빠르거나 가장 유능한 에이전트를 만드는 것이 아니라, 가장 신뢰할 수 있는 에이전트를 만드는 것이기 때문입니다. 빠르게 완료되었더라도 권한 없는 데이터에 접근하거나 예산을 낭비한 작업은 성공이라고 할 수 없습니다.
이 연구는 지능형 에이전트를 위한 보안이 목적지가 아닌 여정 전체의 속성이어야 함을 확인시켜 줍니다. 규칙을 결합하는 이 새로운 방법을 사용함으로써, 기업들은 모든 단계가 승인되고, 추적 가능하며, 경제적으로 건전함을 보장하면서도 소프트웨어가 더 자유롭게 행동할 수 있도록 허용할 수 있습니다. 이 시스템은 에이전트가 무엇을 잘못할지 예측하려 하지 않습니다. 대신, 에이전트가 매 순간 명시적으로 허용된 것만을 수행할 수 있는 프레임워크를 만듭니다. 이러한 접근 방식은 인공지능의 가공할 힘을, 실수가 실제적인 결과로 이어지는 현실 세계에서 기업이 실제로 믿고 운영할 수 있는 도구로 탈바꿈시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.