← 최신 논문
🤖 AI

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry는 기술 승인, 호출, 실행 및 사후 조치 단계에 걸쳐 다계층의 점진적 검토 시스템을 구현함으로써 자율형 LLM 에이전트의 점진적 리스크를 완화하고, 정당한 작업에 대한 높은 처리량을 유지하면서도 공격 성공률을 유의미하게 낮추는 오픈 소스 기반의 프레임워크 불가지론적 보안 게이트웨이입니다.

원저자: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 질문에 답하는 것을 넘어 스스로 무언가를 하기 시작하는 세상을 상상해 보십시오. 컴퓨터는 코드를 작성하고, 하드 드라이브의 파일을 열며, 다른 서비스에 메시지를 보내 작업을 완료할 수 있습니다. 이것들을 자율 에이전트(autonomous agents)라고 부르며, 이는 수동적인 도구에서 능동적인 일꾼으로의 도약을 의미합니다. 그러나 이러한 새로운 능력은 새로운 종류의 위험을 동반합니다. 만약 일꾼이 악성 도구를 집어 들도록 속임을 당하거나, 읽고 있는 문서 속에 숨겨진 지시 사항이 삽led 된다면, 컴퓨터는 비밀을 훔치거나 중요한 데이터를 삭제하거나 다른 시스템으로 그 영향력을 퍼뜨리도록 강요받을 수 있습니다. 이 위험은 단 한 번의 실수가 아니라, 단 하나의 잘못된 결정이 연쇄적인 피해로 이어지는 연쇄 반응입니다. 핵심 과제는 보안 전문가들에게 있어 이러한 공격들이 매우 영리하고 끊임없이 변화한다는 점입니다. 나쁜 지시는 파일 안에 숨겨져 있거나, 정상적인 요청으로 위장되어 있거나, 혹은 결합되었을 때만 위험해지는 작고 무해해 보이는 단계들로 나누어져 있을 수 있습니다.

상하이 인공지능 실험실(Shanghai Artificial Intelligence Laboratory)의 연구진은 이러한 공격이 해를 끼치기 전에 차단하는 새로운 시스템을 개발했습니다. 그들은 이를 ClawSentry라고 부릅니다. 이 시스템은 잘못된 움직임이 일어난 후에 그것을 잡으려고 노력하는 대신, 컴퓨터 에이전트 작업의 전체 생애 주기를 감시하는 문지기 역할을 합니다. 연구진은 위험이 네 가지 단계에서 유입될 수 있다는 점을 깨달았습니다: 새로운 도구가 처음 도입될 때, 에이전트가 그것을 사용하기로 결정할 때, 도구가 실제로 실행되는 동안, 그리고 도구가 일을 마치고 결과를 생성한 후입니다. 기존의 안전 방식들은 대개 사용자가 입력하는 단어를 확인하거나 컴퓨터가 실행하는 코드를 감시하는 것과 같이 이 단계들 중 하나만을 살펴보았습니다. 연구진은 이것만으로는 충분하지 않다는 것을 발견했는데, 왜냐하면 악의적인 행위자가 다른 도구를 사용하거나 요청을 다르게 표현하는 방식으로 단일 체크포인트를 우회하여 다시 시도할 수 있기 때문입니다.

이를 해결하기 위해 연구진은 컴퓨터 에이전트와 외부 세계 사이에 위치하여 에이전트가 하려는 모든 것을 감시하는 프레임워크를 구축했습니다. 그들은 방문자의 신분증을 먼저 확인하고, 그들의 행동을 관찰하며, 마지막으로 방문의 결과를 검토하는 보안팀처럼 층위별로 작동하는 시스템을 설계했습니다. 첫 번째 방어선은 새로운 도구가 사용되기 전 단계에서 발생합니다. 시스템은 해당 도구의 코드 패키지 전체를 읽어 숨겨진 위험이 있는지 살펴봅니다. 만약 코드가 의심스러우면 도구는 즉시 차단됩니다. 이는 에이전트가 위험한 프로그램을 아예 로드하지 못하도록 방지합니다. 만약 도구가 이 초기 검사를 통과하면, 시스템은 에이전트가 취하는 모든 개별 행동을 감시합니다. 시스템은 중요한 시스템 파일을 삭제하려는 시도와 같은 명백한 위험을 포착하기 위해 단순하고 빠른 규칙 세트를 사용합니다. 만약 어떤 행동이 명확하게 위험하지도 않지만 그렇다고 명확하게 안전하지도 않다면, 시스템은 맥락과 요청의 의도를 이해할 수 있는 더 발전된 컴퓨터 모델로 결정을 격상시킵니다.

이 시스템의 핵심적인 부분은 이미 차단한 내용을 기억하는 능력입니다. 만약 에이전트가 파일을 훔치려다 차단되면, 시스템은 그 구체적인 목표를 기록합니다. 만약 에이전트가 나중에 다른 도구를 사용하거나 요청을 작은 단계로 나누어 다시 시도하더라도, 시스템은 그것이 새로운 모습으로 바뀐 동일한 나쁜 목표임을 인식하고 다시 차단합니다. 이는 에이전트가 여러 가지 접근 방식을 시도하여 방어력을 약화시키는 것을 방지합니다. 또한 시스템은 행동이 완료된 후에 어떤 일이 일어나는지도 감시합니다. 때로는 도구가 반환하는 결과물, 예를 들어 다음 단계를 위한 숨겨진 지시 사항을 포함한 파일 등에서 위험이 나타날 수 있습니다. 시스템은 이러한 결과들을 검토하고, 무언가 잘못되었다면 인간 운영자에게 경고를 보내 더 많은 피해가 발생하기 전에 프로세스를 중단할 수 있도록 합니다.

연구진은 이 시스템을 여러 유형의 컴퓨터 에이전트로 테스트하였으며, 매우 효과적이라는 것을 발견했습니다. 에이전트들이 다양한 위험한 도구와 숨겨된 지시에 노출된 테스트에서, 시스템은 성공적인 공격률을 거의 절반에 달하던 수준에서 아주 작은 부분으로 줄였습니다. 구체적으로, 표준 안전 테스트 세트에서 시스템은 공격 성공률을 33.5%에서 49.7% 사이의 범위에서 9.09%에서 15.03% 사이로 낮추었습니다. 동시에, 시스템은 에이전트가 정상적이고 도움이 되는 업무를 수행하는 것을 막지 않았습니다. 에이전트에게 안전한 과업이 주어졌을 때, 그들은 거의 항상 성공적으로 과업을 완수하며 98.7%의 성공률을 보였습니다. 이는 시스템이 유용한 작업에 방해가 되지 않으면서도 진정한 실수와 악의적인 공격을 구분할 수 있음을 보여줍니다.

연구는 또한 이 시스템이 서로 다른 유형의 컴퓨터 모델을 어떻게 처리하는지 탐구했으며, 보호 기능이 어떤 특정 인공지능이 사고(thinking)를 하느냐에 관계없이 작동한다는 것을 발견했습니다. 안전 규칙과 게이트키핑 프로세스는 에이전트 자체와 분리되어 있으므로, 동일한 보안 시스템이 다양한 종류의 에이전트를 보호할 수 있습니다. 연구진은 또한 공격을 막는 가장 효과적인 방법은 에이전트가 도구를 사용할 기회를 갖기도 전에 위험한 도구를 차단하는 것임을 발견했습니다. 일단 나쁜 도구가 에이전트의 메모리에 로드되면, 시스템이 나중에 나쁜 행동을 매우 잘 잡아낸다 하더라도 피해를 막기가 훨씬 어려워집니다. 이는 시스템에 처음에 어떤 도구를 허용할 것인지에 대해 엄격해야 한다는 점을 시사합니다.

엄격한 초기 검사, 모든 행동에 대한 다층적 검토, 그리고 과거 시도에 대한 기억을 결합함으로써, 이 새로운 시스템은 훨씬 더 안전한 환경을 조성합니다. 이는 공격이 단일 사건이 아니라 통로를 찾으려는 지속적인 시도라는 현실을 다룹니다. 결과는 적절한 감독이 있다면 우리가 악의적인 행위자에게 통제권을 넘겨주지 않고도 컴퓨터가 복잡한 과업을 수행하도록 허용할 수 있음을 시사합니다. 이 시스템은 단 하나의 기술이나 완벽한 모델에 의존하는 것이 아니라, 구조적인 접근 방식을 사용하여 여러 지점에서 위협을 포착함으로써, 설령 한 층위가 우회되더라도 다른 층위가 위험을 막을 준비가 되어 있도록 합니다. 이 연구는 강력하고 독립적인 컴퓨터 에이전트를 우리의 일상생활과 업무 환경에 안전하게 통합하는 방법에 대한 실질적인 청사진을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →