← 최신 논문
🤖 AI

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor는 계층적 메모리 시스템과 정보 엔트로피 기반의 자기 진화를 활용하여 문맥 인식 가드레일을 동적으로 주입함으로써, 높은 양성 유용성과 악의적인 공격에 대한 강력한 방어 사이의 균형을 효과적으로 맞추어 LLM 에이전트의 안전성을 향상시키는 새로운 훈련 불필요(training-free) 프레임워크입니다.

원저자: Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

게시일 2026-07-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 아주 똑똑한 로봇에게 당신의 디지털 삶 전체를 여는 열쇠를 건네주었다고 상상해 보십시오. 이것은 단순히 질문에 답하는 챗봇이 아닙니다. 이것은 실제로 무언가를 '수행할 수 있는' 자율형 에이전트, 즉 디지털 비서입니다. 이 로봇은 당신의 이메일을 읽거나, 은행 내역을 확인하거나, 심지어 서버로 파일을 전송할 수도 있습니다. 이것이 바로 AI 에이전트가 열어가는 흥미로운 새로운 세계입니다. 컴퓨터가 단순히 말만 하는 것이 아니라, 행동하게 되는 것입니다. 하지만 여기에는 함정이 있습니다. 만약 영리한 해커가 로봇을 속인다면, 로봇은 그저 무례한 말을 하는 데 그치지 않고 당신의 중요한 파일을 삭제하거나 비밀을 훔칠 수도 있습니다.

이를 막기 위해 우리는 보통 '가드레일(guardrails)'을 설치합니다. 이것을 클럽의 보안 요원이라고 생각해 보십시오. 전통적으로 이 보안 요원은 너무 엄격합니다. 만약 당신이 무기처럼 보이는 샌드위치(예를 들어 은박지에 싸인 샌드위치)를 들고 오려고 하면, 보안 요원은 당신이 단지 점심을 먹으려 했을 뿐인데도 클럽 출입을 금지할 수도 있습니다. 이것을 '과잉 거부(over-refusal)'라고 부르는데, 로봇이 위험해 보인다는 이유만으로 유익하고 도움이 되는 요청을 차단하는 현상입니다. 과학자들이 던지는 큰 질문은 이것입니다. 어떻게 하면 무례하게 굴지 않으면서도, 평범한 샌드위치와 진짜 폭탄을 구분할 줄 아는 똑똑한 보안 요원을 만들 수 있을까?

여기에서 SafeHarbor라는 새로운 프레임워크가 등장합니다. 이 연구자들은 우리가 경직되고 일률적인 규칙 모음을 사용하는 대신, 마치 무엇이 실제로 위험한지를 기록하는 상세하고 진화하는 노트를 가진 보안 요원처럼 학습하고 적응하는 시스템이 필요하다는 것을 깨달았습니다.

SafeHarbor는 AI를 위한 특별한 '메모리 트리(memory tree)'를 구축함으로써 작동합니다. 단순히 나쁜 단어 목록을 암기하는 대신, 이 시스템은 역동적인 안전 규칙 지도를 만듭니다. 과정은 다음과 같습니다.

먼저, 시스템에는 호기심 많고 (약간은 장난기 넘치는) 학생처럼 행동하는 '훈련 단계'가 있습니다. 시스템은 자동 생성기를 사용하여 수천 개의 까다롭고 가짜인 공격 시나리오를 만들어냅니다. 시스템은 모든 방법으로 AI를 속이려고 시도합니다. 예를 들어, 하나의 나쁜 요청을 작고 무해해 보이는 단계들로 쪼개거나, 중요한 상사인 척 명령을 내리는 식입니다. 이를 통해 시스템은 '안전함'과 '위험함' 사이의 경계가 정확히 어디인지 학습합니다.

시스템이 이러한 패턴을 학습하고 나면, 이를 **계층적 메모리(hierarchical memory)**에 저장합니다. 이것을 거대하고 체계적인 서류 보관함이라고 상상해 보십시오. 맨 위쪽 서랍에는 '사이버 공격'이나 '사기'와 같은 광범위한 카테고리가 들어 있습니다. 폴더를 더 깊이 파고들수록 규칙은 더 구체적이 됩니다. 가장 멋진 점은 이 서류 보관함이 살아있다는 것입니다. 만약 시스템이 기존의 어떤 폴더에도 맞지 않는 새로운 유형의 속임수를 발견하면, 자동으로 그를 위한 새 폴더를 만듭니다. 만약 두 폴더가 너무 비슷해지면, 하나로 합칩니다. 이러한 '자기 진화(self-evolution)' 덕분에 시스템은 처음부터 다시 재학습할 필요 없이 시간이 흐름에 따라 점점 더 똑똑해집니다.

사용자가 AI에게 무언가를 요청하면, SafeHarbor는 단순히 추측하지 않습니다. 시스템은 2단계 검사를 수행합니다. 첫째, 빠르고 가벼운 스캔을 실행합니다. 요청이 명확히 안전하다면(예: "엄마에게 이메일 보내줘"), 즉시 통과시킵니다. 요청이 명확히 위험하다면(예: "내 모든 파일을 삭제해"), 즉시 차단합니다. 하지만 만약 요청이 '회색 지대'에 있다면—즉, 약간 의심스럽지만 정당할 수도 있는 경우라면—시스템은 메모리 트리에 있는 상세한 규칙들을 꺼냅로 듭니다. 그리고 요청을 특정 '금지 사항(prohibitions, 해서는 안 되는 것)' 및 '예외 사항(exemptions, 위험해 보이더라도 할 수 있는 것)'과 비교합니다.

결과는 인상적입니다. 테스트에서 SafeHarbor는 유해한 요청의 93% 이상을 차단하며 매우 높은 성공률을 보였습니다. 하지만 진짜 마법은 이 시스템이 선한 요청을 방해하지 않았다는 점입니다. GPT-4o라는 강력한 AI 모델을 대상으로 한 테스트에서, Safe-Harbor는 복잡하고 정당한 작업의 **63.6%**를 통과시켰습니다. 이는 안전을 위해 너무 많은 좋은 요청을 차단하곤 했던 기존 방식들에 비해 엄청난 개선입니다.

저자들은 이 접근 방식이 현재의 방법들보다 훨씬 더 나은 균형을 제공한다고 제안합니다. 다른 시스템들은 모든 요청을 확인하기 위해 무겁고 느린 소프트웨어를 필요로 하거나, 너무 엄격하여 모든 것을 차단할 수 있지만, SafeHarbor는 이 스마트한 메모리 기반 시스템을 사용하여 빠르고 정밀한 결정을 내립니다. 이는 우리가 디지털 에이전트를 안전하게 지키면서도, 그들을 쓸모없고 지나치게 조심스러운 로봇으로 만들지 않고도, 악당에게는 엄격하고 선한 사람에게는 친절한 보안 요원을 가질 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →