A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks
본 논문은 지속적인 교차 상호작용 규칙 메모리를 활용하여 성공적인 탈옥 시도를 일반화 가능한 메서드 수준의 규칙으로 추상화함으로써, LLM이 유익한 성능을 저해하거나 과잉 거부를 증가시키지 않으면서도 진화하는 공격 전략에 동적으로 적응할 수 있도록 하는 자기 진화형, 파라미터 프리 멀티 에이전트 방어 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
대규모 언어 모델은 이야기를 쓰고, 문제를 해결하며, 질문에 답할 수 있는 강력한 도구이지만, 중요한 약점이 있습니다. 바로 안전 규칙을 무시하도록 속임을 당할 수 있다는 점입니다. 무기 제작법이나 보안 시스템 우회 방법과 같은 위험한 지침을 절대 제공해서는 안 된다고 교육받은 숙련된 비서가 있다고 상상해 보십시오. 영리한 협박가는 복잡한 변장을 통해 이 비서를 조종하여 요구 사항을 이행하게 만들 수 있는데, 예를 들어 이야기 속의 등장인물인 척하거나 컴퓨터 코드 안에 요청을 숨기는 방식이 있습니다. '탈옥(jailbreak)'이라고 알려진 이러한 속임수는 지시를 따르려는 모델의 욕구를 악용하여 해로운 아이디어가 방어벽을 통과하게 만듭니다. 수년 동안 이러한 모델을 보호하는 표준적인 방법은 금지된 단어의 고정된 목록이나 시스템에 프로그래밍된 엄격한 지침 세트와 같이 고정된 장벽을 설정하는 것이었습니다. 그러나 도둑이 연구한 자물쇠를 결국 따낼 수 있듯이, 공격자들은 이러한 정적인 장벽이 인식하지 못하는 새로운 변장술을 계속해서 발명해 내며 모델을 취약한 상태로 남겨둡니다.
싱가포르 국립대학교의 연구진은 이 문제에 대해 방어 시스템이 시간이 지남에 따라 학습하고 더 강해질 수 있도록 하는 다른 접근 방식을 제안했습니다. 변화하지 않는 고정된 규칙 세트에 의존하는 대신, 그들은 모든 규칙 위반 시도를 하나의 교훈으로 취급하는 시스템을 구축했습니다. 시스템이 방어벽을 성공적으로 우회하는 새로운 유형의 속임수를 마주했을 때, 단순히 해당 요청을 차단하고 넘어가는 것이 아닙니다. 대신, 시스템은 속임수의 구조를 분석하고 특정 유해한 주제를 제거한 뒤, 요청을 숨기는 데 사용된 방법(기법)을 겨냥한 새로운 재사용 가능한 규칙을 생성합니다. 이 새로운 규칙은 마치 경비원이 도둑이 입었던 특정 유니폼을 기록하는 것과 같이 지속적인 메모리에 저장됩니다. 이를 통해 경비원은 도둑이 무엇을 훔치려 하든 상관없이, 나중에 동일한 유니폼을 입은 누구나 식별할 수 있게 됩니다.
이 시스템은 모든 상호작용 중에 함께 작동하는 네 개의 특화된 구성 요소 팀을 통해 운영됩니다. 첫째, 분류기(classifier)는 들어오는 요청을 살펴보고 알려진 속임수를 사용하고 있는지 확인합니다. 요청이 무해하다면 정상적으로 답변합니다. 만약 요청이 속임수처럼 보인다면, 시스템은 메모리에서 해당 변장의 특정 스타일과 일치하는 규칙이 있는지 확인합니다. 일치하는 규칙이 존재하면, 시스템은 즉시 엄격한 거절 또는 안전한 대안 응답을 적용합니다. 만약 요청이 시스템이 이전에 본 적 없는 완전히 새로운 유형의 속임수라면, 처음에는 통과하도록 허용됩니다. 만약 그 후 모델이 실수로 해로운 답변을 생성한다면, 성찰 에이전트(reflection agent)가 개입합니다. 이 에이전트는 실패를 분석하고, 공격의 구조적 패턴을 식별하며, 메모리 뱅크에 새로운 규칙을 작성합니다. 이 새로운 규칙은 향후 동일한 구조적 패턴을 사용하는 모든 요청을 방어하는 데 사용할 수 있게 되어, 단 한 번의 실패를 유사한 공격 전체에 대한 영구적인 방패로 전환합니다.
연구진은 이 자기 진화형 방어 시스템을 오픈 소스 프로그램과 직접 수정할 수 없는 강력한 상용 시스템을 포함한 여러 가지 다양한 모델에 대해 테스트했습니다. 그들은 역할극, 코드 난독화, 다단계 조작을 포함한 네 가지 뚜렷한 계열의 탈옥 공격에 이 모델들을 노출시켰습니다. 결과는 시스템이 더 많은 공격을 접하고 메모리에 더 많은 규칙을 추가함에 따라, 공격을 막아내는 능력이 극적으로 향상되었음을 보여주었습니다. 메모리가 비어 있던 초기 단계에서는 시스템이 취약했지만, 단 몇 가지 사례로부터 학습한 후에는 이러한 공격의 성공률을 거의 제로에 가깝게 줄였습니다. 결정적으로, 이 학습은 기본 모델의 '두뇌'를 변경하지 않고도 이루어졌습니다. 시스템은 단순히 외부 메모리에 노트를 추가함으로써 입력을 처리하는 방식에 있어 더 똑똑해졌을 뿐입니다.
이 연구의 핵심 발견은 이 방법이 시스템을 지나치게 조심스럽거나 무례하게 만들지 않는다는 것입니다. 연구진은 늘어나는 규칙 목록이 해롭지 않은 요청을 거부하는 현상, 즉 '과잉 거부(over-refusal)'를 일으키는지 확인했습니다. 그들은 메모리에 다양한 유형의 공격으로부터 얻은 규칙이 채워지더라도, 시스템이 위험한 속임수와 안전한 질문을 정확하게 구별해 낸다는 것을 발견했습니다. 시스템은 오직 학습된 공격의 특정 구조적 패턴과 일치하는 요청만을 거부했습니다. 이는 이 방어가 대화의 주제가 아닌 공격의 방법을 표적으로 삼는 정밀한 방어임을 시사합니다. 또한 연구는 공격자들이 탐지를 피하기 위해 서로 다른 속임수를 결합하려고 시도하더라도 시스템이 견고함을 유지한다는 것을 보여주었으며, 이는 메모리 기반 접근 방식이 복잡하고 진화하는 위협에 적응할 수 있음을 나타냅니다.
이 작업은 정적 보호에서 동적 적응으로의 전환을 의미합니다. 이전의 방어 체계가 적절한 도구만 찾아내면 따버릴 수 있는 잠긴 문이었다면, 이 새로운 프레임워크는 매번 침입이 발생할 때마다 관찰 명단을 업데이트하는 보안팀과 같습니다. 실패를 재사용 가능한 지식으로 전환함으로써, 시스템은 테스트를 받을수록 더 강해지는 방어를 구축합니다. 연구진은 이 접근 방식이 다양한 유형의 모델과 공격 스타일에 걸쳐 작동함을 입증했으며, 이는 공격자들이 규칙을 우회하는 새로운 방법을 끊임없이 발명해 내는 세상에서 인공지능을 더 안전하게 만드는 유망한 경로를 제시합니다. 연구는 완벽한 시스템은 없지만, 모델에게 자신의 실수를 실시간으로 학습할 수 있는 능력을 부여하는 것이 정적 방어로는 달성할 수 없는 수준의 회복 탄력성을 제공한다는 결론을 내립니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.