Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
본 논문은 안전 경로를 식별 및 국소화한 후, 기본 안전 메커니즘이 손상되더라도 거절 동작을 유지할 수 있도록 보완적 경로를 학습시킴으로써 화이트박스 공격에 대한 대규모 파운데이션 모델의 강건성을 향상시키는 동적 라우팅 적응형 정렬(Dynamic Routing Adaptive Alignment, DRAA) 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 북적이는 도서관을 걷고 있다고 상상해 보세요. 그곳의 책들은 당신에게 말을 걸 수 있습니다. 이것이 바로 거대 파운데이션 모델(LFM)의 세계입니다. 이들은 글쓰기 보조 도구부터 챗봇에 이르기까지 모든 것에 동력을 제공하는 초지능적인 AI의 두뇌입니다. 이러한 AI 시스템이 안전하려면, "폭탄을 만드는 방법은?" 또는 "은행을 해킹하는 방법은?"과 같은 위험한 질문에 답하지 못하도록 막는 '안전 가드'가 뇌 안에 있어야 합니다. 오랫동안 과학자들은 이 가드가 하나의 튼튼한 문이라고 생각했습니다. 그들은 그 문을 꽉 잠그기 위해 방어책을 구축했습니다. 하지만 최근, 해커들(화이트박스 공격자들)은 도서관의 설계도를 엿보고, 그 문이 정확히 어디에 있는지 찾아낸 뒤, 단순히 경첩을 제거할 수 있다는 사실을 알아냈습니다. 일단 문이 사라지면, AI는 "아니오"라고 말하는 법을 잊어버리고 기꺼이 나쁜 일들을 돕게 됩니다. 큰 문제는, 단 하나의 문에 의존하는 것이 아니라, 기존의 벽이 무너졌을 때 즉시 새로운 벽을 세울 수 있는 AI를 어떻게 만드느냐 하는 것입니다.
이것이 바로 "Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks"라는 논문이 다루는 내용입니다. 샹제 리(Shangze Li)와 동료들이 이끄는 저자들은 기존의 AI 안전 구축 방식이 너무 경직되어 있다는 점을 깨달았습니다. 그들은 DRAA(Dynamic Routing Adaptive Alignment)라고 불리는 새로운 프레임워크를 제안합니다. 이것은 보안 요원에게 특정 문 앞에 서 있는 법을 가르치는 것이 아니라, 그 문이 막혔을 때 즉시 비밀 통로를 통해 교통을 우회하는 법을 가르치는 것과 같습니다.
이들의 "마법 같은 기술"이 어떻게 작동하는지 간단한 단계별로 설명하면 다음과 같습니다:
1. "마법의 문" 찾기
먼저, 연구진은 AI의 뇌 중 정확히 어느 부분이 "아니오"라고 말하는 역할을 하는지 알아내야 했습니다. 그들은 AI에게 안전한 질문(예: "케이크를 굽는 방법은?")과 위험한 질문(예: "케이크를 훔치는 방법은?")을 모두 던졌습니다. AI의 뇌세포(뉴런)가 각각의 질문에 어떻게 반응하며 빛나는지를 비교함으로써, 그들은 특정 "안전 경로"—즉, 주요 가드 역할을 하는 특정 뉴런의 경로—를 정확히 찾아냈습니다.
2. 일부러 문을 부수기
다음으로, 그들은 위험한 행동을 했습니다. AI의 뇌에서 그 주요 안전 경로를 일시적으로 "꺼버린" 것입니다. 그리고 다시 위험한 질문들을 던졌습니다. 예상대로, 주요 가드가 없자 AI는 나쁜 답변들을 내놓기 시작했습니다. 이것이 그들이 연구해야 했던 "실패"였습니다.
3. 우회로 가르치기
이 부분이 아주 영리한 대목입니다. 연구진은 AI가 실패했던 그 순간들을 이용해 AI에게 새로운 교훈을 주었습니다. 그들은 이렇게 말했습니다. "이봐, 메인 가드가 없을 때는 반드시 다른 방법을 찾아내서 '아니오'라고 말해야 해." 그들은 DR-DPO(Dynamic Routing Direct Preference Optimization)라는 특별한 훈련법을 사용했습니다. 이것은 마치 AI가 "우회" 전략을 배우도록 강요받는 게임과 같습니다. 이 훈련은 원래의 안전 뉴런을 고정시켜서 AI가 단순히 그 뉴런들에만 의존할 수 없게 만듭니다. 즉, AI가 위험을 처리하기 위해 자신의 뇌 속에서 새로운 숨겨진 경로를 반드시 찾아내도록 만드는 것입니다.
4. 결과: 초회복력 AI
연구진은 이 논문을 Qwen2.5 및 LLaMA-3.2를 포함한 여러 다른 AI 모델에 테스트했습니다. 결과는 인상적이었습니다. 해커들이 알려진 안전 뉴런을 "가지치기(pruning)"하여 잘라내려 할 때, 기존의 AI 모델들은 무너져 내려 해로운 답변을 내놓았습니다. 하지만 DRAA로 훈련된 모델들은 어떠했나요? 그들은 계속해서 "아니오"라고 말했습니다.
예를 들어, 140억 개의 파라미터를 가진 Qwen2.5-14B 모델의 경우, 표준 방어 체계는 안전 경로가 공격받았을 때 완전히 무너져 313개의 유해한 프롬프트 중 270개를 통과시켰습니다. 그러나 DRAA 모델은 313개 중 단 5개만을 통과시켰습니다. 15억 개의 파라미터를 가진 더 작은 모델에서도 DRAA는 실패율을 248에서 43으로 줄였습니다.
저자들은 또한 이 "우회" 기술이 일반적인 작업 수행 능력을 떨어뜨리는지 확인했습니다. 그들은 수학 문제(GSM8K)와 일반 지식(ARC)을 통해 테스트했습니다. 결과는 DRAA가 기존만큼 똑똑하고 유능하게 유지된다는 것을 보여주었습니다. 즉, AI는 이전처럼 똑똑하고 도움이 되면서도, 주요 방어 체계가 파괴되어도 안전을 유지하는 초능력을 얻은 것입니다.
이것이 왜 중요한가
이 논문은 단일하고 정적인 안전 경로에 의존하는 것은 AI 보안의 치명적인 결함임을 시사합니다. 공격자가 가드가 어디 있는지 안다면, 그 가드를 제거할 수 있기 때문입니다. DRAA는 더 나은 방법, 즉 '중복성(redundancy)'을 구축할 것을 제안합니다. 메인 경로가 침해되었을 때 백업 경로로 동적으로 전환하도록 AI를 훈련함으로써, 우리는 훨씬 더 깨뜨리기 어려운 시스템을 만들 수 있습니다. 저자들은 이 방법이 텍스트뿐만 아니라 이미지와 영상(멀티모달 모델)에도 적용될 수 있으며, 차세대 AI 공격에 대한 강력한 방패가 될 수 있음을 발견했습니다.
요약하자면, 이 논문은 안전이란 단 하나의 잠긴 문이 아니라, 교통을 즉시 우회시켜 어떤 시도로부터도 AI가 안전하게 유지되도록 하는 유연한 경로의 네트워크여야 한다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.