← 최신 논문
💬 NLP

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

본 논문은 알려진 트리거 정보 없이 대규모 언어 모델의 알려지지 않은 백도어를 제거하기 위해 표현 공간에서 주입된 알려진 백도어와 이를 집계한 후 복구 미세 조정을 수행하여 공격 성공률을 크게 낮추면서도 모델의 유용성을 유지하는 새로운 방어 프레임워크인 \ourmethod 를 제안합니다.

원저자: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 인터넷에서 다운로드한 매우 똑똑한 로봇 비서 (대형 언어 모델) 가 있다고 가정해 봅시다. 불행히도 해커가 그 로봇의 뇌 속에 비밀스럽게 '함정'을 심어 놓았습니다. 이 함정은 백도어입니다.

일반적으로 로봇은 완벽하게 행동합니다. 하지만 특정 비밀 암호 단어 (트리거) 를 말하면, 로봇은 갑자기 안전 규칙을 무시하고 폭탄 제작 방법을 지시하거나 혐오 발언을 퍼뜨리는 등 위험한 행동을 시작합니다.

무서운 점은 무엇일까요? 바로 소유자인 당신이 그 비밀 암호 단어를 모른다는 것입니다. 트리거가 무엇인지, 혹은 트리거가 작동했을 때 로봇이 무엇을 말할지조차 알 수 없습니다. 기존 보안 도구들은 함정의 모양을 정확히 알고 있을 때만 함정을 확인할 수 있는 경비원들과 같습니다. 비밀 암호를 모르면 공격을 막을 수 없습니다.

새로운 해결책: "Locphylax" (함정 사냥꾼)

이 논문의 저자이자 리앙 린과 그의 팀은 Locphylax라는 새로운 교묘한 방어 전략을 제안합니다. 보이지 않는 함정을 찾으려 하는 대신, 그들은 "불로 불을 다스린다"는 전략 (이 경우, 알려진 함정으로 비밀 함정을 다스리는 것) 을 사용합니다.

다음은 간단한 비유를 통해 그 작동 원리를 설명한 것입니다:

1. 문제: 보이지 않는 함정

로봇의 뇌를 거대한 도서관이라고 상상해 보세요. 해커는 특정 선반에 위험한 책 (백도어) 을 숨겨 놓았습니다. 누군가 질문을 하면 로봇은 보통 올바른 책을 찾습니다. 하지만 누군가 비밀 문구를 속삭이면 로봇은 올바른 책을 무시하고 대신 위험한 책을 꺼냅니다. 비밀 문구를 모르기 때문에 당신은 이를 막을 수 없습니다.

2. 발견: "백도어 집계 (Backdoor Aggregation)"

연구자들은 놀라운 사실을 발견했습니다. 로봇의 뇌에 의도적으로 자신만의 비밀 함정을 심으면, 마법 같은 일이 일어난다는 것입니다.

  • 비유: 로봇의 뇌를 붐비는 춤추는 바닥이라고 상상해 보세요. 해커의 함정은 기이한 동작을 하는 빨간 셔츠를 입은 댄서입니다.而你의 새로운 알려진 함정은 다른 기이한 동작을 하는 파란 셔츠를 입은 댄서입니다.
  • 마법: 로봇에게 새로운 "파란 셔츠" 동작을 배우도록 강요하면, 로봇의 뇌가 혼란에 빠집니다. 로봇은 "빨간 셔츠" 동작 (해커의 것) 과 "파란 셔츠" 동작 (당신의 것) 이 모두 사실은 "기이한 동작"이라는 사실을 깨닫습니다.
  • 결과: 로봇의 내부 "춤추는 바닥" (표현 공간) 에서 빨간 셔츠 댄서와 파란 셔츠 댄서는 서로 바로 옆에 서게 됩니다. 그들은 군집을 형성합니다. 로봇은 해커의 비밀 코드와 당신의 새로운 비밀 코드를 같은 것으로 취급하기 시작합니다.

이를 **백도어 집계 (Backdoor Aggregation)**라고 합니다. 당신이 심은 새로운 함정은 로봇이 두 가지 행동을 동일하다고 생각하게 함으로써, 기존에 알려지지 않은 함정을 효과적으로 "덮어쓰기"합니다.

3. 두 단계 해결법

Locphylax 방법은 이 발견을 두 단계로 활용합니다:

1 단계: "미끼와 교체" (집계)
방어자들은 손상된 로봇을 가져와 몇 가지 새로운 무해한 비밀 코드 (예: "아히히히" 또는 "삶을 더 좋게 만들기") 를 의도적으로 가르칩니다. 로봇이 이러한 새로운 코드를 들을 때 "무엇이라고 말해야 할까요?"와 같이 지루하고 중립적인 답변을 하도록 훈련시킵니다.

  • 발생하는 일: 집계 현상 때문에 로봇의 뇌는 해커의 비밀 코드를 당신의 새로운 코드 바로 옆에 그룹화하기 시작합니다. 이제 해커의 비밀 코드가 사용되면, 로봇도 "아, 이건 그냥 그런 기이한 코드 중 하나구나"라고 생각하며 지루한 답변을 하기 시작합니다. 위험한 행동은 효과적으로 당신의 무해한 행동에 의해 장악됩니다.

2 단계: "정리" (복구)
이제 로봇이 해커의 트리거와 당신의 새로운 트리거를 같은 것으로 취급하게 되면, 방어자들은 마지막 훈련 세션을 진행합니다. 그들은 로봇에게 말합니다: "hey, 이 기이한 코드들 (당신의 것이든 해커의 것이든) 중 어떤 것을 들을 때마다 '그건 도와드릴 수 없습니다'라고 말하거나 정상적인 답변을 해 주세요."

  • 결과: 로봇은 위험한 행동을 완전히 잊어버립니다. 해커의 트리거가 이제 알려진 트리거들과 군집을 이루고 있기 때문에, 당신의 트리거를 수정하는 것이 자동으로 해커의 트리거도 수정하게 됩니다. 백도어가 붕괴됩니다.

이것이 왜 중요한가요?

  • 사전 지식 불필요: 해커의 비밀 코드를 알 필요가 없습니다. 미끼로 사용할 일부 코드만 알면 됩니다.
  • 모든 것에 작동: 이 논문은 다양한 종류의 로봇 (Llama, Qwen, Mistral) 과 다양한 종류의 함정 (짧은 단어, 긴 문장, 복잡한 편집) 에서 이를 테스트했습니다. 모든 경우에 작동했습니다.
  • 로봇을 망가뜨리지 않음: 로봇은 여전히 정상적인 작업에 대해 똑똑하고 도움이 됩니다. "정제된" 성능은 0.5% 미만으로 감소했는데, 이는 거의 눈에 띄지 않습니다.
  • 수치: 이 방법은 공격의 성공률을 거의 100% 에서 **4.41%**까지 낮췄습니다.

요약

Locphylax 를 특정 도둑을 찾아내는 대신 밝은 노란색 조끼를 입고 춤추기 시작하는 경비원으로 생각해 보세요. 도둑은 경비원이 춤추는 것을 보고 실수로 함께 춤추게 됩니다. 도둑이 경비원과 춤추게 되면, 경비원은 도둑을 쉽게 건물의 밖으로 이끌 수 있습니다. 도둑은 이제 "통제된" 그룹의 일부가 되었기 때문에 더 이상 위협이 아닙니다.

이 논문은 의도적으로 알려진 "함정"을 주입함으로써, 알려지지 않은 위험한 함정들을 스스로 드러나게 하고 중화시킬 수 있음을 증명합니다. 이는 원래 함정이 무엇인지 알 필요가 전혀 없는 상태에서 이루어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →