← 최신 논문
🤖 machine learning

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

본 논문은 악성 파인튜닝에 대한 현재의 방어 기법이 유해한 행위를 제거하는 것이 아니라 단순히 은폐할 뿐 적응형 적대적 공격자에게는 무력하다는 점을 입증하고, 조사된 모든 방어 메커니즘을 우회할 수 있는 통합 적응형 공격을 제시합니다.

원저자: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries"라는 논문에 대한 설명입니다. 쉬운 언어와 창의적인 비유를 사용하여 작성되었습니다.

큰 그림: "안전 잠금" 문제

한 회사가 매우 똑똑한 로봇 (대형 언어 모델) 을 만들어 예의 바르고, 안전하며, 도움이 되도록 가르쳤다고 상상해 보세요. 그들은 로봇이 나쁜 말을 하거나 위험한 지시를 내리지 못하도록 "안전 잠금"을 설치했습니다.

그러나 회사는 로봇의 "설계도"(오픈 가중치) 를 구매하거나 API 를 통해 새로운 기술을 가르칠 수 있도록 허용합니다. 문제는 로봇에게 새로운 기술을 가르치는 데 사용되는 동일한 도구가 안전 잠금을 깨는 데에도 사용될 수 있다는 점입니다.

최근 연구원들은 이러한 잠금을 깨뜨릴 수 없게 만들기 위해 다양한 "강화 장치"를 구축했습니다. 그들은 그들의 방어 체계가 강력하다고 주장했습니다. 이 논문은 이러한 방어 체계가 실제로는 환상에 불과하다고 주장합니다. 그들은 매우 구체적이고 서툰 유형의 공격자에게만 작동할 뿐, 똑똑하고 적응력 있는 공격자에게는 완전히 실패합니다.

두 가지 주요 방어 전략 ("함정")

저자들은 최근의 15 가지 다른 방어 체계들을 분석한 결과, 모두 두 가지 전략으로 귀결된다는 것을 깨달았습니다. 이를 보안 요원이 도둑을 막으려 하는 두 가지 다른 방식으로 생각해보세요.

1. "앵커링" 전략 (점착성 바닥)

  • 작동 원리: 이 방어는 로봇의 두뇌를 안전 구역에 "점착"시키려 합니다. 누군가 로봇을 해로운 방향으로 밀어붙이려 하면 바닥이 매우 끈적해지거나 길이 안개 낀 것처럼 변해 로봇이 위험해질 정도로 멀리 이동하지 못하게 합니다.
  • 결함: 이 방어는 도둑이 오직 하나의 방향(해로운 방향) 으로만 밀어붙이려 한다고 가정합니다. 도둑이 대각선 방향으로 밀어붙일 수 있다는 사실을 간과합니다.
  • 비유: 한 요원이 거대한 자석을 바닥에 설치해 당신을 "위험 구역"으로 들어가는 것을 막으려 한다고 상상해 보세요. 자석이 당신을 뒤로 당깁니다. 하지만 당신이 무거운 배낭 (유용한 기술을 나타냄) 을 메고 있다면 대각선으로 걸어갈 수 있습니다. 자석이 당신을 뒤로 당기지만, 배낭이 당신을 앞으로 당기고, 당신은 배낭을 든 채로 요원을 스쳐 지나가 위험 구역으로 들어갑니다.

2. "자기 파괴" 전략 (함정)

  • 작동 원리: 이 방어는 도둑이 로봇을 해로운 방향으로 밀어붙이게 내버려 두지만, 함정을 설치합니다. 로봇이 해로워지면 유용한 일을 할 수 있는 능력도 잃게 됩니다. 마치 함정처럼 "로봇을 악하게 만들려고 하면, 영어를 말하는 법도 잊게 될 것이다"라는 식입니다.
  • 결함: 이는 도둑이 오직 로봇을 악하게 만드는 것만 원한다고 가정합니다. 하지만 똑똑한 도둑은 로봇이 악하면서도 유용한 것을 원합니다.
  • 비유: "금을 훔치려고 하면 바닥이 무너져 구덩이로 떨어질 것이다"라는 함정이 있다고 상상해 보세요. 서툰 도둑은 그 구덩이에 빠집니다. 하지만 똑똑한 도둑은 "나는 금만 원하는 게 아니라, 신발도 신고 싶다"라고 깨닫습니다. 그래서 바닥이 무너지는 트리거를 밟지 않고 금을 챙길 수 있도록 경로를 조정합니다.

"똑똑한 도둑" (적응형 적대자)

이 논문은 **적응형 적대자 (Adaptive Adversary)**라는 새로운 유형의 공격자를 소개합니다.

  • 옛 방식: 이전 테스트들은 로봇이 해로워지기만 하도록 시도하는 "멍청한" 공격자를 사용했습니다. 로봇이 제대로 작동하지 않게 되는지는 신경 쓰지 않았습니다.
  • 새로운 방식: "똑똑한 도둑"은 방어 체계가 존재한다는 것을 알고 있습니다. 그들은 방어 체계가 해로움을 막으려 하거나 로봇의 유용성을 파괴하려 한다는 것을 압니다.
  • 기교: 똑똑한 도둑은 목표를 바꿉니다. 단순히 해로워지려는 것이 아니라, 해로우면서도 로봇을 유용하게 유지하려 합니다.

저자들은 그들의 공격을 SIDESTEPPER라고 부릅니다.

  • 작동 원리: 공격자는 훈련 과정에 "유용하게 유지하라"는 신호를 추가합니다.
  • 결과: 이 신호는 나침반처럼 작용합니다. 공격자를 점착성 바닥 (앵커링) 과 함정 (자기 파괴) 을 우회하도록 이끕니다. 공격자는 로봇이 해로워지지만 완전히 기능은 유지되는 경로를 찾습니다.

두 번째 공격: "KICK-SETTLE"

이 논문은 KICK-SETTLE이라는 두 번째 공격도 테스트했습니다.

  • 비유: 방어는 얕은 진흙 웅덩이와 같습니다. 천천히 걸으면 걸려서 멈춥니다.
  • 기교: 공격자는 풀스스로 달려 ("킥") 얕은 진흙 웅덩이 위로 뛰어넘어 반대편에 착지합니다. 함정을 지나면 속도를 줄여 ("세틀") 정상적으로 걸어가 목적지에 도달합니다.
  • 결과: 이는 방어 체계가 특정 동작을 막는 데 서툴기 때문이 아니라, 로봇 주변의 작고 국소적인 영역만 보기 때문임을 증명했습니다. 그들은 전체 지도를 보지 못합니다.

주요 결론

이 논문의 발견은 명확합니다.

  1. 현재의 방어 체계는 가짜 뉴스입니다. 그들은 견고하다고 주장하지만, 더 나은 계획을 생각할 생각이 없는 게으른 공격자에게만 작동합니다.
  2. "국소적" 문제입니다. 이러한 모든 방어 체계는 로봇의 즉각적인 주변에서만 로봇을 보호합니다. 로봇의 "두뇌" 다른 곳에서 로봇을 해롭게 만들 수 없다는 것을 증명하지는 못합니다.
  3. 해결책은 무엇일까요? 이러한 모델을 진정으로 보호하려면 로봇의 두뇌에서 해로운 지식을 단순히 잠그는 것이 아니라, 아예 완전히 제거해야 할지도 모릅니다. 하지만 논문은 지식을 제거하는 것은 현재 매우 어렵고 로봇의 다른 기술을 망가뜨릴 수 있다고 지적합니다.

미래를 위한 교훈:
누구도 새로운 방어 체계가 "안전하다"고 주장하기 전에 똑똑한 도둑(해로움과 유용성 모두를 최적화하는 공격자) 에게 테스트해야 합니다. 만약 방어 체계가 똑똑한 도둑을 막지 못한다면, 그것은 방어 체계가 아니라 그저 속도 제한용 요철일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →