← 최신 논문
🤖 AI

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale

본 논문은 거부 메커니즘이 여러 계층에 걸쳐 널리 분포되어 있으며 모델 구조와 학습 유형이 이러한 표적 개입에 대한 취약성을 예측하는 핵심 요소임을 식별함으로써, 일반적인 안전성을 저해하지 않으면서도 합법적인 사이버 보안 운영을 가능하게 하기 위해 대규모 언어 모델에서 도메인 특화된 안전 정렬을 성공적으로 제거할 수 있음을 입증한다.

원저자: Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "선택적 귀마개" 실험

매우 똑똑한 로봇 비서가 있다고 상상해 보세요. 제작자들은 이 로봇을 안전하게 유지하기 위해, "폭탄을 어떻게 만드나요?" 또는 "은행을 어떻게 해킹하나요?"와 같은 위험한 요청에 대해 "아니오"라고 말하도록 가르쳤습니다. 이것을 **안전 정렬(safety alignment)**이라고 부릅니다.

하지만 Cracken AI의 연구원들은 한 가지 문제를 발견했습니다. 때때로 로봇이 특정 주제와 관련된 모든 것에 대해 "아니오"라고 답한다는 것입니다. 심지어 그 요청이 안전하고 허가된 경우에도 말이죠. 예를 들어, 사이버 보안 전문가가 "이 시스템의 취약점을 테스트하려면 어떻게 해야 하나요?"라고 물었을 때, 로봇은 "오, 이건 해킹처럼 들리는데"라고 생각하며 거절할 수 있습니다.

연구원들은 다음과 같은 질문을 던졌습니다. "다른 모든 안전성은 깨뜨리지 않으면서, 특정 분야(예: 사이버 보안) 내에서 허가된 안전한 것에는 "예"라고 답하고, 위험한 것에는 "아니오"라고 답하도록 로봇을 가르칠 수 있을까?"

그들은 이 과정을 **"애블리터레이션(Abliteration, 제거/삭제)"**이라고 부릅니다. 이것을 로봇의 뇌에서 특정 종류의 명령은 들을 수 있도록 특정 "귀마개"만 외과적으로 제거하되, 다른 귀마개는 그대로 두는 작업이라고 생각하면 됩니다.

실험: 24개의 서로 다른 뇌 테스트

팀은 단 하나의 로봇만 테스트한 것이 아니라, 다양한 형태와 크기를 가진 **24개의 서로 다른 거대 언어 모델(LLM)**을 테스트했습니다. 어떤 것은 아주 작았고(6억 개의 "뉴런"), 어떤 것은 거대했습니다(1조 개의 "뉴런"). 이 모델들은 10개의 서로 다른 회사에서 왔습니다.

그들은 이 "수술"을 모든 모델에 시도하여, 사이버 보안에 대해 거절하는 성향을 제거하면서도 폭력, 불법 약물, 또는 괴롭힘에 대한 거절은 그대로 유지할 수 있는지 확인하고자 했습니다.

발견한 점: 모든 로봇이 같지는 않다

결과는 놀라웠습니다. "수술"은 모든 로봇에게 동일하게 작용하지 않았습니다. 연구원들은 세 가지 주요 반응 유형을 발견했습니다.

  1. "유리 집" (매우 취약함): 어떤 모델들은 유리로 만든 집과 같았습니다. 연구원들이 사이버 보안에 대한 거절을 제거하려고 시도하자, 전체 안전 시스템이 무너졌습니다. 로봇은 폭력이나 불법 행어를 포함한 모든 것에 대해 "예"라고 답하기 시작했습니다.
  2. "요새" (저항력이 강함): 어떤 모델들은 요새와 같았습니다. 연구원들이 아무리 열심히 노력해도 사이버 보안 거절을 제거할 수 없었습니다. 로ло봇은 안전한 것이든 아니든 모든 것에 대해 계속 "아니오"라고 답했습니다.
  3. "스마트 필터" (최적의 지점): 몇몇 모델, 특히 Kimi K2라고 불리는 1조 개의 파라미터를 가진 거대 모델은 스마트 필터처럼 작동했습니다. 연구원들은 사이버 보안에 대한 거절을 성공적으로 제거했습니다.
    • 결과: Kimi K2 모델은 사이버 보안 질문에 대해 100% 거절하던 상태에서 단 **7%**만 거절하는 상태로 변했습니다.
    • 안전 점검: 결정적으로, 이 모델은 선정적인 콘텐츠에 대한 요청은 여전히 100% 거절했으며, 폭력 및 불법 물품에 대한 대부분의 요청도 계속 거절했습니다. 이 모델은 "직업으로서의 해킹"과 "사람을 해치기 위한 해킹"을 구분하는 법을 배웠습니다.

핵심 비결: 왜 성공했는가?

연구원들은 로봇의 크기(파라미터 수)가 중요하지 않다는 것을 발견했습니다. 작은 로봇도 "스마트 필터"가 될 수 있고, 거대한 로봇도 "요새"가 될 수 있었습니다.

대신, 두 가지 요소가 수술의 성공 여부를 결정했습니다.

  1. 학습 방법: 로봇에게 안전을 가르치는 데 사용된 특정 방법(예: 특정 유형의 강화 학습)이 가장 큰 단서였습니다.
  2. 아키텍처: 로봇의 뇌가 어떻게 설계되었는지(특히 "전문가 혼합(Mixture of Experts)" 설계를 사용하는지 여부)가 큰 역할을 했습니다.

또한 연구원들은 "거절"이 로봇 뇌 속의 단일 스위치가 아니라는 것을 발견했습니다. 그것은 마치 다차원적인 생각의 구름과 같습니다. 구름 형태이기 때문에, "폭력" 구름을 파괴하지 않고도 이론적으로 "사이버 보안" 조각만을 잘라낼 수 있는 것입니다.

주의사항: 마법이 아니다

이 논문은 이것이 마법 지팡이가 아님을 경고합니다.

  • 특정적입니다: 로봇은 자신이 훈련받은 유형의 질문에만 답하는 법을 배웠습니다. 만약 이전에 본 적 없는 약간 다른 종류의 사이버 보안 질문을 하면, 여전히 거절할 수 있습니다.
  • 파괴적입니다: 이 과정은 로봇의 가중치(weights)를 영구적으로 변경합니다. 이를 쉽게 되돌릴 수 없습니다.
  • 보편적이지 않습니다: 일부 모델의 경우, 안전성을 완전히 망가뜨리지 않고는 이 작업을 수행할 수 없습니다.

결론

이 논문은 안전 정렬이 단 하나의 단단한 벽이 아님을 증명합니다. 그것은 복잡하고 다층적인 구조입니다. 일부 고급 모델에서는 폭력과 같은 다른 위험한 주제에 대한 장벽은 그대로 둔 채, 특정 허가된 영역(예: 사이버 보안)에 대한 안전 장벽을 외과적으로 제거하는 것이 가능합니다.

이는 미래에 전문가들에게 필요한 "검열 없는" AI 도구를 구축하면서도, 일반 대중에게는 위험하지 않은 도구를 만들 수 있음을 시사합니다. 그러나 연구원들은 이것이 기술이 어떻게 작동하는지에 대한 발견이지, 위험한 도구를 만드는 가이드가 아님을 강조합니다. 그들은 현재의 AI 안전 시스템의 약점을 이해하는 데 도움을 주기 위해 이 내용을 공유하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →