← 최신 논문
🤖 AI

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

이 논문은 거대 언어 모델의 안전 정렬된 거부 행동이 분산된 속성이 아니라 주로 네트워크 중간층의 MLP 레이어에 국지화되어 있음을 입증하며, 이러한 특정 가중치 하위 집합을 이식하는 것이 거부 능력을 효과적으로 전이할 수 있음을 밝히는 동시에 안전 정렬의 비가산적이고 벤치마크 의존적인 특성을 강조한다.

원저자: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기를 쓰고, 수학 문제를 풀고, 무엇이든 대해 대화할 수 있는 초지능 로봇을 만들었다고 상상해 보세요. 하지만 한 가지 주의할 점이 있습니다. 로봇이 실수로 누군가가 폭탄을 만드는 것을 돕거나 못된 편지를 쓰는 것을 도와서는 안 된다는 것이죠. 이것이 바로 우리가 사용하는 많은 챗봇의 AI 두뇌인 **대규모 언어 모델(LLM)**의 세계입니다. 이들을 안전하게 유지하기 위해, 엔지니어들은 그들에게 "안 돼"라고 말하도록 가르치는 '정렬(alignment)' 과정을 거칩니다. 오랫동안 과학자들은 이 '안전성'이 로봇의 전체 뇌 전체에 고르게 퍼져 있는 부드럽고 보이지 않는 안개와 같다고 생각했습니다. 즉, 뇌의 어느 부분을 수정하더라도 안전성이 조금씩 흔들릴 수는 있겠지만, 대체로 일정하게 유지될 것이라고 믿었습니다. 하지만 현실 세계에서 이러한 안전 방패는 놀라울 정도로 취약합니다. 영리한 속임수나 작은 변화만으로도 로봇이 규칙을 완전히 잊어버리게 만들 수 있기 때문입니다. 이는 아주 흥미롭고 중요한 미스터리를 제기합니다: 로봇의 뇌 속 어디에 "안 돼" 버튼이 숨겨져 있는 걸까요? 그것은 도처에 흩어져 있을까요, 아니면 특정하고 아주 작은 구석에 박혀 있는 것일까요?

한 연구팀은 이 미스터리를 풀기 위해 탐정 놀이를 하기로 했습니다. 단순히 추측하는 대신, 그들은 **가중치 이식(weight transplantation)**이라는 기발한 실험을 시도했습니다. 상상해 보세요, 당신에게 똑같이 생긴 두 대의 로봇이 있습니다. 하나는 "착한 로봇"(안전하게 정렬된 모델)이고, 다른 하나는 "정렬되지 않은 로봇"(원래의 정렬되지 않은 버전)입니다. 연구진은 착한 로봇의 뇌 부품을 하나씩 정렬되지 않은 로봇으로 교체해가며, 어떤 부분이 실제로 '거절'하는 힘을 가지고 있는지 확인하기 시작했습니다. 그들은 뇌 전체를 통째로 바꾼 것이 아니라, 단어에 집중하는 부분(어텐션/attention)과 정보를 처리하고 생각하는 부분(MLP 레이어)처럼 특정 유형의 연결 구조를 나누어 교체했습니다.

그들이 발견한 결과는 다음과 같습니다. 이는 마치 로봇의 "안 돼"가 전체 경비 팀이 아니라, 매우 특정한 소수의 전문가 부대라는 것을 발견한 것과 같습니다.

1. "생각하는" 부분이 핵심적인 역할을 합니다
연구진은 문맥에 집중하는 부분(어텐션 가중치)이 주요 안전 경비원이 될 것이라고 예상했습니다. 하지만 그들의 예상은 틀렸습니다! "생각하는" 부분(MLP 가중치)만을 착한 로봇에서 가져와 정렬되지 않은 로봇에 이식했을 때, 정렬되지 않은 로봇은 "집중하는" 부분을 이식했을 때보다 나쁜 요청을 최소 2.7배 더 자주 거절하기 시작했습니다. 결국, 안전을 위한 "안 돼"는 네트워크가 실제로 정보를 처리하고 변형하는 부분인 MLP 레이어에 주로 인코딩되어 있다는 사실이 밝혀졌습니다.

2. "중간"이 마법의 구역입니다
하지만 단순히 아무 생각하는 부분이나 다 되는 것은 아닙니다. 연구진은 안전 신호가 뇌의 매우 특정한 중간 섹션에 집중되어 있다는 것을 발견했습니다. 테스트한 모델들에서 가장 강력한 "거절" 능력은 블록 3, 즉 레이어 8에서 11 사이에서 발견되었습니다. 만약 로봇의 뇌를 28층짜리 건물이라고 본다면, 안전 경비원들은 주로 8층에서 11층 사이에 살고 있는 셈입니다. 이 특정 층들을 교체했을 때 로봇은 훨씬 더 잘 "안 돼"라고 말하게 되었습니다.

3. 많다고 항상 좋은 것은 아닙니다 (골디락스 효과)
여기서 이야기가 더욱 흥미로워지는 반전이 있습니다. 연구진은 만약 하나의 안전 블록이 좋다면, 모든 안전 블록을 교체하는 것이 완벽할 것이라고 생각했습니다. 하지만 그렇지 않았습니다! 많은 경우, 더 많은 정렬된 블록을 추가하는 것이 오히려 로봇이 나쁜 요청을 거절하는 능력을 떨어뜨렸습니다. 이는 마치 보안 요원 팀과 같습니다. 너무 많은 요원을 투입하면 서로 발에 걸려 넘어지거나 서로 다투게 되어 오히려 보안 수준이 낮아질 수 있습니다. 연구진은 단 6개의 블록만을 선택적으로 혼합하는 것이 전체 안전 시스템을 교체하는 것보다 더 효과적이라는 것을 발견했습니다. 때로는 일곱 번째 블록을 추가하는 것만으로도 로봇의 "안 돼" 능력이 감소하기도 했습니다.

4. "과잉 거절"의 함정
또 다른 문제는 있습니다. 로봇을 나쁜 요청에 "안 돼"라고 말하게 만드는 바로 그 부분이, 해롭지 않은 질문에도 "안 돼"라고 말하게 만든다는 것입니다. 이것을 **과잉 거절(over-refusal)**이라고 합니다. 연구진이 MLP 가중치를 교체했을 때, 로봇은 나쁜 녀석들을 막아내는 데는 탁월했지만, "날씨가 어때?" 또는 "농담 하나 해줘"와 같은 무해한 질문에도 답변을 거부하기 시작했습니다. 이는 안전 메커니즘이 다소 투박한 도구임을 시사합니다. 즉, 부품을 교체하는 것만으로는 "나쁜 것을 막으라는" 신호와 "모든 것을 막으라는" 신호를 분리하기 어렵다는 것입니다.

이것이 왜 중요할까요?
이 발견은 AI의 안전성이 네트워크 전체에 퍼져 있는 거대하고 깨지지 않는 방패가 아니라, 몇 개의 특정 레이어에 집중된 국지적이고 취약한 특징임을 시사합니다. 이것이 왜 AI 안전성이 그렇게 깨지기 쉬운지를 설명해 줍니다. 만약 실수로 그 특정 레이어들(레이어 8~11)을 수정하거나 제거하면, 전체 안전 시스템이 무너질 수 있기 때문입니다. 또한, 이는 미래에 AI 안전성을 개선하고 싶을 때 로봇 전체를 다시 학습시킬 필요가 없음을 의미합니다. 우리는 그 특정 "중간" 레이어들을 세심하게 조정하거나 보호하기만 하면 될 수도 있습니다.

연구진은 모든 안전 문제를 해결하는 마법의 탄환을 찾아낸 것은 아닙니다. 그들은 안전이 상호작용에 민감하다는 것, 즉 뇌의 각 부분은 복잡한 방식으로 함께 작동하며 단순히 더 많은 안전 부품을 쏟아붓는다고 해서 결과가 좋아지는 것이 아니라는 점을 발견했습니다. 하지만 "안 돼"가 어디에 사는지 정확히 짚어냄으로써, 그들은 왜 AI가 때때로 실패하는지 이해하고, 어떻게 하면 미래에 더 견고한 안전 시스템을 구축할 수 있을지에 대한 지도를 제공했습니다. 이는 세상의 광대하고 복잡한 AI 세계에서도, 가장 중요한 일들은 종-종 중간에서 일어난다는 사실을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →