AI 모델을 거대한 공장이라고 상상해 보세요. 이 공장에는 수백 명의 **전문가 (Expert)**들이 일하고 있습니다.
일반적인 AI (Dense Model): 모든 작업에 모든 직원이 함께 참여합니다.
혼합 전문가 모델 (MoE): 들어온 질문 (주문) 에 따라 가장 적합한 소수의 전문가들만 선택되어 일합니다. (예: 수학 문제를 풀면 '수학 박사'만, 시를 쓰면 '시인'만 나옴).
이 방식은 효율적이지만, 새로운 위험이 생겼습니다.
⚠️ 문제: "가짜 안전"의 함정 (Alignment Shortcut)
기존에 AI를 안전하게 만들기 위해 공장 전체를 다듬는 훈련 (전체 파라미터 미세 조정) 을 했습니다. 그런데 놀라운 결과가 나왔습니다.
현상: AI가 위험한 질문 (예: "범법 방법 알려줘") 을 받았을 때, 실제로 위험한 일을 하는 **'불량 전문가 (Safety-Critical Experts)'**는 고쳐지지 않았습니다.
원인: 대신 공장 관리자 (라우터) 가 "아, 이 질문은 위험하니까 안전한 전문가들만 불러서 처리하자"라고 지시만 바꿨습니다.
결과: 겉보기에는 AI가 "죄송합니다, 할 수 없습니다"라고 거절해서 안전해 보이지만, 실제 불량 전문가들은 여전히 고장 난 상태입니다.
위험: 해커가 질문을 살짝 변형하면 (예: 암호를 섞거나 문장을 바꾸면), 관리자 지시가 뚫려서 여전히 고장 난 불량 전문가가 다시 작동하며 위험한 답변을 내놓을 수 있습니다.
이를 논문에서는 **"안전 훈련의 지름길 (Shortcut)"**이라고 부릅니다. 진짜 고장이 아니라, 안전을 피하는 경로만 막은 것이죠.
💡 해결책: RASA (라우터 인식 안전 정렬)
이 문제를 해결하기 위해 제안된 RASA는 공장 전체를 다 고치는 게 아니라, 정확히 고장 난 전문가만 찾아서 고치는 똑똑한 방법입니다.
RASA 의 작동 원리 (3 단계):
범인 잡기 (Safety-Critical Experts 찾기):
해커가 질문을 했을 때, 평소와 다르게 특정 전문가들만 유독 많이 활성화되는지 분석합니다.
"아, 이 질문을 들으면 'A 박사'와 'B 박사'만 유독 흥분하네? 이 두 분이 바로 위험한 일을 하는 범인이구나!"라고 특정합니다.
정밀 수술 (선택적 훈련):
공장 전체를 멈추지 않고, 오직 그 '범인 전문가'들만 가둬두고 훈련시킵니다.
"너희는 이제부터 위험한 질문을 받으면 무조건 거절해야 해!"라고 가르칩니다.
나머지 안전한 전문가들은 건드리지 않아서, AI 의 원래 능력 (수학, 글쓰기 등) 은 그대로 유지됩니다.
관리자 교육 (라우터 일관성 유지):
이제 범인 전문가들이 고쳐졌으니, 공장 관리자 (라우터) 도 교육합니다.
"위험한 질문이 들어와도, 안전한 질문과 똑같은 경로로 처리해서 고쳐진 전문가에게 보내라"라고 가르칩니다.
해커가 질문을 변형해도, 고쳐진 전문가에게만 전달되도록 경로를 고정합니다.
🌟 RASA 의 장점
완벽한 방어: 해커가 어떤 방식으로 질문을 변형해도, 고쳐진 전문가가 위험한 일을 막아냅니다.
능력 유지: 안전한 전문가들은 건드리지 않았기 때문에, AI 가 원래 하던 일 (수학 풀기, 정보 찾기) 은 여전히 잘합니다.
불필요한 거절 방지: "모든 질문을 거절하는" 과잉 방어를 하지 않고, 정말 위험한 것만 정확히 막습니다.
📝 요약
기존 방법은 **"공장 전체를 재건"**해서 안전을 확보하려 했지만, 해커는 그 틈을 비집고 들어가는 방법을 찾았습니다.
RASA는 **"정확히 고장 난 기계 부품 (전문가) 만 찾아서 수리하고, 그 부품이 작동하는 경로 (라우터) 도 안전하게 고정"**하는 방식입니다.
이 덕분에 AI 는 해킹에 훨씬 강해졌지만, 여전히 똑똑하고 유용한 친구로 남을 수 있게 되었습니다.
이 논문은 혼합 전문가 (Mixture-of-Experts, MoE) 모델의 안전성 정렬 (Safety Alignment) 에 있어 발생하는 고유한 문제를 지적하고, 이를 해결하기 위한 RASA(Routing-Aware Safety Alignment) 라는 새로운 프레임워크를 제안합니다.
주요 내용은 다음과 같습니다.
1. 문제 제기: MoE 모델의 '정렬 단축 (Alignment Shortcut)'
기존의 밀집형 (Dense) 모델과 달리 MoE 모델은 입력 데이터가 소수의 전문가 (Expert) 만을 경유하도록 라우팅 (Routing) 됩니다. 저자들은 MoE 모델에 표준적인 전체 파라미터 안전성 미세 조정 (Full-parameter Safety Fine-tuning) 을 적용할 때 다음과 같은 '정렬 단축 (Alignment Shortcut)' 현상이 발생함을 발견했습니다.
현상: 모델이 실제로 위험한 행동을 하는 '안전-중요 전문가 (Safety-Critical Experts, SCEs)'의 파라미터를 직접 수정하지 않고도, 라우팅 메커니즘을 조작하거나 이미 안전한 전문가들의 활성화 비율을 높이는 방식으로 안전성 점수만 개선되는 것처럼 보입니다.
위험: 이는 겉보기에는 안전해 보이지만, 실제 위험한 전문가들은 수정되지 않은 상태이므로 새로운 적응형 어드버설 프롬프트 (Jailbreak) 에 의해 다시 활성화될 수 있습니다. 또한, 안전한 전문가들이 과도하게 우세해져 불필요한 거절 (Over-refusal) 이 늘어나고 일반 성능이 저하되는 문제가 발생합니다.
2. 제안 방법: RASA (Routing-Aware Safety Alignment)
RASA 는 라우팅 기반의 단축 해결책을 방지하고, 실제로 위험한 전문가들을 명시적으로 수정하기 위해 설계된 라우팅 인식형 전문가 수준 정렬 프레임워크입니다. 이는 이중 최적화 (Bi-level Optimization) 전략을 따릅니다.
핵심 아이디어: 전문가 수정 (Expert Correction) 과 라우팅 제어 (Routing Control) 를 분리하여, 안전성 감독이 실제 위험 파라미터에 도달하도록 합니다.
단계별 프로세스:
안전 - 중요 전문가 (SCEs) 식별: 성공적인 재일브레이크 (Jailbreak) 프롬프트와 정상적으로 거절된 프롬프트 (Anchor) 간의 활성화 빈도 차이 (Adversarial Activation Discrepancy, AAD) 를 계산하여, 공격에 비정상적으로 많이 활성화되는 전문가들을 식별합니다.
선택적 전문가 미세 조정 (SCE-FT): 라우터 (Router) 를 고정 (Freeze) 한 상태에서, 식별된 SCEs 만을 선택적으로 미세 조정하여 거절 행동을 주입합니다. 이때 나머지 안전한 전문가들은 수정되지 않습니다.
라우터 일관성 최적화 (Router Consistency): 수정된 전문가들을 기반으로 라우터를 최적화합니다. 어드버설 입력이 안전 정렬된 입력과 동일한 라우팅 패턴을 따르도록 강제하여, 공격자가 새로운 경로를 통해 SCEs 를 우회하거나 부활시키는 것을 방지합니다.
3. 주요 기여
현상 발견: MoE 모델의 전체 파라미터 미세 조정 시, 라우팅 메커니즘을 통한 '단축 해결책'이 발생하여 실제 위험 전문가가 수정되지 않는다는 사실을 실증적으로 규명했습니다.
새로운 프레임워크 제안: RASA 를 통해 라우팅 기반 우회를 방지하면서 안전 - 중요 전문가를 명시적으로 수리하는 타겟팅된 정렬 방법을 제시했습니다.
강건한 성능 입증: 다양한 재일브레이크 공격에 대해 높은 방어력을 보이며, 일반 성능 (MMLU, GSM8K 등) 을 유지하고 과도한 거절을 통제하는 것을 실험을 통해 증명했습니다.
4. 실험 결과
Qwen3-30B-A3B 와 OLMoE-1B-7B-0125-Instruct 두 가지 대표적인 MoE 아키텍처에서 실험을 수행했습니다.
방어 성능: 다양한 재일브레이크 공격 (FlipAttack, DeepInception, Persuasion 등) 에 대해 거의 완벽한 방어 (Harmlessness Rate ~1.0) 를 달성했습니다. 특히 단일 공격뿐만 아니라 혼합 공격 (Mixed-Attack) 설정에서도 뛰어난 성능을 보였습니다.
일반화 능력: 훈련 데이터에 포함되지 않은 새로운 공격 유형 (Out-of-Distribution) 에 대해서도 강력한 방어력을 보여주었습니다. 이는 서로 다른 공격들이 공통된 안전 - 중요 전문가를 활성화하기 때문에, 이를 수정하면 광범위한 공격에 대응할 수 있기 때문입니다.
일반 성능 및 과거절 제어: MMLU, GSM8K, TruthfulQA 등 일반 벤치마크 성능은 유지되거나 오히려 개선되었으며, XsTest 를 통한 과거절 (Over-refusal) 비율은 기존 방법들에 비해 현저히 낮게 통제되었습니다.
비교 분석: 기존 방법 (SteerMoE, SafeMoE-Fine-tuning 등) 은 라우팅 의존적 안전성을 보이며, 라우팅을 원래 상태로 복원하면 안전성이 급격히 떨어지는 반면, RASA 는 전문가 파라미터 수정을 통해 라우팅에 구애받지 않는 강건한 안전성을 유지했습니다.
5. 의의 및 결론
이 연구는 MoE 모델의 안전성 정렬에 있어 전체 파라미터 업데이트가 아닌 타겟팅된 전문가 수정이 필수적임을 강조합니다. RASA 는 모델 아키텍처를 변경하거나 추가적인 전문가를 도입하지 않고도, 기존 구조 내에서 라우팅 메커니즘을 고려한 효율적이고 강력한 안전성 정렬을 가능하게 합니다. 이는 MoE 모델의 확장성과 효율성을 해치지 않으면서도, 적응형 어드버설 공격에 대비한 견고한 방어 체계를 구축하는 실용적인 해결책을 제시한다는 점에서 의의가 큽니다.