← 최신 논문
💬 NLP

Abliteration Mitigation via Refusal Aliases

이 논문은 랭크-kk 업데이트와 활성화 에일리어싱(activation aliasing)을 통해 거부 방향을 모호하게 함으로써 '어블리터레이션(abliteration)' 공격을 완화하는 가중치 편집 방어 기법인 AMRA를 소개하며, 이를 통해 모델의 유용성에 미치는 영향을 최소화하면서 Llama-3-8B 및 Gemma-2-9B의 거부 유지력을 크게 향상시킨다.

원저자: Nathan Truong

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nathan Truong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능 세계에서 대규모 언어 모델은 추론, 작문, 복잡한 문제 해결이 가능한 강력한 도구가 되었습니다. 이러한 시스템이 안전하고 유용하게 유지되도록 하기 위해, 개발자들은 무기 제조 방법이나 혐오 표현 생성과 같이 해를 끼칠 수 있는 요청을 거부하도록 모델을 훈련합니다. 흔히 '얼라인먼트(alignment)'라고 불리는 이 안전 훈련은 모델이 위험한 주제를 인식하고 이를 정중하게 거절하도록 가르칩니다. 그러나 연구자들은 놀라운 취약점을 발견했습니다. 이 거절 메커니즘은 복잡하고 숨겨진 요새가 아니라, 모델의 내부 작동 방식 속에 존재하는 단순하고 식별 가능한 패턴이라는 점입니다. 공격자들은 "답변하지 마시오"라는 신호를 보내는 모델의 수학적 공간 내의 특정 방향, 즉 이 구체적인 패턴을 찾아냄으로써 이를 수학적으로 지워버릴 수 있으며, 이를 통해 몇 번의 간단한 조정만으로 모델의 안전 브레이크를 효과적으로 꺼버릴 수 있습니다. '에블리터레이션(abliteration)'이라고 알려진 이 과정은 모델을 완전히 정상적으로 작동하게 만들면서도 방어막을 제거하여, 이전에 거부하도록 설계되었던 유해한 콘텐츠를 생성할 수 있게 만듭니다.

한 연구자가 이제 더 강력한 벽을 쌓는 대신, 목표를 찾는 것 자체를 불가능하게 만드는 새로운 방어 방법을 제안했습니다. '거절 에일리어스(Refusal Aliases)를 통한 에블리터레이션 완화'라고 불리는 이 접근 방식은, 공격자가 안전 신호를 찾을 수 없다면 이를 제거할 수도 없다는 원리에 기반합니다. 연구자는 이러한 모델의 거절 행동이 정보를 처리하여 다음 단계로 전달하기 전의 네트워크 특정 레이어에 집중되어 있다는 점을 확인했습니다. 연구자는 이러한 레이어들의 가중치를 미세하게 수정하여 안전 신호를 효과적으로 흐트러뜨리는 기술을 개발했습니다. 이 방식은 모델이 유해한 요청을 만났을 때 명확하고 일관된 "아니오"를 생성하는 대신, 해당 반응을 무작위의 저분산 노이즈로 대체합니다. 모델의 자체 논리에 따르면, 이 노이즘은 후속 레이어들에 의해 교정되어 모델이 안전한 질문에는 정상적으로 계속 작동하면서도, 공격자가 찾아내려 할 명확하고 추출 가능한 패턴은 사라지게 됩니다.

연구자는 이 방법이 안전 기능을 제거하는 데 사용되는 표준 기술들을 견뎌낼 수 있는지 확인하기 위해 Llama-3와 Gemma-2라는 두 가지 인기 있는 오픈 소스 모델에 대해 테스트를 진행했습니다. 실험에서 연구자는 먼저 이 난독화 기술을 모델에 적용한 다음, 통상적인 '에블리터레이션' 공격을 시도했습니다. 결과는 모델의 거절 능력을 유지하는 데 있어 상당한 개선을 보여주었습니다. Llama-3 모델의 경우, 공격이 시도된 후 방어 덕분에 거절 점수가 2.16점 상승했는데, 이는 아무런 보호를 받지 못한 모델과 비교했을 때 상당한 차이였습니다. 결정적으로, 이러한 보안 향상은 모델의 일반적인 지능이나 무해한 질문에 답하는 능력의 손실 없이 이루어졌습니다. 연구자가 표준 지식 및 추론 벤치마크를 통해 모델의 성능을 측정한 결과, 유용성의 저하는 0.5% 미만으로 매우 미미했습니다.

Gemma-2 모델에 적용했을 때는 결과가 더욱 극적이었으나 더 복잡했습니다. 여기서 방어 기술은 공격 후 거절 점수를 14.70점 높였으며, 보호되지 않은 모델과 완전한 안전 베이스라인 사이의 격차를 효과적으로 좁혔습니다. 비록 공격이 모델의 거절 행동을 어느 정도 저하시키기는 했지만, 난독화 덕분에 공격의 효과가 보호되지 않은 버전보다 훨씬 떨어졌습니다. 그러나 Gemma-2에 대한 이 강력한 보호에는 더 높은 비용이 따랐습니다. 연구자는 모델의 수학 문제 해결 능력과 전반적인 지식 보유 능력에서 더 눈에 띄는 하락을 관찰했습니다. 연구자는 이를 Gemma 아키텍처를 보호하기 위해 필요한 설정이 모델의 내부 구조에 더 큰 변화를 수반했기 때문이라고 설명했습니다. 이러한 트레이드오프에도 불구하고, 이 방법은 유해한 출력 비율을 낮게 유지하면서도 방향성 공격으로부터 모델을 성공적으로 요새화한 유일한 방어책임이 입증되었습니다.

이 연구의 핵심은 추출 과정 자체에 초점을 맞추고 있다는 점에 있습니다. 기존의 방어 방식은 종-종 거절 신호를 강화하거나 대화 중에 모델을 유해한 출력으로부터 멀어지도록 유도하려 했습니다. 연구자는 이러한 방법들이 거절 방향을 찾아내고 제거하기가 너무 쉽다는 근본적인 원인을 해결하지 못하기 때문에 실패한다고 주장합니다. 거절 신호를 무작위 에일리어스로 대체하고, 그 노이즈를 무시하도록 모델의 다운스트림 부분을 패치함으로써, 연구자는 모델의 안전 메커니즘을 해체하는 데 사용되는 도구들로부터 보이지 않게 만들었습니다. 이 접근 방식은 개발자가 모델을 대중에 공개하기 전에 적용하도록 설계된 모델 가중치의 일회성 수정입니다. 가중치가 변경되면, 모델은 안전을 유지하기 위해 추가적인 컴퓨팅 파워를 필요로 하지 않으며 재학습도 필요하지 않습니다.

이 연구는 보안과 유용성 사이의 중요한 균형을 강조합니다. 이 방법이 거절 방향의 추출을 효과적으로 방해하긴 하지만, 모든 모델 아키텍처에 대한 완벽한 방패는 아닙니다. 연구자는 방어의 효과가 보호되는 모델의 특정 설계에 크게 의존한다는 것을 발견했습니다. 어떤 모델에서는 보호가 거의 매끄럽게 이루어지는 반면, 다른 모델에서는 안전을 유지하기 위해 모델의 복잡한 추론 능력이 다소 저하되는 타협이 필요했습니다. 저자는 향-후 연구를 통해 유용성에 대한 비용을 줄이기 위해 설정을 정교화하거나, 거절 신호 자체를 강화하는 다른 방법들과 결합할 수 있다고 제안했습니다. 궁극적으로, 이 연구는 공격자가 의존하는 바로 그 서명(signature)을 모호하게 함으로써, 대규모 언어 모델이 안전 가드레일을 제거하려는 시도에 대해 훨씬 더 강력한 회복력을 갖출 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →