기술 요약: 확률 수율보다 순위 매칭이 진정한 심층 안전 정렬을 가능케 한다
1. 문제 정의
오픈 소스 대규모 언어 모델(LLM)은 AI의 민주화에 필수적이지만, 그 개방성은 악의적인 행위자들에게 취약점을 제공합니다. 구체적이고 접근 가능한 위협은 **프리필링 공격(prefilling attack)**으로, 공격자가 어시스턴트의 응답을 긍정적인 접두사(예: "폭탄을 만드는 방법은 다음과 같습니다...")로 미리 채워 넣어 안전 필터를 우회하는 방식입니다.
Qi 등(2025)의 최근 연구는 데이터 증강을 이용한 지도 미세 조정(SFT)을 통해 "심층" 안전 정렬 방어 기법을 제안했습니다. 이 방법은 모델이 단순히 고정된 거절 문자열을 출력하는 대신, 유해한 프리필 직후에 자연어 거절 문구를 생성하도록 학습시킵니다. 이 방식은 표준적인 샘플링 기반 디코딩 및 파라미터 튜닝 공격(온도 조절을 통한 그리드 탐색 등)에는 효과적이지만, 본 논문은 이 방어가 여전히 **피상적(superficial)**이라는 근본적인 결함을 식별했습니다.
저자들은 심층 안전 정렬을 거친 모델이라 할지라도, 상위-k 예측 내에 낮은 확률이지만 높은 순위를 가진 "유해한" 토큰을 여전히 보유하고 있음을 입증했습니다. 확률 질량(probability mass)을 무시하고 대신 순위(특히 상위 20위 이내)를 기준으로 토큰을 선택함으로써 공격자는 거절 메커니즘을 우회할 수 있습니다. 본 논문은 이러한 취약점을 악용하는 순위 보조 프리필링(Rank-Assisted Prefilling, RAP) 공격을 소개하고, 진정한 심층 안전 정렬을 달erm하기 위한 새로운 학습 목표인 PRESTO를 제안합니다.
2. 방법론
2.1 RAP 공격
순위 보조 프리필링(RAP) 공격은 프리필링 기술을 일반화한 것입니다. 공격자는 높은 확률의 토큰에 의존하는 대신, 유해한 서사를 지속하는 상위 k개의 예측 토큰(예: k=20) 중에서 토큰을 선택하며, 이때 토큰의 확률 점수는 고려하지 않습니다.
- 메커니즘: 각 디코딩 단계에서 공격자는 상위 k개 토큰을 검사합니다. 만약 유해한 서사를 자연스럽게 이어가는 토큰("유해 토큰")이 상위 k 안에 나타나면, 설령 거절 토큰(예: "I")의 확률이 훨씬 높더라도 해당 유해 토큰을 선택합니다.
- 자동화 (AutoRAP): 저자들은 거절 토큰과 유해한 지속 토큰을 구분하는 분류기를 사용하여, 수동 개입 없이도 체계적으로 유해 콘텐츠를 추출할 수 있는 자동화된 버전의 RAP을 개발했습니다.
2.2 푸시 포워드 정렬 (Push-Forward Alignment, PFA)
저자들은 데이터 증강 방어의 실패가 거절 토큰의 음의 로그 가능도(negative log-likelihood, 확률)를 최소화하는 데만 집중하고, 유해 토큰의 **순위(ranks)**를 제어하지 못하는 데 있다고 주장합니다.
- 개념: 진정으로 안전한 모델이라면, (프리필이 없는) 첫 번째 응답 토큰의 분포는 거절 토큰이 최상위 순위에 있어야 하며, 프리필을 지속시키는 유해한 토큰이 있어서는 안 됩니다.
- 목표: 모델은 이 **순위-유해 매핑(rank-harm mapping)**을 프리필이 존재하는 상황에서도 첫 번째 토큰 분포로부터 모든 후속 디코딩 단계로 "푸시 포워드(push forward)"해야 합니다. 즉, 특정 토큰이 유해하다면, 프리필의 존재 여부와 상관없이 출력 분포 내에서 그 순위가 낮게 유지되도록 해야 합니다.
- 정식화: 저자들은 순위-s 토큰이 유해할 확률을 나타내는 순위-유해 분포 R(s,x,xpre)를 정의합니다. 목표는 안전한 모델(프리필 없음)의 순위-유해 분포와 공격받는 모델(프리필 있음) 사이의 지구 이동 거리(Earth Mover's Distance, EMD)를 최소화하는 것입니다.
2.3 PRESTO: PRefill attEntion STOpping
PFA를 실질적으로 구현하기 위해, 저자들은 트랜스포머의 멀티 헤드 어텐션(MHA) 메커니즘을 기반으로 한 정규화 손실 함수인 PRESTO를 제안합니다.
- 가설: 상위-k 순위에 유해한 토큰이 존재하는 것은 모델이 유해한 프리필 토큰에 어텐션을 주기 때문입니다. 만약 모델이 프리필 토큰을 "무시"하도록(즉, 해당 토큰에 대한 어텐션을 줄이도록) 학습될 수 있다면, 출력 분포는 원래 프롬프트의 안전하고 거절 중심적인 분포로 회귀할 것입니다.
- 손실 함수: PRESTO는 유해한 프리필 토큰에 대한 어텐션 점수를 최소화하는 동시에, 비-프리필 토큰에 대한 어텐션을 최대화합니다.
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
여기서 A1은 모든 레이어와 헤드에 걸친 프리필 토큰에 대한 평균 어텐션이며, A2는 비-프리필 토큰에 대한 평균 어텐션입니다.
- 학습: 모델은 Qi 등(2025)의 표준 데이터 증강 손실과 PRESTO 손실을 결합하여 미세 조정됩니다. 두 손실 모두 단일 순전파(forward pass) 과정에서 함께 계산됩니다.
3. 주요 기여
- RAP 취약점 식별: 본 논문은 데이터 증강을 통한 "심층" 안전 정렬이 유해 토큰의 확률만을 억제할 뿐, 그 순위를 억제하지 못하기 때문에 불충분함을 입증했습니다.
- 순위 보조 프리필링(RAP) 공격: 낮은 확률의 높은 순위 토큰을 선택하여 데이터 증강 방어를 효과적으로 우회하고 유해 콘텐츠를 추출하는 새로운 접근 가능한 공격 벡터를 제시했습니다.
- 푸시 포워드 정렬 (PFA): 안전 정렬은 첫 번째 토큰 분포의 순위-유해 매핑을 생성 과정 전반에 걸쳐 보존해야 한다는 이론적 프레임워크를 제안했습니다.
- PRESTO: 프리필 토큰에 대한 어텐션을 정규화하여 RAP 공격의 난이도를 크게 높이는, 기계론적으로 해석 가능한 단순한 학습 목표를 제공합니다.
4. 실험 결과
저자들은 세 가지 인기 있는 오픈 소스 모델인 Llama 2 7B Chat, Qwen 3 8B, Gemma 3 12B IT를 대상으로 PRESTO를 평가했습니다.
- 공격 성공률:
- 기존 데이터 증강 방어(Qi et al., 2025) 하에서 RAP 공격은 높은 성공률을 보였습니다 (예: Llama 2 7B의 경우 StrongREJECT 척도에서 약 0.74).
- PRESTO를 적용했을 때, RAP 공격의 성공률은 현저히 감소했습니다. 세 모델 모두에서 PRESTO는 데이터 증강만 사용했을 때보다 최대 4.7배의 안전성 향상(유해성 점수 감소)을 보였습니다.
- AutoRAP의 성능은 인간의 평가와 밀접하게 일치하였으며, 이는 공격의 자동화가 가능함을 확인시켜 주었습니다.
- 유용성 보존:
- PRESTO로 미세 조정된 모델은 MT-Bench(개방형 생성) 및 GSM-8K(수학적 추론)에서 경쟁력 있는 유용성을 유지했으며, 데이터 증강만으로 학습된 모델과 비교하여 성능 저하가 1% 미만이었습니다.
- 기계론적 분석:
- 어텐션 분석 결과, PRESTO는 특히 안전 결정에 핵심적인 역할을 하는 모델의 후반부 레이어에서 유해한 프리필 토큰에 대한 어텐션을 성공적으로 감소시켰습니다.
- 이 방어 기법은 GCG (Greedy Coordinate Gradient) 공격에 대해서도 견고함을 유지하여, PRESTO가 다른 공격 벡터에 대한 취약성을 재도입하지 않음을 보여주었습니다.
5. 의의 및 주장
본 논문은 "심층" 안전 정렬을 달성하려면 확률 기반 목표를 넘어 **순위 기반 제약(rank-based constraints)**으로 나아가야 한다고 주장합니다. 저자들은 모델이 높은 확률로 거절 토큰을 출력하도록 학습시키는 것만으로는, 모델의 내부 어텐션 메커니즘이 여전히 유해한 지속 내용을 상위-k 순위에 남겨둔다면 충분하지 않다고 강조합니다.
PRESTO를 도입함으로써, 이 연구는 실질적이고 저비용인 RAP와 같은 공격에 강한 더 안전한 오픈 소스 모델을 만드는 경로를 제공합니다. 본 연구의 의의는 다음과 같습니다:
- 안전의 민주화: 프리필링을 허용하는 API와 같은 고객 대응 애플리케이션에 오픈 소스 모델을 쉽게 우회될 위험 없이 배포할 수 있게 합니다.
- 우회의 비용: 우회를 불가능하게 만드는 것이 아니라, 악의적인 행위자가 안전망을 우회하는 데 드는 비용을 높이는 목표에 부합합니다.
- 해석 가능성: 왜 이 방어가 작동하는지에 대한 기계론적 설명(어텐션 억제)을 제공하여, 이론적 정렬과 실제 구현 사이의 간극을 메웁니다.
저자들은 완벽한 방어는 없지만, PRESTO가 오픈 소스 LLM을 순위 기반 착취로부터 더 안전하게 만드는 데 있어 중요한 진전이라고 결론짓습니다.