← 최신 논문
💬 NLP

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

본 논문은 대규모 데이터 재생 없이 일반 모델 능력을 보존하면서 안전성 사후 학습에서의 정렬 세금을 완화하기 위해 안전성 기울기를 직교 부분 공간에 투영하는 경량 지속 학습 방법인 OGPSA 를 제안합니다.

원저자: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 간단한 언어와 창의적인 비유를 사용하여 해당 논문을 설명한 것입니다.

문제: "안전세 (Safety Tax)"

당신은 천재적인 다재다능한 요리사 (AI 모델) 를 상상해 보세요. 이 요리사는 훌륭한 프랑스 요리를 만들고, 시를 쓰며, 복잡한 수학 문제를 해결할 수 있습니다. 하지만 때로는 실수로 유독하거나 모욕적인 요리를 내놓기도 합니다.

이를 해결하기 위해, 나쁜 음식을 내놓지 않도록 요리사를 훈련시키는 엄격한 안전 강사를 고용합니다. 강사는 매우 효과적이어서 요리사는 더 이상 유독한 요리를 내놓지 않게 됩니다. 하지만 함정이 하나 있습니다. "안전"해지려고 배우는 과정에서 요리사는 고급 프랑스 요리나 시를 쓰는 법을 잊어버리게 됩니다. 그들은 안전해지지만, 동시에 지루해지고 유용성이 떨어집니다.

AI 세계에서는 이를 **정렬세 (Alignment Tax)**라고 부릅니다. AI 를 더 안전하게 만드는 것은 종종 다른 작업에서의 능력을 "덜 똑똑하게" 만듭니다.

원인: 뇌 속의 교통 체증

이 논문은 이러한 현상이 AI 의 뇌 (수학적 매개변수) 내부에서 발생하는 "교통 체증" 때문이라고 제안합니다.

  • 기존 기술: AI 는 먼저 범용 천재가 되도록 학습했습니다. 이러한 기술들은 뇌 내의 특정 "방향"이나 경로에 저장되어 있습니다.
  • 새로운 안전 규칙: 우리가 AI 에게 안전하도록 가르칠 때, 우리는 이를 새로운 방향으로 밀어붙입니다.
  • 충돌: 불행히도, "안전"을 배우는 데 필요한 방향은 종종 "범용 기술"을 유지하는 데 필요한 방향과 겹칩니다. AI 가 안전을 배우기 위해 앞으로 나아가려 할 때, 실수로 범용 기술의 경로를 부딪혀 지워버립니다. 마치 안전문으로 가려면 앞으로 나아가야 하지만, 그 길은 수학 실력을 담고 있는 벽에 막혀 있습니다. 통과하려면 그 벽을 부수어야 하는 것과 같습니다.

해결책: OGPSA ("옆으로 걷기")

저자들은 OGPSA(안전 정렬을 위한 직교 기울기 투영) 라는 새로운 방법을 제안합니다.

AI 의 뇌를 거대한 무대라고 상상해 보세요.

  • 범용 기술은 AI 가 춤을 잘 추는 무대의 특정 구역입니다.
  • 안전 목표는 AI 가 배워야 할 새로운 춤 동작입니다.

기존 방식 (순진한 튜닝): AI 는 새로운 안전 동작을 배우기 위해 곧바로 그 방향으로 이동하려 합니다. 하지만 안전 동작이 바로 "범용 기술" 구역으로 향하고 있기 때문에, AI 는 실수로 자신의 발을 밟고 춤추는 법을 잊어버립니다.

OGPSA 방식:

  1. 구역 매핑: 먼저 이 방법은 범용 기술 구역의 빠른 "스냅샷"을 찍습니다. 어떤 방향이 그 기술들을 유지하는 데 결정적인지 정확히 식별합니다.
  2. 옆으로 걷기: AI 가 안전 규칙을 배워야 할 때, OGPSA 는 그 동작을 계산합니다. 만약 그 동작이 범용 기술 구역 안으로 들어가지 않으려 한다면, OGPSA 는 그 부분을 잘라냅니다.
  3. 결과: AI 는 강제로 옆으로 걷는 행동을 하게 됩니다. 안전 목표 쪽으로 이동하지만, 범용 기술 구역과 완벽하게 수직 (90 도 각도) 인 방향으로 이동합니다.

비유: 당신이 목표 지점으로 걸어가고 있는데, "잔디밭을 밟지 마라"는 말을 듣는 상황을 상상해 보세요. 멈추거나 잔디밭 위를 걷는 대신, 잔디밭과 평행하게 달리는 보도를 따라 걷습니다. 당신은 여전히 목적지 (안전) 에 도달하지만, 잔디밭 (범용 기술) 을 결코 짓밟지 않습니다.

왜 잘 작동하는가

  • 가벼움: 다른 방법들이 기억을 되살리기 위해 AI 가 과거 교과서를 끊임없이 다시 읽게 하는 (과거 데이터 재생) 방식과 달리, OGPSA 는 금지된 방향을 기억하기 위해 작고 주기적인 "건강 진단"만 필요합니다.
  • 플러그 앤 플레이: 전체 시스템을 변경할 필요 없이 다양한 학습 방법 (SFT 및 DPO 등) 과 함께 작동합니다.
  • 결과: 테스트에서 OGPSA 를 사용하면 AI 가 범용 지능을 많이 잃지 않으면서 매우 안전하게 될 수 있었습니다. 표준 학습에 비해 더 높은 "안전 점수"를 얻으면서도 더 높은 "유용성 점수"를 유지했습니다.

결론

이 논문은 모든 안전 문제를 해결하거나 AI 를 완벽하게 만든다고 주장하지 않습니다. 단순히 교묘한 기하학적 트릭을 제시합니다: AI 에게 안전을 가르칠 때, 이미 알고 있는 것을 잊게 만드는 방식으로 가르치지 않도록 하십시오. AI 가 안전을 "직진"이 아닌 "옆으로" 배우도록 강제함으로써, 우리는 AI 를 안전하면서도 똑똑하게 유지할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →