← 최신 논문
🤖 machine learning

Rotation-Preserving Supervised Fine-Tuning

본 논문은 미세 조정 과정에서 가중치 행렬의 투영된 상위-kk개 특이벡터 블록의 변화를 패널티함으로써 사전 학습된 표현을 유지하면서 도메인 외 일반화를 개선하는 계산적으로 효율적인 방법인 회전 보존 지도 미세 조정 (RPSFT) 을 소개합니다.

원저자: Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 한 명의 매우 유능하고 만능 전문가 (대형 언어 모델) 가 '사전 학습' 단계 동안 요리부터 코딩, 역사까지 모든 것을 배웠다고 말입니다. 이들은 일반적 천재입니다.

이제, 당신은 이 전문가에게 고급 수학 문제 해결과 같은 매우 구체적인 새로운 기술을 가르치고자 합니다. 이를 **지도 학습 미세 조정 (Supervised Fine-Tuning, SFT)**이라고 합니다.

문제: '과도한 전문화'의 함정

이 전문가를 수학에 대해 집중적으로 훈련시키면, 그들은 수학 실력이 매우 뛰어납니다. 하지만 함정이 있습니다. 수학을 마스터하느라 급급한 나머지, 그들이 Previously 잘하던 다른 것들, 즉 창의적인 이야기 쓰기나 일반 상식 질문에 답하는 능력을 '잊어버리거나' 오히려 떨어뜨리게 됩니다.

마치 한 달 내내 매일 감자 껍질만 까는 연습에 매진하는 요리사의 상황을 생각해 보세요. 그들은 세계에서 가장 빠른 감자 껍질 까는 사람이 되지만, 한 달이 끝날 쯤에는 양파를 다지거나 수프에 간을 하는 법을 잊어버립니다. 그들의 뇌는 물리적으로 너무 많이 재배선되어 이전의 기술들이 사라진 것입니다.

인공지능 세계에서는 모델의 내부 '배선' (수학적 가중치) 이 잘못된 방향으로 너무 많이 비틀리고 회전하기 때문에 이런 일이 발생합니다. 모델은 그 일반적인 '형태'를 잃게 됩니다.

해결책: RPSFT ('앵커' 방법)

이 논문의 저자들은 **회전 보존 지도 학습 미세 조정 (Rotation-Preserving Supervised Fine-Tuning, RPSFT)**이라는 새로운 방법을 제안합니다.

다음은 비유입니다:
모델의 내부 배선을 수천 개의 금속 막대로 이루어진 거대하고 복잡한 3 차원 조각품이라고 상상해 보세요. 일부 막대는 두껍고 무겁습니다 (이것들은 모델이 배운 가장 중요하고 일반적인 지식을 나타냅니다). 다른 막대들은 얇고 유연합니다.

  • 표준 훈련 (SFT): 모델에게 수학을 가르치려 할 때, 당신은 전체 조각품을 잡고 새로운 수학 모양에 맞추기 위해 격렬하게 비틀어 봅니다. 수학은 맞출 수 있을지 모르지만, 조각품을 지탱하는 두껍고 무거운 막대들을 구부리게 됩니다. 전체 구조가 왜곡되어 더 이상 똑바로 서 있을 수 없게 됩니다 (일반 기술을 잊어버립니다).
  • RPSFT 훈련: 이 방법은 "수학을 가르치되, 두껍고 무거운 막대들을 비틀지 말자"고 말합니다.

훈련 시작 전에 연구자들은 가장 중요한 막대들 (최대 특이 벡터) 의 '스냅샷'을 찍습니다. 훈련 중에는 이러한 특정 막대들에 보이지 않는 앵커를 설치합니다.

  • 수학 훈련이 이러한 무거운 막대들을 비틀려고 하면, 앵커가 "아니야, 똑바로 있어!"라고 말하며 그들을 다시 당깁니다.
  • 그러나 다른 유연한 막대들은 수학을 배우기 위해 필요한 만큼 자유롭게 움직이고 비틀릴 수 있습니다.

이것이 작동하는 이유

'무거운 막대들'을 고정함으로써, 모델은 새로운 수학 기술을 배우면서도 일반적인 균형을 잃지 않습니다.

  • 결과: 모델은 수학 (작업 적응) 에 뛰어나지만, 일반인으로서의 능력 (도메인 외 일반화) 을 잃지 않습니다.
  • 보너스: 모델의 내부 구조가 여전히 안정적이고 '건강'하기 때문에, 첫 번째 훈련 라운드에서 파괴되지 않았기 때문에 나중에 (강화 학습과 같은) 더 고급 기술을 가르치는 것이 더 쉽습니다.

논문에서 발견한 점

연구자들은 수학 문제를 사용하여 Llama 와 Qwen 과 같은 다양한 AI 모델에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  1. 더 나은 균형: RPSFT 로 훈련된 모델들은 수학에 더 뛰어났을 뿐만 아니라, 표준 방법으로 훈련된 모델들보다 일반 지식을 덜 잊어버렸습니다.
  2. 덜어난 편차: 모델 내부를 살펴보면, '무거운 막대들'이 표준 훈련에서 그랬던 것처럼 거의 비틀리지 않았습니다.
  3. 더 튼튼한 기반: RPSFT 로 훈련된 모델들을 가져와 두 번째 라운드의 고급 훈련을 시켰을 때, 기존 방식으로 훈련된 모델들보다 더 좋은 성과를 냈습니다.

요약하자면

RPSFT 는 학생에게 새로운 과목을 가르칠 때, 그들이 열심히 공부하게 하되 핵심 가치나 일반 지식을 잊지 않도록 보장하는 것과 같습니다. 이는 AI 의 뇌에서 가장 중요한 부분들이 형태를 잃고 비틀리는 것을 방지하기 위해 '수학적 앵커'를 사용하여, 현재 공부하고 있는 한 가지 영역뿐만 아니라 모든 영역에서 똑똑하게 유지되도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →