← 최신 논문
💬 NLP

PriFT: Prior-Support Guided Supervised Fine-Tuning

PriFT(Prior-Support Guided Fine-Tuning)는 온라인 모델의 분포를 사용함으로써 발생하는 자기 강화 역학을 피하기 위해, 동결된 사전 학습된 모델로부터 안정적인 토큰 재가중치 신호를 도출함으로써 지도 미세 조정의 일반화 성능과 RL 초기화를 개선한다.

원저자: Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 이미 수백만 권의 책을 읽고 방대한 일반 지식을 습득한 똑똑한 학생(AI 모델)이 있다고 상상해 보십시오. 이것이 **사전 학습된 모델(pretrained model)**입니다. 이제 당신은 이 학생에게 복잡한 수학 문제를 풀거나 코드를 작성하는 것과 같은 특정한 새로운 기술을 가르치고자 합니다. 이 교육 단계는 **지도 미세 조정(Supervised Fine-Tuning, SFT)**이라고 불립니다.

보통 선생님들은 학생에게 정답이 적힌 교과서를 보여주며 "이 문장을 한 줄 한 줄 그대로 외워라"라고 말합니다. 하지만 이 논문은 이러한 "한 줄씩 암기하기" 방식에 결함이 있다고 주장합니다. 즉, 학생이 이미 알고 있는 지식에 기반하여 실제로 이해되지 않는 답까지도 암기하려고 할 수 있다는 것입니다. 이는 학생이 특정 교과서를 너무 완벽하게 외운 나머지, 질문이 조금만 바뀌어도 제대로 대응하지 못하는 과적합(overfitting) 현상을 초0으로 이어집니다.

문제점: "움직이는 타겟"인 선생님

이를 해결하기 위한 최근의 시도들은 "스마트한 선생님"을 도입했습니다. 이 선생님은 학생이 현재 배우고 있는 내용을 보고 "좋아, 이 답은 지금 학생이 이해할 수 있는 내용이니 여기에 집중하자. 저 답은 혼란스러우니 무시하자"라고 결정합니다.

논문은 이를 **온라인 재가중치 부여(online reweighting)**라고 부릅니다. 문제는 이 선생님이 불안정하다는 점입니다. 학생이 배우면서 그들의 뇌는 변하기 때문입니다. 이 "스마트한 선생님"은 사실 거울을 보고 있는 학생 자신의 뇌와 같습니다.

  • 함정: 만약 학생이 처음에 특정 유형의 답을 좋아하게 되면, 선생님은 계속해서 그것을 강화합니다. 반대로 학생이 어떤 유형을 싫어하게 되면, 선생님은 그것을 가르치지 않습니다.
  • 결과: 학생은 "부익부 빈익빈" 기계가 됩니다. 자신이 이미 좋아했던 몇 가지 일에는 매우 능숙해지지만, 문제를 해결하는 새롭고 다양한 방식들을 탐구하는 능력은 잃게 됩니다. 결국 학생은 경직되고, 이전에 가졌던 넓은 지식마저 잃어버리게 됩니다.

해결책: PriFT (고정된 참조점)

저자들은 PriFT(Prior-Support Guided Fine-Tuning)라고 불리는 새로운 방법을 제안합니다.

학생의 현재, 변화하는 뇌에 무엇을 배울지 묻는 대신, PriFT는 학생의 원래 사전 학습된 뇌(고정된 참조점)에게 조언을 구합니다.

이렇게 생각해 보십시오:

  • 기존 방식: 현재 스트레스를 받고 혼란스러워하는 학생에게 "내가 무엇을 공부해야 할까?"라고 묻는 것입니다. 학생은 "내가 이미 알고 있는 것들만!"이라고 대답할 수도 있습니다. 왜냐하면 새로운 것들에 대해 겁을 먹고 있기 때문입니다.
  • PriFT 방식: 학생의 "과거의 자아"(이 특정 수업을 시작하기 전의 버전)에게 "이 새로운 레슨 중 어떤 부분이 내가 이미 알고 있는 것과 잘 맞아떨어지는가?"라고 묻는 것입니다. 과거의 자아는 안정적이고 차분한 답변을 내놓습니다. "이 개념들은 네 기초와 잘 맞으니 여기에 집중해라. 하지만 나머지 부분들도 무시하지는 마라."

이 "과거의 자아"는 사전 지원(Prior Support) 신호를 제공합니다. 이는 모델에게 다음과 같이 알려줍니다. "이 토큰(단어)은 너의 원래 지식에 의해 뒷받침되므로 학습하기에 안전하다. 저 다른 토큰은 무리가 있으니 주의하라."

PriFT의 작동 방식 (두 가지 형태)

논문은 이 "과거의 자아"의 조언을 사용하는 두 가지 방법을 소개합니다.

  1. PriFT-prob (확률 체크): "과거의 자아"가 특정 단어를 말할 확률이 얼마나 높았는지를 살펴봅니다. 과거의 자아가 매우 확신했다면 그 단어에 높은 가중치를 부여합니다. 과거의 자아가 불확-실했다면 낮은 가중치를 부여합니다.
  2. PriFT-mass (군집 체크): 때때로 어떤 단어는 "쉬울" 수 있지만(과거의 자아가 99% 확신함), 그것이 반드시 가장 중요한 단어라는 뜻은 아닙니다. PriFT-mass는 "누적 질량(cumulative mass)"을 살펴봅니다. 이 방식은 "이 단어가 과거의 자아가 고려했던 가능한 선택지들 중 적어도 절반에 의해 뒷받침되는가?"라고 묻습니다. 이는 모델이 너무 쉽고 당연한 단어들만 배우는 것을 방지하고, 더 어렵고 중요한 추론 단계에 주목하도록 강제합니다.

결과: 이것이 왜 중요한가

저자들은 이 방법을 수학, 코딩, 의학 질문이라는 세 가지 어려운 과업에서 테스트했습니다.

  • 더 나은 일반화: PriFT로 훈련된 모델은 단순히 훈련 데이터를 암기하는 데 그치지 않고, 본 적 없는 새로운 문제를 해결하는 능력이 향상되었습니다.
  • 더 높은 다양성: 모델을 경직되게 만들었던 "온line" 방식과 달리, PriFT는 모델의 사고를 다양하게 유지했습니다. 이는 마치 여러 가지 도구가 들어있는 공구함을 유지하는 것과 같으며, 단 하나의 망치만을 가진 상태와는 다릅니다.
  • 강화 학습(RL)을 위한 더 나은 준비: 흔히 SFT 이후에 연구자들은 모델을 더 똑똑하게 만들기 위해 강화 학습(AI가 시행착오를 통해 배우는 비디오 게임과 같은 방식)을 사용합니다. 논문은 PriFT가 이 다음 단계를 위한 훨씬 더 좋은 "시작점"을 만들어준다는 것을 발견했습니다. PriFT는 모델의 초점을 너무 일찍 좁히지 않았기 때문에, 모델이 RL 게임을 시작할 때 더 많은 "성장 공간"을 가질 수 있었습니다.

핵심 요약

이 논문은 학습 과정을 유도하기 위해 모델의 현재, 변화하는 상태에 맡기는 대신, 고정되고 안정적인 참조점(모델의 원래 지식)을 사용함으로써 더 똑똑하고 유연한 AI를 얻을 수 있다고 주장합니다. 이는 자신의 현재 기분을 맹목적으로 따르는 학생과, 자신의 탄탄한 지식 기반을 참고하여 다음에 무엇을 배울지 결정하는 학생의 차이와 같습니다.

핵 핵심 요점: PriFT는 AI 모델이 자신의 정체성을 잊거나 사고가 편협해지지 않으면서도 새로운 기술을 배울 수 있도록 도와주며, 이를 통해 수학, 코딩, 의학 분야에서 더 뛰어난 성능을 발휘하고 향후 훈련에서 더 큰 성공을 거둘 수 있는 발판을 마련합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →