← 최신 논문
🤖 machine learning

Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates

이 논문은 파인튜닝 목적 함수를 수정하지 않고 훈련 손실에 기반하여 학습률을 동적으로 조정함으로써 대규모 언어 모델에서 파국적 망각을 완화하는 손실 적응형 학습률 스케줄인 FINCH를 소개하며, 이를 통해 작업 성능을 유지하면서 망각을 크게 줄이는 성과를 달성합니다.

원저자: Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo, Babak Salimi

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo, Babak Salimi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 도서관의 거의 모든 책을 읽은 천재 학생이 있다고 가정해 봅시다. 이 학생은 역사, 과학을 알고 완벽한 에세이를 쓰는 법도 압니다. 이것이 초기 '사전 학습 (pretraining)'을 거친 후의 **대규모 언어 모델 (LLM)**입니다.

이제 이 학생에게 매우 구체적인 새로운 기술을 가르치고 싶다고 가정해 봅시다. 예를 들어 드문 방언을 말하거나 새로운 책에 등장하는 허구의 등장인물 목록을 외우는 것입니다. 이것이 **파인튜닝 (fine-tuning)**입니다.

문제: '덮어쓰기 (Overwrite)' 효과

이 논문은 **파괴적 망각 (Catastrophic Forgetting)**이라는 좌절스러운 문제를 지적합니다. 학생에게 이 새롭고 어려운 자료에 집중하도록 강요하면, 그들의 뇌는 기존 연결 고리를 '다시 작성'하기 시작합니다. 그들은 새로운 작업에는 능숙해지지만, 기존 지식을 잊기 시작합니다. 사실을 착각하거나 (할루시네이션), 잘못된 조언을 하거나, 과거에 능숙했던 간단한 지시사항을 따르지 못하게 될 수 있습니다.

기존 해결책들은 학생에게 다음과 같이 말하며 이를 해결하려 합니다: "이해하기 정말 어려운 새로운 수업 부분은 무시하고 쉬운 부분에만 집중하세요."

  • 결함: 이 논문은 이것이 나쁜 아이디어라고 주장합니다. 새로운 언어나 새로운 사실을 배우려면 반드시 어려운 부분과 씨름해야 합니다. 어려운 단어를 무시한다면, 실제로 새로운 기술을 배우지 못하게 됩니다.

해결책: FINCH (지능적인 속도 조절 전략)

저자들은 FINCH라는 새로운 방법을 소개합니다. FINCH는 학생이 무엇을 공부하는지를 바꾸는 것이 아니라, 얼마나 빠르게 공부하는지를 바꿉니다.

학습을 구불구불한 길을 운전하는 것에 비유해 봅시다:

  • 기존 방식 (표준 파인튜닝): 가속 페달을 일정한 속도로 누르고 있습니다. 날카롭고 어려운 커브 (높은 혼란/손실을 가진 '어려운' 데이터 배치) 를 만나면, 차가 회전하며 가드레일에 충돌할 수 있습니다 (기존 지식 망각).
  • FINCH 방식: FINCH는 앞쪽 도로를 살피는 지능형 크루즈 컨트롤처럼 작동합니다.
    • 도로가 험할 때 (높은 손실): 시스템이 학생이 어려운 개념과 씨름하고 있음을 감지합니다. 학습 속도를 늦춥니다 (작은 걸음을 내딛음). 이를 통해 학생은 균형을 잃거나 어디에서 왔는지 잊지 않고 험난한 부분을 신중하게 통과할 수 있습니다.
    • 도로가 매끄러울 때 (낮은 손실): 학생이 개념을 파악했습니다. FINCH는 학습 속도를 높입니다 (큰 걸음을 내딛음) 그래서 수업을 빠르게 마칠 수 있습니다.

핵심 발견

이 논문의 '아하!' 순간은 수학적 관찰에서 나옵니다: 망각의 위험은 해당 순간 모델이 얼마나 혼란스러운지에 직접적으로 비례합니다.

  • 모델이 매우 혼란스러울 때 (높은 손실), 큰 걸음은 기존 지식에 치명적인 충격을 줍니다.
  • 모델이 자신감이 있을 때 (낮은 손실), 안전하게 큰 걸음을 내딛을 수 있습니다.

FINCH는 단순히 이렇게 말합니다: "혼란스러울 때는 작고 신중한 걸음을 내딛고, 자신감이 있을 때는 크게 걸어가라."

결과: 양쪽 세계의 최고

이 논문은 세 가지 어려운 시나리오에서 이를 테스트했습니다:

  1. 새로운 사실 학습: 모델이 아직 본 적 없는 이름과 이야기를 가르치는 것.
  2. 드문 언어 학습: 학습 데이터가 매우 적은 갈리시아어 (Galician) 를 모델에게 가르치는 것.
  3. 과학 추론: 모델에게 복잡한 화학 개념을 가르치는 것.

결과:

  • 표준 방법들은 새로운 작업을 잘 배우면 다른 모든 것을 잊거나, 기존 지식을 기억하면 새로운 작업을 배우지 못했습니다.
  • FINCH는 표준 방법들과 마찬가지로 새로운 작업을 잘 배우면서도 망각을 93% 감소시켰습니다.

마치 학생이 새로운 방언을 완벽하게 배우면서도 역사, 과학, 안전에 대한 지식을 유지한 것과 같습니다. 그들은 새로운 것만 배운 것이 아니라, 신뢰할 수 있고 정직하게 남았으며, 그 과정에서 사실을 지어내지 않았습니다 (할루시네이션 방지).

요약

FINCH는 교육 과정을 바꾸거나 어려운 수업을 숨기지 않습니다. 단지 모델이 자신의 속도를 조절하도록 가르칩니다. 상황이 어려워질 때 속도를 늦춤으로써, 모델은 기존 기억을 지우지 않고 새로운 기술을 습득합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →