← 최신 논문
🔢 mathematics

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

본 논문은 "옵티마이저-모델 일관성" 개념을 제시하여, 사전 학습과 전체 파인튜닝에 동일한 옵티마이저를 사용할 때 다른 옵티마이저나 LoRA 에 비해 파국적 망각이 감소하고 학습-망각 트레이드오프가 개선됨을 입증하는 동시에, Muon 과 같은 특정 옵티마이저가 암기 경향성으로 인해 추론 작업에서 저조한 성능을 보일 수 있음을 밝혀냅니다.

원저자: Yuxing Liu, Jianyu Wang, Tong Zhang

게시일 2026-05-08
📖 4 분 읽기🧠 심층 분석

원저자: Yuxing Liu, Jianyu Wang, Tong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 거대한 도서관의 모든 책을 수년 동안 읽은 천재 학생이 있다고 가정해 봅시다 (이것이 사전 학습입니다). 이 학생은 일반적인 지식, 문법, 그리고 세상을 사고하는 방법을 배웠습니다. 이제 당신은 이 학생에게 수학 문제 풀이나 컴퓨터 코드 작성과 같은 구체적인 새로운 기술을 가르치고 싶어 합니다 (이것이 지도 미세 조정 또는 SFT입니다).

큰 도전 과제는 다음과 같습니다: 도서관에서 배운 모든 것을 잊지 않게 하면서 이 새로운 기술을 어떻게 가르칠 수 있을까요? 만약 그들이 수학에 너무 집중한다면, 간단한 이야기를 쓰는 방법을 잊기 시작할지도 모릅니다. 이를 **"학습 - 망각 트레이드오프"**라고 합니다.

이 논문은 이 학생을 최적으로 가르치는 방법에 대한 놀라운 규칙을 발견했는데, 그것은 무엇을 가르치는지뿐만 아니라 어떻게 가르치는지와 관련이 있습니다.

주요 발견: "같은 교사, 같은 스타일"

저자들은 새로운 기술을 가르치는 최선의 방법은 도서관에서 수년 동안 읽는 동안 사용된 **정확히 같은 교수법 (옵티마이저)**을 사용하는 것이라고 발견했습니다.

  • 유사성: 학생이 특정 방법, 예를 들어 "방법 A"(텍스트 강조와 메모를 취하는 구체적인 방식) 를 사용하여 읽는 법을 배웠다고 상상해 보세요. 만약 "방법 B"(완전히 다른 방식의 강조와 메모) 를 사용하여 수학을 가르치려고 한다면, 학생은 혼란을 겪게 됩니다. 그들은 수학을 배울 수는 있지만, 수년간의 연습으로 뇌에 각인된 방식과 새로운 방식이 충돌하기 때문에 읽기 능력을 잊기 시작할 수 있습니다.
  • 발견: 만약 수학 수업에서도 "방법 A"를 고수한다면, 학생은 수학을 배우면서도 읽기 능력을 온전하게 유지합니다. 이 논문은 이를 **"옵티마이저 - 모델 일관성"**이라고 부릅니다.

왜 이런 일이 발생할까요? ("뇌의 형태" 이론)

이 논문은 서로 다른 교수법이 실제로 학생의 뇌 (모델의 내부 가중치) 를 서로 다른 방식으로 형성한다고 설명합니다.

  1. 서로 다른 형태: 일부 교수법 (가장 일반적인 AdamW 등) 은 뇌를 "희소"하거나 "효율적"이도록 훈련시킵니다. 이는 책이 깔끔하게 정리되어 책 사이에 빈 공간이 있는 도서관과 같습니다. 다른 방법들 (새롭고 세련된 방법인 Muon 등) 은 뇌를 "밀집"되도록 훈련시킵니다. 이는 책이 빽빽하게 꽂혀 있는 도서관과 같습니다.
  2. 불일치: 만약 수년간 뇌를 "희소"하게 훈련시킨 후, 갑자기 수학을 위해 "밀집"된 교수법으로 전환하면, 뇌는 전체 구조를 재배열하느라 허둥지둥하게 됩니다. 이 혼란은 오래된 책들을 떨어뜨리게 만들어 (망각을 유발합니다).
  3. 일치: 만약 수학에서도 "희소"한 방법을 계속 사용한다면, 뇌는 기존 선반에 새로운 책들을 추가할 뿐입니다. 도서관을 다시 짓지 않아도 되므로 망각이 적습니다.

LoRA 의 놀라운 사실

LoRA(저랭크 적응)라는 인기 있는 단축키가 있습니다. LoRA 는 학생이 주된 도서관 책들을 건드리지 않고 수학 답안을 적을 수 있는 작고 별도의 공책을 주는 것과 같습니다. 많은 사람들이 이것이 망각을 피하는 최선의 방법이라고 생각했습니다.

논문의 반전: 저자들은 LoRA 가 좋기는 하지만, 전체 재학습(뇌 전체를 다시 쓰는 것)을 이전과 같은 교수법을 사용하여 수행하는 것이 실제로 더 낫다고 발견했습니다.

  • 유사성: LoRA 는 별도의 공책을 들고 다니는 것과 같습니다. 작동은 하지만, 같은 교수 스타일을 사용하여 주된 뇌를 다시 쓴다면, 단순히 사이드 공책만 사용하는 것보다 새로운 수학을 받아들이면서도 이전의 읽기 능력을 훨씬 더 효과적으로 유지할 수 있습니다.

"암기형" (Muon) 의 사례

이 논문은 Muon이라는 구체적이고 고급스러운 교수법도 살펴보았습니다.

  • 장점: Muon 은 도서관 단계 (사전 학습) 에서 훌륭합니다. 이는 학생이 사실을 놀라울 정도로 잘 암기하도록 돕습니다.
  • 단점: 매우 적은 데이터로 새로운 추론 기술 (예: 수학) 을 배울 때 Muon 은 "단순 암기형"이 되는 경향이 있습니다. 이는 근본적인 패턴을 배우기보다 본인이 보는 구체적인 수학 문제들을 암기하려고 시도합니다.
  • 결과: 만약 Muon 을 전체 여정 (도서관 + 수학) 에 걸쳐 사용한다면, 학생은 사실을 암송하는 데는 뛰어나지만 새로운, 보지 못한 수학 문제를 푸는 데는 어려움을 겪을 수 있습니다. 그들은 예제들을 암기했지만 논리는 배우지 못했습니다.

쉬운 영어로 요약

  1. 일관성이 핵심입니다: 새로운 기술을 배우면서 이전 것들을 잊지 않으려면, 원래 모델을 훈련시킬 때 사용했던 동일한 학습 알고리즘 (옵티마이저) 을 계속 사용해야 합니다.
  2. 스타일을 바꾸지 마세요: 학습 알고리즘을 중간에 변경하면 모델이 "뇌"를 재구성하도록 강요하게 되어 이전 지식을 잃게 됩니다.
  3. 전체 재학습 > 단축키: 때로는 LoRA 와 같은 단축키를 사용하는 것보다 올바른 알고리즘으로 전체 재학습을 수행하는 것이 더 낫습니다. 이는 모델의 뇌가 원래 어떻게 구축되었는지와 더 잘 부합하기 때문입니다.
  4. 과도한 암기에 주의하세요: 일부 고급 알고리즘 (Muon 등) 은 암기에는 뛰어나지만 데이터가 부족할 때 새로운 패턴을 배우는 데는 더 나쁠 수 있습니다.

이 논문은 새로운 것을 배우고 오래된 것을 기억하는 것 사이의 최상의 균형을 원한다면, 처음에 시작했던 같은 교사를 고수해야 한다고 결론 내립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →