← 최신 논문
🤖 machine learning

Curvature-Guided Mixing for MLLM Adaptation

본 논문은 2차 헤시안 근사(second-order Hessian approximations)를 활용하여 최적의 파라미터 혼합 비율을 분석적으로 도출함으로써, 멀티모달 거대 언어 모델(Multimodal Large Language Models)에서 작업 특화와 일반 지식 유지 사이의 균형을 효과적으로 조절하고 치명적 망각(catastrophic forgetting)을 완화하는 이론적 근거를 갖춘 프레임워크인 곡률 가이드 혼합(Curvature-Guided Mixing, CGM)을 제안한다.

원저자: Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: 똑똑한 모델의 "건망증"

당신에게 역사, 과학, 예술, 문학에 대해 모르는 게 없는 아주 박식하고 잘 읽는 사서(사전 학습된 모델)가 있다고 상상해 보세요. 이들은 일반적인 전문가입니다.

이제 당신은 이 사서에게 요리(미세 조정 작업) 분야의 세계적인 전문가가 되도록 훈련시키고 싶습니다. 당신은 그들을 요리 학교로 데려갑니다. 그들은 레시피, 칼질 기술, 맛의 프로필을 놀라울 정도로 잘 배우게 됩니다.

하지만 문제가 하나 있습니다. 졸업할 때쯤 그들은 역사나 과학에 대해 말하는 법을 잊어버렸습니다. 이제 그들은 훌륭한 요리사이지만, 형편없는 사서가 되었습니다. AI의 세계에서는 이를 **파괴적 망각(Catastrophic Forgetting)**이라고 부릅니다. 모델이 새로운 기술은 배우지만, 기존의 일반적인 지식은 잃어버리는 현상입니다.

기존의 해결책: 추측과 무작위성

이전에 과학자들은 이를 해결하기 위해 다음과 같은 방법을 시도했습니다:

  1. 블렌딩(Blending): "요리사" 모델과 "사서" 모델을 무작위로 섞는 것입니다. (두 종류의 수프를 섞고 맛이 맞기를 바라는 것과 같습니다.)
  2. 휴리스틱(Heuristics): "변화가 가장 적었던 가중치를 유지하라"와 같은 단순한 규칙을 사용하는 것입니다. (마치 "거의 움직이지 않은 것은 건드리지 마라"라고 말하는 것과 같습니다.)

이 논문은 이러한 방식들이 마치 추측하는 것과 같다고 주장합니다. 이 방법들은 왜 그런 방식으로 섞어야 하는지에 대한 탄탄한 수학적 근거가 없으며, 균형을 유지하는 데 자주 실패합니다.

새로운 해결책: 곡률 가이드 혼합 (Curvature-Guided Mixing, CGM)

저자들은 **곡률 가이드 혼합(CGM)**이라는 새로운 방법을 제안합니다. 이를 이해하기 위해 모델의 "지식"을 언덕과 골짜기가 있는 지형(landscape)이라고 상상해 보세요.

  • 골짜기: 골짜기의 바닥은 모델이 실수를 가장 적게 하는 곳(최저 손실 지점)입니다.
  • 모양: 어떤 골짜기는 넓고 평평합니다 (주변을 걸어 다녀도 떨어지지 않습니다). 다른 골짜기는 좁고 날카롭습니다 (칼날처럼 생겨서, 아주 조금만 움직여도 절벽 아래로 떨어집니다).

"곡률"의 비유:
"요리" 지식은 좁고 날카로운 골짜기라고 상상해 보세요. 중심에서 조금만 벗어나도 요리 기술을 즉시 잃게 됩니다.
"일반 지식"은 넓고 평평한 골짜기라고 상상해 보세요. 주변을 조금 움직여도 여전히 역사를 알고 있습니다.

CGM의 작동 방식 ("소프트 믹스"):
두 모델을 맹목적으로 섞는 대신, CGM은 모델의 뇌를 구성하는 모든 조각(모든 파라미터)에 대해 이 골짜기들의 모양을 살펴봅니다.

  • 만약 특정 뇌 조각이 요리에 대해 날카로운 골짜기에 있다면, CGM은 이렇게 말합니다: "이 조각의 요리 버전을 유지하라! 너무 민감해서 변화시키기에 위험하다."
  • 만약 어떤 조각이 역사에 대해서는 날카로운 골짜기에 있지만 요리에 대해서는 평평한 골짜기에 있다면, CGM은 이렇게 말합니다: "역사 버전을 유지하라! 이는 기존 기술에 매우 중요하다."
  • CGM은 해당 조각의 지형이 얼마나 "날카로운지" 또는 "평평한지"를 바탕으로 모든 뇌 조각에 대한 완벽한 "혼합 비율"을 계산합니다.

이는 **소프트 믹스(Soft Mix)**를 만들어냅니다: 새로운 작업에 필요한 날카로운 기술과 기존 작업에 필요한 평평한 기술을 모두 유지하는 완벽한 조화의 새로운 모델입니다.

"하드 믹스" (CGM†): 외과의사의 접근법

저자들은 때때로 (변할 필요가 없는 부분까지 포함하여) 모든 것을 섞는 것이 위험할 수 있다는 점을 깨달았습니다. 이는 시계를 고치기 위해 모든 톱니바퀴를 갈아내는 것과 같습니다.

그래서 그들은 CGM† (하드 믹스)를 만들었습니다.

  • 전략: 혼합하는 대신, 이것은 외과의사처럼 행동합니다. 이들은 "날카로움" 점수를 보고 결정합니다: "이 특정 부분들에 대해서는 요리 버전을 유지하고, 저 다른 부분들에 대해서는 역사 버전으로 되돌려 놓겠다(revert)."
  • 결과: 이 방법은 모델의 아주 작은, 핵심적인 비율(예: 10%)만을 변경합니다. 나머지 대부분은 원래의 "사서" 상태 그대로 둡니다.

무엇을 발견했는가?

저자들은 이 방법을 LLaVA와 Qwen이라는 두 가지 유명한 AI 모델에 테스트하였으며, 이미지에 대한 질문 답변이나 캡션 작성과 같은 다양한 작업을 수행했습니다.

  1. 더 나은 균형: 그들의 방법(CGM 및 CGM†)은 이전 방식들보다 일관되게 더 나은 성과를 보였습니다. 기존의 일반 지식을 잊어버리게 만들지 않으면서도 새로운 작업에 능숙하게 만들었습니다.
  2. 효율성: "하드 믹스"(CGM†)는 매우 효율적이었습니다. 그들은 최상의 결과를 얻기 위해 모델 파라미터의 약 **10%**만을 변경하면 된다는 것을 발견했습니다. 나머지 90%는 원래의 똑똑한 모델 상태 그대로 유지되었습니다.
  3. 구조: 그들이 모델의 어느 부분이 변했는지 살펴보았을 때, 그것은 무작위가 아니었습니다. 모델은 특정 데이터 그룹(예: 스프레드시트의 특정 열)을 변경했습니다. 이는 "곡률" 수학이 유지하거나 변경해야 할 올바른 구조적 구성 요소를 실제로 찾아냈음을 증명합니다.

요약

CGM을 주방의 온도(곡률)에 따라 수프에 소금을 얼마나 넣을지 정확히 아는 마스터 셰프라고 생각하세요.
**CGM†**를 신체의 나머지 부분을 절개하지 않고도 문제를 해결하기 위해 정확히 어떤 신경 하나를 건드려야 하는지 아는 마스터 외과의사라고 생각하세요.

두 방법 모두 학습 과정의 "모양"을 사용하여, AI가 새로운 것을 배울 때 자신이 누구였는지를 잊지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →