← 최신 논문
🤖 machine learning

Unlocking the Potential of Continual Model Merging: An ODE Perspective

본 논문은 매개변수 공간에서 저손실 경로를 추적하기 위해 상미분방정식 관점을 활용하여 catastrophic forgetting 을 효과적으로 완화하고 이질적 작업 벤치마크에서 기존 방법들을 능가하는 새로운 지속적 모델 병합 프레임워크인 ODE-M 을 제안한다.

원저자: Lihong Lin, Haidong Kang

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lihong Lin, Haidong Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터 셰프가 완벽한 이탈리아 파스타 요리를 만드는 법을 익혔다고 상상해 보세요. 그다음 일본 스시 마스터인 두 번째 셰프를 고용합니다. 마지막으로 멕시코 타코 전문인 세 번째 셰프를 고용합니다.

문제:
인공지능 (AI) 세계에서는 종종 우리 마스터 셰프들처럼 많은 일을 잘하는'기초 모델 (foundation models)'을 갖게 됩니다. 새로운 작업이 등장할 때 (예: 스시 만드는 법 배우기), 우리는 보통 셰프 전체를 처음부터 다시 훈련시키거나 새로운 지식을 기존 지식 위에 억지로 주입해야 합니다.

이 논문은**지속적 모델 병합 (Continual Model Merging)**에 대해 다룹니다. 이는 이탈리아 셰프, 스시 셰프, 타코 셰프의 기술을 처음부터 다시 훈련시키지 않고도 세 가지 모두 완벽하게 수행할 수 있는'슈퍼 셰프'하나로 결합하려는 시도와 같습니다.

기존 방식 (점프 방법):
이전 방법들은 이탈리아 셰프의 뇌와 스시 셰프의 뇌를 스냅샷으로 찍어 단순히 평균 내는 방식으로 이러한 셰프들을 병합하려 했습니다.

  • 결함: 이탈리아 셰프의 뇌가 계곡 (낮은 손실/우수한 성능) 에 있고, 스시 셰프의 뇌가 또 다른 계곡에 있다고 상상해 보세요. 두 지점을 단순히 직선으로 연결하면 그 사이에 가파르고 험한 산을 올라가야 할 수도 있습니다.
  • 결과: AI 가 그 직선을 따라 이동하려 할 때'손실 장벽 (산)'에 부딪힙니다. 스시를 배우려다 산에 갇혀 파스타 만드는 법을 잊어버리게 됩니다. 이를**파괴적 망각 (catastrophic forgetting)**이라고 합니다. 셰프를 더 많이 추가할수록 슈퍼 셰프는 원래 기술을 더 많이 잊게 됩니다.

새로운 아이디어 (ODE 방법):
저자들은ODE-M(Ordinary Differential Equation-driven Merging, 상미분방정식 기반 병합)이라는 새로운 방식을 제안합니다. 한 셰프에서 다른 셰프로 점프하는 대신, 두 뇌를 연결하는연속적인 경로또는 매끄러운 도로를 상상합니다.

간단한 비유를 들어 그들이 어떻게 하는지 설명하겠습니다:

  1. 매끄러운 도로 (모드 연결성, Mode Connectivity):
    이 논문은 셰프들이 서로 다르게 보이지만, 두뇌를 연결하는 숨겨진 매끄럽고 낮은 지대의 길이 존재하며 그 위에서는 둘 다 잘 요리할 수 있다고 가정합니다. 목표는 산 위를 가로지르는 직선이 아니라 이 도로를 찾는 것입니다.

  2. 속도 제한이 있는 GPS(속도장, Velocity Field):
    저자들은 이탈리아 스타일에서 스시 스타일로 슈퍼 셰프를 안내하는 GPS 와 같은'속도장 (velocity field)'을 만듭니다.

    • 문제: 때때로 GPS 는 차를 가파른 언덕 위로 몰아가려 합니다 (이는'손실'을 증가시키거나 요리 실력을 떨어뜨립니다).
    • 해결책: 시스템이 실시간으로 지형을 확인합니다. 앞길이 언덕으로 올라가기 시작하면 (손실 증가), 해당 방향에'브레이크'또는'감쇠기'를 적용합니다. 망각을 유발하는 이동 부분을 늦추면서도 차가 새로운 기술을 향해 전진하도록 허용합니다.
  3. 정지 신호 (작동점, Operating Point):
    항상 목적지 (새로운 셰프의 뇌) 까지 운전할 필요는 없습니다. 때로는 파스타 기술을 잃지 않으면서 스시 기술을 일부만 배우고 싶을 수도 있습니다.

    • 시스템은 매끄러운 도로 위 어느 지점에서든 차를 멈출 수 있게 합니다.
    • 새로운 작업이 매우 중요하면 더 멀리 운전합니다 (새로운 셰프에 더 가깝게).
    • 기존 작업이 더 중요하면 더 일찍 멈춥니다 (기존 지식을 더 많이 유지).
    • 이는'시간 스케줄 (time schedule)'로 제어되며, 이는 새로운 기술을 얼마나 흡수할지 대 기존 기술을 얼마나 유지할지 결정하는 다이얼 역할을 합니다.

왜 이것이 더 나은가요?

  • 산 등반 불필요: 낮은 손실의 매끄러운 경로를 따라가므로 AI 는 기존 기술을 잊게 만드는'산'을 올라갈 필요가 없습니다.
  • 제어: 사용자는 기존 지식을 깨뜨리지 않고 새로운 지식을 얼마나 추가할지 정확히 결정할 수 있는 다이얼을 제공합니다.
  • 결과: 그들의 테스트 (자동차, 꽃, 교통 표지판과 같은 이미지를 인식하는 AI 모델 사용) 에서 이 방법은 이전 어떤 방법보다 모든 작업을 기억하는 데 더 뛰어난'슈퍼 셰프'를 만들었습니다. 많은 새로운 레시피를 하나씩 추가할 때도 파스타 기술을 유지하면서 스시를 배웠습니다.

요약:
이 논문은 두 개의 서로 다른 AI 뇌를 무뎌진 도구로 억지로 합쳐서 (무언가를 부수는) 대신, 매끄럽고 안내된 경로를 사용하여 병합합니다. 이는 AI 를 (무언가를 잊게 만드는)'위험 구역'우회하도록 조종하는 신중한 항해자처럼 작동하며, 사용자에게 기존 기술과 새로운 기술을 균형 있게 유지하기 위해 그 경로를 얼마나 더 진행할지 정확히 결정할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →