← 최신 논문
🤖 machine learning

Model Fusion via Retrofitting

본 논문은 중간 뉴런을 그룹화하고 속성 점수를 활용하여 중요한 특징을 정렬함으로써 융합을 표현 매칭 문제로 간주하는 뉴런 중심 모델 융합 프레임워크를 제시하며, 이는 VGG, ResNet, ViT 등 다양한 아키텍처에서 재학습 없이 기존 방법들, 특히 제로샷 및 비 IID 시나리오에서 우수한 성능을 달성합니다.

원저자: Phoomraphee Luenam, Andreas Spanopoulos, Amit Sant, Thomas Hofmann, Sotiris Anagnostidis, Sidak Pal Singh

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Phoomraphee Luenam, Andreas Spanopoulos, Amit Sant, Thomas Hofmann, Sotiris Anagnostidis, Sidak Pal Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 명의 전문가 셰프가 각자만의 독특한 레시피를 수년 동안 다듬어 왔다고 상상해 보세요. 셰프 A 는 이탈리아 요리를 전문으로 하고, 셰프 B 는 일본 요리를 전문으로 합니다. 그들은 한 번도 함께 일해 본 적이 없으며, 서로 다른 도구를 사용하고, 심지어 재료를 측정하는 단위조차 다를 수 있습니다.

이제 이탈리아 요리와 일본 요리 모두 완벽하게 조리할 수 있는 단일 '마스터 셰프'를 만들고 싶다고 가정해 봅시다. 하지만 그들에게는 요리 학교로 돌아가 처음부터 모든 것을 다시 배우라고 요청할 수 없습니다. 단순히 그들의 기존 지식을 한 사람 안에 즉시 통합하고 싶을 뿐입니다.

이것이 바로 모델 퓨전 (Model Fusion) 의 문제입니다. 인공지능 (AI) 세계에서는 종종 별도로 훈련된 서로 다른 신경망 (즉, '셰프들') 을 가지고 있습니다. 우리는 새로운 데이터로 재훈련하는 비용이 많이 들고 시간이 오래 걸리는 과정 없이, 이들을 하나의 강력한 모델로 병합하고 싶어 합니다.

문제: '언어 장벽'

이 논문은 단순히 두 모델의 가중치를 평균내는 것 (레시피 책을 페이지별로 섞는 것과 같음) 은 보통 실패한다고 설명합니다. 그 이유는 무엇일까요? 비록 유사한 데이터로 훈련되었더라도, 그들은 서로 다른 방식으로 학습하기 때문입니다.

  • '순열 (Permutation)' 문제: 셰프 A 의 '향신료 선반'에서 '커민'이 상단 서랍에 있는 반면, 셰프 B 의 '커민'은 하단 서랍에 있다고 상상해 보세요. 단순히 서랍들을 평균 내면 의미가 없는 지저분한 혼합물이 됩니다. AI 뉴런 (즉, '재료들') 은 서로 다른 순서와 위치에 있기 때문입니다.
  • '제로샷 (Zero-Shot)' 도전: 대부분의 기존 방법들은 셰프들이 유사한 배경을 가지고 있을 때는 괜찮게 작동합니다. 하지만 그들이 완전히 다른 데이터 (하나는 이탈리아 음식, 다른 하나는 일본 음식) 로 훈련된 경우, 기존 방법들은 처참하게 실패합니다. 결합된 모델은 혼란스러워져 개별 셰프들보다 성능이 떨어집니다.

해결책: '타겟 (Target)'을 통한 '리트로핏 (Retrofitting)'

저자들은 리트로핏을 통한 모델 퓨전 (Model Fusion via Retrofitting) 이라는 새로운 방법을 제안합니다. 단순히 셰프들을 평균내는 대신, 번역가와 코치 역할을 하는 교묘한 두 단계 과정을 사용합니다.

1 단계: '그룹화' (쌍둥이 찾기)

먼저, 알고리즘은 뉴런들 (뉴런은 인간의 뇌에 있는 개별 뉴런과 같거나, 셰프들의 특정 '기술'과 같습니다) 이 데이터를 볼 때 실제로 무엇을 하고 있는지 살펴봅니다.

  • 셰프 A 와 셰프 B 의 유사한 뉴런들을 서로 그룹화합니다.
  • 창의적인 전환: 논문은 뉴런 귀속 점수 (Neuron Attribution Scores) 를 도입합니다. 모든 재료가 동등하게 중요한 것은 아니라고 상상해 보세요. 어떤 향신료는 맛에 결정적이지만, 다른 것들은 단순히 장식일 뿐입니다. 알고리즘은 어떤 뉴런이 '스타 플레이어 (높은 중요도)'이고 어떤 것이 '벤치 워머 (낮은 중요도)'인지 식별합니다.
  • 그런 다음 각 그룹마다 '타겟 (Target)' 을 생성합니다. 이는 그룹화된 뉴런들의 중요도에 따라 가중치를 둔, 완벽한 평균을 나타내는 '골드 스탠더드' 레시피 카드라고 생각하세요.

2 단계: '리트로핏' (코치)

이제 알고리즘은 새로운 '마스터 셰프' (퓨전된 모델) 를 구축합니다. 단순히 기존 셰프들을 복사하는 것이 아니라, 방금 생성한 그 '골드 스탠더드 타겟'들과 일치하도록 새로운 모델의 레이어를 훈련시킵니다.

  • 새로운 견습생을 데려와서 "셰프 A 나 셰프 B 를 단순히 복사하지 마세요. 우리가 설계한 이 특정 타겟 요리를 보세요. 당신의 출력이 이 타겟과 완벽하게 일치할 때까지 요리를 조정하세요"라고 말하는 것과 같습니다.
  • 이는 네트워크의 하단에서 상단까지 레이어별로 발생합니다.

이것이 더 나은 이유 (결과)

이 논문은 다양한 AI 아키텍처 (VGG, ResNet, Vision Transformers 등) 에서 이를 테스트하여 다음을 발견했습니다:

  1. 다른 방법들이 실패할 때 작동합니다: '제로샷' 시나리오 (새로운 데이터에 대한 추가 훈련 없이 모델을 병합하는 경우) 에서 기존 방법들은 종종 무작위 추측으로 붕괴됩니다. 저자들의 방법은 모델이 완전히 겹치지 않는 서로 다른 데이터 (한 모델은 빨간 차만 보고 다른 모델은 파란 차만 보는 '샤어드 (Sharded)' 설정과 같은 경우) 로 훈련되었더라도 높은 정확도를 유지합니다.
  2. 중요성을 존중합니다: '뉴런 귀속 점수'를 사용함으로써, 이 방법은 덜 중요한 특징들의 노이즈에 묻히지 않고 원래 모델들의 가장 중요한 특징들이 보존되도록 보장합니다.
  3. 유연합니다: 이는 하나의 특정 유형이 아닌 다양한 유형의 AI 아키텍처에서 작동합니다.

트레이드오프

이 논문은 이 방법이 '빠르고 성의 없는' 평균화 방법보다 약간 느리고 계산량이 많음을 인정합니다. 그러나 그들은 이것이 가치가 있다고 주장합니다:

  • 다른 방법들은 작동하려면 보통 몇 시간에서 며칠의 추가 미세 조정 (fine-tuning) 이 필요한 반면, 이 방법은 즉시 사용 가능한 모델을 생산합니다 (제로샷).
  • 장기적으로 보면, 고장 난 모델을 수리하는 데 소요되는 시간을 절약하는 것이 초기 퓨전에 소요된 추가 시간을 상쇄합니다.

요약 비유

  • 구식 방법: 서로 다른 두 언어를 단어 대 단어 번역하여 세 번째 언어로 옮기고, 의미가 유지되기를 바랍니다. 이는 보통 말도 안 되는 소리로 끝납니다.
  • 신식 방법 (리트로핏): 두 셰프가 모두 이해하는 핵심 개념들 ('타겟') 을 식별하고, 중요도에 따라 값을 부여한 후, 새로운 셰프에게 그 특정 통일된 언어를 완벽하게 구사하도록 가르칩니다.

이 논문은 이 접근 방식이 처음부터 다시 훈련할 필요 없이, 매우 다른 독립적인 AI 모델들을 효과적으로 결합할 수 있게 해준다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →