← 최신 논문
🤖 machine learning

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

이 논문은 독립적으로 학습된 수십억 개의 파라미터를 가진 트랜스포머 모델들을 정렬하기 위해 기능 보존적 가중치 변환을 적용함으로써, 언어와 시각 도메인 모두에서 장벽 없는 선형 모드 연결성(linear mode connectivity)과 효과적인 모델 병합을 가능하게 하는 새로운 듀얼 학습 프레임워크를 제안한다.

원저자: Tianyi Li, Zhiqiang Shen

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianyi Li, Zhiqiang Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 서로 다른 두 레시피의 결합

두 명의 마스터 셰프가 초콜릿 케이크라는 똑같은 요리를 완벽하게 만드는 법을 수년간 연마했다고 상상해 보세요. 두 사람 모두 케이크를 맛있게 만드는 법을 알고 있습니다. 하지만 그들은 서로 다른 주방에서 기술을 배웠고, 서로 다른 계량컵을 사용했으며, 재료를 배치하는 방식도 완전히 다릅니다.

  • 셰프 A는 밀가루를 왼쪽 그릇에, 설탕을 오른쪽 그릇에 둡니다.
  • 셰프 B는 밀가루를 오른쪽에, 설탕을 왼쪽에 둡니다.

만약 단순히 두 사람의 레시피를 중간 지점에서 "섞으려고" 한다면(이를 **선형 보간(linear interpolation)**이라고 합니다), 결과는 재앙이 됩니다. 밀가루 반 컵과 설탕 반 컵이 같은 그릇에 담길 수는 있겠지만, 지침이 서로 일치하지 않기 때문에 케이크는 무너져 내릴 것입니다. AI의 세계에서는 이를 **손실 장벽(loss barrier)**이라고 부릅니다. 즉, 결합된 모델이 제대로 작동하지 않고 에러율이 치솟는 지점을 말합니다.

문제점: "숨겨진" 차이점

오랫동안 과학자들은 이 두 셰프가 단순히 서로 다른 케이크를 만들고 있다고 생각했습니다. 하지만 이 논문은 그들이 사실 같은 케이크를 만들고 있으며, 단지 서로 다른 **대칭성(symmetries)**을 가지고 있을 뿐이라고 주장합니다.

AI에서 "대칭성"이란 순서를 바꾸더라도 결과가 변하지 않는 것을 의미합니다.

  • 순열(Permutation): 다른 단계들을 그에 맞춰 조정하기만 한다면, 단계의 순서를 바꿀 수 있습니다 (예: 우유를 넣기 전과 후의 순서 변경).
  • 스케일링(Scaling): 양을 조절하기 위해 아주 큰 숟가락이나 아주 작은 숟가락을 사용할 수 있습니다.

문제는 두 AI 모델을 각각 따로 훈련시키면, 자연스럽게 서로 다른 "섞임(shuffle)" 상태에 빠지게 된다는 점입니다. 만약 이러한 섞임 상태를 먼저 해결하지 않고 모델을 혼합하려고 하면, AI는 혼란에 빠지게 됩니다.

기존의 해결책: 한쪽 방향의 조정

기존 방법들은 셰프 B의 레시피를 셰프 A의 모습에 강제로 맞추는 방식으로 이 문제를 해결하려 했습니다. 그들은 이렇게 말하는 식입니다. "좋아, 셰프 B, 셰프 A와 맞추기 위해 설탕을 왼쪽으로 옮겨."

이 방법은 어느 정도 도움이 되지만, 마치 사각형 못을 둥근 구멍에 억지로 끼워 넣는 것과 같습니다. 셰프 B는 셰프 A의 특정 주방 구조에 맞추기 위해 자신의 스타일 전체를 뒤틀어야 합니다. 효과는 있지만, 결과물인 "중간" 레시피는 여전히 실패할 위험이 높습니다.

새로운 해결책: "이중 댄스" (LMC-DM)

이 논문은 **이중 학습 매칭(Dual Learned Matching)**이라는 새로운 방법을 소개합니다. 한 셰프가 다른 셰프를 따라 하도록 강요하는 대신, 두 셰프가 중간에서 만나기로 합의하는 방식입니다.

무도회장을 상상해 보세요. 셰프 A가 가만히 서 있고 셰프 B가 그에게 맞추려고 노력하는 대신, 두 셰프가 서로를 향해 춤을 추며 다가갑니다.

  1. 두 셰프 모두 재료를 정리하는 새로운 방식을 배웁니다 (자신의 "대칭성"을 조정합니다).
  2. 두 사람의 발걸음이 완벽하게 일치하는 공유된 중립적 주방 레이아웃을 향해 이동합니다.
  3. 일단 정렬이 되면, 레시피를 부드럽게 혼합할 수 있습니다.

두 셰프 모두 유연하게 움직이며 공통의 목표를 향해 나아가기 때문에, "중간" 지점은 더 이상 재앙의 구역이 아닙니다. 그곳은 원래의 케이크만큼이나 맛있는 케이크를 만들 수 있는 부드럽고 안전한 경로가 됩니다.

실제 연구 결과

연구진은 이 거대한 AI 모델들(수십억 개의 파라미터를 가진 모델, 이는 수백만 개의 재료가 있는 주방과 같습니다)을 대상으로 테스트를 진행했습니다.

  • 결과: 이 "이중 댄스" 방법을 사용했을 때, "재앙의 구역"(손실 장벽)이 거의 완전히 사라졌습니다.
  • 시각 모델(Vision Models): 이미지 인식 모델(고양이나 개를 식별하는 모델 등)을 테스트했습니다. 두 가지 서로 다른 모델을 혼합하더라도, 결합된 모델은 전체 과정 동안 높은 정확도(69% 이상)를 유지했습니다.
  • 언어 모델(Language Models): 텍스트 생성 모델(이야기를 쓰는 모델 등)을 테스트했습니다. 중간 규모의 모델의 경우 에러율이 거의 제로에 가까웠습니다. 수십억 개의 파라미터를 가진 거대 모델의 경우에도 에러는 매우 작았습니다.

시사점

이 논문은 거대 AI 모델들이 고립된 섬이 아니라는 것을 증명합니다. 그들은 사실 숨겨진 경로로 연결되어 있습니다. 한 모델이 다른 모델을 억지로 복제하도록 만드는 대신, 두 모델이 스스로를 조정하여 중간에서 만나게 한다면, 모델들을 매끄럽게 병합할 수 있습니다.

이는 우리가 서로 다른 두 가지 고도로 훈련된 AI 모델을 처음부터 다시 훈련시키거나 복잡한 새로운 구조를 만들 필요 없이, 하나의 강력한 모델로 결합할 수 있음을 의미합니다. 이는 마치 두 가지 서로 다른 언어가 사실은 같은 언어의 다른 방언임을 깨닫는 것과 같습니다. 약간의 유연성만 있다면 두 언어를 모두 구사하여 서로를 완벽하게 이해할 수 있는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →