← 최신 논문
💬 NLP

Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model Merging

본 논문은 태스크 간의 간섭을 완화하고 여러 LoRA 적응 언어 모델의 병합 성능과 강건성을 크게 향상시키기 위해, 미세 조정 이전에 LoRA 부공간을 제약하는 방법인 OSRM(Orthogonal Subspaces for Robust model Merging)을 제안한다.

원저자: Haobo Zhang, Jiayu Zhou

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haobo Zhang, Jiayu Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "너무 많은 요리사" 시나리오

상상해 보세요. 당신에게는 모든 요리를 할 줄 아는 아주 똑똑하고 다재다능한 셰프(거대 언어 모델, LLM)가 있습니다. 하지만 이 셰프가 특정 요리를 완벽하게 해내도록 만들기 위해, 각기 다른 전문 요리사(부주방장)들을 고용하여 특정 레시피를 가르칩니다.

  • 부주방장 A는 셰프에게 완벽한 이탈리아 파스타 만드는 법을 가르칩니다.
  • 부주방장 B는 셰프에게 완벽한 일본식 초밥 만드는 법을 가르칩니다.
  • 부주방장 C는 셰프에게 완벽한 프랑스 디저트 만드는 법을 가르칩니다.

AI의 세계에서 이러한 "레슨(배움)"은 LoRA(Low-Rank Adaptation)라고 불립니다. 이는 메인 셰프의 기억 전체를 새로 쓰는 대신, 뇌를 미세하게 조정하는 작고 효율적인 추가 요소들입니다.

문제점:
보통, 이 세 가지를 모두 할 줄 아는 셰프를 원한다면, 세 개의 별도 주방(세 개의 별도 모델)을 운영해야 합니다. 이는 비용이 많이 들고 공간도 많이 차지합니다.

그래서 연구자들은 새로운 아이디어를 시도했습니다: 모델 병합(Model Merging). 그들은 "파스타 뇌", "초밥 뇌", "디저트 뇌"를 가져와서 하나의 단일한 "슈퍼 셰프"로 합치려고 시도했습니다.

재앙:
하지만 이 뇌들을 하나로 합쳤을 때, 결과는 엉망진창이었습니다. 슈퍼 셰프는 파스타를 만들려다가 실수로 간장(초밥 레슨에서 온 것)을 넣었습니다. 초밥을 만들 때는 버터(디저트 레슨에서 온 것)를 너무 많이 넣었습니다. 레슨들이 서로 **간섭(Interference)**했기 때문에 성능이 폭락했습니다.

논문의 해결책: "방음실"

저자인 장하오(Haobo Zhang)와 저우자위(Jiayu Zhou)는 문제가 단순히 뇌를 어떻게 섞느냐의 문제가 아니라, 애초에 레슨이 어디에 저장되느냐의 문제라는 것을 깨달았습니다.

그들은 OSRM(Orthogonal Subspaces for Robust model Merging)이라는 새로운 방법을 제안합니다.

비유: 지식의 도서관
셰프의 뇌를 수많은 선반이 있는 거대한 도서관이라고 상상해 보세요.

  • 기존 방식: 부주방장 A(파스타)가 셰프를 가르칠 때, 그들은 1번 선반에 노트를 적었습니다. 부주방장 B(초밥)가 가르칠 때도 그들은 1번 선반에 파스타 노트 바로 옆에 노트를 적었습니다. 나중에 도서관에서 노트를 읽으려 할 때, 내용이 뒤섞여 있었습니다. 이것이 국수에 관한 노트인지 밥에 관한 노트인지 구분할 수 없었습니다.
  • OSRM 방식: 셰프들이 가르치기 시작하기 전에, OSRM은 사서 역할을 하여 방음실(직교 부공간, Orthogonal Subspaces)을 배정합니다.
    • 파스타 셰프에게는 이렇게 말합니다: "당신은 1번 선반에만 글을 쓸 수 있습니다."
    • 초밥 셰프에게는 이렇게 말합니다: "당신은 2번 선반에만 글을 쓸 수 있습니다."
    • 디저트 셰프에게는 이렇게 말합니다: "당신은 3번 선반에만 글을 쓸 수 있습니다."

결정적으로, 논문은 이 "선반"들이 데이터(재료)를 기반으로 선택된다고 설명합니다. 사서는 파스타 재료를 살펴보고 말합니다. "좋아요, 1번 선반은 파스타 노트가 초밥 노트와 실수로 섞이지 않을 유일한 장소입니다."

레슨이 시작되기 전부터 이 레슨들을 별개의, 겹치지 않는 "방"에서 진행하도록 강제함으로써, 최종적인 "슈패 셰프"는 노트가 엉키지 않고도 모든 지식에 접근할 수 있게 됩니다.

작동 원리 (The "Magic Trick")

  1. 먼저 데이터를 살펴보기: AI가 새로운 작업을 배우기 전에, 이 방법은 해당 작업의 몇 가지 예시(예: 파스타 레시피 문장 몇 개)를 살펴봅니다.
  2. "조용한 구역" 찾기: 새로운 레슨이 기존 레슨과 부딪힐 가능성이 가장 낮은 특별한 수학적 방향(부공간)을 계산합니다. 이는 시끄러운 방 안에서 조용한 구석을 찾는 것과 같습니다.
  3. 문 잠그기: AI가 오직 그 조용한 구석에서만 새로운 작업을 배우도록 강제합니다.
  4. 쉽게 병합하기: 모델을 결합할 때, 모두가 각자의 조용한 구석에서 배웠기 때문에 노트가 충돌하지 않습니다. 단순히 그것들을 더하기만 하면 "슈퍼 셰프"가 완벽하게 작동합니다.

논문의 연구 결과

저자들은 다양한 AI 모델(작은 모델부터 Llama와 같은 매우 큰 모델까지)을 사용하여 8가지 유형의 언어 작업(문법 이해, 감성 분석, 질문 답변 등)에 대해 테스트했습니다.

  • 더 나은 병합: OSRM을 사용했을 때, "슈퍼 셰프"는 이전 방식들에 비해 여러 작업을 동시에 수행하는 능력이 훨씬 뛰어났습니다. "파스타에 간장을 넣는" 문제가 거의 사라졌습니다.
  • 단일 작업에서도 여전히 우수함: 비록 레슨을 특정 구석으로 몰아넣었음에도 불구하고, 셰프들은 개별 작업(파스타, 초밥 또는 디저트)에 대해 이전과 마찬가지로 뛰어난 실력을 유지했습니다.
  • 강건함(Robust): 이 방법은 설정을 약간 변경하더라도 잘 작동했습니다. 완벽한 튜닝이 필요하지 않았으며, 매우 신뢰할 수 있었습니다.

핵심 요약

이 논문은 AI 모델을 결합할 때 발생하는 "충돌하는 레슨" 문제를 해결합니다. 모델이 결합된 에 엉망이 된 것을 고치려 노력하는 대신, 각 작업에 모델의 뇌 속에 자신만의 "방음실"을 배정함으로써 문제가 발생하는 것을 사전에 방지합니다.

이를 통해 우리는 매번 새로운 작업을 위해 별도의 모델을 저장할 필요 없이, 하나의 단일하고 강력한 AI 모델이 여러 가지 일을 잘 수행할 수 있도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →