← 최신 논문
🤖 machine learning

Multi-Objective Bayesian Optimization for Model Merging

이 논문은 여러 모델을 가중치 공간에서 결합하기 위한 병합 파라미터를 효율적으로 선택하기 위해 다목적 베이지안 최적화를 사용하는 프레임워크인 MOBO-Merge를 소개하며, 다양한 병합 연산자와 모델 구성에 대해 랜덤 탐색보다 우수한 성능을 입증한다.

원저자: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 두 가지 서로 다른 레시피를 완성하기 위해 수년간 공을 들인 셰프라고 상상해 보십시오. 하나는 세계 최고의 초콜릿 케이크이고, 다른 하나는 가장 풍미 있고 복잡한 라자냐입니다. 당신에게는 마법 같은 주방이 있어서, 단순히 재료를 그릇에 넣고 운에 맡겨 섞는 것이 아니라, 완성된 케이크와 라자냐 전체를 층층이 결합하여 새로운 요리를 만들어내야 합니다. 이것이 바로 **AI 모델 병합(AI model merging)**의 세계입니다. 이 컴퓨터 과학의 한 구석에서, 연구자들은 이미 특정 작업(예를 들어 수학 문제를 잘 푸는 모델과 코딩을 잘하는 모델)을 수행하도록 훈련된 두 개 이상의 AI 모델을 가져와서, 처음부터 다시 훈련시키지 않고도 하나의 더 똑똑한 모델로 결합하려고 시도합니다.

어려운 점은 어떻게 섞느냐 하는 것입니다. 만약 50:50으로 섞는다면, 두 맛 모두 제대로 나지 않는 어중간한 '케이크-라자냐'가 나올 수도 있습니다. 만약 90:10으로 섞는다면, 라자냐의 풍미를 완전히 잃어버릴 수도 있습니다. 이것을 병합 파라미터(merge parameter) 문제라고 부릅니다. 보통, 완벽한 배합을 찾는 것은 무작정 건초 더미에서 손으로 건져 올리는 것과 같습니다. 이는 비용이 많이 들고 시간이 오래 걸리며, AI의 '레시피'(수학적 원리)를 볼 수 없기 때문에 매우 좌절스러운 과정입니다. 이 논문은 단순하지만 강력한 질문을 던집니다. "스마트한 추측 기반 전략을 사용하여, 무작위로 찍는 것보다 훨씬 빠르게 최적의 조합을 찾을 수 있을까?"


AI 모델을 섞는 스마트한 셰프의 가이드

이 논문에서 소개하는 새로운 "스마트 셰프", MOBO-Merge를 만나보십시오. 저자들(모하메드 빈 자이드 인공지능 대학교 연구팀)은 AI 모델을 섞는 것이 마치 두 가지 경쟁하는 맛 사이에서 완벽한 균형을 찾는 것과 같다는 점을 깨달았습니다. 당신은 새로운 AI가 지시 이행 능력(사용자의 말을 듣는 것)과 수학적 추론 능력(문제를 해결하는 것) 모두에서 뛰어나기를 원하지만, 보통 한쪽을 개선하면 다른 쪽은 약간 저하되기 마련입니다.

저자들은 단 하나의 "완벽한" 조합을 찾는 대신, **파레토 프런트(Pareto front)**를 찾는 데 집중하기로 했습니다. 이것은 "최선의 타협점들"을 모아놓은 지도라고 생각하면 됩니다. 이 지도 위의 모든 점은, 수학 능력을 높이기 위해 지시 이행 능력을 희생해야 하거나, 그 반대의 상황이 발생하는 모든 '최적의 절충안'을 나타냅니다. 목표는 단 하나의 승자를 뽑는 것이 아니라, 당신의 필요에 가장 잘 맞는 것을 선택할 수 있도록 훌륭한 옵션들의 전체 지형을 발견하는 것입니다.

문제점: "블랙박스" 주방

문제는 새로운 조합을 테스트하는 것이 매우 비싸다는 점입니다. 새로운 조합이 효과가 있는지 확인하려면, 새로운 AI 모델을 구축하고 수백 개의 테스트 질문을 통과시켜야 합니다. 이는 마치 케이크 한 조각을 맛보기 위해 케이크 전체를 다시 굽는 것과 같습니다. 케이크가 구워지는 동안에는 맛을 볼 수 없으며(가이드를 줄 '그래디언트'가 없음), 사용할 수 있는 재료(테스트를 위한 예산)도 제한되어 있습니다.

만약 단순히 무작위로 섞는 방식(판에 다트를 던지는 것처럼)을 사용한다면, 운 좋게 맞출 수도 있겠지만 많은 시간과 재료를 낭비하게 될 것입니다. 만약 섞는 레시피가 간단하다면(단 하나의 조절 노브만 있는 단순한 블렌딩), 무작위 추측도 나쁘지 않습니다. 하지만 레시 recipe가 복잡하다면—예를 들어 케이크의 각 층마다 서로 다른 노브가 있다면—무작위 추측은 재앙이 될 것입니다.

해결책: "스마트한 추측" 기계

저자들은 **다목적 베이지안 최적화(Multi-Objective Bayesian Optimization)**를 사용하는 MOBO-Merge 프레임워크를 만들었습니다. 쉽게 말해, 이것은 "스마트한 추측" 기계입니다.

작동 방식은 다음과 같습니다:

  1. 대리 모델(The Surrogate Model): 매번 케이크를 굽는 대신, 기계는 이미 테스트한 몇 가지 조합을 바탕으로 "예측 지도"를 구축합니다. 기계는 "아, 모델 A를 30%, 모델 B를 70% 섞으면 수학 점수는 올라가지만 지시 이행 점수는 떨어지는구나"라고 학습합니다.
  2. 획득 함수(The Acquisition Function): 이것은 기계의 직관입니다. 기계는 지도를 보고 "가장 많은 것을 배우기 위해 다음에 어디를 테스트해야 할까?"라고 묻습니다. 단순히 높은 점수를 찾는 것이 아니라, 최선의 "절충 지도"(파레토 프 フロント)를 그리는 데 도움이 될 지점을 찾습니다.
  3. 루프(The Loop): 새로운 조합을 선택하고, 테스트하고, 지도를 업데이트하며 반복합니다.

저자들은 이를 두 가지 유명한 AI 제품군인 Qwen3-4BLlama-3.1-8B에 대해 테스트했습니다. 그들은 다음과 같은 다양한 방식으로 혼합을 시도했습니다:

  • 선형(Linear): 단순한 블렌딩 (노브 1개).
  • TIES: 모델 간의 충돌하는 지침을 해결하려는 더 복잡한 방법 (노브 4개).
  • 블록 선형(Block-Linear): AI의 각 층을 별도의 블록으로 취급하여 매우 미세하게 조정할 수 있는 방법 (노브 4개 또는 8개).

연구 결과

결과는 아주 스마트한 지도를 가진 보물 찾기와 같았습니다.

  • 단순한 혼합: 혼합이 단순할 때(노브가 하나일 때), "스마트한 추측"(MOBO-Merge)은 무작위 추측보다 약간 더 나은 수준이었습니다. 실제로 Qwen 모델에 대한 한 가지 테스트에서는 무작위 추측이 아주 미세하게 더 나은 결과를 보이기도 했습니다. 이는 레시피가 단순하다면, 최적의 조합을 찾기 위해 슈퍼컴퓨터가 필요하지 않음을 시사합니다.
  • 복잡한 혼합: 하지만 혼합이 복잡해질 때(TIES나 여러 개의 노브를 가진 Block-Linear를 사용할 때), MOBO-Merge는 빛을 발했습니다. 이는 무작위 추측보다 훨씬 더 나은 조합을 찾아냈습니다. 예를 들어, TIES 방식을 사용한 Llama 모델의 경우, MOBO-Merge는 무작위 탐색이 찾을 수 있는 것보다 현저히 더 나은 조합을 찾아냈습니다.
  • "세 가지 모델" 도전: 저자들은 세 가지 모델(지시 이행 + 수학 + 코딩)을 동시에 섞는 것도 시도했습니다. 여기서 스마트한 추측의 이점은 엄청났습니다. Llama 모델의 한 사례에서, MOBO-Merge는 무작위 혼합 중 가장 좋은 결과보다 두 배 이상 더 뛰어난 조합을 찾아냈습니다.

가장 흥ор로운 발견 중 하나는 단 하나의 "최고의" 혼합 방법이란 존재하지 않는다는 점이었습니다. 때로는 단순한 Linear 방식이 가장 잘 작동하고, 때로는 복잡한 TIESBlock-Linear 방식이 승리합니다. 이는 전적으로 어떤 AI 모델을 섞느냐, 그리고 무엇을 달성하고자 하느냐에 달려 있습니다.

이것이 왜 중요한가

이 논문은 MOBO-Merge가 AI 모델을 결합하려는 모든 이들에게 강력한 도구임을 시사합니다. 이 방법은 모델을 섞는 새로운 방식을 발명하는 것이 아니라, 적절한 조합을 찾는 더 스마트한 방법을 제공합니다.

이 방법을 사용함으로써, 연구자들은 수천 번의 비싼 테스트를 거치지 않고도 고품질의 결합된 능력을 찾아낼 수 있습니다. 이는 운에 맡기던 과정을 체계적인 탐색으로 바꿔줍니다. 저자들은 12가지 테스트 시나리오 중 11가지에서 MOBO-Merge가 무작위 추측보다 더 나은 "절충 지도"를 찾아냈음을 확인했습니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 이 방법 역시 테스트를 실행하는 데 비용과 시간이 듭니다. 이 방식은 혼합 레시피가 복잡할 때 가장 잘 작동하며, 모든 작업에서 완벽한 조합을 보장하지는 않습니다. 그러나 처음부터 다시 훈련시키지 않고도 유연하고 다재다능한 AI 시스템을 구축하고자 하는 사람들에게, 이 "스마트한 추측" 접근법은 훨씬 더 효율적인 길을 제시합니다.

결국, 이 논문은 우리가 완벽한 슈퍼 AI를 위한 레시피를 항상 예측할 수는 없을지라도, 적어도 맹목적으로 추측하는 것을 멈추고 수학적 직관을 통해 가능성을 탐구할 수 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →