← 최신 논문
🤖 AI

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

본 논문은 경량 라우터를 사용하여 토큰당 정확히 하나의 전문가를 선택하는 하드 top-1 라우팅을 통해 독립적으로 훈련된 동결된 추론 LoRA 전문가들을 구성함으로써, 소프트 라우팅 베이스라인보다 훨씬 적은 학습 가능한 파라미터를 요구하면서도 전문가들의 원래 단위 규모 가산 업데이트를 보존하는 2단계 프레임워크인 Hard-Routed MoR-LoRA를 제안한다.

원저자: Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 다섯 명의 아주 똑똑하고 전문화된 셰프 팀이 있다고 상상해 보세요. 한 명은 이탈리아 파스타의 거장이고, 다른 한 명은 일본 스시의 천재이며, 세 번째는 멕시코 타코의 달인이고, 그 외에도 마찬가지입니다. 각 셰프는 자신만의 주방에서 자신만의 비밀 레시피를 가지고 따로 훈련받았습니다.

이제 당신은 이 모든 요리를 완벽하게 해낼 수 있는 단 하나의 레스토랑을 열고 싶지만, 이 셰프들을 모두 불러 모아 팀으로서 재교육할 수는 없다고 상상해 보세요. 또한, 그들의 개별적인 기술이 가진 섬세한 균형을 망칠 수 있기 때문에 그들의 레시피를 하나의 거대한 "슈퍼 레시피"로 섞을 수도 없습니다.

이것이 바로 **"Learning to Select, Not Relearn(다시 배우는 것이 아니라 선택하는 법을 배우기)"**이라는 논문이 인공지능(AI)을 위해 해결하고자 하는 문제입니다.

이 논문이 제시하는 해결책의 간단한 요약은 다음과 같습니다.

문제점: "소프트 믹스(Soft Mix)"의 실수

과로의 연구자들은 이러한 전문화된 "셰프들"(LoRA 전문가라고 불림)을 결합하려고 할 때 **소프트 라우팅(Soft Routing)**이라는 방법을 사용했습니다.

소프트 라우팅을 믹서기라고 생각해 보세요. 어떤 요리를 만들고 싶을 때, 믹서기는 이탈리아 셰프의 맛을 조금, 스시 셰프의 맛을 조금, 그리고 타코 셰프의 맛을 조금씩 가져와서 모두 함께 갈아버립니다.

  • 문제점: 이탈리아 셰프는 혼자서 온전한 파스타 한 접시를 요리하도록 훈련받았습니다. 만약 믹서기에 의해 재료가 희석되어 그들에게 10%의 재료만 주어진다면, 그들의 요리는 형편없는 맛이 될 것입니다. 수학적 계산이 맞지 않는 것이죠. 이를 해결하기 위해 이전의 방식들은 셰프들을 다시 학교로 돌려보내 "희석된" 재료로 요리하는 법을 다시 배우게 해야 했습니다. 이는 비용이 많이 들고 느린 작업입니다.

해결책: "하드 라우티드(Hard-Routed)" 웨이터

저자들은 Hard-Routed MoR-LoRA라는 새로운 시스템을 제안합니다. 믹서기 대신, 그들은 매우 효율적인 웨이터를 사용합니다.

  1. 셰프들은 고정됩니다 (The Chefs Stay Frozen): 특화된 셰프들(AI 전문가들)은 자신의 특정 작업(예: 수학 또는 의료 질문)에 최고가 되도록 개별적으로 훈련됩니다. 일단 훈련이 끝나면, 그들은 "고정"됩니다. 그들은 변하지 않습니다. 그들은 자신들의 원래의 완벽한 레시피를 유지합니다.
  2. 스마트한 웨이터: 시스템은 작고 가벼운 "웨이터"(라우터)를 훈련시킵니다. 이 웨이터의 유일한 임무는 고객의 주문(입력 질문)을 보고 결정하는 것입니다: "좋아, 이것은 수학 문제군. 수학 셰프에게 보내자. 이것은 의료 질문이군. 의사 셰프에게 보내자."
  3. 한 명의 셰프, 하나의 요리: 웨이터는 전체 주문을 정확히 단 한 명의 셰프에게 보냅니다. 셰프는 자신의 원래 레시피(100% 스케일)를 사용하여 요리를 만듭니다. 섞거나 희석하지 않습니다.
  4. 마법 같은 기술: 웨이터는 갑작스럽고 이산적인(discrete) 선택을 해야 하기 때문에, 표준적인 수학을 사용하여 웨이터를 가르치기가 어렵습니다. 논문은 **직통 추정기(Straight-Through Estimator, STE)**라는 영리한 트릭을 사용합니다. 웨이터가 수학을 배우기 위해 주문을 나누는 "척"하면서도(학습을 위해), 실제로는 한 명의 셰프에게 전체 요리를 서빙하는(품질을 높이기 위해) 방식으로 연습한다고 상상해 보세요. 이를 통해 웨이터는 셰프들을 망가뜨리지 않고도 학습할 수 있습니다.

이것이 왜 중요한 일인가

저자들은 다섯 가지 다른 유형의 작업(수학, 상식, 의학, 독해, 문법)에 대해 다양한 크기의 AI 모델을 사용하여 이 시스템을 테스트했습니다.

  • 적은 노력으로 더 나은 결과: 그들의 "하드 라우티드" 시스템은 기존의 "믹서기" 방식만큼 성능이 좋거나 오히려 더 좋았지만, 학습 가능한 매개변수(parameters)는 훨씬 적었습니다. 이는 다섯 명의 셰프를 재교육하는 대신, 똑똑한 웨이터 한 명을 고용하는 것과 같습니다.
  • 추론 능력 보존: 논문은 셰프들을 먼저 훈련시키기 위해 RLVF(검증 가능한 피드백으로부터의 강화 학습)라는 특별한 훈련법을 사용할 때, 그들이 "생각하는 능력"(단계별로 추론하는 능력)이 훨씬 더 좋아진다는 것을 발견했습니다. 하드 라우티드 시스템은 셰프의 작업을 희석하지 않기 때문에 이 사고 능력을 완벽하게 보존합니다.
  • "믹서기"는 거짓말을 하고 있었습니다: 저자들은 기존의 "믹서기" 방식들을 분석하여, 두 명의 셰프를 섞으려고 시도할 때조차 믹서기가 결국 한 명의 셰프에게만 의존하게 된다는 것(약 70%의 경우)을 발견했습니다. 즉, "믹서기"는 아무 이유 없이 불필요한 일을 하고 있었던 것입니다. "하드 라우티드" 웨이터는 중간 단계를 건너뛰고 즉시 적절한 셰프를 선택합니다.

핵심 요약

이 논문은 특화된 AI 전문가들을 결합할 때, 그들을 재훈련하거나 그들의 뇌를 서로 섞을 필요가 없다는 것을 가르쳐 줍니다. 단지 적절한 작업을 수행할 적합한 전문가를 선택하고, 그들이 훈련받은 그대로의 일을 할 수 있게 하는 스마트하고 가벼운 시스템이 필요할 뿐입니다.

이는 팀원들에게 타협된 평범한 공동 프로젝트를 강요하는 대신, 적절한 전문가가 각자의 업무를 하나씩 완벽하게 처리하도록 내버려 두는 것의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →