← 최신 논문
🤖 machine learning

Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA

이 논문은 고정된 k개의 전문가를 사용하는 베이스라인의 성능을 유지하거나 능가하면서도 연산 효율성을 최적화하기 위해, 라우터의 신뢰도와 불일치 신호에 따라 토큰당 활성 전문가의 수를 동적으로 조정하는 Mixture-of-Experts LoRA를 위한 파라미터가 필요 없는 드롭인(drop-in) 라우팅 메커니즘인 CARE를 소개한다.

원저자: Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 명의 작은 음악가들로 구성된 거대하고 똑똑한 오케스트라의 지휘자라고 상상해 보세요. 이 오케스트라는 인간처럼 읽고 쓸 수 있는 컴퓨터 뇌의 일종인 '거대 언어 모델(Large Language Model)'입니다. 이 뇌가 수학 문제를 풀거나 코드를 작성하는 것과 같은 특정 작업을 잘 수행하도록 만들기 위해, 우리는 오케스트라 전체에 새로운 곡을 가르치는 대신, 정확히 무엇을 해야 할지 아는 작은 '전문가' 섹션을 추가합니다. 이것을 LoRA(Low-Rank Adaptation)라고 부릅니다. 이는 마치 전체 악보를 새로 쓰는 대신, 거대한 합창단 속에 몇 명의 전문 솔리스트를 슬쩍 끼워 넣어 특정 노래를 수정하는 것과 같습니다.

이제, 이 솔리스트들이 MoE(Mixture-of-Experts) 시스템으로 조직되어 있다고 상상해 보세요. 오케스트라가 음표(또는 단어)를 연주할 때, '라우터(router)'는 어떤 솔리스트가 연주해야 할지를 결정합니다. 기존 방식은 매우 경직되어 있었습니다. 라우터는 음표가 얼마나 쉽거나 어려운지와 상관없이 항상 똑같은 수의 솔리스트(예를 들어 4명)를 선택했습니다. 이는 마치 간단한 시리얼 한 그릇을 만드는 데 세계적인 셰프 4명을 고용하고, 복잡한 5코스 만찬을 만드는 데는 단 2명의 셰프만 고용하는 것과 같습니다. 쉬운 작업에는 에너지를 낭비하고, 어려운 작업에는 지원이 부족하게 만드는 셈입니다. 큰 질문은 이것입니다. "라우터를 더 똑똑하게 만들 수 있을까? 라우터가 음표를 보고, 그것이 까다롭다는 것을 깨달은 뒤, '이봐, 이 곡에는 더 많은 셰프가 필요해!'라고 말할 수 있을까? 그러면서도 오케스트라 전체의 속도를 늦추지 않고 말이죠."

이 논문은 바로 이 문제를 해결하기 위해 CARE(Confidence-Adaptive Routing of Experts)라는 영리한 새로운 규칙을 소개합니다. 저자들은 라우터의 의사 결정 과정 속에 이미 숨겨진 비밀 신호가 있다는 것을 발견했습니다. 라우터가 단어에 대해 확신이 있을 때는 한두 명의 전문가를 매우 높은 확신을 가지고 선택합니다. 반면 혼란스러울 때는 여러 전문가에게 투표를 분산시킵니다. CARE는 이 '확신 신호'를 사용하여 각 단어에 몇 명의 전문가를 고용할지 결정합니다. 라우터가 확신이 있다면 CARE는 단 몇 명만 고용합니다. 만약 라우터가 불확실하거나 고용된 전문가들이 서로 의견 충돌을 일으키기 시작하면, CARE는 더 많은 전문가를 고용합니다.

연구진은 두 개의 강력한 컴퓨터 뇌(LLaMA-3.1-8B 및 Qwen2.5-7B)를 사용하여 상식, 수학, 코딩, 일반 지식을 포함한 8가지 유형의 과제를 테스트했습니다. 그들은 CARE가 효율성을 위한 마법 같은 기술이라는 것을 발견했습니다. 필요한 곳에만 더 많은 '두뇌 전력'을 쏟아부음으로써, CARE는 기존의 경직된 방식과 동일한 총 컴퓨팅 파워를 사용하면서도 어려운 작업에서의 정확도를 높였습니다. 실제로, 기존 방식과 동일한 수준의 정확도를 얻기 위해 CARE는 평균적으로 12% 적은 전문가를 사용했습니다. 이는 마치 똑같이 맛있는 식사를 하면서도 음식 낭비를 줄이는 것과 같습니다.

나아가, CARE는 단순히 비용을 절감할 뿐만 아니라 내장된 거짓말 탐지기 역할도 합니다. 왜냐하면 CARE는 라우터가 혼란스러워하거나 전문가들이 의견 차이를 보일 때를 알 수 있기 때문에, 컴퓨터가 이해하지 못하는 질문(분포 외 이벤트, out-of-distribution event)에 직면했을 때 이를 감지할 수 있습니다. 논문은 CARE가 자신의 작업을 확인하기 위해 컴퓨터가 질문을 여러 번 반복해서 실행해야 하는 다른 방법들보다 이러한 혼란스러운 순간을 더 잘 포착한다는 것을 보여줍니다. CARE는 전문가를 고용하는 규칙을 변경하는 것만으로, 추가적인 훈련 없이 단 한 번의 통과(single pass)만으로 이 모든 일을 해냅니다. 이는 경직된 '일률적 시스템'을 에너지를 언제 써야 할지 정확히 아는 '유연하고 똑똑한 시스템'으로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →