Scalable Prompt Routing via Fine-Grained Latent Task Discovery
이 논문은 수동 정의된 분류의 한계를 극복하고, 그래프 기반 클러스터링을 통한 잠재 작업 발견과 전문가 혼합 아키텍처를 결합한 2 단계 라우팅 방식을 제안하여, 다양한 최첨단 모델들 사이에서 성능은 극대화하고 비용은 절반 이하로 절감하는 확장 가능한 프롬프트 라우팅 솔루션을 제시합니다.
원저자:Yunyi Zhang, Soji Adeshina, Patrick Guan, Ashwin Ganesh, Zhen Han, Vassilis N. Ioannidis, Huzefa Rangwala, George Karypis
이 논문은 **"어떤 질문을 던졌을 때, 수많은 AI 모델 중 가장 적합한 모델을 자동으로 골라주는 시스템"**에 대한 이야기입니다.
과거에는 "이 질문은 수학 문제니까 수학 AI를 불러라"처럼 사람이 직접 규칙을 정했지만, 지금은 AI 모델이 수십 개나 되고 그 성능 차이가 매우 미세해져서 사람이 일일이 정하기가 불가능해졌습니다. 이 논문은 그 문제를 해결하기 위해 **두 단계로 나누어 똑똑하게 작동하는 새로운 방법 (FineRouter)**을 제안합니다.
🎭 비유로 이해하는 핵심 아이디어
이 시스템을 이해하기 위해 **거대한 "요리 학교"와 "손님"**을 상상해 보세요.
1. 상황: 요리 학교와 수많은 요리사들
수십 명의 요리사 (AI 모델들): 각자 특기가 다릅니다. 어떤 이는 미슐랭 스타일 스테이크를 잘 만들고, 어떤 이는 복잡한 파스타를, 또 어떤 이는 디저트를 잘합니다.
손님 (사용자의 질문): "오늘 저녁에 뭐 먹을까?"라고 묻습니다.
문제: 손님의 질문이 "스테이크 레시피"인지, "파스타 만들기"인지, 아니면 "디저트 추천"인지에 따라 최고의 요리사가 다릅니다. 하지만 모든 요리사의 요리를 다 시식해 보는 것은 시간과 돈이 너무 많이 듭니다.
2. 기존 방식의 한계
수동 분류 (옛날 방식): "음식"이라는 큰 카테고리만 정해뒀습니다. 그래서 "스테이크"와 "파스타"를 구분하지 못하고 모두 "요리"로 처리해 버려서, 스테이크를 잘하는 요리사가 파스타를 만들게 되는 실수가 자주 일어납니다.
단일 관리자 (모노리스 방식): 한 명의 관리자가 모든 손님의 질문을 보고 "누가 가장 잘할까?"를 판단하려 합니다. 하지만 요리사들이 100 명이나 되고 실력 차이가 미세하면, 관리자가 그 미세한 차이를 모두 기억하고 판단하기엔 너무 버겁습니다.
3. 이 논문이 제안하는 해결책: "FineRouter" (두 단계 시스템)
이 시스템은 두 명의 전문가가 팀을 이루어 작동합니다.
🧩 1 단계: "질문의 성격을 알아내는 탐정" (잠재적 작업 발견)
역할: 손님의 질문을 듣고, 이 질문이 정확히 어떤 "세부 장르"에 속하는지 찾아냅니다.
방법:
과거의 수많은 질문과 그 질문에 대한 최고의 답변들을 분석합니다.
유사한 질문끼리 그룹을 짓습니다. (예: "수학 문제"라는 큰 카테고리 대신, "대수학 문제", "기하학 문제", "문장 풀이 수학 문제"처럼 아주 세분화된 그룹을 자동으로 찾아냅니다.)
각 그룹마다 "누가 이 일을 가장 잘할까?"를 미리 조사해 둡니다. (예: 대수학 그룹에는 A 요리사, 파스타 그룹에는 B 요리사)
결과: 손님이 질문을 던지면, 이 탐정은 "아, 이 질문은 '대수학' 그룹에 속하는군요!"라고 딱딱 구분해 줍니다.
🎯 2 단계: "세부 전공을 가진 전문가들" (작업 인식 품질 추정)
역할: 1 단계에서 분류된 그룹에 맞춰, 각 요리사 (AI 모델) 가 이 질문을 얼마나 잘 처리할지 점수를 매깁니다.
방법:
모든 요리사를 위한 일반 관리자: 기본적인 점수를 매깁니다.
그룹별 전문가: '대수학' 그룹에 들어온 질문에는 '대수학 전문가'가, '디저트' 그룹에는 '디저트 전문가'가 각각 점수를 매깁니다.
이렇게 하면, 특정 분야에 특화된 AI 모델이 그 분야에서 얼마나 빛을 발할지 훨씬 정확하게 예측할 수 있습니다.
🏁 최종 결정: 두 신호의 합
1 단계의 "그룹 분류"와 2 단계의 "세부 점수"를 합쳐서 최종적으로 **가장 적합한 요리사 (AI 모델)**를 한 명만 뽑아냅니다.
이 과정에서 불필요한 요리사들을早早 (일찍) 제외시켜 비용을 아끼면서도 최고의 맛을 보장합니다.
🌟 이 시스템의 놀라운 성과
이 논문의 실험 결과 (11 개의 최신 AI 모델과 10 가지 다양한 테스트) 는 다음과 같습니다:
단일 최강자보다 더 낫다: 가장 성능이 좋은 AI 하나만 쓰는 것보다, 이 시스템이 상황에 맞춰 AI 를 골라주는 것이 전체적으로 더 좋은 결과를 냈습니다.
비용 절감: 최고의 AI 를 무조건 쓰는 것보다 비용은 절반도 들지 않으면서 더 좋은 성능을 냈습니다. (비유하자면, 미슐랭 스타 요리사를 무조건 부르는 대신, 그날의 메뉴에 맞는 최고의 요리사를 골라 부르는 셈입니다.)
미세한 차이 포착: "수학"이라는 큰 카테고리만으로는 구분할 수 없었던 "대수학 vs 기하학" 같은 미세한 차이까지 찾아내어, 각 AI 의 강점을 극대화했습니다.
💡 결론
이 논문은 **"AI 모델이 너무 많아져서 혼란스러운 시대"**에, 자동으로 세분화된 작업을 발견하고 각 작업에 맞는 최고의 모델을 골라주는 지능형 라우팅 시스템을 제시합니다.
마치 수십 개의 식당이 있는 거대한 푸드코트에서, 손님의 취향과 메뉴를 분석해 가장 맛있는 음식을 만들어줄 특정 식당만 안내해 주는 똑똑한 가이드와 같습니다. 덕분에 우리는 더 적은 비용으로 더 맛있는 (더 정확한) AI 답변을 받을 수 있게 됩니다.
1. 문제 정의 (Problem Statement)
대규모 언어 모델 (LLM) 의 성능이 향상되면서, 단일 모델이 모든 태스크에서 최상의 성능을 내는 것이 아니라 모델마다 강점이 다른 태스크가 존재합니다. 이에 따라 각 쿼리에 가장 적합한 모델을 동적으로 선택하는 프롬프트 라우팅 (Prompt Routing) 이 중요해졌습니다.
그러나 기존 라우팅 방법들은 다음과 같은 한계로 인해 확장성 (Scalability) 에 문제가 있습니다:
수동 정의 태스크 분류의 한계: 기존 방법들은 수동으로 정의된 거시적인 태스크 분류 (예: 수학, 코딩, QA 등) 에 의존합니다. 하지만 수십 개의 최첨단 (Frontier) 모델들이 등장하고 그 성능 차이가 미묘해지면서, 이러한 거시적 분류는 모델 간의 세밀한 능력 차이를 포착하지 못합니다.
단일 모놀리식 라우터의 한계: 모든 태스크를 하나의 모델로 처리하는 방식은 다양한 태스크 간의 미묘한 성능 차이를 구분하는 데 어려움을 겪습니다. 특히 성능 격차가 좁은 최첨단 모델들 사이에서 라우팅을 수행할 때, 어떤 모델이 특정 프롬프트에 가장 적합한지 식별하는 것이 매우 까다로워집니다.
2. 제안 방법론: FineRouter
저자들은 이러한 한계를 극복하기 위해 자동화된 세밀한 태스크 발견 (Automated Fine-Grained Task Discovery) 과 태스크 인식 품질 추정 (Task-Aware Quality Estimation) 을 결합한 2 단계 라우팅 아키텍처인 FineRouter를 제안합니다.
1 단계: 태스크 유형 발견 및 매칭 (Task Type Discovery & Matching)
그래프 기반 클러스터링: 학습 데이터에서 프롬프트를 기반으로 잠재적인 태스크 유형을 자동으로 발견합니다.
의미적 유사성: LLM 을 사용하여 각 프롬프트에 대한 태스크 설명을 생성하고, 이를 임베딩하여 의미적 유사도를 계산합니다.
성능 기반 유사성: 각 프롬프트에 대해 선호되는 모델들의 순위 (Rank) 를 기반으로 한 모델 선호 패턴의 유사도 (Rank Biased Overlap, RBO) 를 계산합니다.
클러스터링: 의미적 유사도와 성능 선호 패턴을 결합하여 프롬프트 그래프를 구성하고, Leiden 알고리즘을 통해 커뮤니티 (클러스터) 를 탐지합니다. 각 클러스터는 하나의 '발견된 태스크 유형'이 됩니다.
후보 모델 선정: 각 발견된 태스크 클러스터 내에서 해당 태스크에 가장 잘 수행할 것으로 예상되는 소수의 상위 후보 모델들을 선정합니다.
태스크 분류기 학습: 새로운 프롬프트가 들어오면, 학습된 분류기가 이를 발견된 태스크 유형 중 하나에 할당합니다.
2 단계: 태스크 인식 동적 라우터 (Task-Aware Dynamic Router)
혼합 전문가 (Mixture-of-Experts, MoE) 아키텍처: 1 단계에서 할당된 태스크 유형에 따라 전문화된 예측 헤드를 활성화합니다.
일반 어댑터 (General Adapters): 모든 모델에 대한 전반적인 품질 점수를 예측하는 공통 모듈.
태스크별 어댑터 (Task-Specific Adapters): 특정 태스크 유형에 할당된 후보 모델들만을 위해 학습된 전문화된 모듈.
학습 전략: 공유된 인코더 (Prompt Encoder, LLM Embedding) 는 고정하고, 태스크별 예측 헤드를 해당 태스크에 할당된 데이터로만 미세 조정 (Fine-tuning) 하여 각 전문가가 특정 도메인에 최적화되도록 합니다.
추론 (Inference) 과정
태스크 할당: 입력 프롬프트를 1 단계 분류기를 통해 태스크 유형에 매핑합니다.
품질 점수 예측: 할당된 태스크에 따라 해당 태스크별 어댑터와 일반 어댑터를 활성화하여 모든 후보 모델에 대한 품질 점수를 예측합니다.
점수 집계:
Stage 1 점수: 태스크 클러스터 전체에서 모델이 보인 평균 품질 (사전 지식).
Stage 2 점수: 특정 프롬프트에 대한 세밀한 품질 예측.
이 두 가지 점수를 가중치 (α) 를 통해 결합하여 최종 라우팅 점수를 산출하고, 점수가 가장 높은 모델을 선택합니다.
3. 주요 기여 (Key Contributions)
확장 가능한 자동 태스크 발견: 의미적 신호와 성능 기반 신호를 결합하여 대규모 학습 데이터에서 거시적 분류가 아닌 세밀한 잠재 태스크 유형을 자동으로 발견하는 방법을 제안했습니다.
태스크 인식 라우팅 아키텍처: 발견된 태스크 구조를 활용하여 혼합 전문가 (MoE) 기반의 품질 추정 모델을 설계했습니다. 이는 각 태스크 유형에 특화된 예측 헤드를 통해 더 정확한 모델 선택을 가능하게 합니다.
종합적인 평가: 10 개의 다양한 벤치마크와 11 개의 최첨단 모델 (Claude-Sonnet-4.5, DeepSeek-R1, Llama-4-Maverick 등) 을 대상으로 평가하여, 기존 라우팅 방법론 및 단일 최강 모델보다 우수한 성능과 비용 효율성을 입증했습니다.
4. 실험 결과 (Results)
성능: 10 개 벤치마크 (NQ, MMLU, GSM8K, HumanEval 등) 에서 FineRouter 는 기존 라우팅 베이스라인 (kNN, MLP, RouteLLM, IPR 등) 을 일관되게 능가했습니다.
단일 모델 대비 우위: 단일 최강 모델 (예: Claude-Sonnet-4.5) 보다도 더 높은 전반적인 성능을 달성했습니다.
비용 효율성: 단일 최강 모델을 사용하는 것보다 약 50% 미만의 비용으로 동일한 또는 더 높은 성능을 달성했습니다. 이는 라우팅을 통해 비용이 낮은 모델이 적합한 태스크에 할당되었음을 의미합니다.
** Ablation Study:**
수동 정의된 거시적 분류 (Coarse CLS) 보다 자동 발견된 세밀한 태스크 (Fine CLS) 가 더 효과적인 라우팅 신호를 제공했습니다.
1 단계 (태스크 발견) 만 또는 2 단계 (동적 라우팅) 만 사용하는 것보다, 두 단계를 모두 결합한 전체 아키텍처가 가장 우수한 성능을 보였습니다.
케이스 스터디: "수학"이라는 거시적 카테고리 내에서 '기호 대수학'과 '문맥적 단어 문제'를 구분하여 서로 다른 모델을 선택하거나, '전화번호 지역 코드'와 같은 예상치 못한 니치 도메인을 성공적으로 발견한 사례가 확인되었습니다.
5. 의의 및 결론 (Significance)
이 논문은 모델 풀이 확장되고 모델 간 성능 격차가 좁아지는 시대에, 수동 분류에 의존하지 않고 데이터 기반의 자동화된 세밀한 태스크 구조를 발견하는 것이 라우팅 성능을 극대화하는 핵심임을 입증했습니다.
확장성: 수백 개의 모델이 존재하는 환경에서도 수동 분류의 한계를 극복하고 적응적으로 라우팅할 수 있는 체계를 제시했습니다.
비용 최적화: 단순히 가장 강력한 모델을 사용하는 것이 아니라, 태스크에 맞는 적절한 모델을 선택함으로써 비용 대비 성능 (Cost-Performance Trade-off) 을 획기적으로 개선했습니다.
미래 방향: 텍스트 기반 프롬프트에 국한되어 있으나, 향후 멀티모달 입력으로 확장될 수 있는 잠재력을 가지고 있습니다.
결론적으로, FineRouter 는 대규모 LLM 풀을 효율적으로 활용하기 위한 지능적이고 확장 가능한 라우팅 프레임워크로서, 모델의 잠재적 능력을 극대화하면서도 비용을 절감하는 실용적인 솔루션을 제공합니다.