Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm
Brick은 6가지 역량 차원과 추정된 난이도에 따라 쿼리를 모델에 동적으로 배분하는 Mixture-of-Models 패러다임을 위한 멀티모달 라우터로, 단일 모델 베이스라인 및 기존 라우터들과 비교하여 우수한 정확도와 상당한 비용-지연 시간 절감을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 고급스러운 레스토랑을 운영한다고 상상해 보세요. 당신에게는 세 명의 서로 다른 셰프가 있습니다:
- 셰프 콴(Qwen): 재능 있고 빠르며, 가격이 매우 저렴한 로컬 요리사입니다.
- 셰프 딥시크(DeepSeek): 숙련된 기술을 가졌으며, 중간 가격대의 전문가입니다.
- 셰프 키미(Kimi): 엄청난 비용을 요구하지만 거의 모든 분야에서 매우 뛰어난, 세계적으로 유명한 셀러브리티 셰프입니다.
문제점:
매일 수천 명의 고객이 각기 다른 요청을 가지고 들어옵니다. 어떤 이들은 간단한 그릴드 치즈 샌드위치를 주문합니다(쉬운 작업). 또 어떤 이들은 복잡한 10코스 분자 미식가 테이스팅 메뉴를 주문합니다(어려운 작업).
과거에 레스토랑 매니저들은 "피상적 라우팅(superficial routing)"을 사용하여 누가 무엇을 요리할지 결정했습니다. 그들은 주문의 길이나 사용된 키워드를 살펴보았습니다.
- 결함: "리만 가설을 증명하라"와 같은 짧은 주문은 사실 매우 어려운 작업이어서 셀러브리티 셰프가 필요합니다. 반면, "토스트 만드는 법"에 대한 길고 장황한 설명은 사실 쉬운 작업이라 로컬 요리사가 처리할 수 있습니다. 만약 단순히 보기에 어려워 보인다는 이유로 모든 길고 복잡해 보이는 주문을 비싼 셀러브리티 셰프에게 보낸다면, 당신은 파산하게 될 것입니다. 반대로 모든 것을 저렴한 요리사에게 보낸다면, 탄 토스트와 화난 고객들을 마주하게 될 것입니다.
해결책: "브릭(Brick)"
이 논문은 단순히 주문의 길이를 보는 것이 아니라, 해당 주문이 요구하는 구체적인 기술을 분석하는 똑똑한 "헤드 웨이터(라우터)"인 **브릭(Brick)**을 소개합니다.
브릭은 모든 요청을 여섯 가지 구체적인 "난이도 풍미(flavors)"로 나눕니다:
- 코딩
- 창의적 글쓰기
- 지시 사항 이행
- 수학적 추론
- 계획/전략
- 일반 상식
브릭의 작동 방식 (비유):
- 주문의 맛을 보다: 주문이 들어오면 브릭은 이를 읽고 다음과 같이 자문합니다: "이 주문에는 수학이 얼마나 들어있는가? 창의적 글쓰기는 얼마나 들어있는가?" 그리고 요청에 대한 "풍미 프로필"을 생성합니다.
- 셰프들의 기술 확인: 브릭은 각 셰프의 비밀 점수표("기술 매트릭스")를 가지고 있습니다. 예를 들어, 키미 셰프는 수학에 매우 뛰어나지만, 때때로 생소한 역사적 사실에 대해서는 답변하기를 거부하고(추측하기보다 "모른다"라고 말하는 것을 선호함) 그렇다는 것을 알고 있습니다. 또한 딥시크 셰프는 놀랍게도 역사에 강하며, 어떤 경우에는 셀러브리티 셰프보다 더 낫다는 것도 알고 있습니다.
- "품질 vs 비용" 다이얼: 레스토랑 주인은 브릭에 있는 특별한 노브(knob)를 돌릴 수 있습니다.
- "최대 품질(Max Quality)"으로 돌리면: 브릭은 가격표를 무시합니다. 비용이 들더라도 완벽하게 해낼 가능성이 가장 높은 셰프에게 주문을 보냅니다.
- "최대 절약(Max Savings)"으로 돌리면: 약간의 실수 가능성이 있더라도 가능한 한 가장 저렴한 셰프를 사용하려고 노력합니다.
- "중립(Neutral)"으로 돌리면: 브릭은 적절한 균형점을 찾습니다. 대부분의 일은 중간 가격대의 셰프에게 맡기고, 정말로 필요할 때만 셀러브리티 셰프를 호출합니다.
결과:
연구진은 이 시스템을 5,504개의 서로 다른 "주문(쿼리)"에 대해 테스트했습니다. 결과는 다음과 같습니다:
- 단일 최고 셰프를 능가함: 브릭을 "최대 품질" 설정으로 두었을 때, 모든 것을 셀러브리티 셰프(키미)에게 보내는 것보다 더 많은 주문을 정확히 처리했습니다. 왜냐하면 셀러브리티 셰프는 저렴한 셰프들이 해결할 수 있는 질문에 대해서도 때때로 답변을 거부하기 때문입니다. 브릭은 셀러브리티 셰프의 "모른다"는 태도를 우회해야 할 때를 알고 있습니다.
- 비용 절감: "중립" 설정에서 브릭은 항상 셀러브리티 셰프를 사용할 때보다 약 4.7배의 돈을 아꼈으면서도, 정확도는 아주 미미하게(1% 미만)만 손실되었습니다.
- 속도: 브릭이 간단하거나 중간 정도의 과업을 더 빠르고 저렴한 셰프들에게 자주 보냈기 때문에, 고객들은 셀러브리티 셰프를 기다리는 것에 비해 평균적으로 거의 두 배 빠르게 음식을 받았습니다.
- 경쟁 우위: 다른 시스템들은 단어 수나 도메인 이름을 통해 난이도를 예측하려 했으나 실패했습니다. 실제 필요한 기술을 들여다보는 브릭은 테스트된 다른 모든 라우팅 방식보다 뛰어난 성능을 보였습니다.
"오라클(Oracle)"의 천장:
연구진은 "완벽한 세상"의 시나리오(오라클이라고 불림)도 계산했습니다. 만약 마법 같은 웨이터가 모든 주문을 보고 어떤 셰프가 그것을 해결할지 즉각적으로 알 수 있다면, 83.25%의 주문을 맞출 수 있을 것입니다. 브릭은 76.98%를 맞췄습니다. 이는 브릭이 가능한 절감액과 품질 개선의 대부분을 포착했지만, 아직 시스템이 활용하지 못한 약 6%의 "헤드룸(여지)"이 남아있음을 의미합니다.
이것이 "에이전트(Agent, 로봇)"에게 중요한 이유:
논문은 이것이 AI "에이전트"(연속적인 작업을 수행하는 소프트웨어)에게 매우 중요하다는 점을 언급합니다. 만약 에이전트가 문제를 해결하기 위해 10단계를 거쳐야 하는데, 가장 저렴한 셰프를 먼저 확인하고, 그다음 저렴한 셰프, 그다음 비싼 셰프 순으로 확인하는 "캐스케이드(cascade)" 방식의 게으른 라우팅 시스템을 사용한다면, 매 단계마다 시간과 비용을 낭비하게 됩니다. 브릭은 "원샷(one-shot)" 결정권자입니다. 즉, 즉시 올바른 셰프를 선택합니다. 이는 로봇을 빠르게 만들고 청구서를 낮게 유지해 줍니다.
요 요약:
브릭은 우리가 모든 업무에 대해 무턱대고 가장 비싼 AI 모델을 사용하는 것을 막아주는 똑똑한 배차원입니다. 브릭은 작업이 실제로 무엇을 필요로 하는지를 분석하고, 이를 서로 다른 모델의 특정 강점에 맞추며, 비용 절감과 최상의 답변 사이의 균형을 조절할 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.