← 최신 논문
🤖 AI

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

이 설문 조사는 단일 구조의 비효율성을 해결함으로써 자원 소비를 최적화하고 비용을 절감하며 성능을 향상할 수 있도록 쿼리를 적절한 모델로 동적으로 유도하는 방법을 분석하여, 거대 언어 모델 기반 시스템의 라우팅 전략에 대한 포괄적인 개요를 제공한다.

원저자: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

게시일 2026-07-16
📖 6 분 읽기🧠 심층 분석

원저자: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 질문을 던질 때마다 전문가 팀이 달려와 답을 해주는 세상을 상상해 보세요. 어떤 이들은 노벨상 수상 교수처럼 시간당 비용을 청구하는, 매우 똑똑하지만 느리고 비싼 전문가들입니다. 또 다른 이들은 대부분의 일을 처리할 수 있지만 정말 까다로운 수수께끼 앞에서는 주춤거릴 수도 있는, 지식은 풍부하지만 빠르고 저렴한 친구 같은 존재들입니다. 인공지능의 세계에서 이 "전문가"들은 거대 언어 모델(LLM)입니다. 현재 대부분의 컴퓨터 시스템은 단순한 물 한 잔부터 복잡한 5코스 요리까지 모든 주문을 주방의 가장 비싼 셰프에게 보내버리는 고집 센 레스토랑처럼 구축되어 있습니다. 이 방식도 작동은 하지만, 낭비적이고 느리며 많은 에너지를 소모합니다. 과학자들이 던지는 핵심 질문은 이것입니다. "우리가 주문을 보고, 이 주문을 빠르고 저렴한 조력자에게 보낼지 아니면 비싼 천재에게 보낼지 즉각 결정할 수 있는 더 똑똑한 '매트르 디(maître d', 지배인'을 어떻게 만들 수 있을까?" 이것이 바로 "라우팅(routing)"이라 불리는 새로운 분야의 핵심이며, 이는 더 적은 것으로 더 많은 것을 해내는 것에 관한 것입니다.

"적은 것으로 더 많이 하기(Doing More with Less)"라는 제목의 이 논문은 연구자들이 그 똑똑한 매트르 디를 만들기 위해 시도하고 있는 다양한 방법들을 집대성한 방대한 투어 가이드입니다. 프랑스 출신의 저자 팀은 단순히 하나의 새로운 기술을 발명한 것이 아니라, 현재 테스트 중인 전략들의 전체 지형을 수집하고 정리했습니다. 그들은 돈과 에너지를 아끼는 가장 좋은 방법이 모든 것을 위해 하나의 거대한 뇌를 사용하는 것이 아니라, 질문의 난이도에 따라 질문을 적절한 도구로 라우팅하는 시스템을 만드는 것임을 발견했습니다. 그들은 간단한 인사말에는 아주 작고 저렴한 모델을 사용할 수 있으며, 정말 어려운 논리 퍼즐에만 크고 비싼 모델을 아껴둘 수 있다는 것을 발견했습니다. 하지만 그들은 이것이 아직 마법의 지팡이는 아니라고 경고합니다. 어떤 방법은 비용 절감에는 뛰어나지만 정확도를 놓칠 수 있고, 어떤 방법은 실제 세상에서 실행하기에는 너무 복잡합니다. 이 논문은 미래가 고정된 규칙에 얽매이는 것이 아니라, 새로운 도구가 생겨날 때마다 배우고 생각을 바꿀 수 있는 "적응형(adaptive)" 시스템에 있다고 제안합니다.

거대한 문제: "모두에게 똑같은" 셰프

거대 언어 모델(LLM)을 초특급 셰프라고 생각해 보세요. 어떤 셰프들은 제너럴리스트입니다. 샌드위치부터 수플레까지 거의 모든 것을 요리할 수 있죠. 하지만 이들을 고용하는 데는 비용이 많이 들고 작업 시간도 오래 걸립니다. 다른 셰프들은 스페셜리스트입니다. 예를 들어 피자 만드는 데는 천재적이지만 케이크를 굽는 데는 젬병일 수도 있습니다.

현재 대부분의 AI 시스템은 메뉴를 무시하는 레스토랑과 같습니다. 만약 당신이 물 한 잔을 요청한다면, 시스템은 가장 비싸고 강력한 셰프(예: GPT-4 또는 Claude)를 호출합니다. 이것은 엄청난 낭비입니다. 많은 돈이 들고, 엄청난 전기를 사용하며, 필요 이상으로 시간이 오래 걸립니다. 이 논문은 우리에게 "라우터(router)", 즉 스마트한 웨이터가 필요하다고 주장합니다. 웨이터는 당신의 요청을 보고 결정해야 합니다. "헤이, 이건 그냥 간단한 질문이네. 빠른 저렴한 인턴에게 보내자." 하지만 만약 당신이 복잡한 수학 문제를 묻는다면, 웨이터는 "좋아, 이건 헤드 셰프가 필요해"라고 말해야 합니다.

이 논문이 답하는 세 가지 큰 질문

저자들은 이 문제를 세 가지 간단한 질문으로 나눕니다: 무엇을 최적화할 것인가? 언제 결정을 내릴 것인가? 그리고 어떻게 실제로 라우터를 구축할 것인가?

1. 우리는 무엇을 아끼려고 하는가?

대부분의 사람들은 오직 돈만이 중요하다고 생각합니다. 하지만 논문은 우리가 시간(지연 시간)과 환경(에너지)도 신경 써야 한다고 지적합니다.

  • 돈: AI가 질문에 답할 때마다 단어(토큰)당 아주 적은 비용이 발생합니다.
  • 시간: 단순한 "안녕"이라는 말에 느리고 강력한 AI가 답하기를 기다리는 것은 짜증스러운 일입니다.
  • 지구: 거대 AI 모델은 많은 전기를 사용합니다. 만약 우리가 질문의 80%에 작은 모델을 사용할 수 있다면, 엄청난 양의 에너지를 아끼고 탄소 발자국을 줄일 수 있습니다.

2. 언제 결정하는가?

논문은 "웨이터"가 선택을 내릴 수 있는 두 가지 주요 순간을 식별합니다.

  • 답변 생성 전 (Pre-generation): 웨이터는 아무도 요리를 시작하기 전에 당신의 질문을 살펴봅니다. 그들은 "이건 간단한 피자 주문 같군"이라고 추측하고 즉시 저렴한 셰프에게 보냅니다. 이것은 빠르고, 큰 셰프가 개입하지 않기 때문에 돈을 아낄 수 있습니다.
  • 답변 생성 후 (Post-generation/Cascade): 웨이터는 저렴한 셰프가 먼저 시도하게 둡니다. 만약 답변이 별로거나 셰프가 확신이 없어 보인다면, 그때 웨이터는 비싼 셰프에게 질문을 보냅니다. 이것은 피자를 주문하고 한 조각 맛을 본 뒤, 만약 타버렸다면 헤드 셰프를 불러서 새로 만들게 하는 것과 같습니다. 이것은 더 안전하지만, 저렴한 셰프가 자주 실패한다면 더 느리고 비용이 많이 들 수 있습니다.

3. 어떻게 웨이터를 만드는가?

이 부분이 가장 재미있는 부분입니다. 논문은 수십 가지의 서로 다른 "웨이터" 전략을 검토하며, 이를 네 가지 주요 가족으로 분류합니다.

  • "닮은꼴" 웨이터 (유사성 기반 - Similarity-based): 이 웨이터는 과거의 질문들을 담은 스크랩북을 가지고 있습니다. 만약 당신이 지난주에 했던 질문과 비슷한 질문을 던진다면, 웨이터는 그 질문에 답했던 것과 같은 셰프에게 보냅니다. 마치 "지난번에 고양이에 대해 물었을 때 고양이 전문가가 아주 훌륭했으니, 이번 고양이 질문도 그들에게 보내야지"라고 말하는 것과 같습니다.
  • "선생님" 웨이터 (지도 학습 - Supervised): 이 웨이터는 학생처럼 훈련됩니다. 패턴을 인식하는 법을 배웁니다. 예를 들어, "수학"에 관한 질문은 보통 수학 전문가가 필요하고, "농담"에 관한 질문은 창의적인 모델이 필요하다는 것을 배웁니다. 이는 "어떤 요리를 어떤 셰프가 담당하는가"에 대한 교과서를 암기한 학생과 같습니다.
  • "도박꾼" 웨이터 (강화 학습 - Reinforcement Learning): 이 웨이터는 비디오 게임 캐릭터처럼 시행착오를 통해 배웁로. 여러 셰프를 시도해보고, 답변이 좋았는지 확인하며, 돈을 아끼고 좋은 답변을 얻어내면 "보상"을 받습니다. 시간이 지나면서 교과서 없이도 최고의 전략을 스스로 학습합니다.
  • "자기 성찰" 웨이터 (생성형 - Generative): 이것은 AI가 자신과 대화하는 방식입니다. 웨이터는 저렴한 셰프에게 "정말로 대답할 수 있겠어?"라고 묻습니다. 만약 셰프가 "잘 모르겠어요"라고 답하면, 웨이터는 즉시 질문을 큰 셰프에게 보냅니다. 이는 친구에게 "너 이거 알아?"라고 물어보고, 친구가 머뭇거리면 전문가를 부르는 것과 같습니다.

논문이 제외하는 것들 ("관심 갖지 마세요" 목록)

저자들은 무엇이 좋은 라우팅 전략이 아닌지에 대해 매우 명확하게 밝히고 있습니다. 그들은 단순히 다섯 명의 셰프로부터 답변을 모은 뒤 가장 좋은 것을 고르는 것(앙상블 방법이라 불림)은 라우팅과 같지 않다고 명시적으로 말합니다. 그것은 피자 다섯 판을 주문하고 나서 맛없는 것을 버리는 것과 같으며, 너무 비쌉니다. 목표는 요리를 시작하기 전에 올바른 셰프를 선택하는 것이지, 모든 것을 다 요리한 다음 고르는 것이 아닙니다.

또한 그들은 AI에게 자신의 확신도를 추측하게 하는 것과 같은 일부 방법들이 까다로울 수 있다고 언급합니다. 때때로 AI는 실제로 알지 못함에도 불구하고 "나는 알고 있다!"라고 과하게 확신할 수 있습니다. 이는 시스템이 잘못된 셰프를 신뢰할 경우 나쁜 답변으로 이어질 수 있습니다.

결론: 유망하지만 완벽하지는 않다

논문은 라우팅이 강력한 도구이지만, 아직 완전히 해결된 미스터리는 아니라고 결론짓습니다.

  • 효과가 있습니다: 많은 테스트에서 스마트한 라우팅은 큰 모델을 사용하는 것만큼 좋은 답변을 유지하면서도 비용을 절반 이상 절감할 수 있음을 보여주었습니다.
  • 까다롭습니다: 최선의 전략은 상황에 따라 다릅니다. 어떤 경우에는 "닮은꼴" 접근 방식이 가장 잘 맞고, 다른 경우에는 "선생님" 접근 방식이 더 좋습니다.
  • 미래: 저자들은 다음 단계가 이러한 라우터들을 "적응형"으로 만드는 것이라고 제안합니다. 현재는 주방에 새로운 셰프를 추가하면 웨이터 시스템 전체를 다시 훈련시켜야 하는 경우가 많습니다. 미래의 목표는 새로운 셰프의 기술을 즉각적으로 이해하고, 긴 훈련 기간 없이도 바로 사용할 수 있는 웨이터를 만드는 것입니다.

요약하자 true, 이 논문은 더 똑똑하고, 저렴하며, 친환경적인 AI 시스템을 구축하기 위한 가이드북입니다. 우리는 견과류를 깨기 위해 대형 망치를 사용할 필요가 없다는 것을 알려줍니다. 작은 망치를 언제 쓰고 큰 망치를 언제 써야 하는지 아는 똑똑한 시스템을 구축함으로써, 우리는 AI를 더 빠르고, 저렴하고, 지구에 더 이롭게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →