← 최신 논문
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra는 다양한 벤치마크에서 경직된 다중 에이전트 시스템에 비해 훨씬 높은 정확도와 낮은 비용을 달성하기 위해 작업 분해 깊이, 작업자 선택, 추론 예산을 공동으로 최적화하는 통합된 강화 학습 기반 오케스트레이션 정책을 도입합니다.

원저자: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡한 문제를 해결해야 한다고 상상해 보세요. 예를 들어 호텔 예약, 항공권 구매, 교통 상황 확인, 식사 준비 등을 포함하는 전국 일주 로드 트립을 계획하는 것과 같습니다.

인공지능 세계에서는 현재 대부분의 시스템이 이 문제를 두 가지 어색한 방식 중 하나로 처리합니다:

  1. "일괄 적용형" 보스: 항공권 예약부터 야채 다지기까지 모든 일을 수행하도록 가장 비싸고 초지능적인 CEO(대규모 AI 모델) 를 고용합니다. 이는 작동하지만, 날씨 확인 같은 단순한 작업조차도 매우 비싸고 느립니다.
  2. "경직된 조립 라인": "먼저 CEO 에게 항공권을 요청하고, 그다음 호텔 정보를 요청하라"는 사전 작성된 스크립트를 따릅니다. 이는 유연성이 부족합니다. CEO 가 바쁘거나 작업이 변경되면 전체 라인이 멈춥니다.

Uno-Orchestra는 이 쇼를 운영하는 더 새롭고 지능적인 방법입니다. 이는 스스로 일을 수행하지는 않지만, 작업의 모든 작은 부분에 대해 정확히 누구를 고용해야 할지 아는 훌륭하고 비용에 민감한 투어 매니저라고 생각하세요.

핵심 아이디어: "선택적 위임"

투어 매니저 (Uno-Orchestra) 는 요청을 받으면 두 가지 질문을 동시에 던집니다:

  1. "이것을 분해해야 할까?" (분해)
  2. "이 특정 부분에 가장 적합한 사람은 누구인가?" (라우팅)
  • 작업이 단순한 경우(예: "2+2 는 얼마인가?"), 매니저는 "아무도 부를 필요가 없다. 내가 바로 답하겠다"고 말합니다. 이는 시간과 비용을 절약합니다.
  • 작업이 복잡한 경우(예: "주식 데이터를 분석하고 시각화하는 Python 스크립트를 작성하라"), 매니저는 이를 하위 작업으로 분할합니다: "데이터 찾기", "코드 작성", "코드 실행", "차트 만들기".
  • 마법 같은 트릭: 각 하위 작업에 대해 매니저는 완벽한 근로자를 선택합니다. "데이터 찾기" 작업은 빠르고 저렴한 인턴 (작고 저렴한 AI 모델) 에게 할당할 수 있습니다. 하지만 "차트 만들기" 작업은 전문적이고 비싼 예술가 (강력하고 비싼 AI 모델) 에게 할당합니다.

어떻게 이렇게 훌륭하게 학습했는가

이 논문은 새로운 직원을 교육하는 것처럼 두 단계의 훈련 과정을 설명합니다:

  1. 인턴십 (지도 미세 조정): 시스템은 "마스터 매니저"가 문제를 해결하는 61,000 개의 예시를 관찰했습니다. 마스터 매니저는 추측이 아닌 실제 도구와 실제 코드 실행을 사용했습니다. 시스템은 이러한 성공적인 패턴을 모방하는 법을 학습했습니다: 언제 분해해야 하는지, 그리고 어떤 작업을 어떤 근로자에게 할당해야 하는지.
  2. 시뮬레이션 리그 (강화 학습): 그 후 시스템은 스스로 어려운 문제를 해결해야 하는 "훈련 아레나"에 배치되었습니다.
    • 문제를 정확하고 저렴하게 해결하면 높은 점수를 받았습니다.
    • 정확하게 해결했지만 돈을 낭비하면 낮은 점수를 받았습니다.
    • 실패하면 0 점이었습니다.
    • 결정적으로, 시스템은 특정 단계에 대해 칭찬 (또는 비난) 을 받는 법을 학습했습니다. 3 단계에서 잘못된 근로자를 선택했다면, 단순히 마지막에 "실패했다"는 일반적인 피드백을 받는 대신 그 특정 실수를 학습했습니다.

결과: 빠르고, 저렴하며, 똑똑함

연구진은 이 새로운 투어 매니저를 수학 및 코딩부터 긴 문서 읽기에 이르기까지 13 가지 다른 유형의 도전 과제에 걸쳐 22 개의 다른 시스템 (다른 "라우터" 및 "조립 라인" 포함) 과 비교하여 테스트했습니다.

  • 점수: Uno-Orchestra 는 **77%**의 성공률을 기록했으며, 이는 다음으로 가장 좋은 시스템보다 약 16% 더 높은 수치였습니다.
  • 비용: 더욱 놀라운 점은 무거운 워크플로우 시스템보다 쿼리당 비용이 10 배 더 적게 들면서 이 결과를 달성했다는 것입니다.

왜 더 잘 작동하는가

이 논문은 그 비결이 유연성이라고 주장합니다.

  • 기존 시스템은 거대한 한 개의 뇌로 모든 일을 하려 했거나 (너무 비쌈), 경직된 스크립트를 따르거나 (너무 멍청함) 했습니다.
  • Uno-Orchestra 는 재즈 음악가와 같습니다. 단순한 단일 음 (직접적인 답변) 을 연주할 때와 전체 밴드를 소집할 때 (작업 분해) 를 언제 해야 하는지 알고 있으며, 각 음에 필요한 정확한 악기 (AI 모델) 를 알고 있습니다.

요약

Uno-Orchestra 는 지능적인 프로젝트 매니저가 되는 법을 학습하는 시스템입니다. 단순히 질문을 라우팅하는 것이 아니라, 어떻게 분해할지, 누구에게 할당할지 결정하며, 동시에 엄격한 예산을 유지합니다. 이는 가장 어려운 문제를 해결하기 위해 가장 비싼 AI 가 필요하지 않다는 것을 증명합니다. 올바른 시기에 올바른 일을 수행하는 올바른 AI 만 있으면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →