← 최신 논문
💻 computer science

Symphony-Coord: Adaptive Routing for Multi-Agent LLM Systems

Symphony-Coord는 정적 라우팅의 한계를 극복하기 위해 에이전트 선택을 2단계 비콘 프로토콜과 LinUCB 셀렉터를 활용한 적응형 온라인 멀티 암드 밴딧 문제로 변환함으로써, 실시간 피드백을 기반으로 작업 라우팅 및 결함 복구를 동적으로 최적화하는 멀티 에이전트 LLM 시스템을 위한 탈중앙화된 조정 프레임워크이다.

원저자: Zhaoyang Guan, Huixi Cao, Ming Zhong, Yin Wang, Guanyu Liu, Eric Yang, Lynn Ai, Yongxin Ni, Bill Shi

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhaoyang Guan, Huixi Cao, Ming Zhong, Yin Wang, Guanyu Liu, Eric Yang, Lynn Ai, Yongxin Ni, Bill Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 엄청난 규모의 전문가 팀이 있다고 상상해 보세요. 하지만 그들은 모두 서로 다릅니다. 어떤 이들은 수학에 능숙하고, 어떤 이들은 코딩을 잘하며, 어떤 이들은 빠르지만 실수를 하고, 또 어떤 이들은 느리지만 매우 정확합니다. 그리고 매초마다 복잡한 작업들이 홍수처럼 밀려듭니다.

대부분의 기존 시스템의 문제는 고정된 규칙 책에 따라 업무를 배정하는 경직된 관리자처럼 행동한다는 점입니다: "수학 작업은 A에게, 코딩 작업은 B에게 보낸다." 이 방식은 A가 지치거나, 수학 문제가 약간 변형되거나, 혹은 B가 사실 이 특정 유형의 수학 문제에 대해 A보다 더 뛰어난 능력을 갖추고 있을 때도 그대로 유지됩니다. 결국 시스템은 정체되고, 비효전적이며, 쉽게 무너집니다.

Symphony-Coord는 이 팀을 운영하는 새로운 방식입니다. 경직된 관리자 대신, 지금 이 순간 이 작업에 가장 적합한 사람이 누구인지 실시간으로 학습하는 스마트하고 적응력 있는 "교통 관제사"를 사용합니다.

작동 원리는 다음과 같습니다 (쉬운 비유를 사용했습니다):

1. 문제점: 경직된 오케스트라

전통적인 시스템에서 모든 음악가(에이전트)는 콘서트가 시작되기 전에 고정된 악기(역할)를 배정받습니다. 만약 지휘자가 바이올린 솔로를 원한다면 바이올리니스트를 부릅니다. 하지만 만약 바이올리니스트가 아프다면 어떻게 될까요? 혹은 그 음악의 특정 음표가 사실 첼로를 필요로 하는 것이라면요? 시스템은 이에 적응할 줄 모르며, 다음 적임자를 찾기 위해 시간을 허비하거나 성능이 저하되는 결과를 초래합니다.

2. 해결책: 스마트 교통 관제사

Symphony-Coord는 팀을 역동적인 재능의 풀(pool)로 취급합니다. 새로운 작업이 도착하면 단순히 이름표를 보는 것이 아니라, "누가 사용 가능한가, 누가 빠른가, 그리고 이전에 이와 유사한 일을 성공적으로 수행한 적이 있는가?"를 묻습니다.

이는 저자들이 **"다이내믹 비콘 프로토콜(Dynamic Beacon Protocol)"**이라고 부르는 두 단계 과정을 통해 해결됩니다.

1단계: "라이트닝 라운드" (Top-L 필터링)

방 안에 100명의 전문가가 있다고 상상해 보세요. 100명 모두에게 일일이 "이 일을 할 수 있나요?"라고 묻는 것은 시간이 너무 오래 걸리고 시간을 낭비하는 일입니다.

  • Symphony-Coord가 하는 일: 빠르게 "비콘(beacon, 신호)"을 비춥니다(빠른 확인). 각자의 이력서(역량)와 현재 상태(바쁜지, 혹은 오류가 발생 중인지)를 살핍니다.
  • 결과: 100명 중 가장 적합한 상위 3~5명을 즉시 추려냅니다. 이를 통해 엄청난 양의 시간과 비용(컴퓨팅 자원)을 절약합니다.

2단계: "도박사의 선택" (LinUCB 선택)

이제 상위 3명의 후보 명단이 생겼습니다. 이 중 단 한 명을 어떻게 고를까요?

  • 기존 방식: 과거에 가장 많이 승리했던 사람을 고릅니다. (하지만 이는 위험합니다. 그 사람이 오늘 슬럼프에 빠졌을 수도 있기 때문입니다.)
  • Symphony-Coord 방식: LinUCB라고 불리는 전략을 사용하는데, 이는 두 가지 사이에서 균형을 잡는 스마트한 도박사와 같습니다:
    1. 활용(Exploitation): "이 사람은 실적이 아주 좋습니다. 이 사람을 선택합시다."
    2. 탐색(Exploration): "이 사람을 한동안 시도해보지 않았습니다. 어쩌면 이 까다로운 질문에 대해 이 사람이 실제로 최고일지도 모릅니다. 한번 기회를 줘서 배워봅시다."
  • 학습: 작업이 완료된 후, 시스템은 피드백을 받습니다. 답이 맞았나요? 빨랐나요? 만약 그렇다면, 해당 에이전트에게 "하이파이브(점수 상승)"를 해줍니다. 만약 아니라면, 다음에는 더 주의하도록 학습합니다.

3. 왜 더 나은가: "살아있는" 시스템

이 논문은 이 시스템이 정적인 레이블에 의존하지 않기 때문에 우수하다고 주장합니다.

  • 적응성: 만약 에이전트가 실수를 하기 시작하면(예: 지친 노동자처럼), 시스템은 피드백을 감지하고 즉시 그들에게 어려운 작업을 보내는 것을 중단합니다.
  • 회복 탄력성: 만약 최고의 전문가가 갑자기 오프라인 상태가 되더라도, 시스템은 붕괴되지 않습니다. 시스템은 빠르게 다음으로 적합한 가용 인력에게 업무를 전달하는 법을 배웁니다.
  • 효율성: 초기에 "가능성 있는" 후보들을 걸러냄으로써 자원을 절약하고, 시스템이 정체되지 않고 더 많은 작업을 처리할 수 있게 합니다.

4. 증거: "의학 퀴즈" 테스트

저자들은 이 시스템을 의학 질문이나 수학 문제와 같은 어려운 과업들을 통해 테스트했습니다.

  • 그들은 Symphony-Coord를 단일 전문가 및 다른 다중 에이전트 팀들과 비교했습니다.
  • 결과: Symphony-Coord는 일관되게 더 높은 점수를 기록했습니다. 이 시스템은 특정 "수학 에이전트"가 공식적으로 "의학 전문가"로 분류되어 있지 않음에도 불구하고, 특정 "의학적 논리" 질문에 대해 그 에이전트가 가장 적합하다는 것을 찾아내는 데 더 뛰어났습니다.
  • 또한, 팀의 규모가 커짐에 따라(5명에서 100명으로), Symphony-Coord는 빠르고 정확한 상태를 유지한 반면, 다른 시스템들은 느려지고 혼란에 빠진다는 것을 보여주었습니다.

요약

Symphony-Coord를 단순히 악보를 읽는 지휘자가 아니라, 실시간으로 오케스트라의 소리를 들으며 현재의 음표에 가장 적합한 연주자를 빠르게 찾아내고, 누가 완벽하게 연주하고 있고 누가 음이 이탈하고 있는지에 따라 끊임없이 라인업을 조정하는 지휘자로 생각하십시오. 이 시스템은 경직되고 깨지기 쉬운 시스템을, 매 작업이 완료될 때마다 더 똑똑해지는 유연하고 자가 치유가 가능한 팀으로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →