← 최신 논문
🤖 AI

ProtocolBench: Which LLM MultiAgent Protocol to Choose?

이 논문은 성공률, 지연 시간, 오버헤드 및 강건성 지표를 통해 LLM 멀티 에이전트 통신 프로토콜을 평가하기 위한 종합적인 벤치마크인 ProtocolBench와, 시스템 성능과 신뢰성을 크게 향상시키기 위해 최적의 프로토콜을 동적으로 선택하는 학습 가능한 시스템인 ProtocolRouter를 소개한다.

원저자: Hongyi Du, Jiaqi Su, Jisen Li, Lijie Ding, Yingxuan Yang, Peixuan Han, Xiangru Tang, Kunlun Zhu, Jiaxuan You

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hongyi Du, Jiaqi Su, Jisen Li, Lijie Ding, Yingxuan Yang, Peixuan Han, Xiangru Tang, Kunlun Zhu, Jiaxuan You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 소설을 쓰거나, 환자를 진단하거나, 공급망을 관리하는 것과 같은 복잡한 문제를 해결하기 위해 거대한 AI 어시스턴트 팀을 구축하고 있다고 상상해 보십시오. 이 AI 에이전트들은 업무를 완수하기 위해 서로 대화해야 합니다. 하지만 인간과 마찬가지로, 그들은 단순히 무작정 소리를 지를 수는 없습니다. 그들에게는 어떻게 말하고, 듣고, 메시지를 전달할지에 대한 규칙인 **통신 프로토콜(communication protocol)**이 필요합니다.

현재는 다양한 "언어" 또는 프로토콜(예: A2A, ACP, ANP, Agora)이 존재합니다. 문제는 어떤 프로토콜을 선택할지가 일종의 '추측 게임'이 되어버렸다는 점입니다. 개발자들은 자신의 특정 작업에 어떤 것이 가장 빠르고, 신뢰할 수 있으며, 보안이 철저한지 알지 못한 채, 단지 직감에 의존하여 선택하곤 합니다.

이 논문은 이를 해결하기 위해 두 가지 핵심적인 요소를 소개합니다. 바로 **테스트 베드(testing ground)**인 ProtocolBench와 **스마트 셀렉터(smart selector)**인 ProtocolRouter입니다.

1. 테스트 베드: ProtocolBench

ProtocolBench를 이 통신 프로토콜들을 위한 거대하고 표준화된 "경주 트랙"이라고 생각하십시오. 연구원들은 단순히 누가 경주에서 이겼는지만 보는 것이 아니라, 압박 속에서 각 프로토콜이 어떻게 성능을 발휘하는지 측정하기 위해 네 가지 특정 지표를 측정합니다.

  • 업무를 완수했는가? (작업 성공도 - Task Success)
  • 얼마나 빨리 수행했는가? (지연 시간 - Latency)
  • 얼마나 많은 "연료"(데이터)를 태웠는가? (메시지 오버헤드 - Message Overhead)
  • 문제가 발생했을 때 어떻게 되는가? (견고성 - Robustness)

이를 테스트하기 위해, 그들은 네 가지 다른 "시나리오"(다양한 유형의 경주와 같은)를 설정했습니다.

  • 탐정 (GAIA): 방대한 문서 도서관에서 답을 찾기 위해 협력하는 에이전트 팀.
  • 조립 라인 (Streaming Queue): 코디네이터가 작업자들에게 1,000개의 질문을 보내면 작업자들이 빠르게 답변해야 하는 빠른 속도의 시스템.
  • 폭풍 훈련 (Fail-Storm): 에이전트들이 갑자기 "사망"(연결 끊김)하고, 작업이 계속되는 동안 다시 연결되어야 하는 시뮬레이션.
  • 비밀 요원 (Safety Tech): 에이전트들이 누군가 엿듣거나 데이터를 훔치지 못하도록 보안을 유지하며 대화해야 하는 의료 시나리오.

중요한 발견:
연구원들은 단 하나의 "최고"인 프로토콜은 존재하지 않는다는 것을 발견했습니다. 그것은 전적으로 무엇을 하고 있느냐에 달려 있습니다.

  • 만약 속도와 낮은 데이터 사용량이 필요하다면 (조립 라인처럼), ACP가 승자였습니다.
  • 만약 높은 수준의 추론과 팀워크가 필요하다면 (탐정처럼), A2A가 가장 우수한 성능을 보였습니다.
  • 만약 최대의 보안과 프라이버시가 필요하다면 (비밀 요원처럼), ANPAgora만이 엄격한 암호화와 신원 확인을 처리할 수 있었습니다.
  • 만 만약 문제가 생겼을 때의 회복 탄력성이 필요하다면 (폭풍 훈련처럼), A2A가 대화를 지속하는 데 가장 신뢰할 수 있었습니다.

2. 스마트 셀렉터: ProtocolRouter

단일 프로토콜이 모든 면에서 승리할 수 없기 때문에, 연구원들은 ProtocolRouter를 구축했습니다.

이것을 교통 관제탑이나 스마트한 지휘자라고 생각하십시오. 팀 전체가 동일한 언어를 사용하도록 강요하는 대신, Router는 각 작업의 특정 부분을 살펴보고 그 작업에 가장 적합한 프로토콜을 할당합니다.

  • 예시: 복잡한 프로젝트에서, Router는 "연구원" 에이전트들에게는 (다양한 출처와 안전하게 통신해야 하므로) Agora를 사용하라고 지시할 수 있고, "계산기" 에이전트들에게는 (숫자를 최대한 빠르게 주고받아야 하므로) ACP를 사용하라고 지시할 수 있습니다.

Router는 규칙(예: "암호화 필수" 또는 "매우 빨라야 함")을 확인하고 적절한 도구를 선택합니다. 논문은 이 스마트한 셀렉터를 사용하는 것이 하나의 프로토콜만을 고수하는 것보다 시스템의 장애 복구 속도를 18% 더 빠르게 만들고, 작업을 더 성공적으로 해결할 수 있음을 보여줍니다.

3. "브릿지(Bridge)" 개념

이러한 서로 다른 언어들이 어떻게 서로 소통하는지에 대한 흥หนึ่ง로운 기술적 세부 사항이 있습니다. Router가 서로 다른 프로토콜을 서로 다른 에이전트에게 할당할 때, 그들은 서로를 이해할 방법이 필요합니다. 논문은 **스테이트리스 브릿지(stateless bridge)**를 설명합니다.

두 사람이 서로 다른 언어를 말하고 있다고 상상해 보십시오. 그들은 서로의 언어를 배울 필요 없이, 즉석에서 단어를 변환해 주는 번역기를 사용하면 됩니다. 이 시스템의 브릿지는 정확히 그 역할을 합니다. 메시지의 실제 의미를 바꾸거나 속도를 크게 늦추지 않으면서 메시지 형식을 프로토콜 A에서 프로토콜 B로 변환합니다.

요약

  • 문제점: AI 통신 프로토콜을 선택하는 것은 지금까지 추측 게임이었습니다.
  • 해결책: 저자들은 속도, 비용, 성공도, 안전성을 측정하기 위해 엄격한 테스트 트랙인 ProtocolBench를 구축했습니다.
  • 결과: 서로 다른 프로토콜이 서로 다른 상황에서 승리합니다. "만능(one size fits all)"은 존재하지 않습니다.
  • 혁신: 그들은 ProtocolRouter를 만들어 작업의 각 특정 부분에 가장 적합한 프로토콜을 자동으로 선택하게 함으로써, AI 팀을 더 빠르고, 안전하며, 신뢰할 수 있게 만들었습니다.

요컨대, 이 논문은 우리를 "멋져 보여서 프로토콜을 고르는 단계"에서 "데이터가 그 작업에 적합한 도구라고 말하기 때문에 프로토콜을 고르는 단계"로 이동시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →