ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
이 논문은 300 개 이상의 상호의존적 도구와 동적 환경 시뮬레이션을 기반으로 한 모델 컨텍스트 프로토콜에 기반한 엄격한 벤치마크인 ComplexMCP 를 소개하며, 이는 도구 검색 포화, 과도한 자신감, 전략적 패배주의와 같은 병목 현상으로 인해 현재 대규모 언어 모델 에이전트가 복잡한 워크플로우에서 인간보다 현저히 낮은 성능을 보인다는 사실을 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 독서량이 풍부한 로봇 비서를 고용하여 복잡한 비즈니스를 운영한다고 상상해 보세요. 당신은 "주식 몇 주 사기, 항공권 예약하기, 친구에게 메시지 보내기"와 같은 작업 목록을 그에게 줍니다.
과거 연구자들은 이 로봇들을 테스트할 때 "2+2 계산하기"나 "날씨 조회하기"와 같은 단순하고 고립된 작업을 주었습니다. 로봇들은 이러한 작업에서는 훌륭했습니다. 하지만 현실 세계에서는 작업들이 엉망입니다. 작업들은 서로 의존합니다 (누가 여행하는지 알기 전까지는 항공권 예약을 할 수 없습니다), 시스템은 오작동할 수 있습니다 (인터넷이 지연될 수 있습니다), 그리고 작업 중에도 환경이 변합니다 (친구가 당신을 차단했을 수도 있고, 쇼핑 카트에 이미 물건이 담겨 있을 수도 있습니다).
문제: "마지막 마일" 격차
이 논문의 저자들인 ComplexMCP는 우리의 AI 에이전트들이 쉬운 부분에서는 잘하지만, 실제 현실 세계의 작업을 수행하는 마지막이자 가장 어려운 단계인 "마지막 마일"에서는 실패한다고 주장합니다. 그들은 빈 주차장에서 완벽하게 평행 주차를 할 수 있는 운전자가 구덩이와 다른 차들이 있는 붐비는 도시 거리를 운전하려 할 때 충돌하는 것과 같습니다.
해결책: AI 를 위한 "시뮬레이션 도시"
이 로봇들이 실제 혼란을 얼마나 잘 처리하는지 테스트하기 위해, 팀은 ComplexMCP를 구축했습니다. 이를 단순한 퀴즈가 아니라 7 개의 서로 다른 지구 (소셜 미디어 마을, 주식 시장, 온라인 상점, 여행사 등) 가 있는 거대한 시뮬레이션 비디오 게임 도시로 생각하세요.
- 도구들: 이 도시 내부에는 AI 가 사용할 수 있는 300 개 이상의 다양한 "도구들" (버튼, 레버, API) 이 있습니다.
- 혼란: 핵심적으로, 이러한 도구들은 서로 연결되어 있습니다. 단순히 버튼을 누르는 것이 아니라, 도구가 작동하기 전에 네트워크를 먼저 수리하거나 잔고를 확인하거나 사용자의 신원을 확인해야 할 수도 있습니다.
- "시드" 메커니즘: 테스트를 공정하면서도 현실적으로 만들기 위해, 그들은 "시드" (무작위 숫자 생성기와 같은) 를 사용합니다. 이는 매번 테스트를 실행할 때마다 도시가 약간 다르게 보이도록 합니다 (다른 사용자, 다른 가격, 다른 네트워크 속도). 하지만 규칙은 동일하게 유지됩니다. 이는 AI 가 단순히 정답을 외우는 것을 방지합니다.
대규모 테스트: 로봇 대 인간
연구자들은 최상위 AI 모델들 (GPT-5, Gemini, Claude 등) 을 이 도시로 데려와 47 개의 복잡한 미션을 수행하게 했습니다. 또한 실제 인간들에게도 동일한 도구들을 사용하여 동일한 작업을 수행하게 했습니다.
결과: stark 한 현실 점검
결과는 놀랍고 경각심을 불러일으켰습니다:
- 인간은 약 **94%**의 성공률을 보였습니다.
- 최고의 AI(Gemini-3-Flash) 는 약 **55%**의 성공률만 보였습니다.
- 가장 진보된 모델들조차 60% 이상의 성공률을 넘기 어려워했습니다.
왜 로봇들은 실패할까요?
이 논문은 이러한 똑똑한 에이전트들이 현실 세계에서 허둥지둥하는 세 가지 주요 원인을 파악했습니다:
- "도구 과부하" (검색 포화): 30만 권의 책이 있는 도서관에서 특정 책을 찾아야 하는 사서라고 상상해 보세요. 만약 그들에게 목록 없이 책을 찾아달라고 하면, 그들은 압도당합니다. 마찬가지로 AI 가 수백 개의 도구 중에서 선택해야 할 때, 올바른 도구를 잊어버리거나 옵션의 sheer한 양에 혼란을 겪는 경우가 많습니다.
- "클린 슬레이트" 편향 (과신): 이것이 가장 흔한 실수입니다. AI 는 세상이 새로운 게임 레벨처럼 비어 있고 신선하다고 가정합니다. 실제로는 "쇼핑 카트"에 이미 물건이 있거나 "네트워크"가 고장 났을 수 있습니다. AI 는 현재 상태를 확인하는 것을 건너뛰고 단순히 행동하려 하므로, (이미 가지고 있는 것을 구매하려는 것과 같은) 오류가 발생합니다. 공간이 있는지 확인하지 않고 가득 찬 여행 가방에 새로운 물건을 추가하려는 것과 같습니다.
- 전략적 패배주의: AI 가 작은 오류 (일시적인 네트워크 오작동 등) 에 부딪히면, 그것을 수정하려 (예: "네트워크 가속기" 도구 호출) 하기보다는 종종 포기합니다. 문제를 해결하기 위한 다른 경로를 시도하기보다는, 정중하게 "이것을 할 수 없습니다"라고 말하는 데 자신의 화려한 언어 능력을 사용합니다. 구덩이를 보고 즉시 차를 되돌리는 대신 그냥 피해서 운전하는 운전자와 같습니다.
"검색" (RAG) 은 어떨까요?
연구자들은 AI 에게 모든 300 개의 도구를 한 번에 보여주는 대신 올바른 도구를 찾을 수 있는 "검색 엔진"을 제공하는 것이 도움이 되는지도 테스트했습니다. 이는 일부 메모리를 절약했지만, 실제로는 이러한 복잡한 작업에서 AI 를 더 나쁘게 만들었습니다. 왜일까요? 검색 엔진이 다음 단계에 필요한 "숨겨진" 도구들을 찾을 수 없었기 때문입니다. 사서에게 "요리에 관한 책"을 요청했지만, 실제로 필요한 책의 제목이 "케이크 굽는 법"이고, 사서가 연결이 명확하지 않다고 생각하여 그것을 제안하지 않은 것과 같습니다.
결론
이 논문은 AI 가 더 똑똑해지고 있지만, 복잡하고 엉망인 현실 세계 환경에서 완전히 자율적인 근로자가 되기에는 아직 준비가 되지 않았다고 결론 내립니다. 이는 현재 세계의 상태를 인식하고, 작은 오류에서 회복하며, 복잡한 의존성 체인을 탐색하는 능력이 부족합니다. ComplexMCP는 이제 AI 를 위한 새로운 "운전 면허 시험"이 되어, 이러한 약점들을 찾아내어 다음 세대 로봇들이 충돌 없이 도시를 운전할 수 있도록 학습하게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.