← 최신 논문
💬 NLP

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

이 논문은 대규모 MCP 서버 환경에서의 에이전트 성능을 평가하기 위해 70 개 서버와 527 개의 도구를 포함한 'LiveMCPBench' 벤치마크를 제안하고, 검색 오류가 주요 병목 현상임을 규명하여 향후 연구 방향을 제시합니다.

원저자: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

게시일 2026-02-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🌊 1. 배경: AI 비서와 거대한 도구 바다

최근 AI(대형 언어 모델) 는 단순히 말만 하는 것을 넘어, 외부의 '도구'를 이용해 일을 처리할 수 있게 되었습니다. 이를 **MCP(Model Context Protocol)**라고 하는데, 쉽게 말해 AI 가 사용할 수 있는 수만 개의 도구 (앱, 웹사이트, 파일 등) 를 연결해주는 표준 규약입니다.

하지만 문제는 이 도구들이 너무 많다는 것입니다. 마치 **거대한 항구 (바다) 에 10,000 개가 넘는 배 (서버) 와 500 개가 넘는 컨테이너 (도구)**가 떠다니는데, AI 비서는 그중에서 정확히 필요한 것을 찾아내야 합니다.

🧪 2. 문제점: 기존 시험은 너무 쉬웠어요

지금까지 AI 의 도구 사용 능력을 시험할 때는 현실과 동떨어진 환경에서 테스트했습니다.

  • 비유: 마치 작은 방에 책상 위 도구 10 개만 놓고 "이것으로 집을 지어보세요"라고 시험을 본 것과 같습니다.
  • 현실: 실제 세상은 거대한 항구에서 수천 개의 도구 중 필요한 것을 찾아내고, 여러 도구를 조합해야 합니다.
  • 결론: 기존 시험은 AI 가 실제 바다를 항해할 능력을 제대로 평가하지 못했습니다.

🚀 3. 해결책: 'LiveMCPBench'라는 새로운 시험지

저자들은 이 문제를 해결하기 위해 LiveMCPBench라는 새로운 평가 기준을 만들었습니다.

  • 실전 같은 시나리오: "다음 주 월요일에 베이징에서 상하이로 가는 기차표 구하기", "오늘 뉴스 요약해서 PDF 로 만들기"처럼 실제 사람들이 매일 겪는 95 가지 일을 시험 문제로 냈습니다.
  • 거대한 도구 세트: 시험을 위해 70 개의 서버와 527 개의 도구를 준비했습니다. 중요한 건 이 도구들이 별도의 복잡한 설정 없이 바로 쓸 수 있게 (Plug-and-Play) 준비했다는 점입니다.
  • 현실적인 평가: AI 가 답을 내놓았을 때, 정답이 맞는지 LLM(또는 인간) 심판이 "핵심 포인트"를 기준으로 꼼꼼히 채점합니다.

📊 4. 실험 결과: AI 들의 실력은?

최신 AI 모델 12 개를 이 시험에 출전시켰습니다. 결과는 극명하게 갈렸습니다.

  • 최고의 선수: Claude-Sonnet-4는 **약 79%**의 성공률을 보였습니다. 이 모델은 필요한 도구를 찾아내고, 여러 도구를 조합해서 문제를 해결하는 능력이 뛰어났습니다.
  • 중하위권: 대부분의 다른 모델들은 30~50% 정도에 그쳤습니다.
  • 핵심 발견:
    1. 도구 조합 능력이 중요: 단순히 도구 하나만 쓰는 게 아니라, 여러 도구를 능동적으로 조합하는 모델이 훨씬 잘했습니다.
    2. 가장 큰 병목은 '찾기' (검색): 실패한 경우의 **약 50%**가 "필요한 도구를 못 찾았다"는 이유였습니다. 도구를 잘못 쓰거나 (Tool Error) 질문을 잘못 던진 것보다, 올바른 도구를 찾아내는 것이 가장 어려운 일이었습니다.

🔍 5. 결론 및 시사점

이 연구는 우리에게 중요한 메시지를 줍니다.

  • 현재의 한계: AI 가 도구 자체를 쓰는 능력은 꽤 좋지만, **수만 개의 도구 바다에서 '정답'을 찾아내는 능력 (검색)**이 여전히 약합니다.
  • 미래의 방향: 앞으로는 AI 가 도구를 더 잘 조합하는 것뿐만 아니라, 방대한 도구 목록에서 정확한 도구를 빠르게 찾아내는 기술을 발전시켜야 합니다.

💡 한 줄 요약

"AI 비서가 거대한 도구 창고에서 필요한 것을 찾아내서 일을 잘 해내려면, '찾는 능력 (검색)'을 먼저 키워야 한다!"

이 논문은 바로 그 '찾는 능력'을 평가할 수 있는 현실적인 시험지를 만들고, 현재 AI 들이 그 시험에서 얼마나 고전하고 있는지를 낱낱이 분석한 연구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →