← 최신 논문
🤖 AI

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

본 논문은 주장 기반 채점 기준을 사용하여 현실적인 다단계 워크플로우에서 대규모 언어 모델의 도구 사용 역량을 엄격하게 평가하도록 설계된 36 개의 실제 MCP 서버와 220 개의 도구에 걸친 1,000 개의 작업으로 구성된 대규모 벤치마크인 MCP-Atlas 를 소개합니다.

원저자: Chaithanya Bandi, Ben Hertzberg, Geobio Boo, Tejas Polakam, Jeff Da, Sami Hassaan, Manasi Sharma, Andrew Park, Ernesto Hernandez, Dan Rambado, Ivan Salazar, Rafael Cruz, Chetan Rane, Ben Levin, Brad K
게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chaithanya Bandi, Ben Hertzberg, Geobio Boo, Tejas Polakam, Jeff Da, Sami Hassaan, Manasi Sharma, Andrew Park, Ernesto Hernandez, Dan Rambado, Ivan Salazar, Rafael Cruz, Chetan Rane, Ben Levin, Brad Kenstler, Bing Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 복잡한 프로젝트를 도와달라고 매우 똑똑하고 독서량이 풍부한 개인 비서 (AI) 를 고용했다고 말입니다. 특정 도구 목록을 제시하는 대신, "이 주제를 조사하고 내부 데이터베이스를 확인한 후 특정 날짜를 찾아줘"라고만 말합니다.

문제는 이 비서의 지하에 220 개의 다양한 도구가 들어 있는 거대한 도구 상자가 있는데, 비서는 한 번에 10 개에서 25 개의 도구만 볼 수 있다는 점입니다. 이들 중 일부는 비서가 정말로 필요한 도구들이지만, 다른 일부는 '방해 요소'입니다. 즉, 비슷해 보이지만 작업에는 쓸모없는 도구들입니다.

MCP-Atlas는 AI 비서들이 올바른 도구를 찾아내고, 이를 올바르게 사용하며, 문제를 해결하기 위해 조각들을 맞춰 넣는 능력을 평가하기 위해 설계된 거대한 실세계 테스트입니다. 이때 사용자에게 어떤 도구를 선택해야 하는지 정확히 알려주지 않습니다.

이 논문을 간단한 비유로 설명하면 다음과 같습니다:

1. 문제: "가짜" 테스트

이전 AI 도구 사용 테스트는 요리 수업에서 선생님이 학생에게 "양파를 자르려면 빨간 칼을 사용하세요"라고 적힌 레시피 카드를 handing 하는 것과 같았습니다.

  • 문제점: 이는 학생이 실제로 어떤 칼을 집어야 하는지, 혹은 지저분한 주방을 다룰 수 있는지 테스트하지 못합니다. 실제 생활은 더 지저분합니다. 단순히 "샐러드를 만들어라"라고 말하면, 학생은 칼, 도마, 볼을 스스로 찾아야 합니다.
  • 과거 방식: 많은 테스트들이 실제 업무의 복잡성을 반영하지 않는 가짜 도구나 단순한 작업을 사용했습니다.

2. 해결책: MCP-Atlas ("실제 주방" 테스트)

연구진은 MCP-Atlas라는 거대한 실제 주방을 구축했습니다. 여기에는 다음이 포함됩니다:

  • 36 개의 실제 서버: 은행, 도서관, 기상 관측소, 코드 저장소 등 36 개의 서로 다른 실세계 상점과 같습니다. 이들은 가짜 시뮬레이션이 아니라 실제 그 자체입니다.
  • 220 개의 도구: 해당 상점에서 실제로 사용 가능한 도구들입니다.
  • 1,000 개의 작업: "광고에 관한 논문을 찾은 후, 특정 캠페인의 내부 판매 데이터를 확인하고 시작 날짜를 알려줘"와 같은 1,000 개의 다양한 도전 과제들입니다.
  • 반전: AI 는 도구 이름을 절대 알려주지 않습니다. AI 는 "아, 논문은 도서관에, 판매 데이터는 은행에 문의해야겠구나"라고 스스로 파악해야 합니다.

3. AI 채점 방법: "사실 확인" 채점 기준

연구진은 AI 의 답변이 "들려보기에 좋은지" 인간이 추측하게 하는 대신 **주장 기반 채점 기준 (Claim-Based Rubric)**을 사용합니다.

  • 비유: 작업이 샌드위치를 만드는 것이라고 가정해 봅시다. "올바른" 샌드위치는 다음이 있어야 합니다: 1) 빵, 2) 햄, 3) 치즈, 4) 머스터드 소스.
  • 채점: AI 가 빵, 햄, 치즈는 있지만 머스터드 소스를 잊어버린 샌드위치를 가져오면, 점수가 0 점인 것은 아닙니다. 부분 점수 (약 75%) 를 받습니다.
  • 중요성: 이는 AI 가 길고 화려한 단락을 작성했다는 이유만으로 점수를 받는 것을 막습니다. AI 는 도구를 사용해 찾은 실제 사실에 대해서만 점수를 받습니다.

4. 결과: AI 는 나아지고 있지만 여전히 실수합니다

연구진은 이용 가능한 가장 똑똑한 AI 모델들 ("최첨단" 모델) 을 테스트했습니다.

  • 점수: 최고의 AI (Claude Opus 4.5) 는 약 **62%**의 작업을 "완벽하게" (또는 통과할 만큼 충분히) 수행했습니다. 그 다음으로 좋은 모델들은 50% 대였으며, 일부 구형 모델은 매우 낮은 점수 (10% 미만) 를 받았습니다.
  • 주요 실패 원인: AI 가 실패한 가장 큰 이유는 생각하거나 읽을 수 없어서가 아니었습니다. 올바른 도구를 찾지 못했거나, 아예 도구를 사용해야 한다는 사실을 몰랐기 때문입니다.
    • 비유: AI 는 샌드위치를 만드는 법을 알았지만, 햄을 얻으려고 냉장고를 여는 것을 잊어버리거나, 머스터드 소스인 줄 알고 피클 병을 잘못 집어 든 것과 같습니다.
  • "조기 중단" 문제: 많은 AI 는 작업을 시작해 한 단계를 수행한 후, 작업을 끝낼 도구를 가지고 있음에도 불구하고 "나머지는 할 수 없다"고 말하며 작업을 중단했습니다. 그들은 너무 일찍 포기했습니다.

5. 다양한 작업 유형

이 테스트는 업무의 서로 다른 "지역"을 다루었습니다:

  • 기본 (날씨, 지도): AI 는 여기서 적절히 수행했습니다.
  • 분석 (데이터, 차트): AI 는 여기서 놀라울 정도로 잘 수행했습니다.
  • 금융 및 코딩: AI 는 여기서 가장 어려움을 겪었습니다. 이 분야들은 매우 정확한 지시 (특정 날짜 형식이나 특정 코드 구문 등) 를 요구하며, AI 는 종종 세부 사항에서 실수를 저질렀습니다.

6. 미래에 대한 시사점

이 논문은 AI 가 더 똑똑해지고 있지만, "도구를 사용하는 법을 아는 것"과 "언제 도구를 사용해야 하는지 아는 것" 사이에는 여전히 엄청난 격차가 있다고 결론 내립니다.

  • 핵심 교훈: 현재 AI 모델들은 올바른 도구를 손에 쥐고 나면 지시를 따르는 데 뛰어납니다. 하지만 지저분한 도구 상자에서 가짜 도구를 무시하고 다단계 문제를 해결할 올바른 도구를 선택하는 데는 여전히 서툴러 있습니다.

요약하자면: MCP-Atlas 는 AI 를 위한 엄격한 실세계 운전 시험입니다. 이 테스트는 자동차 (AI 모델) 들이 더 빨라지고 있지만, 많은 차량들이 사고를 내거나 포기하지 않고도 교통 (올바른 도구 찾기) 을 헤쳐 나가는 데 여전히 어려움을 겪고 있음을 보여줍니다. 연구진은 향후 다른 과학자들이 더 나은 "운전자"를 만들 수 있도록 테스트 질문과 규칙을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →