LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
본 논문은 병렬 평가 프레임을 통해 MCP 활성화 에이전트를 스트레스 테스트하도록 설계된 101 개의 실제 세계 쿼리로 구성된 벤치마크인 LiveMCP-101 을 소개하며, 최첨단 LLM 조차도 복잡한 다단계 도구 오케스트레이션에 어려움을 겪고 있음을 드러내고 향후 개선을 안내하기 위해 7 가지 구체적인 실패 모드를 식별합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 LiveMCP-101 논문에 대한 설명으로, 쉬운 언어와 창의적인 비유를 사용하여 작성되었습니다.
큰 그림: "실시간" 시승 테스트
새로운 자율주행차를 테스트한다고 상상해 보세요. 대부분의 이전 테스트는 교통등이 변하지 않고 도로가 항상 비어 있는 비디오 게임이나 폐쇄된 주차장에서 이루어졌습니다. 그 환경에서는 차가 경로를 외워 완벽해 보일 수 있었습니다.
하지만 실제 세계에서는 교통등이 변하고, 보행자가 예상치 않게 길을 건너며, 도로 상태가 초단위로 바뀝니다.
이 논문은 AI 에이전트를 위한 실제 세계의 실시간 교통 테스트와 같은 LiveMCP-101을 소개합니다. 연구자들은 AI에게 교과서에서 수학 문제를 풀게 하는 대신, 복잡한 다단계 문제를 해결하기 위해 디지털 도구들의 "스위스 아미 나이프"(예: 항공권 가격 확인, GitHub 에서 코드 검색, 날씨 조회 등) 를 사용하게 합니다. 이러한 문제들은 AI 가 작업을 수행하는 동안에도 변화합니다.
문제: "정적 지도" 대 "실시간 GPS"
- 구식 방식 (정적 도구): AI 에이전트가 도시의 인쇄된 지도를 받았다고 상상해 보세요. 지도에 커피숍 위치가 명시되어 있으므로 AI 는 그 위치를 정확히 알고 있습니다. 하지만 커피숍이 어제 이동했다면 AI 는 길을 잃습니다. 이것이 현재 대부분의 AI 도구가 작동하는 방식입니다. 고정된 지침에 의존합니다.
- 새로운 방식 (MCP): 이 논문은 **모델 컨텍스트 프로토콜 (Model Context Protocol, MCP)**이라는 것을 사용합니다. 이를 실시간 GPS로 생각하세요. AI 에게는 미리 인쇄된 지도가 없습니다. 대신 GPS 에게 "지금 이용 가능한 도구는 무엇인가?"라고 물어보고, 이를 어떻게 사용할지 찾아내야 합니다. 문제는 "실시간 GPS" 데이터가 매초 변한다는 점입니다. 항공권 가격이 오르거나 뉴스 제목이 바뀌는 동안 AI 가 생각할 수도 있습니다.
해결책: "병렬 레이스"
시험을 치르는 동안 정답이 변하는 시험에서 AI 를 어떻게 평가할 수 있을까요?
연구자들은 병렬 레이스 시스템을 구축했습니다:
- 참조 주자: 매우 똑똑하고 인간이 안내하는 로봇이 테스트받는 AI 와 정확히 같은 시간에 정확히 같은 작업을 수행합니다. 이는 그 특정 순간에 대한 "정답"을 얻기 위해 엄격하고 사전 승인된 계획을 따릅니다.
- 테스트 주자: 테스트받는 AI 는 스스로 계획을 세우려고 노력합니다.
- 심판자: 결승선에서 심판자 (다른 AI) 가 테스트 주자의 결과를 참조 주자의 결과와 비교합니다.
이를 통해 AI 는 날씨 변화나 주가 변동으로 인해 불이익을 받지 않습니다. AI 는 변화에 올바르게 대응하지 못했을 때만 불이익을 받습니다.
결과: 가장 "똑똑한" 아이들조차 고군분투 중
연구자들은 GPT-5 와 Claude 와 같은 가장 똑똑한 모델을 포함하여 18 개의 서로 다른 AI 모델을 테스트했습니다.
- 점수: 최고의 AI 모델조차 작업의 약 **58%**만 올바르게 수행했습니다.
- 비유: 5 명의 서로 다른 사람을 전화하고, 3 개의 서로 다른 웹사이트를 확인하며, 단서가 변하는 동안 보고서를 작성해야 하는 복잡한 보물찾기를 박사 과정 학생들에게 준다고 상상해 보세요. 가장 똑똑한 학생들조차 40% 이상에서 실패했습니다.
"7 대 죄악" (실패 모드)
이 논문은 AI 가 실패한 이유를 분석하여 세 가지 주요 범주로 묶인 7 가지 일반적인 실수를 발견했습니다:
1. 계획 실패 ("길 잃은 운전자")
- 지도 무시: AI 가 지시 사항의 일부를 완전히 놓칩니다 (예: "두 번째로 인기 있는 비디오를 찾으라"고 했지만 첫 번째를 찾음).
- 과신: AI 는 자신의 기억에서 답을 알고 있다고 생각하여 도구 사용을 거부하고, 이로 인해 할루시네이션 (사실과 다른 내용 생성) 이 발생합니다.
- 행동 없는 말하기: AI 는 "생각" 속에서 완벽한 계획을 작성하지만, 실제로 버튼을 눌러 실행하지는 않습니다.
- 잘못된 도구: AI 는 올바른 도구를 선택하지만 잘못된 도구를 사용합니다 (예: "계산기"가 필요한데 "검색" 도구를 사용함).
2. 매개변수 오류 ("오타" 문제)
- 구문 오류: AI 가 도구의 언어를 잘못 사용합니다. 도구가
1(숫자) 이 필요할 때 "1"(단어) 이라고 말합니다. 도구는 즉시 요청을 거부합니다. - 의미 오류: AI 는 언어를 올바르게 사용하지만 의미를 잘못 이해합니다. 사용자가 실제로 "뉴욕 시의 날씨"를 원했는데 "뉴욕의 날씨"를 요청하거나, 존재하지 않는 날짜를 요청합니다.
3. 출력 처리 ("마지막 1 마일" 문제)
- 구문 분석 오류: 도구가 AI 에게 올바른 데이터 (숫자가 포함된 JSON 파일 등) 를 제공하지만, AI 가 이를 올바르게 읽지 못합니다. 평균을 잘못 계산하거나 핵심 숫자를 놓쳐 최종 보고서를 망칠 수 있습니다.
결론
이 논문은 AI 가 도구와 대화하는 능력은 향상되고 있지만, 실시간으로 변화하는 복잡한 실제 세계 작업에는 여전히 충분히 신뢰할 수 없다고 결론지었습니다.
- 폐쇄형 모델(GPT-5 등)은 계획 수립에는 더 뛰어나지만, 데이터를 올바르게 읽는 "마지막 1 마일" 부분에서는 여전히 어려움을 겪습니다.
- 오픈 소스 모델은 종종 루프에 갇혀 시간을 낭비하고 진행 없이 토큰을 소모합니다.
간단히 말해: 우리는 AI 를 테스트하기 위해 매우 엄격하고 실제적인 체육관 (LiveMCP-101) 을 구축했습니다. 그 결과, 가장 강력한 AI 선수들조차 실시간으로 변하는 지도를 가진 마라톤을 달릴 때 자신의 신발 끈에 걸려 넘어지고 있음을 보여줍니다. 우리가 AI 를 실제 세계에서 자율적으로 작동하도록 신뢰하기까지는 아직 갈 길이 멉니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.