LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs
이 연구는 거대 언어 모델이 행동적 선호도 때문에 모델 컨텍스트 프로토콜(MCP) 서버 지침에 효율적으로 임베딩된 참조 데이터를 검색 도구보다 우선시하여 무시하는 경우가 많다는 것을 밝히며, 이는 도구 선택보다 지침 컨텍스트를 우선시하도록 하는 명시적인 호스트 수준의 메커니즘이 필요함을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 스마트 어시스턴트가 단순히 대화만 하는 것이 아니라, 문제를 해결하기 위해 방대한 도구와 데이터베이스를 즉각적으로 불러올 수 있는 초능력을 가진 세상을 상상해 보세요. 이것이 바로 **대규모 언어 모델(LLM)**이 **도구(tools)**와 함께 작동하는 흥미로운 최전선입니다. LLM을 많이 알고 있지만 가끔은 찾아봐야 하는 데는 똑똑하고 호기심 많은 학생이라고 생각해 보세요. 이 학생을 돕기 위해, 우리는 **모델 컨텍스트 프로토콜(Model Context Protocol, MCP)**이라는 새로운 표준을 가지고 있습니다. MCP는 학생의 "호스트"(학생을 실행하는 앱)가 특정 도구, 데이터, 그리고 그것들을 사용하는 방법에 대한 일련의 지침을 전달할 수 있게 해주는 유니버설 리모컨이라고 생각하면 됩니다.
연구자들이 던지는 핵심 질문은 이것입니다: 그 학생이 정말로 지침을 듣고 있는가? 때로는 지침에 "이 페이지에 당신이 필요한 답을 이미 써두었으니, 그냥 읽으세요!"라고 적혀 있기도 합니다. 하지만 또 다른 경우에는 "참고로, 원한다면 누를 수 있는 검색 버튼이 여기 있습니다"라고 적혀 있기도 합니다. 결과적으로, 아무리 똑똑한 학생이라도 눈앞에 놓인 답을 무시하고 반짝이는 검색 버튼에 한눈을 팔 수도 있다는 사실이 밝혀졌습니다. 이 논문은 바로 이 시나리오를 깊이 파고들어, "검색 습관"이 지침을 읽는 능력보다 더 강한지, 만약 그렇다면 어떻게 해결할 수 있는지를 살펴봅니다.
위대한 "메뉴 읽기" vs "웨이터 부르기" 실험
이 연구에서 연구자들은 한국 법률을 찾는 데 도움을 주는 서버인 **렉스링크(LexLink)**라는 디지털 주방을 설정했습니다. 이 서버는 마치 레스토랑의 메뉴판과 같습니다. 보통 특정 요리(법률)를 원한다면, 웨이터(검색 도구)에게 주방으로 가서 레시피를 찾아 가져다 달라고 요청해야 합니다. 이는 시간과 노력이 듭니다.
하지만 레스토랑 주인(서버)은 영리하게 결정했습니다. 테이블 위에 가장 인기 있는 메뉴 20개와 정확한 주문 번호를 포함한 "오늘의 특선 메뉴" 리스트를 인쇄해 둔 것입니다(서버 지침). 규칙은 간단했습니다: 만약 리스트에 있는 요리를 원한다면, 웨이터에게 직접 주문 번호를 말하세요. 주방을 검색하라고 요청하지 마세요! 이는 더 빠르고 저렴한 방식입니다.
연구자들은 그 후 클로드(Claude), 제미나이(Gemini), GPT와 같은 가족 계열의 24가지 서로 다른 AI 학생들을 초대하여 이 메뉴로 주문하게 했습니다. 그들은 AI 학생들이 "오늘의 특선 메뉴" 리스트를 읽고 직접 주문할 것인지, 아니면 리스트를 무시하고 여전히 "검색" 버튼을 누를 것인지를 확인하기 위해 54,000회의 실험을 수행했습니다.
충격적인 발견: 검색 버튼의 유혹이 너무 강하다
결과는 다소 경종을 울리는 것이었습니다. 연구자들이 검색 버튼을 완전히 제거하여 학생들이 테이블 리스트를 반드시 사용하도록 강제했을 때, 24개의 AI 모델 중 23개가 리스트를 읽고 정확하게 주문하며 **98%에서 100%**의 성공률을 보였습니다. 이는 학생들이 지침을 읽을 수 있다는 것을 증명했습니다. 다만 검색 버튼이 있을 때는 그러고 싶어 하지 않았을 뿐입니다.
하지만 검색 버튼이 존재할 때, 이야기는 극적으로 변했습니다. 24개 중 9개의 모델은 성공률이 15% 미만으로 떨어졌습니다. 그들은 답이 바로 테이블 위에 있음에도 불구하고 "오늘의 특선 메뉴" 리스트를 완전히 무시하고 계속해서 검색 버튼을 눌렀습니다. 연구자들은 이를 **"행동적 선호(behavioral preference)"**라고 부릅니다. AI가 지침을 읽기에 너무 멍청해서가 아닙니다. 비효율적인 선택임에도 불구하고 자신이 가장 잘 아는 도구에 손을 뻗는 습관을 가지고 있는 것입니다. 이는 마치 정답이 5페이지에 있다는 것을 알면서도 선생님에게 책 5페이지를 펴달라고 계속 요청하는 아이와 같습니다.
흥ertz하게도, "최신형"이거나 "더 똑똑하다"는 것이 더 나은 행동을 보장하지는 않았습니다. 일부 매우 최신 모델들이 오히려 이전 세대의 형제들보다 이 특정 규칙을 따르는 데 더 서툴렀습니다. 연구는 모델의 최신성이 이런 상황에서 누가 좋은 경청자가 될지를 예측하지 못한다는 것을 발견했습니다.
그들에게 듣는 법을 가르칠 수 있을까? (마법의 공식)
연구자들은 테이블 위의 지침을 변경하여 이 나쁜 습관을 고치려고 시도했습니다. 그들은 세 가지 다른 기술을 테스트했습니다:
- 강압적인 헤더 (B): "반드시 리스트를 사용해야 합니다! 검색하지 마세요!"라는 크고 굵은 경고 문구.
- 예시 (C): 올바르게 하는 모습과 잘못하는 모습을 보여주는 그림.
- 힌트 (D): 검색 버튼의 설명을 "저를 사용하기 전에 리스트를 먼저 확인하세요"라고 변경함.
그들은 가능한 모든 조합으로 이 기술들을 섞어서 테스트했습니다. 결과는 단 하나의 기술만으로는 모두에게 통하지 않는다는 것을 보여주었습니다. 실제로 어떤 AI 모델들에게는 "강압적인 헤더"만 사용하는 것이 오히려 성능을 떨어뜨려 (한 사례에서는 0%까지 하락!) 더 나쁜 결과를 초 thấy했습니다. 이는 큰 소리로 외치는 것이 어떤 학생에게는 공부하게 만드는 자극이 되지만, 어떤 학생은 얼어붙게 만드는 것과 같습니다.
하지만 세 가지 기술을 모두 결합했을 때, 결과는 놀라웠습니다. 24개 중 20개의 모델이 성공률 86% 이상으로 다시 올라갔습니다. 이는 AI에게 단순히 소리를 지른다고 해서 습관을 고칠 수는 없지만, 경고, 예시, 힌트를 결합한 다각적인 접근 방식이 대부분의 모델을 다시 궤도에 올려놓을 수 있음을 시사합니다.
이것이 미래에 의미하는 바
주요 시사점은 AI에게 도구와 지침을 주는 것만으로는 충분하지 않다는 것입니다. AI는 지침을 무시하게 만드는 "검색 반사(search reflex)"를 가질 수 있으며, 이는 시간과 자원의 낭비로 이어집니다. 이 논문은 이러한 AI를 실행하는 앱(호스트)이 개입해야 한다고 주장합니다. AI가 지침을 읽기를 기대하는 대신, 앱이 AI가 도구를 선택하기도 전에 지침을 먼저 확인하도록 강제해야 합니다.
그렇게 될 때까지 개발자들은 주의를 기울여야 합니다. 단순히 하나의 지침을 작성하고 그것이 모든 AI에게 작동할 것이라고 기대해서는 안 됩니다. 지침을 사용할 것으로 예상되는 "가장 약한" 모델을 기준으로 지침을 테스트해야 하며, 단순히 명령을 내리기보다는 예시와 힌트를 혼합하여 사용해야 합니다. 이 연구는 문제가 실재하지만, 적절한 지침의 레시피를 통해 해결 가능하다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.