PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling
이 논문은 데이터 분포의 격차와 적대적 테스트의 부족 문제를 체계적으로 해결하기 위해 LLM 생성과 결정론적 API 실행을 결합한 2단계 프레임워크를 사용하는 진단 벤치마크인 PluginEval을 소개하며, 이를 통해 대규모 언어 모델의 도구 라우팅을 평가하기 위한 세밀한 오류 귀속을 가능하게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하고 의욕 넘치는 로봇 집사에게 수천 가지의 다양한 도구가 담긴 거대한 공구함을 사용하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 "배고파"라고 말합니다. 그러면 로봇은 세 가지를 결정해야 합니다. 첫째, 실제로 도구를 사용해야 하는가, 아니면 그냥 간식을 생각하면 되는가? 둘째, 만약 도구가 필요하다면 어떤 특정 도구가 적절한가(망치가 아니라 믹서기처럼)? 셋째, 그 도구를 실제로 제대로 잡아서 망가뜨리지 않고 사용할 수 있는가? 이것이 바로 인공지능의 '함수 호출(function calling)'의 세계입니다. 이는 AI 모델이 단순히 대화하는 것을 넘어 항공권을 예약하거나 날씨를 확인하는 것과 같이 실제로 '행동'을 시작하게 만드는 기술입니다. 하지만 여기서 까다로운 점이 있습니다. 로봇이 올바른 말을 한다고 해서 반드시 올한 도구를 골랐거나 올바르게 사용했다는 뜻은 아닙니다. 우리는 이 로봇이 정말 똑똑한 것인지, 아니면 그저 운이 좋았던 것인지를 테스트할 방법이 필요합니다.
이것이 바로 이 논문의 저자들이 PluginEval을 통해 해결하고자 하는 문제입니다. 그들은 현재 대부분의 AI 로봇 테스트가 모두가 쉽게 주차할 수 있는 텅 빈 주차장에서 시험을 치르는 운전 면허 시험과 같다는 점을 발견했습니다. 이러한 테스트에는 까다로운 상황이 부족하고, 로봇이 실패하는 구체적인 방식을 잡아내지 못하며, 종종 다른 로봇에게 정답을 채점하게 함으로써 편향될 수 있습니다. 그래서 연구팀은 중국어 쿼리에 특화된 훨씬 더 강력한 "운전 시험"을 구축했습니다. 그들은 단순히 최종 점수만 보는 것이 아니라, 탐정처럼 로봇이 왜 실패했는지 정확히 밝혀내는 시스템을 만들었습니다. 도구를 가져오는 것을 잊었는지, 잘못된 것을 집었는지, 아니면 올바른 도구를 사용하려고 시도했지만 재료를 쏟아버렸는지 말입니다.
탐정의 도구 상자: 그들이 테스트를 구축한 방법
이 새로운 벤치마크를 만들기 위해 저자들은 단순히 질문들을 나열하고 요행을 바지 않았습니다. 그들은 '폐쇄 루프 구축 프레임워크(PCCF)'라는 것을 발명했는데, 이는 멋진 말로 표현하자면 테스트를 만들기 위해 스스로 교정하는 기계를 만든 것입니다.
이것은 마치 레벨이 완벽해질 때까지 계속 레벨을 다시 플레이하는 비디오 게임 레벨 디자이너와 같습니다.
- 1단계 (현실 점검): 먼저, 질문(예: "도쿄로 가는 저렴한 항공편을 찾아줘")을 가져와 여러 AI 모델에게 해결하도록 요청합니다. 하지만 여기서 반전이 있습니다. 그들은 AI의 말을 그대로 믿지 않습니다. 실제로 코드를 실행합니다. 만약 AI가 "항공 API를 호출하겠습니다"라고 말하면, 시스템은 실제로 그 호출을 시도합니다. 만약 API가 "에러: 날짜 누락"이라고 응답하면, 시스템은 AI가 실패했음을 알게 됩니다. 이는 '아이디어'와 '현실'을 분리합니다.
- 2단계 (공백 메우기): 그런 다음 시스템은 결과를 살펴보고 "어디에 까다로운 질문이 부족한가?"라고 묻습니다. 예를 들어, 테스트에 날씨에 관한 쉬운 질문은 너무 많고 복잡한 여행 예약에 관한 어려운 질문은 부족할 수 있습니다. 시스템은 이러한 구멍을 메우기 위해 구체적으로 더 어려운 질문을 생성합니다. 즉, AI를 속이기 위해 설계된 함정인 "적대적(adversarial)" 질문을 만들어냅니다.
- 루프: 이 새로운 까다로운 질문들은 다시 1단계로 돌아가 재테스트를 받습니다. 만약 질문이 너무 쉽다면 시스템은 더 어렵게 만듭니다. 만약 너무 혼란스럽다면, 인식 증거를 사용하여 부정적인 사례를 강화한 후 다시 검증합니다. 이 루프는 AI가 단순한 실수부터 복잡한 논리적 함정에 이르기까지 혼란을 느낄 수 있는 모든 가능성을 테스트가 다룰 때까지 계속 회전합니다.
판결: 테스트가 밝혀낸 것
그들이 완벽한 테스트(54가지 서로 다른 도구에 걸쳐 인간이 검증한 3,000개의 질문 포함)를 완성한 후, 세계에서 가장 똑똑한 다섯 가지 AI 모델을 테스트에 투입했습니다. 여기에는 GPT-5.4, Claude 4.6, Gemini 3.1 Pro와 같은 유명한 이름들이 포함되었습니다.
결과는 놀라웠습니다. 저자들은 종합 점수(최종 성적)가 오해의 소지가 있다는 사실을 발견했습니다.
- 난이도의 함정: 테스트가 쉬운 질문 위주일 때는 모든 AI가 80% 이상의 점수를 받으며 천재처럼 보였습니다. 하지만 "어려움" 단계의 질문에 부딪히자마자 점수는 급락했습니다. 가장 어려운 질문의 경우, 최고의 AI조차 정답률이 약 10%에 불과했습니다. 이는 현재의 모델들이 매우 취약하다는 것을 시사합니다. 즉, 단순한 작업에는 훌륭하게 작동하지만 상황이 복잡해지면 무너집니다.
- 모델마다 다른 결함: 논문은 단순히 "모델 A가 더 낫다"라고 말하는 데 그치지 않았습니다. 자동차 엔진을 점검하는 정비사처럼 오류를 세분화했습니다.
- GPT-5.4는 필요한 도구를 식별하는 것과 불필요한 호출을 피하는 것 모두에서 가장 좋지 않은 모습을 보였으며, "미회수(miss recall, 필요한 도구 사용을 잊음)"와 "과잉 회수(over recall, 사용하지 않아도 될 때 도구를 사용함)" 비율이 모두 가장 높았습니다.
- Claude Opus 4.6는 도구 사용을 기억하는 능력(가장 낮은 미회수율)은 가장 뛰어났지만, 때때로 사용하지 않아야 할 때도 도구를 사용했습니다(높은 과잉 회수율).
- Gemini 3.1 Pro는 가장 균형 잡힌 오류 프로필을 가졌으며, 가장 낮은 과잉 회수율을 달로하여 낮은 회수율에도 불구하고 경쟁력 있는 정확도를 유지했습니다.
- "시간" 문제: 모든 모델에서 공통적으로 눈에 띄는 특정 유형의 오류가 있었습니다. 바로 **시간적 오류(Temporal Errors)**입니다. "다음 주 화요일"이나 "지난달"을 묻는 것과 같이, AI들은 일관되-게 날짜와 시간을 정확히 맞추는 데 어려움을 겪었습니다. 이것이 전반적으로 가장 큰 실패 원인이었습니다.
이것이 중요한 이유
이 논문은 AI의 도구 사용 능력을 판단할 때 단 하나의 백분율만 봐서는 안 된다고 주장합니다. 어떤 모델은 쉬운 질문에 강해서 점수가 높을 수도 있고, 혹은 운이 좋아서 높을 수도 있습니다. 저자들은 다른 AI의 추측이 아닌, 인간이 검증한 "골드 스탠다드(gold standard)"와 AI의 답변을 비교하는 그들의 새로운 "골드 앵커링(Gold-Anchored)" 판단 시스템을 사용하여, 로봇이 정확히 어디에서 실패했는지를 짚어낼 수 있었습니다.
저자들은 진정으로 신뢰할 수 있는 AI 에이전트를 만들기 위해서는 AI를 단순히 작동하거나 작동하지 않는 '블랙박스'로 취급하는 것을 멈춰야 한다고 제안합니다. 대신, 의사가 진단하듯이 단계가 누락되었는지, 잘못된 도구를 집었는지, 아니면 단순히 타이밍을 놓쳤는지를 체크하며 진단해야 합니다. 그들의 연구는 오늘날의 AI가 강력하긴 하지만, 특히 작업이 어려워지거나 타이밍이 까다로워질 때 여전히 상당한 사각지대가 존재한다는 것을 보여줍니다. 이 논문은 AI의 도구 사용 문제를 "해결했다"고 주장하는 것이 아니라, 로봇이 어디에서 비틀거리는지에 대한 첫 번째 실제 지도를 제공함으로써 우리가 그들이 더 안정적으로 걷도록 도울 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.