← 최신 논문
🤖 AI

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

이 논문은 30개의 벤치마크와 다양한 도메인에 걸쳐 약 100만 개의 표준화된 레코드를 아우르는 통합된 고해고도 코퍼스인 Messier를 소개하며, 이는 포괄적인 교차 벤치마크 에이전트 평가를 가능하게 하고, 작업 유형 간의 불균형한 진보를 드러내며, AI 에이전트 역량을 감사하고 확장하기 위한 기초적인 인프라를 제공한다.

원저자: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 면에서 가장 뛰어난 비디오 게임 캐릭터가 누구인지 알아내려고 노력하고 있다고 상상해 보십시오. 당신에게는 점프를 기가 막히게 잘하는 캐릭터, 수학 퍼즐의 귀재인 캐릭터, 그리고 미로를 완벽하게 통과할 수 있는 캐릭터가 있습니다. 하지만 여기 함정이 있습니다. 게임마다 "기술"을 측정하는 방식이 다르다는 것입니다. 어떤 게임은 단 하나의 구덩이를 뛰어넘는 것에 금색 별을 주지만, 다른 게임은 문을 열기 위해 복잡한 대수학 문제를 풀어야 합니다. 또 다른 게임은 적에게 한 번도 닿지 않고 레벨의 모든 코인을 모아야 합니다. 만약 당신이 그저 최종 점수인 "95%"와 같은 단일 숫자만 본다면, 그들이 모두 비슷하게 잘한다고 생각할 수도 있습니다. 하지만 그 숫자는 혼란스러운 세부 사항들을 숨기고 있습니다. 그 캐릭터가 점프를 못 해서 실패한 것일까요, 아니면 문 앞에서 막혀서 실패한 것일까요? 그들은 모든 것을 완벽하게 수행해서 95%를 받은 것일까요, 아니면 아주 작은 하나를 실수해서 전체 실행을 0점으로 처리받은 것일까요?

이것은 바로 AI 에이전트를 연구하는 과학자들이 직면한 문제입니다. 이들은 단순한 챗봇이 아닙니다. 도구를 사용하고, 코드를 작성하며, 웹을 탐색하고, 실시간 환경에서 결정을 내릴 수 있는 디지털 작업자들입니다. 현재 수백 개의 서로 다른 테스트(벤치마크)가 존재하지만, 이들은 모두 서로 다른 언어로 말하고 있습니다. 어떤 테스트는 엄격합니다. 만약 10단계의 레시-조리법 중 한 단계라도 놓치면 0점을 받습니다. 다른 테스트는 더 관대합니다. 이 때문에 코딩을 잘하는 에이전트와 법률 조사를 잘하는 에이전트를 비교하는 것은 매우 어렵습니다. 이는 마치 단 하나의 "운동 능력" 점수만을 가지고 마라톤 선수와 체스 그랜드마스터를 비교하려는 것과 같습니다. AI가 실제로 어떻게 발전하고 있는지 이해하려면, 우리는 이 점수의 내부를 들여다보고 에이전트가 정확히 어디에서 성공하고 어디에서 비틀거리는지 볼 수 있는 방법이 필요합니다.

여기, AI 테스트를 위한 거대한 범용 번역기 역할을 하는 거대한 새로운 프로젝트인 MESSIER가 등장했습니다. MESSIER의 연구진은 단순히 새로운 테스트를 만든 것이 아니라, 30개의 기존 테스트를 수집하여 11,891개의 특정 작업74,205가지의 서로 다른 성공 확인 방식을 아우르는 거대한 라이브러리를 구축했습니다. 그들은 714개의 서로 다른 AI 에이전트에 대한 데이터를 모았으며, 법률 검토나 양자 회로 설계와 같이 데이터가 부족했던 6개의 어려운 영역에 대해서는 새롭고 신선한 테스트를 직접 수행했습니다. 총 약 100만 개의 실험 기록을 하나의 깔끔하고 표준화된 형식으로 정리했습니다. 이것은 마치 서로 다른 통화와 수학 규칙을 가진 30개 상점에서 받은 혼란스러운 영수증 더미를 가져와서, 무엇을 샀고 비용이 얼마였으며 어떤 상점이 가장 좋은 혜택을 제공했는지 정확히 볼 수 있는 하나의 명확한 스프레드시트로 만드는 것과 같습니다.

MESSIER가 발견한 가장 흥ant한 사실은 점수를 계산하는 방식이 이야기를 바꾼다는 것입니다. 이 논문은 많은 테스트가 "엄격한" 규칙을 사용한다는 점을 보여줍니다. 즉, 에이전트가 작업의 아주 작은 부분이라도 실패하면 전체를 실패로 표시합니다. 연구진은 만약 이 규칙을 완화하고 에이전트가 제대로 수행한 부분이 얼마나 되는지를 살펴본다면, 발전의 모습이 매우 다르게 보일 것이라는 점을 보여주었습니다. 예를 들어, 한 법률 벤치마크에서 엄격한 "전부 아니면 전무(all-or-nothing)" 식의 규칙은 에이전트가 성공하는 비율을 단 **0.2%**라고 말했습니다. 하지만 세부 사항을 살펴보았을 때, 에이전트가 평균적으로 **28.8%**의 기준을 충족하고 있다는 것을 발견했습니다. 엄격한 규칙이 많은 부분적인 진전을 숨기고 있었던 것입니다. 이는 AI가 나아지고 있기는 하지만, 우리가 그것을 측정하는 방식이 너무 가혹하여 에이전트가 실제보다 더 자주 실패하는 것처럼 보이게 만들 수 있음을 시사합니다.

또한 이 연구는 AI가 진정으로 "승리"하고 있는 곳과 여전히 고전하고 있는 곳을 지도화했습니다. 그들은 AI가 "함수 호출(function calling, 도구 사용)"에는 거의 완벽하며, 성공률이 0.97에 달한다는 것을 발견했습니다. 또한 프로그래밍 분야에서도 매우 빠르게 발전하고 있습니다. 그러나 AI는 "엔터프라이즈 워크플로우(enterprise workflows)", 즉 비즈니스 프로세스를 관리하는 것과 같은 복잡하고 다단계적인 사무 업무에서는 여전히 어려움을 겪고 있습니다. 이 영역에서의 성공률은 0.57에 불과하며, 이는 에이전트가 성공보다 실패를 더 많이 한다는 것을 의미합니다. 연구진은 또한 이 거대한 라이브러리를 사용하여, 수백만 달러를 들여 새로운 테스트를 수행하지 않고도 다른 주요 순위들과 매우 밀접하게 일치하는(상관관계 0.81) AI를 위한 새로운 "기술 척도"를 만들 수 있음을 입증했습니다.

궁극적으로 MESSIER는 명확성을 위한 도구입니다. 이는 에이전트가 단순히 최종 점수만으로 어떻게 실패하는지가 아니라, 어떻게 실패하는지에 대한 미세한 세부 사항을 살펴봄으로써, AI가 실제로 무엇을 할 수 있는지에 대한 훨씬 더 진실된 그림을 얻을 수 있음을 시사합니다. 이것은 AI가 모든 것을 해결했다고 말하는 것이 아니라, 우리의 현재 측정 도구들이 너무 뭉툭할 수 있다는 점을 시사합니다. 이러한 결과를 표준화함으로써, 저자들은 동일한 테스트를 반복하는 데 드는 비용 낭비를 줄이고, 연구자들이 어떤 작업에 AI가 준비되어 있고 어떤 작업에 여전히 인간의 손길이 필요한지를 정확히 이해할 수 있도록 돕기를 희망합니다. 데이터는 이제 누구나 사용할 수 있도록 공개되었으며, 이를 통해 혼란스러운 숫자의 덩어리를 AI 지형의 명확한 지도로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →