← 최신 논문
🤖 AI

The Necessity of a Unified Framework for LLM-Based Agent Evaluation

본 논문은 다양한 프롬프트와 환경과 같은 교란 요인으로 인해 LLM 기반 에이전트 평가에 표준화가 부재한 현상이 모델 성능의 공평하고 재현 가능하며 엄격한 평가를 보장하기 위한 통합 프레임워크를 필요로 한다고 주장한다.

원저자: Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 문제: "맹미 테스트"

특정 요리를 가장 잘하는 셰프가 누구인지 알고 싶다고 가정해 봅시다. 맹미 테스트를 진행합니다. 하지만 함정이 하나 있습니다.

  • 셰프 A는 고급 전문 오븐, 프리미엄 재료, 그리고 야채를 다듬어 주는 부셰프를 받습니다.
  • 셰프 B는 녹이 슬은 토스터, 냉동 재료, 그리고 아무런 도움도 받지 못합니다.

셰프 A 가 맛있는 요리를 만들고 셰프 B 는 요리를 태웠다면, 셰프 A 가 더 뛰어난 요리사라고 생각할 수 있습니다. 하지만 실제로 결과의 차이는 셰프들의 실력 때문만이 아니라 그들이 일했던 부엌의 차이 때문이었습니다.

이것은 바로 대형 언어 모델 (LLM) 에이전트에 대한 논문이 지적하는 문제와 정확히 일치합니다.

현재 연구자들은 AI 에이전트 (도구를 사용하고, 계획을 세우며, 결정을 내릴 수 있는 AI) 를 테스트할 때, 각 AI 를 서로 다른 "부엌"(하네스라고 함) 에 감싸서 테스트합니다. 한 AI 는 세련된 프롬프트, 똑똑한 메모리 시스템, 엄격한 도구 인터페이스를 받을 수 있고, 다른 AI 는 간단한 프롬프트와 엉성한 인터페이스를 받을 수 있습니다. 점수가 나오면, 그 AI 가 더 똑똑한 것인지, 아니면 단순히 더 좋은 "부엌"을 받았는지를 알 수 없습니다.

논문의 해결책: 표준화된 "경주 트랙"

저자들은 AI 모델을 공정하게 비교하기 위해서는 통합 프레임워크가 필요하다고 주장합니다. 이는 모든 자동차 (AI 모델) 가 달릴 수 있는 단일하고 표준화된 경주 트랙을 건설하는 것과 같습니다.

  • 자동차 (AI 모델): 우리가 테스트하고자 하는 대상입니다. 빠릅니까? 효율적인가요?
  • 트랙 (하네스 및 환경): 이는 도로 표면, 날씨, 연료 유형, 그리고 경기 규칙을 포함합니다.

논문의 주장은 다음과 같습니다: 모든 사람에게 트랙을 정확히 동일하게 유지하십시오.
우리가 매 테스트마다 트랙 (프롬프트, 메모리 도구, AI 가 인터넷과 상호작용하는 방식) 을 변경한다면, 더 빠른 기록이 자동차가 더 뛰어나서인지, 아니면 도로가 더 매끄러워서인지 구분할 수 없습니다.

수정해야 할 부분 ("트랙"의 구성 요소)

논문의 "부엌" 또는 "트랙"을 결과에 혼란을 주지 않도록 표준화해야 하는 다섯 가지 구체적인 부분으로 나눕니다.

  1. 도로 규칙 (추론): 때로는 한 AI 는 다른 인터넷 공급자를 사용한다는 이유만으로 안전 필터에 막히고 다른 AI 는 그렇지 않을 수 있습니다. 테스트는 모든 사람에게 규칙이 동일하게 적용되도록 보장해야 합니다.
  2. 사용 설명서 (프롬프팅): 일부 AI 테스트는 모델에 200 단어짜리 지시를 주고, 다른 테스트는 AI 에게 어떻게 생각해야 하는지 기본적으로 알려주는 2,000 단어짜리 매뉴얼을 줍니다. 논문은 작업은 다를 수 있지만, 지시를 전달하는 방식은 동일해야 한다고 말합니다.
  3. 노트북 (메모리): 일부 AI 에이전트는 과거 사건을 기억하기 위해 완벽하게 정리된 노트북을 받습니다. 다른 에이전트는 오래된 정보가 무작위로 버려지는 messy 한 서류 더미를 받습니다. 테스트는 모든 AI 가 동일한 유형의 노트북을 받도록 보장해야 합니다.
  4. 도구 벨트 (도구 호출): 일부 AI 모델은 매우 엄격한 형식으로 도구를 사용하도록 훈련된 반면, 다른 모델은 대충 해도 허용됩니다. 한 AI 가 도구 호출에서 쉼표를 놓쳐 실패한 반면, 다른 AI 는 테스트가 관대해서 성공했다면, 이는 공정한 비교가 아닙니다.
  5. 세계 (환경): 이것은 매우 중요합니다. AI 가 "실시간" 웹사이트에서 테스트된다면, 그 웹사이트는 내일 바뀔 수 있습니다. AI 가 웹사이트 변경으로 인해 실패했다면, 그것은 AI 의 잘못이 아닙니다. 논문은 테스트 동안 환경이 변하지 않도록 "얼어붙은" 세계의 스냅샷을 사용해야 한다고 주장합니다.

이 프레임워크가 아닌 것

저자들은 이 프레임워크가 무엇을 위한 것이 아닌지 매우 신중하게 설명합니다.

  • 이는 실생활 AI 제품에서의 혁신을 막으려는 것이 아닙니다. Anthropic 이나 OpenAI 와 같은 기업들은 여전히 제품들을 위해 가장 놀랍고 복잡하며 혁신적인 "부엌"을 자유롭게 구축해야 합니다.
  • 이는 모든 AI 를 동일하게 만들려는 것이 아닙니다.
  • 이는 오직 과학적 테스트( "시험") 를 위한 것일 뿐입니다.

포뮬러 1 경주를 생각해 보세요.

  • 엔진 (AI 모델): 이것이 제조업체들이 개선하고자 하는 부분입니다.
  • 규정 (통합 프레임워크): FIA(경주 기구) 는 타이어 크기, 연료, 차체 치수에 대한 엄격한 규칙을 설정합니다.
  • 왜? 한 자동차가 다른 자동차보다 빠를 때, 그것이 엔진 때문인지, 아니면 한 팀이 더 좋은 타이어를 사용했거나 다른 연료를 사용했기 때문인지 알 수 있도록 하기 위함입니다.

제안된 계획

이 논문은 이를 해결하기 위한 세 부분으로 구성된 시스템을 제안합니다.

  1. 통제된 서브스트레이트: 모든 테스트에서 프롬프트, 메모리, 도구를 일정하게 유지하는 표준 "주행자".
  2. 표준화된 점수 산출 방법: 단순히 "합격/불합격"이라고 말하는 대신, AI 가 어떻게 수행했는지 측정해야 합니다 (너무 많은 단계를 걸었는가? 메모리를 너무 많이 사용했는가?).
  3. 버전 관리: 기술이 빠르게 발전하므로 이 "규칙집"은 버전 (v1.0, v2.0 등) 을 가져야 합니다. 규칙이 변경되면, 새로운 규칙을 적용하지 않고 2020 년과 2024 년의 자동차 랩 타임을 비교하지 않는 것처럼, 구 버전의 점수와 새 버전의 점수를 비교하지 않습니다.

요약

이 논문은 현재 우리는 모든 AI 테스트가 서로 다른 설정을 사용하기 때문에 사과와 오렌지를 비교하고 있다고 주장합니다. 진정으로 어떤 AI 가 "가장 똑똑한지" 알기 위해서는, 모든 AI 를 정확히 같은 방에 두고, 정확히 같은 도구를 주며, 동일한 문제를 해결하게 지켜봐야 합니다. 그때에야 비로소 "이 AI 가 더 낫다"라고 말할 수 있지, "이 AI 가 더 좋은 설정을 받았다"라고 말하는 것이 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →