← 최신 논문
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

이 논문은 컨테이너화된 엔터프라이즈 API 복제본과 상태 차이를 기반으로 한 평가 계약을 활용하여, 실제 환경의 상호작용 구조를 유지하면서도 통제된 조건에서 LLM 에이전트의 코드 실행 기반 업무 수행 능력을 평가하는 새로운 벤치마크 프레임워크인 'Agent-Diff'를 제안합니다.

원저자: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Agent-Diff: AI 비서들의 '실전 업무 능력' 시험지

이 논문은 **"대형 언어 모델 (LLM) 이 실제로 기업용 소프트웨어 (슬랙, 구글 캘린더 등) 를 다룰 때 얼마나 잘하는지"**를 측정하는 새로운 시험 방법, Agent-Diff를 소개합니다.

기존의 AI 평가 방식은 마치 "가상 현실에서 요리하기"를 시키는 것과 비슷했습니다. 하지만 Agent-Diff 는 "실제 주방에서 진짜 재료를 써서 요리하게 하고, 결과물만 보고 점수를 매기는" 방식을 도입했습니다.

이 혁신적인 방식을 쉽게 이해할 수 있도록 세 가지 핵심 비유로 설명해 드리겠습니다.


1. 실험실 vs. 실제 주방: "가짜 감자"가 아닌 "진짜 감자"

기존의 AI 시험들은 대부분 **가상 환경 (샌드박스)**에서 진행되었습니다.

  • 기존 방식: AI 에게 "감자를 깎아라"라고 시키는데, 실제로는 가짜 플라스틱 감자를 주고, AI 가 "깎는 시늉"만 하면 점수를 줍니다.
  • 문제점: AI 가 플라스틱 감자를 깎는 법을 외웠을 뿐, 진짜 감자를 깎을 줄 모를 수 있습니다.

Agent-Diff 의 방식:

  • 실제 API 복제: 연구팀은 실제 기업용 서비스 (슬랙, 박스 등) 와 **완전히 똑같은 '복제본 (Container)'**을 만들었습니다.
  • 비유: AI 에게 진짜 감자를 주고, **진짜 주방 (복제된 서버)**에서 요리하게 합니다. AI 는 자신이 실제 주방에 있는 줄 알고 코드를 짜고 명령을 내립니다.
  • 결과: AI 가 실제로 감자를 잘 깎아내는지, 아니면 감자를 바닥에 떨어뜨리는지 실제 결과로만 판단합니다.

2. 과정이 아닌 결과: "요리 실력"을 보는 '상태 차이 (State-Diff)'

과거에는 AI 가 "어떤 버튼을 눌렀는지 (과정)"를 따라가며 점수를 매겼습니다. 하지만 AI 는 같은 결과를 내기 위해 여러 가지 다른 방법을 쓸 수 있습니다.

  • 기존 방식 (과정 추적): "AI 가 칼을 3 번 움직였으니 점수 10 점!" (하지만 감자는 여전히 통째로 남아있을 수 있음)
  • Agent-Diff 방식 (상태 차이): "요리 전에는 감자가 1 개였는데, 요리 후에는 감자 조각이 5 개가 되었으니 점수 10 점!"

이를 **State-Diff(상태 차이)**라고 합니다.

  • 비유: 시험 감독관이 AI 가 칼을 어떻게 움직였는지 지켜보지 않고, 요리 시작 전과 끝난 후의 접시 내용물만 비교합니다.
  • 핵심: "내가 원하는 대로 감자가 잘렸나요?"가 오직 중요한 질문입니다. 만약 AI 가 감자는 잘 깎았는데, 옆에 있던 소금통을 깨뜨렸다면 (원치 않는 부작용), 그건 실패로 간주합니다.

3. 설명서 유무 테스트: "외우기" vs "학습하기"

이 연구는 AI 가 설명서 (API 문서) 를 봤을 때와 안 봤을 때의 실력을 비교했습니다.

  • 상황 A (설명서 없음): AI 는 처음 보는 메뉴판을 보고 "어? 이 버튼이 뭐지?"라고 추측하며 시도해봐야 합니다.
  • 상황 B (설명서 제공): AI 는 메뉴판을 보고 정확한 레시피를 찾아 요리합니다.

주요 발견:

  • 새로운 기능: 만약 AI 가 훈련 데이터에 없는 **완전히 새로운 기능 (예: 최신 Box 의 'Hub' 기능)**을 다뤄야 한다면, 설명서가 있을 때와 없을 때의 실력 차이가 **엄청나게 큽니다.**这说明 AI 는 단순히 과거 지식을 외우는 것이 아니라, 새로운 정보를 보고 적응하는 능력이 중요하다는 것을 보여줍니다.
  • 잘하는 AI vs 못하는 AI:
    • 잘하는 AI (DeepSeek, Devstral 등): 실수했을 때 "아, 내가 실수했네. 다른 방법을 써보자"라고 적극적으로 문제를 해결합니다.
    • 못하는 AI: 같은 실수를 반복하거나, "어?成功了!"라고 **거짓말 (할루시네이션)**을 하며 끝냅니다.

요약: 이 연구가 왜 중요한가요?

  1. 진짜 실력을 본다: AI 가 가상 환경이 아닌, 실제 기업 업무 환경에서도 잘 작동하는지 검증합니다.
  2. 결과 중심 평가: AI 가 뭘 했는지보다 무엇을 성취했는지에 집중합니다.
  3. 새로운 기준 제시: AI 가 새로운 도구를 보고 얼마나 빨리 적응하는지, 그리고 실수를 어떻게 고치는지 분석할 수 있는 기준을 마련했습니다.

결론적으로, Agent-Diff는 AI 비서들에게 "가상의 시험지"가 아닌 **"실제 업무 현장에서의 생존 능력"**을 평가하는 새로운 기준이 될 것입니다. 앞으로 우리가 AI 를 업무에 도입할 때, 이 시험 점수가 높은 AI 를 선택하면 더 신뢰할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →