← 최신 논문
💬 NLP

Holistic Evaluation and Failure Diagnosis of AI Agents

본 논문은 AI 에이전트의 실패를 효과적으로 국소화하고 범주화하기 위해 상향식 진단과 하향식 스패 수준 평가를 결합한 종합 평가 프레임워크를 제시하며, TRAIL 벤치마크에서 최첨단 성능을 달성하고 에이전트 진단의 주요 병목 현상이 모델 능력보다는 평가 방법론에 있음을 입증합니다.

원저자: Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir
게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir Chorev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI 로봇 팀을 고용하여 20 분짜리 유튜브 동영상 안에 숨겨진 특정 숫자를 찾거나 고장 난 소프트웨어 코드를 수정하는 것과 같은 복잡한 퍼즐을 해결한다고 상상해 보세요. 때로는 로봇들이 성공하기도 하지만, 다른 때는 실패하기도 합니다.

이 논문이 지적하는 문제는 현재 그들의 작업을 점검하는 방식이 시험의 최종 답안만 확인하는 교사와 같다는 점입니다. 답이 틀리면 교사는 '불합격'이라고 표시하고 넘어갈 뿐, 왜 틀렸는지, 혹은 50 단계 과정 중 로봇이 어디서 혼란을 겪었는지는 알려주지 않습니다. 지시사항을 잘못 읽었을까요? 잘못된 도구를 사용했을까요? 아니면 단순히 숫자를 지어냈을까요?

Deepchecks 의 저자들은 '전체적 평가 프레임워크 (Holistic Evaluation Framework)'라는 새로운 시스템을 구축했는데, 이는 초정밀 탐정처럼 작동합니다. 최종 결과물만 채점하는 대신, 로봇의 전체 여정을 '스팬 (spans)'이라고 부르는 작고 관리 가능한 단계로 세분화하여 정확히 무엇이 잘못되었는지 찾아냅니다.

다음은 간단한 비유를 사용하여 그들의 시스템이 어떻게 작동하는지 설명한 것입니다:

1. 양면 탐정 접근법

저자들은 로봇의 작업을 한 가지 관점만으로 살펴보는 것만으로는 부족하다는 점을 깨달았습니다. 그들은 두 가지 다른 관점을 결합했습니다:

  • 하향식 탐정 (현미경):
    로봇이 사용한 모든 도구를 하나하나 살펴본다고 상상해 보세요. 로봇이 올바른 질문을 했을까요? 돌아온 답변이 논리적일까요? 파일을 열려고 할 때 충돌이 발생했을까요?

    • 비유: 이는 자동차 엔진의 모든 볼트와 전선을 점검하는 정비사와 같습니다. 볼트 하나가 헐거우면 즉시 찾아냅니다. 이는 명령어의 오타나 고장 난 도구와 같은 구체적인 실수를 발견하는 데 탁월하지만, 더 큰 그림 (예: 정비사가 잘못된 차를 보고 있다는 사실) 을 놓칠 수 있습니다.
  • 상향식 탐정 (조망점):
    이는 전체 여정을 살펴봅니다. 로봇이 자신의 계획을 따랐을까요? 같은 질문을 다섯 번이나 반복하며 시간을 낭비했을까요? 중요한 정보를 확인하는 것을 잊었을까요?

    • 비유: 이는 비행 경로를 전체적으로 감시하는 관제사와 같습니다. 엔진 부품 하나하나가 완벽하게 작동하더라도 비행기가 이상한 우회 경로를 취하거나 연료를 낭비하는지 파악할 수 있습니다.

마법: 현미경과 조망점을 모두 사용함으로써 이 시스템은 정확히 무엇이 잘못되었는지 (예: '환각') 와 어디서 발생했는지 (예: '검색 도구를 요청한 14 단계') 를 알려줄 수 있습니다.

2. 구식 방법들이 실패한 이유

이 논문은 TRAIL 벤치마크 (데이터 찾기나 코드 수정과 같은 실제 세계 작업을 사용함) 라는 까다로운 테스트를 통해 새로운 시스템을 구식 방법들과 비교했습니다.

  • 단일 심판 (구식 방식):
    100 페이지 분량의 보고서를 읽어서 모든 실수를 한 번에 찾아내도록 매우 똑똑한 한 사람에게 요청한다고 상상해 보세요.

    • 문제점: 보고서가 길어질수록 그 사람은 압도당합니다. 100 페이지에 집중하는 바람에 45 페이지의 실수를 놓칠 수 있습니다. 논문에서도 가장 똑똑한 AI 모델들 (GPT-5.4 등) 이 한 번에 모든 것을 하도록 요청받았을 때, 길고 복잡한 작업에서 구체적인 실수를 찾는 데 처참하게 실패했습니다. 그들은 어떤 종류의 오류가 발생했는지 추측할 수는 있었지만, 그것이 어디에 있는지 지적할 수는 없었습니다.
  • 새로운 프레임워크 (지혜로운 방식):
    한 사람이 책 전체를 읽는 대신, 전문가 팀을 상상해 보세요. 한 사람은 1 페이지를 확인하고, 다른 사람은 2 페이지를 확인하고, 이런 식으로 이어집니다. 그런 다음 관리자가 그들의 메모를 종합합니다.

    • 결과: 시스템은 작업이 매우 길어지더라도 압도되지 않았습니다. 오류를 훨씬 더 높은 정확도로 찾아냈습니다.

3. 결과: 압도적인 승리

그들이 새로운 시스템을 기존 최상위 방법들과 비교했을 때:

  • '어디'를 찾는 능력: 그들의 시스템은 정확히 어떤 단계가 실패했는지 pinpoint 하는 데 3.5 배 더 뛰어났습니다. 가장 어려운 테스트에서 오류 유형과 위치를 동시에 찾는 데는 12.5 배 더 뛰어났습니다.
  • '같은 두뇌, 더 나은 방법'이라는 놀라운 사실: 그들은 구식 방식과 새로운 방식 모두에 정확히 같은 초지능 AI 모델 (GPT-5.4) 을 사용했습니다.
    • 구식 방식: AI 는 긴 코드 작업에서 오류를 찾는 데 7% 의 정확도를 보였습니다.
    • 새로운 방식: 동일한 AI 는 86% 의 정확도를 보였습니다.
    • 결론: 문제는 AI 가 충분히 똑똑하지 않았기 때문이 아니라, 작업을 평가하도록 요청하는 방법이 결함이 있었기 때문입니다. 방법을 변경함으로써 AI 의 진정한 잠재력을 unlocking 했습니다.

4. 이것이 의미하는 바 (논문에 따르면)

이 논문은 AI 에이전트를 고치기 위해서는 최종 점수만 바라보는 것을 멈춰야 한다고 결론 내립니다. 우리는 실패를 정확하게 진단하기 위해 작업을 작고 독립적인 조각으로 분할하는 시스템이 필요합니다.

그들은 또한 사용한 테스트 데이터 (TRAIL) 에 일부 labeling 이 엉망이었다는 점 (예: 인간이 잘못된 단계를 오류로 표시한 경우) 을 지적했지만, 이러한 결함에도 불구하고 그들의 새로운 방법은 경쟁자들을 압도했습니다.

간단히 말해: 이 논문은 AI 에이전트를 평가하기 위해 '더 똑똑한' AI 가 필요한 것이 아니라, 그들을 평가하는 더 지혜로운 방법이 필요하다고 주장합니다. 큰 문제를 작고 관리 가능한 조각으로 분할함으로써, 그들의 시스템은 다른 방법들이 완전히 놓치는 오류들을 찾아냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →