← 최신 논문
💬 NLP

An Empirical Study of Automating Agent Evaluation

본 논문은 도메인별 전문성을 재사용 가능한 기술로 인코딩하여 에이전트 평가를 자동화하는 AI 어시스턴트인 EvalAgent 를 소개하며, 이러한 지식이 프론티어 코딩 어시스턴트와 베이스라인 접근법을 크게 능가하는 실행 가능하고 의미 있는 평가 코드 생성에 결정적임을 입증합니다.

원저자: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti M
게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 훌륭하고 자율적인 로봇 비서를 만들었다고 가정해 봅시다. 이 로봇은 항공권 예약, 코드 작성, 의료 문제 진단까지 수행할 수 있습니다. 하지만 어떻게 이 로봇이 실제로 좋은 일을 하고 있는지 알 수 있을까요?

과거에는 최종 답변만 확인했습니다. "올바른 항공권을 예약했는가?" 하지만 현대의 AI 에이전트는 복잡합니다. 많은 단계를 거치고, 다양한 도구를 사용하며, 때로는 중간에 실수를 하더라도 나중에 이를 수정하기도 합니다. 최종 결과만 확인하는 것은 학생의 최종 시험 점수만으로 성적을 매기는 것과 같습니다. 그들이 부정행위를 했는지, 고생했는지, 혹은 학습 내용을 제대로 습득했는지는 무시한 채요. 전체 과정을 지켜봐야 합니다.

문제는 이러한 복잡한 로봇들을 지켜보고 평가하는 일이 매우 어렵고 비용이 많이 들며 인간 전문가의 도움이 필요하다는 점입니다. AWS AI 랩스의 연구자들은 단순한 질문을 던졌습니다. 다른 로봇들을 자동으로 평가하는 '수퍼 로봇'을 만들 수 있을까?

이것이 바로 그들의 발견을 쉽게 설명한 이야기입니다.

문제: 평가 방법을 모르는 '똑똑한' 로봇

연구자들은 먼저 가장 첨단 코딩 어시스턴트 (프런티어 모델) 를 이용해 평가 소프트웨어를 작성해 보았습니다. 코딩 어시스턴트에게 로봇의 코드를 주고 "이 로봇이 작동하는지 확인하는 테스트를 작성해 달라"고 요청했습니다.

결과는 참혹했습니다. 코딩 어시스턴트들은 평생 시험을 본 적이 없는 열성적인 인턴들과 같았습니다.

  • 잘못된 것을 측정했습니다: 로봇이 문제를 해결했는지 확인하는 대신, 사용된 단어 수나 생각에 걸린 시간 (지연 시간, 토큰 수 등) 을 세었습니다.
  • 모든 것을 지나치게 복잡하게 만들었습니다: 2 개만 필요했는데 12 개 이상의 다양한 테스트로 구성된 거대하고 messy 한 테스트 스위트 (test suites) 를 작성했습니다. 마치 견과류를 깨기 위해 망치를 사용한 것과 같았습니다.
  • 혼란에 빠졌습니다: 완벽한 전략을 세웠지만, 그 계획과 맞지 않는 코드를 작성했습니다.

교훈: 로봇이 코드 작성에 능하다고 해서 코드 평가 방법을 안다는 뜻은 아닙니다. 좋은 테스트를 만드는 데 필요한 구체적인 '상식'이 부족합니다.

해결책: EvalAgent (전문 평가자)

이를 해결하기 위해 팀은 EvalAgent를 구축했습니다. EvalAgent 를 일반적인 스마트 로봇이 아니라 전문 도구 세트를 갖춘 로봇으로 생각하세요.

단순히 추측하는 대신, EvalAgent 는 **평가 기술 (Evaluation Skills)**이라는 '배낭'을 지고 있습니다. 이는 로봇이 정확히 어떻게 평가해야 하는지 알려주는 사전 포장된 지시사항, 템플릿, 최신 매뉴얼입니다.

  • 절차적 지시사항: "먼저 목적지가 아닌 로봇의 여정을 살펴보십시오."
  • 재사용 가능한 템플릿: "바퀴를 다시 발명하지 않도록 테스트를 작성하는 표준 방법을 여기 제시합니다."
  • 실시간 매뉴얼: "로봇이 사용하는 도구의 현재 사용 설명서입니다 (구식 명령을 사용하지 않도록 하기 위함)."

EvalAgent 는 이러한 기술을 활용하여 **추적 기반 파이프라인 (Trace-Based Pipeline)**을 구축합니다. 로봇의 전체 여정을 기록하는 보안 카메라를 상상해 보세요. EvalAgent 는 이 비디오를 지켜보며 핵심 순간들을 포착합니다 (올바른 도구를 사용했는가? 오류에서 복구했는가?). 그리고 코드가 어떻게 생겼는지가 아니라 실제로 무슨 일이 일어났는지에 기반하여 보고서를 작성합니다.

증명: 효과가 있었을까?

연구자들은 여행 플래너부터 의료 문서 처리기까지 20 가지 다른 로봇으로 구성된 AgentEvalBench라는 '짐 (Gym)'을 만들어 시스템을 테스트했습니다. 그들은 EvalAgent 를 '일반 코딩 어시스턴트' 및 기타 방법과 비교했습니다.

결과:

  1. 실제로 작동합니다: EvalAgent 의 테스트는 첫 시도에서 **65%**의 성공률로 의미 있는 결과를 제공했습니다. 다른 방법들은 약 70% 의 경우 실패하거나 무용한 결과를 내놓았습니다.
  2. 인간이 선호합니다: 인간 전문가들이 보고서를 살펴봤을 때, **80%**의 경우 EvalAgent 의 작업을 선호했습니다.
  3. 효율적입니다: EvalAgent 는 훨씬 더 짧고 깔끔한 코드를 작성했습니다. 다른 방법들은 필요한 것보다 6 배 더 많은 코드를 작성하여 실행되지 않는 많은 '불필요한 무게'를 만들어낸 반면, EvalAgent 는 집중력을 유지했습니다.

핵심 교훈 (비밀 레시피)

이 연구는 EvalAgent 가 다른 방법들이 실패한 곳에서 성공한 세 가지 주요 이유를 발견했습니다.

  1. 대본만 읽지 말고 영화를 보라: 로봇의 실제 *실행 추적 (execution traces, 로봇이 무엇을 했는지에 대한 영상)*을 기반으로 평가하는 것은 정적 코드 분석만 읽는 것보다 훨씬 좋습니다. 이는 정적 분석이 놓치는 오류들을 잡아냅니다.
  2. 계획보다 기술이 낫다: 로봇에게 단순히 "먼저 계획하고 그다음 구축하라"고 요청하는 것은 잘 작동하지 않았습니다. 로봇은 훌륭한 계획을 세우지만 그다음에는 엉망인 집을 짓곤 했습니다. **평가 기술 (Evaluation Skills, 도구 세트)**이 진정한 영웅이었습니다. 이는 로봇이 집중하도록 유지하고 터무니없는 코드를 작성하는 것을 방지했습니다.
  3. 매뉴얼을 최신으로 유지하라: 로봇이 사용하는 도구들은 빠르게 변합니다. EvalAgent 는 최신 문서를 즉시 가져오도록 시스템을 사용했습니다. 이것이 없다면, 구식 지시를 사용했기 때문에 작성된 코드는 종종 고장 나 있었습니다.

결론

AI 에이전트의 평가를 자동화하는 것은 가능하지만, 단순히 똑똑한 로봇에게 "알아서 하라"고 요청해서는 안 됩니다. 대신 전문 도구 세트를 제공하고 로봇의 실제 행동을 관찰하는 방법을 보여줘야 합니다. EvalAgent는 정확히 이를 수행하여 혼란스럽고 비용이 많이 드는 인간의 작업을 신뢰할 수 있고 실행 가능한 보고서를 생산하는 간소화된 자동화 프로세스로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →