← 최신 논문
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

본 논문은 57 개의 머신러닝 평가 하네스에 대한 실증 연구를 제시하여, 스펙 지정 단계를 운영상의 주요 문제 원인으로 규명하고, 16,560 건의 문제를 근본 원인에 따라 분류하여 구현되지 않은 기능, 문서화 부재, 그리고 누락된 입력 유효성 검사가 문제의 60% 이상을 차지함을 드러내며, 평가 공학을 별도의 소프트웨어 공학 분야로 취급하기 위한 기반을 마련한다.

원저자: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 레시피를 평가하려는 셰프라고 상상해 보세요. 당신은 재료 (데이터), 레시피 카드 (모델), 그리고 어떤 요리를 '훌륭한' 것으로 만드는지에 대한 규칙 목록 (지표) 을 가지고 있습니다. 하지만 음식을 맛보기 전에, 요리를 할 부엌, 조리 시간을 추적할 타이머, 그리고 결과를 기록할 점수판이 필요합니다.

인공지능 (AI) 세계에서는 이 '부엌'을 **평가 하네스 (Evaluation Harness)**라고 부릅니다. 이는 실제로 테스트를 실행하고, 데이터를 로드하며, 점수를 계산하고, AI 모델이 잘 수행하고 있는지 알려주는 소프트웨어 도구입니다.

이 논문은 57 가지 다른 'AI 부엌'이 어떻게 작동하는지, 어디에서 고장 나는지, 그리고 왜 사람들이 그것들에 대해 좌절하는지 살펴보기 위한 대규모 검사와 같습니다. 연구자들은 이 새로운 분야를 **평가 공학 (Evaluation Engineering)**이라고 부릅니다.

다음은 그들의 발견 사항을 간단한 비유로 정리한 것입니다:

1. 5 단계 부엌 워크플로우

연구자들은 모든 AI 평가 부엌이 생산 라인처럼 5 가지 특정 단계를 거친다는 것을 발견했습니다:

  • 프로비저닝 (부엌 세팅): 가스레인지, 냄비, 재료를 준비합니다. 여기에는 소프트웨어 설치와 계정 로그인이 포함됩니다.
  • 명세 (레시피 작성): 정확히 무엇을 요리할지, 어떤 재료를 사용할지 결정합니다. 여기서 AI 모델과 테스트 데이터를 로드합니다.
  • 실행 (음식 조리): AI 모델을 실제로 실행하여 답변을 생성합니다.
  • 평가 (시식 및 점수 매기기): 정답과 답변을 비교하고 점수를 계산합니다.
  • 보고 (메뉴 제공): 차트나 보고서로 최종 결과를 보여줍니다.

큰 놀라움: 대부분의 부엌은 '조리 (실행)'에는 뛰어나지만 '제공 (보고)'에는 형편없습니다. 어제보다 오늘 음식 맛이 떨어졌는지 알려주는 자동 경보 시스템이 있는 부엌은 매우 드뭅니다.

2. 문제가 발생하는 곳 (근본 원인)

팀은 사용자들로부터 16,000 건 이상의 불만 (이슈라고 함) 을 조사했습니다. 그들은 문제들이 보통 수학이 잘못되었거나 코드가 극적으로 충돌하기 때문이 아니라는 것을 발견했습니다. 대신, 문제들은 대부분 관료주의적이고 누락된 부분에서 비롯됩니다.

지침이 누락되었거나 상자에 '빨간 벽돌 포함'이라고 적혀 있지만 실제로는 파란 벽돌만 들어있는 레고 세트를 조립하려는 것이라고 생각해 보세요.

부엌이 실패하는 상위 3 가지 이유는 다음과 같습니다:

  1. 기능 누락 (24%): 도구가 특정 작업을 수행할 것이라고 약속했습니다 (예: 특정 유형의 데이터 처리). 하지만 개발자들은 실제로 그 부분을 만들지 않았습니다. 스티어링 휠은 있지만 엔진이 없는 차와 같습니다.
  2. 나쁜 지침 (20%): 도구는 작동하지만 매뉴얼이 없거나, 구식이거나, 혼란스럽습니다. 사용자들이 어떻게 사용하는지 파악할 수 없습니다.
  3. 안전 점검 부재 (17%): 도구가 재료가 신선한지 확인하지 않습니다. 나쁜 데이터를 입력하면 멈추지 않고 쓰레기를 요리하여 쓰레기 같은 점수를 제공합니다.

3. 부엌의 다양한 유형

연구자들은 57 개의 부엌을 4 가지 '원형 (유형)'으로 그룹화했으며, 각 유형에는 고유한 두통이 있습니다:

  • 표준화 테스트 부엌 (40%): 표준 시험 (AI 의 SAT 와 같은) 에 대해 여러 모델을 테스트하는 크고 유명한 부엌들입니다.
    • 가장 큰 두통: 의존성 파손. 그들은 예고 없이 변경되거나 사라지는 외부 재료 (데이터셋) 에 의존합니다. 공급업체가 포장 방식을 바꾸면 부엌 전체가 작동을 멈춥니다.
  • 전문 도구 (21%): 한 가지 일만 완벽하게 수행하는 작은 도구들입니다 (예: 로봇이 걸을 수 있는지 확인).
    • 가장 큰 두통: 나쁜 지침. 너무 단순하기 때문에 개발자들이 설정 방법을 명확하게 설명하는 지침을 작성하는 것을 잊어버립니다.
  • 커스텀 프로브 (21%): 코딩이나 수학 같은 특정 기술을 테스트합니다.
    • 가장 큰 두통: 수학 오류. 자신만의 점수 계산 공식을 만들기 때문에 종종 수학을 잘못 계산하여, 점수는 올바르게 보이지만 실제로는 잘못된 침묵하는 오류를 초래합니다.
  • 풀서비스 레스토랑 (17%): 모든 것을 수행하는 세련된 올인원 플랫폼들입니다.
    • 가장 큰 두통: 계약 불일치. 원격 심사관과 로컬 모델과 같이 많은 다른 부분들을 연결하기 때문에, 부분들이 종종 같은 언어로 소통하지 못해 의사소통 장애가 발생합니다.

4. '침묵하는 살인자'

논문의 가장 위험한 문제는 침묵하는 점수 오류입니다.

심판이 수프를 맛보고 5 스타 등급을 매기는 상황을 상상해 보세요. 심판은 자신 있고, 점수가 인쇄되며, 모두 행복해합니다. 하지만 심판은 실제로 소금을 넣는 것을 잊어버렸고, 수프는 끔찍하게 맛이 있습니다. 도구가 충돌한 것은 아닙니다. 단지 잘못된 점수를 제공했을 뿐입니다.

논문은 많은 도구들이 점수를 잘못 계산하거나 (알고리즘 오류) 데이터가 타당한지 확인하지 못한다는 것 (검증 격차) 을 발견했습니다. 그리고 시스템에 '제 2 의 의견'이 내장되어 있지 않기 때문에, 훨씬 나중에야 사람들이 이를 알아차립니다.

5. 미래에 대한 의미

이 논문은 이러한 도구들을 단순한 '스크립트'가 아닌 진지한 공학 제품으로 취급해야 한다고 결론 내립니다.

  • 개발자는 수학이 완벽하다고 가정하는 것을 멈추고 '안전망' (예: 점수를 인쇄하기 전에 타당한지 확인) 을 구축해야 합니다.
  • 사용자는 점수를 맹신하는 것을 멈춰야 합니다. 도구가 '95% 정확도'라고 한다고 해서 그것이 진실이라는 뜻은 아닙니다. 작업을 다시 확인해야 합니다.
  • 연구자는 이러한 도구들을 테스트할 새로운 방법을 개발해야 합니다. 왜냐하면 '테스트' 자체가 환각을 일으킬 수 있는 AI 일 때, 소프트웨어를 테스트하는 기존 방법은 작동하지 않기 때문입니다.

간단히 말해: 우리는 다른 기계를 테스트하기 위해 놀라운 기계를 구축했지만, 테스트를 수행하는 기계들은 종종 지침이 누락되어 있고, 논리에 구멍이 있으며, 혼란스러울 때 우리에게 알려줄 능력이 부족합니다. 이러한 '부엌'을 고치는 것은 더 나은 '셰프 (AI 모델)'를 만드는 것만큼이나 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →