← 최신 논문
🤖 machine learning

On Randomness in Agentic Evals

이 논문은 단일 실행 기반의 에이전트 평가가 통계적 노이즈로 인해 실제 알고리즘적 진전을 왜곡할 수 있음을 6 만 개의 실행 데이터를 통해 입증하고, 신뢰할 수 있는 평가를 위해 다중 실행 및 통계적 검정력 분석을 포함한 새로운 평가 관행을 제안합니다.

원저자: Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

게시일 2026-03-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 인공지능 에이전트 (AI 에이전트) 의 성능을 평가할 때 우리가 흔히 저지르는 **'우연의 함정'**에 대해 경고하는 연구입니다.

간단히 비유하자면, **"한 번의 시험 점수만으로 학생의 실력을 판단하는 것은 매우 위험하다"**는 이야기입니다.

다음은 이 논문의 핵심 내용을 일상적인 언어와 비유로 풀어낸 설명입니다.


🎲 1. 문제: "한 번의 행운"을 실력으로 착각하다

지금까지 AI 에이전트 (예: 코딩을 도와주는 AI) 의 성능을 평가할 때, 연구자들은 보통 하나의 작업에 대해 딱 한 번만 실행해보고 그 결과 (성공했는지 실패했는지) 로 점수를 매겼습니다. 마치 학생이 수학 문제를 딱 한 번 풀어서 그 결과만으로 '수학 천재'라고 선언하는 것과 비슷합니다.

하지만 이 논문은 **"그 한 번의 결과가 운이 좋았을 뿐일 수도 있다"**고 말합니다.

  • 비유: 동전을 던져서 앞면이 나오면 "이 동전은 앞면이 나올 확률이 100% 다!"라고 믿는 것과 같습니다. 실제로는 10 번 던졌을 때 앞면이 7 번, 뒷면이 3 번 나올 수도 있는데, 딱 한 번 던져서 앞면이 나왔다고 해서 결론을 내리는 것은 위험합니다.

📊 2. 실험 결과: 놀라운 '변동성'

저자들과 연구팀은 SWE-Bench(소프트웨어 버그를 고치는 과제)라는 유명한 시험지를 가지고, 3 가지 다른 AI 모델로 각각 10 번씩 총 60,000 번의 실험을 했습니다. 결과는 충격적이었습니다.

  • 동일한 조건, 다른 결과: 같은 AI, 같은 문제, 같은 설정 (심지어 '랜덤성'을 없앤다고 알려진 0 온도 설정) 으로 실행해도, 성공률이 2.2% 에서 6.0% 까지 달라졌습니다.
  • 비유: 같은 요리사가 같은 레시피로 같은 재료를 써서 요리를 10 번 했는데, 1 번은 완벽하고 3 번은 너무 짜고, 2 번은 덜 익은 상태가 나온 것과 같습니다.
  • 결론: 만약 어떤 AI 가 이전 모델보다 3% 더 잘한다고 발표했는데, 그 차이가 단순히 "운이 좋았던 한 번의 실행" 때문일 수도 있다는 뜻입니다. 즉, 진짜 발전인지, 그냥 운인지 구분하기 어렵습니다.

🦋 3. 원인: 나비 효과 (작은 차이가 큰 결과를 만든다)

왜 이렇게 결과가 들쑥날쑥할까요? 연구팀은 AI 가 생각하는 과정 (트레이젝토리) 을 자세히 분석했습니다.

  • 초기 분기: AI 가 문제를 해결하기 위해 생각할 때, 처음 몇 토큰 (단어) 만으로도 생각이 갈라집니다.
  • 비유: 길을 떠날 때, 처음 1 분 동안 "왼쪽으로 가자"라고 생각했는지 "오른쪽으로 가자"라고 생각했는지에 따라, 나중에는 완전히 다른 도시 (해결책) 에 도달하게 됩니다.
  • 나비 효과: 아주 사소한 말실수나 생각의 차이가 AI 의 다음 행동, 도구 사용, 그리고 최종 결과까지 완전히 다른 방향으로 이끌었습니다. 심지어 랜덤성을 없애려 노력해도 (온도 0), AI 엔진 자체의 미세한 차이 때문에 이런 분기가 일어납니다.

📈 4. 제안: 더 똑똑한 평가 방법

이제 우리는 AI 의 실력을 더 정확하게 평가해야 합니다. 저자들은 세 가지 구체적인 방법을 제안합니다.

  1. 한 번이 아니라 여러 번 해보기 (Multiple Runs):
    • 비유: 한 번의 시험 점수가 아니라, 10 번의 모의고사 평균 점수를 보고 실력을 판단하세요. 작은 개선을 측정할 때는 특히 더 많은 횟수가 필요합니다.
  2. 통계적 검증 (Statistical Power):
    • 비유: "이 약이 정말 효과가 있을까?"를 증명하려면 충분한 수의 환자를 테스트해야 하듯, AI 의 개선이 진짜인지 확인하려면 통계적으로 충분한 횟수를 실행해야 합니다.
  3. 최선과 최악의 시나리오 모두 보기 (Pass@k & Pass^k):
    • 비유:
      • Pass@k (낙관적): "최선을 다해서 5 번 시도하면 몇 번 성공할까?" (기회만 주면 잘하는지)
      • Pass^k (비관적): "5 번 시도했을 때, 매번 성공할까?" (일관성이 있는지)
    • 이 두 가지 점수의 차이를 보면, AI 가 운에 의존하는지, 아니면 진짜 실력이 있는지 알 수 있습니다.

💡 5. 결론: 왜 이것이 중요한가?

이 논문의 핵심 메시지는 **"AI 의 발전을 논할 때, 우연에 의한 노이즈를 진짜 신호로 착각하지 말라"**는 것입니다.

  • 현재의 문제: 한 번의 실행으로 "우리가 3% 더 발전했다!"라고 외치는 것은, 실제로는 그 3% 가 그냥 운일 뿐일 수 있어 과학적으로 신뢰할 수 없습니다.
  • 미래의 방향: AI 시스템이 더 복잡해지고 길어질수록 (오래된 버그를 고치거나 복잡한 작업을 수행할 때), 작은 초기 차이가 결과에 미치는 영향은 더 커질 것입니다. 따라서 더 많은 실행 횟수와 통계적 분석이 필수적입니다.

한 줄 요약:

"AI 의 실력을 한 번의 행운으로 판단하지 말고, 여러 번의 실패와 성공을 평균내어 진짜 능력을 확인해야 합니다. 그래야만 우리는 AI 기술이 정말로 발전하고 있는지, 아니면 그냥 운이 좋았을 뿐인지 알 수 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →