← 최신 논문
🤖 AI

Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation

본 논문은 LLM 벤치마킹의 표본 분산을 해결하기 위해 여러 세대를 활용하는 계층적 통계 모델을 제안하여 점수 정확도를 향상시키고, 세밀한 프롬프트 수준의 난이도 분석을 가능하게 하며, 데이터 시각화를 통한 벤치마크 품질 관리를 용이하게 한다.

원저자: Wenbo Zhang, Hengrui Cai, Wenyu Chen

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wenbo Zhang, Hengrui Cai, Wenyu Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 요리사의 요리 실력을 평가하려 한다고 상상해 보세요. 100 가지 레시피 목록을 그들에게 주어 요리를 시킵니다.

기존 방식 (한 번의 시도 문제)
현재 대부분의 사람들은 AI 모델 (대형 언어 모델 등) 을 평가할 때, 질문을 하나 던지고 단 하나의 답변만 보고 판단합니다.

  • 요리사가 오믈렛을 한 번 완벽하게 만들면, 우리는 그들을 명장으로 평가합니다.
  • 한 번만 태워먹으면, 우리는 그들을 형편없다고 말합니다.

문제는 이러한 AI 요리사들이 다소 예측 불가능하다는 점입니다. 때로는 '탐욕적'인 기분에 safest 하고 가장 표준적인 레시피에 매달리기도 하고, 다른 때는 '무작위적'으로 창의적인 변형을 시도하기도 합니다. 만약 한 가지 요리만 맛본다면 운이 좋거나 나쁠 수 있습니다. 요리사가 실제로 실력이 좋은지, 아니면 단순히 그 한 번의 주문에서 운이 좋았을 뿐인지 알 수 없습니다. 이는 농구 선수의 자유투 성공률을 공 하나만 던지는 것을 보고 판단하는 것과 같습니다.

새로운 방식 (다중 생성 접근법)
이 논문은 더 나은 방법을 제안합니다: 요리사에게 같은 요리를 50 번 만들어 보게 하십시오.

같은 레시피에 대한 50 가지 다른 시도를 살펴보면 훨씬 더 명확한 그림을 얻을 수 있습니다:

  1. 진짜 실력 대 운: 요리사가 50 번 중 48 번을 성공하면, 그들이 진정으로 실력이 있다는 것을 알 수 있습니다. 만약 25 번만 성공한다면, 그 한 번의 운 좋은 성공이 완벽해 보였더라도 그들이 어려움을 겪고 있다는 것을 알 수 있습니다.
  2. 난이도 측정: 이제 어떤 레시피가 실제로 어려운지 알 수 있습니다. 모든 요리사가 특정 요리를 50 번 시도하고 모두 실패한다면, 그 요리는 객관적으로 어렵습니다. 모두 성공한다면 쉬운 것입니다. 이는 모든 질문에 대한 '난이도 점수'를 생성합니다.
  3. 나쁜 레시피 찾기: 때로는 레시피 책 자체가 잘못되어 있을 수 있습니다. 예를 들어 레시피에는 '소금 추가'라고 되어 있지만 정답 키에는 '설탕 추가'라고 되어 있을 수 있습니다. 요리사가 레시피에 따라 소금을 추가하며 50 번 시도하지만 정답 키가 잘못되어 있다면, 컴퓨터는 이러한 혼란을 파악할 수 있습니다. 논문은 이를 '데이터 맵 (Data Map)'이라고 부르며, 이는 테스트 자체의 잘못된 질문을 찾아 수정하는 데 도움이 됩니다.

'주사위 굴리기' 비유
AI 를 주사위 한 쌍이라고 생각해 보세요.

  • 탐욕적 디코딩 (기존 방식): 이는 주사위가 항상 가능한 가장 높은 숫자로 나오도록 강요하는 것과 같습니다. 예측 가능하지만, 주사위가 할 수 있는 전체 범위를 보여주지는 못합니다.
  • 무작위 샘플링 (새로운 방식): 이는 주사위를 자연스럽게 굴리게 하는 것입니다.
  • 논문의 통찰: 주사위를 한 번 굴려서 '6'이 나왔다면, 그 주사위가 마법 같다고 생각할 수 있습니다. 하지만 50 번 굴리면 진정한 평균을 보게 됩니다. 이 논문은 주사위를 더 많이 굴리는 것 (더 많은 답변 생성) 이 AI 의 실력에 대한 추정을 훨씬 더 정확하게 만들고 우연일 가능성을 줄인다는 것을 수학적으로 증명합니다.

실제로 발견한 것
연구진들은 여러 다른 AI 모델을 사용하여 네 가지 다른 유형의 '테스트 (벤치마크)'에서 이를 검증했습니다:

  • 안정성: 그들은 어려운 추론 작업의 경우, AI 가 무작위 샘플러처럼 행동한다는 것을 발견했습니다. 하나의 답변만으로는 진실을 알 수 없습니다.
  • 격차: AI 가 안전을 추구할 때 (탐욕적) 얻는 결과와 기회를 택할 때 (무작위) 얻는 결과 사이에는 종종 큰 차이가 있습니다. 무작위 추측 하나에만 의존하는 것은 불안정합니다.
  • 데이터 정제: AI 에게 같은 질문에 50 번 답하게 함으로써, 연구진은 수학 데이터셋의 질문 중 약 44% 가 잘못 레이블링되었거나 혼란스럽게 작성된 것을 찾아낼 수 있었습니다.

단점
이 논문은 요리 50 개를 만드는 것은 요리 하나를 만드는 것보다 더 많은 시간과 에너지를 소모한다고 인정합니다. 더 많은 컴퓨팅 파워가 필요합니다. 그러나 그 대가로 AI 에 대해 훨씬 더 정직하고 신뢰할 수 있는 성적표를 얻게 됩니다.

요약
책 한 장으로 책을 판단하지 말고, 하나의 답변으로 AI 를 판단하지 마십시오. AI 에게 같은 작업을 여러 번 시도하게 함으로써 우리는 그 진정한 능력을 파악하고, 어떤 질문이 실제로 어려운지 이해하며, 깨진 테스트를 수정할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →