There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
이 논문은 평가 하네스 설정(프롬프트 문구 및 채점 방식 등)이 성능 변동의 주요 동인이며, 종종 모델의 실제 능력보다 모델의 순위를 결정짓는 경우가 많기 때문에 현대의 LLM 리더보드가 근본적으로 신뢰할 수 없음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 연구자들은 컴퓨터 프로그램이 언어를 얼마나 잘 이해하는지 측정하기 위해 표준화된 테스트에 의존합니다. 흔히 벤치마크라고 불리는 이 테스트들은 모델에게 일련의 객관식 질문을 제시하고 모델이 정답을 얼마나 맞혔는지를 기록합니다. 그 결과로 나온 점수는 기계의 지능에 대한 결정적인 사실로 취급되며, 이를 통해 과학자들은 서로 다른 모델들을 비교하여 순위를 매기고 승자를 선언할 수 있습니다. 수년 동안 학계는 모델의 성능이 무작위적인 확률로 인해 약간 변동될 수는 있지만, 전반적인 순위는 기술적 능력에 대한 안정적인 진실을 반영한다는 가정하에 운영되어 왔습니다. 한 모델이 정말로 다른 모델보다 더 똑똑한가라는 질문은 정답률이라는 단 하나의 숫자를 살펴보는 것으로 답해져 왔습니다.
하지만 새로운 조사에 따르면, 이 단 하나의 숫자는 훨씬 더 복잡한 이야기를 담고 있습니다. 이 연구는 모델이 받는 점수가 단순히 지능의 척도가 아니라, 그것을 채점하는 데 사용되는 특정 규칙의 산물임을 밝혀냈습니다. '평가 하네스(evaluation harness)'라고 알려진 이 규칙들은 겉보기에는 사소해 보이는 선택 사항들을 포함합니다. 여기에는 정답 옵션이 나열되는 순서, 기계에 주어지는 지시문의 정확한 문구, 그리고 정답 여부를 결정하는 방법 등이 포함됩니다. 이러한 선택들은 흔히 임의로 또는 편의에 따라 결정되지만, 연구자는 이를 변경하는 것만으로도 리더보드를 완전히 새로 써서, 꼴찌로 기록된 모델을 1위로 만들거나 그 반대의 상황을 만들 수 있다는 것을 발견했습니다. 이 결과는 인공지능을 순위 매기는 현재의 방식이 이전에 믿어왔던 것보다 훨씬 덜 안정적임을 시사하며, '최고'의 모델은 전적으로 테스트가 어떻게 실시되느냐에 달려 있다는 것을 의미합니다.
이 숨겨진 불안정성을 밝혀내기 위해, 캘리포니아 대학교 샌디에이고 캠퍼스의 한 연구자는 테스트 규칙 자체를 하나의 변수로 취급하는 거대한 실험을 설계했습니다. 단일 테스트를 실행하고 그 결과를 받아들이는 대신, 그는 동일한 시험을 실시하는 26가지의 서로 다른 방식을 구성했습니다. 그는 네 개의 주요 계열에 속하는 12개의 서로 다른 언어 모델을 가져와 동일한 3,679개의 객관식 질문에 답하게 했습니다. 모든 질문에 대해, 그는 가능한 모든 테스트 규칙의 조합을 적용하여 모델들을 실행했습니다. 여기에는 정답 선택지의 순서를 섞는 것, 질문의 구절을 바꾸는 것, 그리고 모델이 생성한 텍스트를 읽는 방식과 각 옵션의 수학적 가능성을 계산하는 방식이라는 두 가지 서로 다른 채점 방식을 전환하는 것이 포함되었습니다.
결과는 놀라웠습니다. 연구자가 단일 모델의 점수를 살펴보았을 때, 단 하나의 정확한 지점은 발견되지 않았습니다. 대신, 그는 넓은 범위의 가능한 점수대를 발견했습니다. 상위권 모델 중 하나는 사용된 26가지 규칙 세트에 따라 점수가 최저 31%에서 최고 89%까지 분포했습니다. 이는 동일한 기계가, 동일한 내부 코드와 동일한 지식을 가지고 있음에도 불구하고, 테스트 관리자가 글자의 순서를 바꾸거나 프롬프트의 스타일을 바꿨다는 이유만으로 거의 모든 정답을 맞혔거나 혹은 3분의 1도 맞히지 못한 것으로 기록될 수 있음을 의미합니다. 평균적으로, 표준 규칙 하에서 모델이 맞힌 것으로 인정받은 답변의 85%는 다른 동등하게 유효한 규칙 세트 아래에서는 틀린 것으로 표시될 수 있었습니다.
가장 결정적인 발견은 이러한 변동이 테스트 전체에 고르게 퍼져 있는 무작위 노이즈가 아니었다는 점입니다. 불안정성은 모델들을 서로 갈라놓는 질문들에 집중되어 있었습니다. 연구자가 두 인접 모델이 규칙에 상관없이 모두 정답을 맞히거나 틀린 질문들을 살펴보았을 때, 모델들은 사실상 동률이었습니다. 순위를 만들어내는 차이는 오직 모델들이 불확실해하는 질문들에서만 존재했습니다. 실제로, 서로 인접한 모델 쌍들의 경우, 점수 차이의 거의 전부(평균 약 96%)가 이러한 불안정한 질문들에 의해 발생했습니다. 만약 앞뒤로 바뀌는 질문들을 제거한다면, 순위는 사라지고 모델들은 구별 불가능한 상태가 됩니다.
이러한 취약성은 '승자'의 정체성이 모델의 고정된 속성이 아니라 평가자가 내린 선택임을 의미했습니다. 특정 규칙 세트 아래에서는 특정 모델이 1위를 차지할 수 있지만, 다른 규칙 세트 아래에서는 완전히 다른 모델이 승자가 될 수 있습니다. 이 연구에서 네 개의 서로 다른 모델이 사용된 구성에 따라 1위에 도ر할 수 있었습니다. 표준 규칙 하에서 12개 중 11위를 기록했던 한 모델은 다른 채점 방식을 사용했을 때 1위로 뛰어올랐습니다. 연구자는 정답을 채점하는 방식, 즉 모델이 쓴 텍스트를 읽을 것인지 아니면 확률을 계산할 것인지의 선택이 가장 강력한 요인이었으며, 이것이 옵션의 순서나 프롬프트의 문구보다 더 많은 순위 변동을 일으켰다고 언급했습니다.
연구는 또한 이 분야의 인기 있는 추세, 즉 시간을 절약하기 위해 이 거대한 테스트들을 가장 '정보력이 높은' 질문들의 작은 집합으로 압축하는 경향에 대해서도 조사했습니다. 몇 백 개의 잘 선택된 질문이 전체를 대표할 수 있다는 논리였습니다. 그러나 연구자는 이 관행이 문제를 오히려 악화시킨다는 것을 발견했습니다. 가장 정보력이 높다고 선택되는 질문들이 바로 테스트 규칙에 가장 민감한 질문들이기 때문입니다. 어렵고 중요한 질문들만을 남겨둠으로써, 압축된 벤치마크는 그것이 대체하는 전체 테스트보다 훨씬 더 휘발성이 강해집니다. 작은 테스트는 더 명확한 그림을 제공하는 것이 아니라, 설정의 미세한 조정에 따라 순위가 바뀔 가능성이 훨씬 더 높은 더 취약한 그림을 제공합니다.
궁극적으로, 이 논문은 모델의 능력을 나타내는 진실로서 단 하나의 숫자를 보고하는 현재의 관행이 오해의 소지가 있다고 주장합니다. 점수는 모델만의 속성이 아니라, 특정 규칙과 상호작용하는 모델의 속성입니다. 연구자는 미래의 보고서들이 리더보트를 고정된 위계로 취급하는 것을 멈추고, 가능한 점수의 범위를 제시해야 한다고 제안합니다. 또한 모델을 비교할 때, 과학자들이 규칙에 의해 결과가 좌우되는 질문보다는 모델들이 안정적이고 합의를 이루는 질문들에 집중해야 한다고 제안합니다. 커뮤니티가 이러한 테스트를 실행하는 단 하나의 변경 불가능한 방식에 합의하기 전까지, 순위는 인공지능에 대한 결정적인 척도가 아니라 평가자의 선택을 반영하는 결과물로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.