← 최신 논문
🤖 AI

Position: Evaluation Scores Are Perishable Knowledge Claims

이 논문은 평가 점수가 평균화를 통해 집계될 때 '신뢰 인플레이션'에 취ка되기 쉬운 소멸성 지식 주장이라고 주장하며, 대신 오도된 순위를 방지하기 위해 점수의 형식성, 범위 및 유효 기간을 명시적으로 추적하는 보수적인 '최약체 연결(weakest-link)' 접근 방식을 제안한다.

원저자: Sankalp Gilda, Shlok Gilda

게시일 2026-07-30
📖 6 분 읽기🧠 심층 분석

원저자: Sankalp Gilda, Shlok Gilda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스코어카드 함정: 왜 "평균"은 거짓말이 될 수 있는가

당신이 세 명의 서로 다른 목격자로부터 얻은 단서로 미스터리를 풀려는 탐정이라고 상상해 보십시오. 한 목격자는 절대 거짓말을 하지 않지만 멀리서 사건을 지켜본 매우 정확한 로봇입니다. 다른 한 명은 모든 것을 가까이서 보았지만 멋져 보이기 위해 가끔 이야기를 지어내는 수다스러운 인간입니다. 세 번째는 용의자가 말하는 것을 그대로 반복하는 거울입니다. 만약 당신이 이들의 이야기를 "평균" 낸다면, 당신은 아주 합리적으로 들리는 깔끔하고 중간 정도의 사건 전말을 얻게 될 것입니다. 하지만 여기 함정이 있습니다. 만약 인간 목격자가 용의자가 빨간 모자를 쓰고 있었다고 말했다면(실제로는 파란색이었음에도 불구하고), 그 하나의 잘못된 디테일은 로봇이 날씨에 대해 얼마나 완벽한 설명을 내놓았는지와 상관없이 전체 이야기를 망쳐버립니다. 인공지능의 세계에서, 특히 우리가 이 컴퓨터 두뇌들이 얼마나 똑똑한지 측정하려고 할 때, 우리는 종 often 이와 똑같은 실수를 저지릅니다. 우리는 테스트 점수를 단순히 더하고 숫자로 나누어 "최종 성적"을 얻을 수 있는 단순한 수학 문제처럼 취급합니다. 하지만 이 논문의 저자들은 이러한 점수들이 단순한 숫자가 아니라, 유통기한이 있고, 적용되는 특정 범위가 있으며, 서로 다른 신뢰 수준을 가진 '진실에 대한 주장'이라고 주장합니다. 만약 우리가 이러한 숨겨진 규칙들을 무시하고 모든 것을 그냥 평균 내버린다면, 우리는 "신뢰 인플레이션(Trust Inflation)"에 빠지게 됩니다. 이는 우리가 실제로 가장 위험한 방식으로 고장 났을지도 모르는 시스템에 대해 과도하게 자신감을 갖게 된다는 것을 뜻하는 멋진 표현입니다.

논문의 핵심 아이디어: 평균을 내는 것을 멈추고, 가장 약한 고리를 확인하라

Sankalp과 Shlok Gilda가 작성한 이 논문은 현재 AI 모델을 순위 매기는 방식이 근본적으로 결함이 있다고 주장합니다. 왜냐하면 모든 테스트 결과를 마치 동일하게 강력하고 영구적인 것처럼 취급하기 때문입니다. 저자들은 이 문제를 **신뢰 인플레이션(Trust Inflation)**이라고 부릅니다. 이는 자동화된 컴퓨터 체크, 인간의 의견, 그리고 AI 판사의 판단과 같은 서로 다른 유형의 증거를 하나의 "평균" 점수로 섞을 때 발생합니다. 문제는 단 하나의 약점이 전체 그림을 망칠 수 있음에도 불구하고, 평균을 내는 행위가 그 약점을 숨겨버린다는 점입니다.

이를 설명하기 위해 저자들은 간단한 비유를 사용합니다. 체인을 상상해 보십시오. 전체 체인의 강도는 모든 고리의 평균 강도가 아니라, 가장 약한 고리에 의해 결정됩니다. 99개의 고리가 강철로 만들어지고 단 하나의 고리가 종이로 만들어진 체인이 있다면, 그 체인은 깃털의 무게에도 끊어질 것입니다. 마찬가지로, 어떤 AI 모델이 시를 쓰는 데는 뛰어나지만 사실을 말하는 것(사실성)에는 형편없다면, "평균" 점수는 그 모델을 괜찮은 다재다키한 모델처럼 보이게 만들 수 있습니다. 하지만 현실 세계에서 그 AI가 의료 조언을 하는 데 사용된다면, 그 AI의 사실 전달 능력 부족은 그 시가 얼마나 아름다운지와 상관없이 재앙이 될 것입니다.

논문은 우리가 "평균"을 기본 방법으로 사용하는 것을 멈춰야 한다고 제안합니다. 대신, 특히 안전이 중요한 작업(safety-critical tasks)을 위해서는 "가장 약한 고리" 접근 방식을 사용해야 합니다. 이는 AI가 단 하나의 중요한 테스트에서 실패하더라도, 그 실패를 반영하여 전체 등급이 낮아져야 함을 의미합니다. 즉, 다른 좋은 점수들로 인해 그 실패가 가려져서는 안 된다는 것입니다.

AI 진실의 세 가지 규칙

저자들은 모든 AI 테스트 점수가 마치 식품 포장지가 내용물, 원산지, 유통기한을 알려주는 것처럼, 세 가지 구체적인 사항을 알려주는 "라벨"을 가지고 있어야 한다고 제안합니다.

  1. 형식성 (증거가 얼마나 강력한가?): 모든 테스트가 동일한 가치를 지니지는 않습니다. 논문은 "티어(Tier)" 시스템을 만듭니다.

    • Tier F0 (가장 약함): 다른 AI 모델이 작업물을 판단하거나 크라우드소싱된 의견이 여기에 해당합니다. 저자들은 AI 판사들이 실제로는 틀렸더라도 길고 화려한 답변을 선호하는 경향이 있기 때문에, 이들의 신뢰도는 0.70의 상한선까지만 신뢰할 수 있다고 제안합니다.
    • Tier F1 & F2 (더 강함): 구조화된 컴퓨터 체크나 통제된 인간 테스트입니다. 이들은 더 신뢰할 수 있지만, 인간 테스트조차도 한계(신뢰도 최대 0.95)가 있습니다.
    • Tier F3 (가장 강함): 공식적인 수학적 증명입니다. 이것만이 완벽한 1.00의 신뢰도에 도달할 수 있습니다.
    • 규칙: 만약 Tier F0 점수를 Tier F2 점수와 섞는다면, 전체 결과는 F0 수준(0.70)으로 제한됩니다. 강한 테스트를 더한다고 해서 약한 테스트를 강하게 만들 수는 없습니다.
  2. 범위 (이것이 어디에 적용되는가?): 테스트 점수는 그것이 테스트된 특정 상황에 대해서만 유효합니다. AI가 영어 질문에 대해 테스트를 받았다면, 그 점수가 스페인어에도 능숙하다는 것을 의미하지 않습니다. 일반 상식에 대해 테스트받았다고 해서 법률 자문에 능숙하다는 뜻도 아닙니다. 논문은 우리가 실수로 잘못된 곳에 점수를 사용하지 않도록, 점수가 그 한계를 명시적으로 밝혀야 한다고 주장합니다.

  3. 유효 기간 (언제 만료되는가?): 테스트 점수에는 유통기한이 있습니다. 우유처럼 말입니다. 점수의 유효 기간은 지나갑니다. 저자들은 AI 모델이 훈련 과정에서 테스트 질문을 이미 본 경우(이를 "데이터 오염(contamination)"이라 부름), 그 점수는 의미가 없어진다고 지적합니다. 그들은 모든 점수에 유통기한이 있어야 한다고 제안합니다. AI가 생성한 의견은 몇 주 동안만 유효할 수 있지만, 공식적인 수학 증명은 영원히 지속될 수 있습니다.

실제 사례: 작동 중인 "신뢰 인플레이션"

저자들은 단순히 이론만 이야기한 것이 아니라, AI 에이전트를 위한 실제 테스트 시스템을 구축했고 몇 가지 무서운 버그를 발견했습니다.

  • 침묵하는 버그: 그들은 컴퓨터 코드 언어 간의 불일치로 인해 모든 실패가 성공으로 기록되는 것을 발견했습니다. 시스템이 그들에게 거짓말을 하고 있었으며, 아무도 눈치채지 못한 채 점수를 부풀리고 있었습니다. 이것이 인프라 수준에서의 "신뢰 인플레이션"입니다.
  • "평균"의 거짓말: 그들은 유명한 공개 리더보드인 HELM을 사용하여 이 이론을 테스트했습니다. 그들은 10가지 서로 다른 시나리오에 걸쳐 54개의 상위 AI 모델을 조사했습니다.
    • 모델들을 평균 점수로 순위를 매겼을 때, 상위 5개 모델은 하나의 그룹이었습니다.
    • 모델들을 가장 약한 고리(어떤 카테고리에서든 가장 낮은 점수) 기준으로 순위를 매겼을 때, 상위 5개 모델은 완전히 다른 그룹이었습니다.
    • 실제로 두 상위 5개 리스트 사이의 겹치는 부분은 zero였습니다. 기존 방식으로 보았을 때 최고의 "다재다능한 모델"처럼 보였던 모델들이 실제로는 가장 큰 숨겨진 약점을 가지고 있었습니다. 반면, 예전 방식으로 보았을 때 "평균"처럼 보였던 모델들이 실제로는 치명적인 실패가 없었기 때문에 더 신뢰할 수 있는 모델이었습니다.

이것이 미래에 의미하는 바

논문은 AI 커뮤니티에 행동 촉구를 하며 마무리됩니다. 그들은 우리가 점수 뒤에 숨겨진 수학을 숨기는 것을 멈추기를 원합니다.

  • 과정을 보여주십시오: 모든 점수는 증거가 얼마나 강한지, 무엇에 적용되는지, 그리고 언제 만료되는지를 나타내는 라벨을 지녀야 합니다.
  • 선택하십시오: 만약 반드시 점수를 결합해야 한다면, 어떤 방법을 사용하고 있는지 밝혀야 합니다. 낙관적인 입장을 취하고 있습니까(평균 사용)? 아니면 보수적인 입장을 취하고 있습니까(가장 약한 고리 사용)? 논문은 안전을 위해서라면 보수적인 "가장 약한 고리" 방식을 기본값으로 사용해야 한다고 주장하지만, 적어도 우리가 그런 선택을 했다는 사실은 인정해야 한다고 말합니다.
  • 버전 관리: 소프트웨어 코드와 마찬가지로, 테스트 결과를 기록하는 방식은 버전 관리가 되어야 합니다. 그래야 사과와 오렌지를 실수로 비교하는 일이 발생하지 않습니다.

저자들은 이것이 "포지션 페이퍼(position paper)"임을 인정합니다. 즉, 모든 것을 100% 옳다고 증명하는 거대한 새로운 실험이라기보다, 강력한 논리와 엔지니어링 경험을 바탕으로 새로운 사고방식을 제안하는 것이라는 뜻입니다. 그들은 너무 보수적인 태도가 좋은 모델을 나쁘게 보이게 만들 수 있다는 점을 인정하지만, 평균적으로는 훌륭해 보이지만 실제로는 사람들에게 해를 끼치는 방식으로 실패하는 시스템을 배포하는 것보다는 안전한 편이 낫다고 주장합니다. 점수의 "인식론적 상태(epistemic status, 즉 진실성과 한계)"를 투명하게 만듦으로써, 우리는 어떤 AI 시스템을 신뢰할지에 대해 더 나은 결정을 내릴 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →