← 최신 논문
💬 NLP

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

본 논문은 LLM 기반 심사가 서로 다른 실행 간에 상당한 평가자 내 불일치를 보임으로써 점수의 신뢰성을 훼손한다는 사실을 밝히고, 이러한 평가가 특정 지침을 통해 여전히 효과적으로 활용될 수 있는지 조사한다.

원저자: Rajarshi Haldar, Julia Hockenmaier

게시일 2026-04-29
📖 5 분 읽기🧠 심층 분석

원저자: Rajarshi Haldar, Julia Hockenmaier

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks"라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 정리합니다.

핵심 아이디어: "룰렛" 심판

유명한 음식 평론가를 새로 생긴 식당을 리뷰하러 고용했다고 상상해 보세요. 같은 테이블에 앉아, 앞에는 같은 냅킨이 놓인 채로, 같은 요리를 세 번 연속으로 맛보게 합니다.

  • 첫 번째 맛보기: 5 점 만점에 5 점으로 "걸작"이라고 평가합니다.
  • 두 번째 맛보기: 2 점으로 "맛없고 과익된" 요리라고 평가합니다.
  • 세 번째 맛보기: 4 점으로 "괜찮지만 소금이 더 필요해"라고 평가합니다.

만약 이런 일이 일어난다면, 그 평론가를 신뢰하지 못하게 될 것입니다. 그들의 판단은 룰렛과 같다는 것을 깨닫게 되죠. 음식 (입력) 은 변함없는데도, 룰렛이 돌아서 매번 다른 숫자에 멈추기 때문입니다.

연구자들은 다른 AI 가 생성한 텍스트를 심판하는 역할을 Large Language Models(LLM) 에게 맡겼을 때 정확히 같은 현상을 발견했습니다. 그들은 이러한 AI 심판들이 **"Rating Roulette(등급 룰렛)"**으로 고통받고 있음을 발견했습니다.

문제: AI 심판이 자기 자신과 합의하지 못함

AI 세계에서는 종종 한 AI 가 다른 AI 의 작업을 채점합니다. 이를 "LLM-as-a-Judge(심판으로서의 LLM)"라고 부릅니다. 인간을 고용하는 것보다 빠르고 저렴하기 때문에 인기가 많습니다.

하지만 연구자들은 간단한 테스트를 진행했습니다.

  1. 뉴스 요약이나 채팅 대화와 같은 텍스트 조각을 가져옵니다.
  2. 동일한 AI 심판에게 정확히 같은 지시사항을 사용하여 세 번 채점하게 합니다.
  3. AI 가 매번 같은 점수를 주는지 확인합니다.

결과: AI 심판들은 제각각이었습니다.

  • 요약이 사실적인지 확인하는 SummaC 작업에서, 가장 좋은 AI 심판조차 스스로와 약 79% 만 일치했습니다.
  • 챗봇 대화를 순위 매기는 MT-Bench 작업에서는 일치율이 더 떨어졌습니다. 한 AI 심판은 경우의 **61%**에서만 세 번 연속으로 정확히 같은 답을 주었습니다.

질문과 답변은 변하지 않았는데도, 심판의 기분이 매번 바뀌는 것과 같습니다.

역효과를 부르는 "마술"

"좋아, AI 에게 무작위성을 멈추라고 해보자. 항상 같은 답을 내도록 뇌의 '주사위 굴리기' 부분을 끄자"라고 생각할 수 있습니다.

연구자들은 이를 시도했습니다. AI 를 100% 결정론적 (무작위성 없음) 으로 설정했습니다.

  • 일관성이 생겼나요? 네.
  • 더 나은 심판이 되었나요? 아니요.

오히려 AI 에게 주사위 굴리기를 강제로 멈추게 했을 때, 인간 심판과 비교해 등급이 더 나빠졌습니다. 마치 셰프에게 매번 정확히 같은 레시피를 사용하도록 강요하는 것과 같습니다. 실수는 멈출지 몰라도 창의성이나 적응력은 사라지고, 결국 음식 맛은 더 나빠집니다.

이 논문은 트레이드오프가 있다고 제안합니다. 인간의 의견과 일치하는 좋은 등급을 얻으려면 AI 는 약간의 "무작위성 (변동성)"이 필요합니다. 하지만 그 동일한 무작위성이 AI 를 자기 자신과 불일치하게 만듭니다.

인간 비교: 인간이 더 나을까요?

연구자들은 이것이 AI 만의 문제인지 확인하기 위해 인간 심판들도 살펴보았습니다.

  • 전문가: 전문가들이 같은 텍스트를 채점할 때 서로 상당히 잘 일치했지만 완벽하지는 않았습니다.
  • 크라우드 워커: 일반인 (크라우드 워커) 들이 텍스트를 채점할 때, 서로나 전문가들과 자주 불일치했습니다.
  • 놀라운 사실: 어떤 경우에는 AI 심판들이 서로 간에 인간들보다 더 일관적이었습니다. 하지만 AI 의 점수가 너무 변동성이 커서, AI 가 실제로 "옳은" 것인지 아니면 단순히 "운이 좋은" 것인지 구분하기 어렵습니다.

왜 이것이 중요한가? ("고장 난 자" 비유)

나무의 높이를 재려고 한다고 상상해 보세요.

  • 옛 방식: 약간 구부러진 자를 사용합니다. 완벽하지는 않지만 일정합니다.
  • 새 방식 (LLM 심판): 고무로 만든 자를 사용합니다. 때로는 늘어나고 때로는 줄어듭니다. 같은 나무를 세 번 재더라도 세 가지 다른 숫자가 나옵니다.

고무 자를 사용하면 측정을 신뢰할 수 없습니다. 이 논문은 현재 LLM 을 심판으로 사용하는 것이 고무 자를 사용하는 것과 같다고 주장합니다.

  • 한 번 테스트를 실행하면 점수가 나옵니다.
  • 다시 실행하면 다른 점수가 나옵니다.
  • 세 번째로 실행하면 세 번째 점수가 나옵니다.

점수가 매번 변하기 때문에, AI 가 실제로 품질을 잘 판단하는 것인지, 아니면 단순히 추측하는 것인지 알 수 없습니다.

다양한 작업에서 무엇을 발견했나요?

연구자들은 AI 가 수행해야 하는 세 가지 다른 "게임"을 테스트했습니다.

  1. 참 또는 거짓 (SummaC): 요약이 사실적으로 정확한가요? (이진 선택)
    • 결과: AI 심판들은 불일치했으나, 더 크고 새로운 모델들이 약간 더 나았습니다.
  2. 1 에서 5 점까지의 리뷰 (SummEval): "일관성", "유창성" 등에 대해 요약을 평가합니다.
    • 결과: AI 는 매우 불일치했습니다. 특히 "유창성"(텍스트가 얼마나 매끄러운지) 에서 그랬습니다. 흥미롭게도 AI 는 때때로 인간들이 서로 합의하는 것보다 유창성을 평가하는 데 더 나았습니다.
  3. 배틀 로얄 (MT-Bench): 두 챗봇 중 어떤 것이 더 나은 답을 주었나요?
    • 결과: 이것이 가장 어려운 작업이었습니다. AI 심판들은 여기서 극도로 변동성이 컸으며, 어떤 챗봇이 더 나은지 자주 마음을 바꿨습니다.

결론: 룰렛 휠을 어떻게 고칠 것인가

이 논문은 AI 심판을 사용하려는 사람들을 위한 몇 가지 실용적인 팁을 제공합니다.

  1. 단일 실행을 신뢰하지 마세요: AI 에게 무언가를 채점하게 하려면 첫 번째 답만 받아들이지 마세요. 세 번 채점하게 하고 평균이나 다수결을 취하세요. 이렇게 하면 "룰렛" 효과를 완화하고 인간이 말할 점수에 더 가까운 점수를 얻을 수 있습니다.
  2. 무작위성을 끄지 마세요: 무작위성이 불일치를 유발하지만, 완전히 끄면 AI 가 인간의 의견과 일치하는 능력이 떨어집니다. 올바른 답을 얻으려면 약간의 혼란이 필요합니다.
  3. 자기 일관성을 확인하세요: AI 심판을 신뢰하기 전에, 그것이 자기 자신과 합의하는지 확인해야 합니다. 자기 자신과 합의하지 못한다면, 당신과도 합의하지 못할 가능성이 높습니다.

요약

이 논문은 AI 심판들이 현재 신뢰할 수 없다는 것을 밝힙니다. 매번 같은 질문을 받을 때마다 다른 답을 주기 때문입니다. 그들은 안정적인 저울이 아니라 룰렛 휠과 같습니다. 더 새로운 AI 모델들이 약간 더 일관성이 있지만, 여전히 신뢰할 수 있는 데 어려움을 겪고 있습니다. 현재 가장 좋은 해결책은 AI 에게 게임을 여러 번 플레이하게 하고 단일 "스핀"을 신뢰하는 대신 결과를 평균내는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →