← 최신 논문
💬 NLP

LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation

이 논문은 기존 평가 방법의 한계를 극복하기 위해 게임 이론 기반의 상호 평가 프레임워크를 제안하고, LLM 간의 자기 평가 결과가 인간 선호도와 얼마나 일치하는지를 실증적으로 검증합니다.

원저자: Gao Yang, Yuhang Liu, Siyu Miao, Xinyue Liang, Zhengyang Liu, Heyan Huang

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gao Yang, Yuhang Liu, Siyu Miao, Xinyue Liang, Zhengyang Liu, Heyan Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"거대 언어 모델 (LLM) 들이 서로를 평가할 때, 과연 우리가 인간이 원하는 대로 공정한 순위를 매길 수 있을까?"**라는 흥미로운 질문에서 시작합니다.

기존의 AI 평가 방식은 마치 **"정답이 있는 수학 시험"**처럼, 정해진 답안지와 비교해서 점수를 매기는 방식이었습니다. 하지만 요즘의 AI 는 창의적인 글쓰기나 복잡한 대화처럼 정답이 하나로 정해지지 않는 일을 잘합니다. 이런 경우 정답지 비교는 무용지물이죠.

이 논문은 이를 해결하기 위해 **"게임 이론 (Game Theory)"**이라는 수학적 도구를 도입했습니다. 이를 쉽게 이해할 수 있도록 **<판사들이 서로를 심판하는 법정>**과 **<친구들이 모여서 최고의 영화를 뽑는 모임>**이라는 두 가지 비유로 설명해 드리겠습니다.


1. 문제: "나 자신을 칭찬하는 AI" (자기 편향성)

상상해 보세요. 6 명의 AI 가 한 문제를 풀고, 그중 한 명인 'AI A'가 심판이 되어 다른 AI 들의 답을 평가한다고 칩시다.
그런데 'AI A'는 자신이 푼 답을 다른 사람보다 훨씬 더 잘했다고 평가합니다. 마치 자신이 쓴 에세이를 스스로 "세계 최고"라고 칭찬하는 것과 비슷하죠.

기존 연구들은 AI 가 심판이 될 때 이런 '자기 과시 (Narcissism)' 때문에 공정한 순위가 나오지 않는다고 지적했습니다. 마치 친구들이 모여서 "누가 가장 예쁘니?"를 투표할 때, 각자가 자기 사진을 1 등으로 찍어주는 상황과 같죠.

2. 해결책: "게임 이론을 활용한 민주적 투표"

이 논문은 이 문제를 해결하기 위해 모든 AI 가 서로를 평가하는 '분산형 피어 리뷰 (Peer Review)' 방식을 제안합니다. 그리고 여기서 핵심은 단순한 점수 합산이 아니라, '게임 이론'에 기반한 투표 알고리즘을 쓴다는 점입니다.

  • 상황: 6 명의 AI 가 서로의 답안을 보고 1 위부터 6 위까지 순위를 매깁니다. (자신의 답도 포함해서요.)
  • 문제: AI A 는 자기 자신을 1 등, AI B 는 자기 자신을 1 등으로 매깁니다. 서로의 의견이 충돌합니다.
  • 해결: 이 논문은 **케네미 - 영 (Kemeny-Young)**이라는 특별한 알고리즘을 사용합니다. 이는 마치 **"여러 사람의 서로 다른 의견을 종합해서, 가장 많은 사람이 동의할 수 있는 '최선의 합의'를 찾아내는 지혜로운 의장"**과 같습니다.

이 알고리즘은 "누가 자기 자신을 1 등이라고 했든 상관없이, 전체적인 의견의 흐름을 분석해서 가장 공정한 순위를 찾아냅니다." 마치 100 명이 투표할 때, 소수의 극단적인 목소리에 흔들리지 않고 전체의 합의를 이끌어내는 것과 같습니다.

3. 실험 결과: "인간과 AI 의 눈이 맞아떨어지다"

연구진은 이 방식을 다양한 문제 (수학, 코딩, 창의적 글쓰기 등) 에 적용해 보았습니다. 결과는 놀라웠습니다.

  • 수학과 코딩 (정답이 명확한 영역): AI 들이 서로 평가하고 알고리즘으로 합치면, 인간의 평가와 거의 90% 이상 일치했습니다. 마치 AI 들이 인간 판사들의 마음을 읽은 것처럼 정확했습니다.
  • 창의적 글쓰기 (정답이 모호한 영역): 여기서는 의견이 갈릴 수밖에 없었지만, 그래도 **전체적인 추세 (데이터셋 수준)**에서는 인간이 선호하는 방향과 잘 맞았습니다.
  • 자기 편향성 제거: 중요한 점은, AI 가 자기 자신을 평가하는 데이터가 포함되어 있어도, 이 알고리즘은 그 편향을 거의 무시하고 공정한 순위를 매겼다는 것입니다. 마치 "나를 1 등이라고 한 친구의 목소리는 무시하고, 나머지 친구들의 합리적인 의견을 바탕으로 최종 순위를 정한" 것과 같습니다.

4. 핵심 메시지: "혼자서 평가하지 말고, 함께 합의하자"

이 논문의 결론은 매우 간단합니다.

"하나의 AI 가 다른 AI 를 평가하는 방식은 편향될 수 있습니다. 하지만 모든 AI 가 서로를 평가하고, 게임 이론의 수학적 원리로 그 의견을 합치면, 인간이 원하는 공정한 평가를 얻을 수 있습니다."

이는 마치 한 명의 천재가 모든 것을 판단하는 것보다, 여러 평범한 사람들이 모여 토론하고 투표하는 것이 더 현명한 결정을 내릴 수 있다는 '지혜의 군중 (Wisdom of Crowds)' 이론이 AI 평가에도 적용된다는 것을 보여줍니다.

요약

  1. 문제: AI 가 심판이 되면 자기 자신을 너무 잘 평가합니다 (자기 편향).
  2. 해결: 모든 AI 가 서로를 평가하게 하고, 수학적 투표 알고리즘으로 의견을 합칩니다.
  3. 결과: 이 방식은 인간의 평가와 매우 잘 일치하며, 특히 수학이나 논리 문제에서는 거의 완벽하게 맞습니다.
  4. 의미: 앞으로 AI 를 평가할 때, 정답지 비교나 한 명의 AI 심판보다는 여러 AI 가 서로 평가하고 합의하는 방식이 더 공정하고 신뢰할 만하다는 것을 증명했습니다.

이 연구는 AI 시대에 우리가 어떻게 더 공정하고 인간적인 방식으로 AI 의 능력을 측정할 수 있는지에 대한 새로운 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →