← 최신 논문
💬 NLP

Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages

이 논문은 자연어 처리(NLP) 커뮤니티 내 다국어 및 저자원 언어 환경에서 LLM-as-a-Judge의 제한적이고 종종 일관되지 않은 적용을 분석하며, 과도한 신뢰와 단일 모델 의존성과 같은 위험성을 강조하는 동시에 더욱 견고한 평가 관행을 위한 권고 사항을 제시한다.

원저자: A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 전 세계의 다양한 언어를 사용하는 수천 명의 참가자를 대상으로 하는 거대한 글쓰기 오디션을 운영하고 있다고 상상해 보세요. 영어와 스페인어부터 요루바어(Yorùbá)나 마사이어(Maasai) 같은 희귀한 저자원 언어까지, 모든 언어가 등장합니다.

과거에는 우승자를 결정하기 위해 모든 언어를 구사하는 인간 심사위원 패널이 필요했습니다. 하지만 이는 느리고 비용이 많이 들며 조직하기가 어려웠습니다.

최최근, 새로운 도구가 도착했습니다: 바로 AI 심사위원입니다. 이것은 답변을 읽고, 비교하고, 점수를 줄 수 있는 매우 똑똑한 컴퓨터 프로그램(대규모 언어 모델, LLM)입니다. 빠르고 저렴하며 많은 언어를 구사할 수 있기 때문에, 사람들은 인간 심사위원을 대체하기 위해 이 도구를 사용하기 시작했습니다.

문제점:
이 논문은 우리가 이해도가 낮은 언어에 대해 AI 심사위원이 운영되도록 내버려 두었을 때 어떤 일이 발생하는지 조사하는 탐정 보고서와 같습니다. 저자들은 저자원 언어를 위해 AI 심사위원을 사용하려 했던 최근의 연구 논문 33편을 검토했습니다. 그들은 이 아이디어가 겉보기에는 훌륭해 보이지만, 현실은 엉망이고 위험하다는 것을 발견했습니다.

다음은 비유를 사용하여 정리한 연구 결과입니다:

1. "관광객" 심사위원

AI 심사위원이 파리(영어)를 여러 번 방문하여 도시를 완벽하게 알고 있는 관광객이라고 상상해 보세요. 하지만 이제 그들은 아마존의 외딴 마을에서 열리는 요리 대회 심사를 맡게 되었습니다.

  • 논문의 주장: AI 심사위원은 영어에는 뛰어나지만, 저자원 언어에서는 아마존의 현지 음식을 한 번도 맛보지 못한 관광객과 같습니다. 그들은 음식이 그저 화려해 보인다는 이유로 맛있다고 생각하거나, 재료 자체를 완전히 오해할 수도 있습니다.
  • 현실: 논문에 따르면 많은 연구에서 연구자들은 AI 심사위원이 요루바어나 네팔어에 대해서도 영어만큼 뛰어날 것이라고 가정했습니다. 그들은 AI가 실제로 그 언어를 이해하고 있는지 확인하지 않았습니다. 종종 AI는 추측하거나 환각(hallucination)을 일으키고 있었지만, 연구자들은 이를 그대로 믿었습니다.

2. "단일 심판"의 편향성

스포츠 경기에서 심판이 단 한 명뿐이라면, 그 심판이 실수를 했을 때 경기 전체가 불공정해집니다.

  • 논문의 주장: 저자들이 살펴본 대부분의 연구는 단 하나의 AI 모델(주로 GPT-4와 같은 유명한 모델)만을 사용하여 모든 심사를 수행했습니다. 다른 AI에게 검토를 요청하지 않았습니다.
  • 현실: 이것은 특정 팀의 팬이기도 한 심판을 두는 것과 같습니다. 만약 특정 AI 모델에 편향(예를 들어, 짧고 좋은 답변보다 긴 답변을 선호하는 경향)이 있다면, 전체 평가는 왜곡됩니다. 논문은 48%의 연구가 단 하나의 심판 모델에 의존했으며, 33%는 GPT를 유일한 심판으로 사용했음을 발견했습니다.

3. "영어 전용" 안전망

프랑스어로 된 시험지를 채점하는 선생님을 상상해 보세요. 선생님이 채점을 잘하고 있는지 확인하기 위해, 프랑스어로 작성된 정답지와 대조하여 검증합니다.

  • 논문의 주장: 많은 연구자가 자신의 AI 심사위원이 신뢰할 수 있다고 주장했습니다. 하지만 저자들이 자세히 살펴본 결과, "안전망"이 빠져 있었습니다. 그들은 종로히 AI의 신뢰성을 영어 데이터로 확인한 다음, 그것이 프랑스어, 독일어 또는 스와힐리어에서도 똑같이 작동할 것이라고 가정했습니다.
  • 현실: 논문은 많은 경우에서 AI가 대상 언어의 전문가와 실제로 대조 검증되지 않았음을 발견했습니다. 그들은 영어를 기반으로 심사위원을 검증했고(영어를 잘하는 영역), 그 후 다른 언어(그곳에서는 형편없을 수 있는 영역)에 이를 맹목적으로 적용했습니다.

4. "과도하게 자신만만한" 군중

연구 커뮤니티에는 AI를 너무 신뢰하는 경향이 있습니다.

  • 논문의 주장: AI는 빠르고 저렴하기 때문에, 연구자들은 AI를 "과도하게 신뢰"하고 있습니다. 그들은 AI의 점수를 절대적인 진리로 취급하며, 심지어 AI가 어려운 언어로 고군분투하고 있을 때조차도 그렇습니다.
  • 현실: 논문은 데이터가 매우 적은 언어(저자원 언어)의 경우, AI가 가장 취약할 수 있다고 경고합니다. 그럼에도 불구하고, 이를 재확인할 인간 전문가가 없기 때문에 사람들은 그냥 AI의 결함 있는 점수를 받아들입니다. 이는 잘못된 평가가 사실로 받아들여지는 순환을 만듭니다.

저자들의 권고 사항 ("경기의 규칙")

이를 해결하기 위해, 논문은 AI 심사위원을 사용하는 모든 이들을 위한 네 가지 간단한 규칙을 제안합니다:

  1. 현지 언어로 심사위원을 테스트하라: AI가 영어를 할 수 있다고 해서 그 언어를 안다고 가정하지 마십시오. AI가 해당 특정 언어의 실제 화자들과 일치하는지 확인하기 전에는 그 점수를 믿지 마십시오.
  2. 인간을 과정에 포함하라 (Human in the Loop): AI를 사용하더라도, 인간이 작업물의 샘플을 확인해야 합니다. 이는 마치 수석 코치가 심판의 판정을 검토하는 것과 같습니다.
  3. 기존 도구가 더 나은지 확인하라: 때로는 단순하고 오래된 수학적 도구(예: 정확한 단어 일치 횟수 계산)가 언어를 이해하지 못하는 화려한 AI보다 더 안전할 수 있습니다. 단순한 도구가 더 잘 작동한다면 AI를 사용하지 마십시오.
  4. 단어만이 아닌 문화를 존중하라: 언어는 단순히 문법이 아니라 문화입니다. AI는 이야기의 단어는 이해할 수 있지만 문화적 의미는 놓칠 수 있습니다. 연구자들은 AI가 어휘뿐만 아니라 맥동(context)과 문화까지 이해하는지 확인해야 합니다.

결론

논문은 AI 심사위위가 강력한 도구이긴 하지만, AI가 완전히 이해하지 못하는 언어에 사용하는 것은 위험하다고 결론짓습니다. 그것은 마치 지역 예술사를 알지 못하는 관광객에게 지역 예술 축제의 심사를 맡기는 것과 같습니다. 이러한 AI 심사위위가 특정 저자원 언어에서 실제로 역량이 있는지 검증하기 전까지, 우리는 그 점수를 최종 결론으로 믿어서는 안 됩니다. 우리는 AI가 어디서나 작동할 것이라고 가정하는 것을 멈추고, 실제로 그러한지 증명하기 시작해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →