← 최신 논문
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

이 논문은 영어에서 기계 번역된 기존 데이터셋의 한계를 극복하기 위해 그리스어 학술 및 전문 시험에서 직접 발췌하거나 작성한 21,805 개의 다중 선택 질문으로 구성된 'GreekMMLU'라는 새로운 벤치마크를 소개하고, 이를 통해 다양한 언어 모델의 그리스어 수행 능력을 평가하고 개선 방향을 제시합니다.

원저자: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 왜 새로운 시험지가 필요했을까요? (기존의 문제점)

지금까지 AI 의 지능을 측정할 때 주로 **미국식 시험지 (MMLU)**를 사용했습니다. 그런데 이 시험지를 그리스어로 쓰려면, 영어 문제를 기계 번역기로 돌려서 사용해야 했습니다.

  • 비유: 마치 한국어 시험을 보는데, 영어 문제를 번역기로 돌려서 풀게 하는 상황과 같습니다.
    • 번역기에서 나온 문장은 어색하고 (번역투), 한국의 문화나 역사적 맥락이 사라집니다.
    • 예를 들어, "그리스 신화 속 무희"에 대한 문제를 영어로 번역했다가 다시 그리스어로 돌리면, 원래의 뉘앙스나 문화적 깊이가 사라져서 AI 가 진짜로 그리스어를 잘하는지, 아니면 그냥 번역된 영어를 외운 것인지 알 수 없습니다.

이 연구팀은 **"그리스어는 그리스인만 아는 문화와 언어의 맛 (Nuance) 이 있다"**고 말합니다. 그래서 원래 그리스어로만 만들어진 진짜 시험지가 필요하다고 판단했습니다.

2. GreekMMLU 란 무엇인가요? (새로운 시험지)

연구팀은 그리스의 실제 학교 시험, 자격증 시험, 공무원 시험 문제 2 만 1,805 개를 모아서 새로운 시험지를 만들었습니다.

  • 구성: 45 가지 과목 (수학, 역사, 법, 의학, 그리스 신화 등) 으로 나뉘어 있습니다.
  • 난이도: 초등학교 문제부터 전문 자격증 문제까지 다양합니다.
  • 특징: 모든 문제가 원어민이 만든 그리스어로 되어 있어, 번역의 오류나 문화적 왜곡이 없습니다.
    • 비유: 외국인이 한국어를 배울 때, 번역된 교재가 아니라 한국 드라마와 실제 한국인의 일상 대화를 통해 배우는 것과 같습니다.

3. 어떤 실험을 했나요? (AI 들의 시험)

연구팀은 80 개 이상의 다양한 AI 모델 (오픈소스 모델부터 구글, 오픈AI 의 최신 모델까지) 을 이 시험지에 투입했습니다.

  • 결과 1: 거대하고 비싼 AI 가 압승

    • 최신의 거대 AI (GPT-4o, Gemini 등) 는 90% 이상의 높은 점수를 받았습니다.
    • 반면, 일반인도 쓸 수 있는 오픈소스 모델들은 70~80% 선에 머물렀습니다.
    • 비유: **명문대 교수 (최신 AI)**와 **일반 대학생 (오픈소스 모델)**이 같은 시험을 봤을 때, 교수님이 훨씬 더 잘 푼 것과 같습니다.
  • 결과 2: '그리스어 특화' 모델이 더 잘함

    • 단순히 여러 언어를 섞어서 학습한 모델보다, 그리스어에 특화되어 추가 학습을 받은 모델이 훨씬 좋은 성적을 냈습니다.
    • 특히 그리스 신화, 역사, 전통 같은 '그리스 고유의 문화'가 필요한 문제에서는 일반 모델이 많이 틀렸지만, 그리스어 특화 모델은 잘 풀었습니다.
    • 비유: 한국어만 공부한 한국인이 한국 사투리나 속담 문제를 풀면 잘하지만, 여러 나라 말을 조금씩 아는 외국인은 같은 문제를 풀 때 헤매는 것과 비슷합니다.
  • 결과 3: 문제의 난이도에 따른 차이

    • 초등학교 수준의 문제는 대부분의 AI 가 잘 풀었지만, 대학생이나 전문가 수준의 문제 (의학, 공학 등) 는 AI 들도 많이 틀렸습니다.
    • 비유: 아이들 장난감 (초등 문제) 은 로봇도 잘 다루지만, **정교한 수술 도구 (전문 문제)**를 다루려면 아직 인간 (고급 AI) 의 손이 필요합니다.

4. 이 연구의 핵심 교훈 (결론)

  1. 번역만으로는 부족합니다: AI 가 특정 언어를 잘하려면, 그 언어로 원래 만들어진 데이터로 학습해야 합니다. 번역된 데이터는 AI 의 실력을 과장하거나 왜곡할 수 있습니다.
  2. 문화적 맥락이 중요합니다: 언어는 단순한 단어의 나열이 아니라, 그 나라의 역사와 문화가 담겨 있습니다. AI 가 진짜로 그 언어를 이해하려면 이 '문화적 맛'을 배워야 합니다.
  3. 공정한 평가가 필요합니다: 이 새로운 시험지 (GreekMMLU) 를 통해 앞으로 개발될 AI 들이 그리스어 실력을 얼마나 진정으로 갖췄는지, 공정하게 평가할 수 있게 되었습니다.

요약하자면

이 논문은 **"그리스어 AI 를 평가하려면, 번역된 영어 시험지가 아니라 그리스어 원본 시험지가 필요하다"**고 주장하며, 실제로 그런 시험지를 만들고 다양한 AI 를 시험시켜 "그리스어에 특화된 학습이 얼마나 중요한지" 증명해 보인 연구입니다.

마치 **"한국어 AI 를 평가할 때, 영어로 번역된 한국 문학 문제를 주지 말고, 원작인 한국 소설과 시를 주어야 진짜 실력을 알 수 있다"**는 말과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →