GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek
이 논문은 영어에서 기계 번역된 기존 데이터셋의 한계를 극복하기 위해 그리스어 학술 및 전문 시험에서 직접 발췌하거나 작성한 21,805 개의 다중 선택 질문으로 구성된 'GreekMMLU'라는 새로운 벤치마크를 소개하고, 이를 통해 다양한 언어 모델의 그리스어 수행 능력을 평가하고 개선 방향을 제시합니다.
지금까지 AI 의 지능을 측정할 때 주로 **미국식 시험지 (MMLU)**를 사용했습니다. 그런데 이 시험지를 그리스어로 쓰려면, 영어 문제를 기계 번역기로 돌려서 사용해야 했습니다.
비유: 마치 한국어 시험을 보는데, 영어 문제를 번역기로 돌려서 풀게 하는 상황과 같습니다.
번역기에서 나온 문장은 어색하고 (번역투), 한국의 문화나 역사적 맥락이 사라집니다.
예를 들어, "그리스 신화 속 무희"에 대한 문제를 영어로 번역했다가 다시 그리스어로 돌리면, 원래의 뉘앙스나 문화적 깊이가 사라져서 AI 가 진짜로 그리스어를 잘하는지, 아니면 그냥 번역된 영어를 외운 것인지 알 수 없습니다.
이 연구팀은 **"그리스어는 그리스인만 아는 문화와 언어의 맛 (Nuance) 이 있다"**고 말합니다. 그래서 원래 그리스어로만 만들어진 진짜 시험지가 필요하다고 판단했습니다.
2. GreekMMLU 란 무엇인가요? (새로운 시험지)
연구팀은 그리스의 실제 학교 시험, 자격증 시험, 공무원 시험 문제 2 만 1,805 개를 모아서 새로운 시험지를 만들었습니다.
구성: 45 가지 과목 (수학, 역사, 법, 의학, 그리스 신화 등) 으로 나뉘어 있습니다.
난이도: 초등학교 문제부터 전문 자격증 문제까지 다양합니다.
특징: 모든 문제가 원어민이 만든 그리스어로 되어 있어, 번역의 오류나 문화적 왜곡이 없습니다.
비유: 외국인이 한국어를 배울 때, 번역된 교재가 아니라 한국 드라마와 실제 한국인의 일상 대화를 통해 배우는 것과 같습니다.
3. 어떤 실험을 했나요? (AI 들의 시험)
연구팀은 80 개 이상의 다양한 AI 모델 (오픈소스 모델부터 구글, 오픈AI 의 최신 모델까지) 을 이 시험지에 투입했습니다.
결과 1: 거대하고 비싼 AI 가 압승
최신의 거대 AI (GPT-4o, Gemini 등) 는 90% 이상의 높은 점수를 받았습니다.
반면, 일반인도 쓸 수 있는 오픈소스 모델들은 70~80% 선에 머물렀습니다.
비유: **명문대 교수 (최신 AI)**와 **일반 대학생 (오픈소스 모델)**이 같은 시험을 봤을 때, 교수님이 훨씬 더 잘 푼 것과 같습니다.
결과 2: '그리스어 특화' 모델이 더 잘함
단순히 여러 언어를 섞어서 학습한 모델보다, 그리스어에 특화되어 추가 학습을 받은 모델이 훨씬 좋은 성적을 냈습니다.
특히 그리스 신화, 역사, 전통 같은 '그리스 고유의 문화'가 필요한 문제에서는 일반 모델이 많이 틀렸지만, 그리스어 특화 모델은 잘 풀었습니다.
비유:한국어만 공부한 한국인이 한국 사투리나 속담 문제를 풀면 잘하지만, 여러 나라 말을 조금씩 아는 외국인은 같은 문제를 풀 때 헤매는 것과 비슷합니다.
결과 3: 문제의 난이도에 따른 차이
초등학교 수준의 문제는 대부분의 AI 가 잘 풀었지만, 대학생이나 전문가 수준의 문제 (의학, 공학 등) 는 AI 들도 많이 틀렸습니다.
비유: 아이들 장난감 (초등 문제) 은 로봇도 잘 다루지만, **정교한 수술 도구 (전문 문제)**를 다루려면 아직 인간 (고급 AI) 의 손이 필요합니다.
4. 이 연구의 핵심 교훈 (결론)
번역만으로는 부족합니다: AI 가 특정 언어를 잘하려면, 그 언어로 원래 만들어진 데이터로 학습해야 합니다. 번역된 데이터는 AI 의 실력을 과장하거나 왜곡할 수 있습니다.
문화적 맥락이 중요합니다: 언어는 단순한 단어의 나열이 아니라, 그 나라의 역사와 문화가 담겨 있습니다. AI 가 진짜로 그 언어를 이해하려면 이 '문화적 맛'을 배워야 합니다.
공정한 평가가 필요합니다: 이 새로운 시험지 (GreekMMLU) 를 통해 앞으로 개발될 AI 들이 그리스어 실력을 얼마나 진정으로 갖췄는지, 공정하게 평가할 수 있게 되었습니다.
요약하자면
이 논문은 **"그리스어 AI 를 평가하려면, 번역된 영어 시험지가 아니라 그리스어 원본 시험지가 필요하다"**고 주장하며, 실제로 그런 시험지를 만들고 다양한 AI 를 시험시켜 "그리스어에 특화된 학습이 얼마나 중요한지" 증명해 보인 연구입니다.
마치 **"한국어 AI 를 평가할 때, 영어로 번역된 한국 문학 문제를 주지 말고, 원작인 한국 소설과 시를 주어야 진짜 실력을 알 수 있다"**는 말과 같습니다.
1. 문제 정의 (Problem)
대형 언어 모델 (LLM) 은 그리스어를 포함한 다국어 코퍼스로 훈련되지만, 그리스어에 대한 신뢰할 수 있는 평가 벤치마크는 극히 부족합니다.
기존 데이터의 한계: 현재 존재하는 그리스어 평가 데이터셋은 대부분 영어에서 기계 번역된 것입니다. 이는 그리스어의 풍부한 형태론 (morphology), 유연한 어순, 복잡한 부정 구조 등을 제대로 반영하지 못하며, 문화적 맥락과 교육 과정을 왜곡합니다.
문화적/언어적 격차: 그리스어는 역사, 법률, 시민 교육, 전문 자격증 시험 등 국가별 커리큘럼과 문화적 맥락에 밀접하게 연결된 지식이 중요합니다. 번역된 벤치마크는 이러한 '현지화된 지식 (localized knowledge)'의 격차를 숨기거나 모델의 실제 능력을 과대평가합니다.
평가의 부재: 그리스어에 특화된 대규모 멀티태스크 언어 이해 (Massive Multitask Language Understanding) 를 평가할 수 있는 원천 (Native) 데이터가 없어, 모델의 진정한 그리스어 능력을 측정하기 어렵습니다.
2. 방법론 (Methodology)
저자들은 GreekMMLU라는 최초의 대규모, 원천 (Native) 기반 벤치마크를 제안했습니다.
데이터 수집 및 구성:
출처: 그리스어 교육 및 전문 시험 (초등학교, 중등교육, 대학교, 전문 자격증, 공무원 시험 등) 에서 직접 수집된 **21,805 개의 객관식 문제 (MCQ)**로 구성되었습니다.
주제 분류: STEM(과학기술), 인문학, 사회과학, 기타 등 4 개의 상위 카테고리와 45 개의 세부 주제로 체계화되었습니다.
그리스 특화 항목: 그리스 역사, 신화, 문학, 전통, 현대 그리스어 등 현지 문화 지식이 필수적인 8 개의 'Greek Specific' 주제를 포함하여 번역 데이터로는 평가 불가능한 영역을 커버했습니다.
난이도: 초등학교부터 전문가 수준까지 교육 단계별로 난이도가 표기되어 있습니다.
데이터 전처리 및 품질 관리:
PDF, DOCX 등 이질적인 파일 형식을 추출하기 위해 PyMuPDF 와 Tesseract OCR 을 사용했습니다.
추출된 텍스트의 오류 (특히 그리스어 특수문자 및 수식) 를 수정하기 위해 LLM(Claude 3.5) 을 보조 도구로 활용했으나, 새로운 질문 생성은 금지하고 원본 의미만 보존하도록 설계했습니다.
5 명의 그리스어 원어민 전문가 (석사/교수급) 가 데이터의 언어적 정확성과 오답을 검증하여 최종 데이터의 노이즈를 약 2% 미만으로 낮췄습니다.
데이터 분할:
공개 세트 (16,855 개): 연구 및 실험용.
비공개 세트 (4,948 개): 리더보드용. 이를 통해 데이터 오염 (Contamination) 을 방지하고 견고한 평가를 가능하게 했습니다.
3. 주요 기여 (Key Contributions)
GreekMMLU 벤치마크 출시: 21,805 개의 객관식 문제와 45 개 주제를 포함하는 최초의 대규모 원천 그리스어 벤치마크를 공개했습니다.
대규모 모델 평가: 80 개 이상의 오픈소스 및 폐쇄형 LLM 을 대상으로 한 포괄적인 평가를 수행했습니다.
성능 영향 요인 분석: 모델 크기, instruction tuning(지시 미세조정), 프롬프팅 전략, 주제 영역, 교육 수준 등이 그리스어 이해도에 미치는 영향을 심층 분석했습니다.
공식 리더보드: 데이터 오염을 방지하기 위한 공개/비공개 세트를 포함한 리더보드를 운영하여 공정한 평가를 지원합니다.
4. 실험 결과 (Results)
80 개 이상의 모델 (Qwen, Llama, Gemma, EuroLLM, Meltemi, Krikri 등) 에 대한 Zero-shot 및 5-shot 평가 결과는 다음과 같은 통찰을 제공합니다.
성능 격차:
폐쇄형 최상위 모델 (Frontier Models): Gemini 3 Flash(93.16%), GPT-5.2(87.75%), GPT-4o(86.81%) 등이 가장 높은 성능을 보였습니다.
오픈 가중치 모델: Llama-3.3-70B-Instruct(79.65%) 나 Qwen2.5-72B-Instruct(79.70%) 등 최상위 오픈 모델도 폐쇄형 모델보다 상당한 격차 (약 10%p 이상) 를 보였습니다.
그리스어 적응의 중요성:
그리스어 특화 모델: Meltemi, LLaMA-Krikri, Plutus 등 그리스어 코퍼스로 추가 훈련된 모델은 동급 크기의 범용 다국어 모델보다 그리스 특화 주제 (역사, 신화 등) 에서 훨씬 우수한 성능을 보였습니다.
Instruction Tuning: 지시 미세조정 (Instruction-tuned) 된 모델이 Base 모델보다 일관되게 높은 성능을 보였으며, 특히 그리스어 프롬프트 구조와 답변 선택 관습에 대한 정렬 (Alignment) 이 개선되었습니다.
스케일링 법칙: 모델 파라미터 수가 증가할수록 성능이 선형적으로 향상되었으며, 20 억 파라미터 미만의 소형 모델은 무작위 추측 수준에 머무르는 경우가 많았습니다.
교육 수준별 성능: 초/중등 교육 문제는 상대적으로 높은 정확도를 보인 반면, 대학 및 전문 자격증 수준의 복잡한 문제는 모든 모델에서 성능이 하락했습니다.
보정 (Calibration): 그리스어 특화 모델 (Llama-Krikri 등) 은 모델의 확신도 (Confidence) 와 정확도 간의 상관관계가 매우 높았으나 (r=0.93), 범용 모델은 보정 오류가 더 컸습니다.
5. 의의 및 결론 (Significance)
문화적 맥락의 중요성 입증: 번역된 벤치마크는 그리스어와 같은 문화적/교육적 맥락이 중요한 언어의 능력을 제대로 평가할 수 없음을 증명했습니다. 원천 데이터 기반 평가가 필수적입니다.
지역화 훈련의 가치: 범용 다국어 모델보다 지역 언어에 특화된 훈련 (Greek-adapted training) 이 현지화된 지식과 언어적 뉘앙스를 이해하는 데 결정적인 역할을 함을 확인했습니다.
미래 방향 제시: 그리스어 LLM 개발자들에게는 원천 데이터 수집과 지역화 훈련의 중요성을, 연구자들에게는 문화적으로 grounded 된 평가 벤치마크의 필요성을 강조합니다.
한계: 현재는 객관식 질문에만 국한되어 있으며, 개방형 생성, 대화형 추론, 방언 및 구어체, 멀티모달 콘텐츠는 포함되지 않았습니다.
이 논문은 그리스어 LLM 평가의 새로운 표준을 제시하며, 저자원 언어 (Low-resource language) 에 대한 모델의 능력을 정확히 측정하고 개선하기 위한 중요한 기반을 마련했습니다.