Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
이 논문은 GPT-4o, Claude 3.5 Sonnet 등 7 가지 최신 대규모 언어 모델을 광둥어, 일본어, 터키어라는 저자원 및 형태론적으로 풍부한 언어를 대상으로 한 새로운 크로스링구얼 벤치마크를 통해 평가하고, 모델별 성능 차이와 문화적·형태론적 이해의 한계를 분석합니다.
지금까지 AI(거대 언어 모델) 는 영어라는 **'메인 코스'**에서는 요리 실력이 천재 수준입니다. 하지만 이 논문은 "그럼 토끼 꼬리 같은 언어 (터키어), 한자·가나 혼용 언어 (일본어), 그리고 자료가 귀한 방언 (광둥어) 같은 '서브 메뉴'에서도 똑같이 잘할까?"를 궁금해했습니다.
저자들은 7 개의 최신 AI(구글의 GPT-4o, 클로드 3.5, 오픈소스 LLaMA 등) 를 데리고 터키, 일본, 광둥어 세 나라로 여행을 보냈습니다.
🎒 2. 여행 일정 (평가 과제 4 가지)
AI 들에게 네 가지 미션을 주었습니다.
상식 퀴즈 (Open QA): "터키의 첫 여성 조종사는 누구야?" 같은 사실을 묻습니다.
뉴스 요약 (Summarization): 긴 기사를 읽고 핵심만 짧게 요약해 봅니다.
번역기 테스트 (Translation): 영어 문장을 각 나라 말로 바꿔 봅니다.
현지 문화 대화 (Culturally Grounded Dialogue): 가장 중요한 미션입니다.
예시: "할머니께 실례가 안 되는 말로 사과하는 법을 알려줘" (일본어 존댓말)
예시: "광둥어 농담을 알아듣고 웃어줘" (문화적 유머)
AI 가 단순히 말만 잘하는 게 아니라, 현지 예절과 문화를 제대로 이해하는지 확인합니다.
🏆 3. 결과 발표: 누가 1 등일까?
🥇 1 등: GPT-4o (최고급 AI)
비유: "세계 여행 전문가"
모든 언어에서 가장 잘했습니다. 특히 광둥어처럼 자료가 부족한 언어에서도 원어민처럼 자연스럽게 대화하고, 일본어 존댓말이나 터키어의 복잡한 문법도 잘 다뤘습니다.
🥈 2 등: GPT-4, Claude 3.5
비유: "유능한 가이드"
1 등과 거의 비슷하게 잘했지만, 아주 미세한 문화적 뉘앙스나 광둥어 구어체에서는 1 등보다 약간 뒤처졌습니다.
🥉 3 등: LLaMA 3.1 (70B), Mistral Large 2
비유: "열심히 공부한 대학생"
터키어나 일본어에서는 상위권 AI 들과 비슷하게 잘했지만, 광둥어처럼 데이터가 적은 언어에서는 실수가 꽤 많았습니다.
📉 하위권: LLaMA-2 (13B), Mistral 7B
비유: "여행 준비를 제대로 안 한 초보자"
언어가 복잡하거나 자료가 부족하면 엉뚱한 말을 하거나, 아예 대답을 못 하는 경우가 많았습니다. "영어는 잘하지만, 다른 언어는 아직 초보" 수준입니다.
💡 4. 주요 발견 (재미있는 점들)
문법 괴물 (터키어) vs 문화의 미묘함 (일본어/광둥어):
터키어는 단어가 꼬리에 꼬리를 물고 길어지는 '접미사' 언어인데, 작은 AI 들은 이걸 꼬아서 엉뚱한 단어를 만들었습니다.
일본어와 광둥어는 '예절'과 '방언'이 중요합니다. 상위 AI 들도 가끔 "할머니에게 반말을 하거나", "광둥어 특유의 표현을 중국어 표준어로 바꿔서" 말해 실수를 했습니다.
데이터의 불공정:
AI 는 영어로 배운 게 너무 많아서, 영어를 먼저 생각하고 그걸 다른 언어로 번역하는 식으로 대답하는 경우가 많았습니다. 특히 광둥어는 학습 자료가 너무 부족해서 AI 들이 고생했습니다.
점수표의 함정:
기계가 점수를 매기는 것 (BLEU, ROUGE 점수) 만으로는 부족했습니다. "문법적으로 완벽하지만, 할아버지에게 너무 딱딱하게 말해서 실례가 되는 경우"를 기계는 모르고, 현지 원어민 평가자만이 "이건 예의 없는 말이야!"라고 지적할 수 있었습니다.
🚀 5. 결론: 앞으로의 과제
이 논문은 **"최고급 AI 가 영어 밖에서도 훌륭하지만, 아직 완벽하지는 않다"**는 것을 보여줍니다.
큰 AI 가 더 낫다: 모델이 클수록 문화와 문법을 잘 이해합니다.
데이터가 생명이다: 광둥어처럼 자료가 적은 언어는 AI 가 여전히 어려워합니다.
사람의 손이 필요하다: 기계 점수만 믿으면 안 되고, 현지 사람이 직접 "이건 문화적으로 맞는지" 확인해야 합니다.
한 줄 요약:
"최고급 AI 들도 세계 여행을 가면 영어권에서는 천재지만, 다른 문화권에서는 가끔 '현지 예절'을 잊어버리고 실수를 합니다. 앞으로는 더 많은 언어와 문화를 배워서, 전 세계 모든 사람이 편하게 쓸 수 있는 AI 가 되어야 합니다."
1. 문제 제기 (Problem)
대형 언어 모델 (LLM) 은 영어와 같은 고자원 (high-resource) 언어에서 탁월한 성능을 보이지만, 저자원 (low-resource) 언어와 형태소 풍부 (morphologically rich) 언어에서의 성능은 아직 충분히 연구되지 않았습니다.
불균형한 발전: 기존 벤치마크 (XTREME, TyDi QA 등) 는 주로 고자원 언어에 치중되어 있어, 전 세계 언어의 포용성과 공정성 문제가 대두됩니다.
구체적 도전 과제:
터키어 (Turkish): 높은 접착성 (agglutinative) 과 풍부한 형태소로 인해 단어 형태가 매우 길고 복잡하며, 모델의 구성적 일반화 능력을 시험합니다.
일본어 (Japanese): 복잡한 문자 체계 (한자, 히라가나, 가타가나) 와 문맥 의존적 문법, 존칭 (honorifics) 등 세밀한 문화적 이해가 필요합니다.
광둥어 (Cantonese): 저자원 언어 (특히 구어체와 문자화 자료 부족) 로서, 표준 중국어와 다른 독특한 구어 문법과 어휘를 가지며, LLM 학습 코퍼스에서 데이터가 극히 부족합니다.
연구 질문: 최신 LLM 들이 영어 외의 언어에서 형태학적 복잡성과 문화적 맥락을 얼마나 잘 처리하는가? 소규모 오픈 소스 모델은 proprietary 모델에 비해 얼마나 뒤처지는가?
2. 방법론 (Methodology)
이 논문은 광둥어, 일본어, 터키어 3 개 언어를 대상으로 한 새로운 크로스-링구얼 벤치마크를 제안하고, 7 가지 최첨단 LLM 을 평가했습니다.
A. 평가 모델 (Evaluated Models)
모델 규모와 소스 유형을 다양하게 포함하여 비교 분석했습니다:
Proprietary (상용): GPT-4o, GPT-4, Claude 3.5 Sonnet