← 최신 논문
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

이 논문은 지역에 기반한 콘텐츠와 인문학 과목에 대한 대규모 언어 모델들의 이해도에서 STEM 분야와 비교되는 상당한 격차를 드러내는, 30개의 대규모 언어 모델의 성능을 평가하기 위해 현지 교육 자료에서 추출한 26,000개 이상의 우르두어 다지선다형 문항으로 구성된 종합 벤치마크인 UrduMMLU를 소개한다.

원저자: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 학생 집단의 지적 능력을 테스트하려고 한다고 상상해 보십시오. 수년 동안 당신은 그들에게 영어로 작성된 시험지만을 제공할 수 있었습니다. 당신은 그들이 영어를 읽을 줄 안다는 것은 알지만, 그들이 자신들의 문화에 대한 역사, 문학, 과학을 실제로 이해하고 있는지, 아니면 단순히 그 개념들의 영어 번역본을 암기한 것뿐인지 알 방법이 없습니다.

이 논문은 2억 3천만 명 이상의 사람들이 사용하는 **우르두어(Urdu)**를 위해 특별히 설계된 거대한 새로운 "시험"인 URDUMMLU를 소개합니다. 연구진이 무엇을 했고 무엇을 발견했는지, 몇 가지 간단한 비유를 사용하여 설명하겠습니다.

1. 문제점: "번역된 메뉴" 이슈

지금까지 연구자들이 AI 모델을 우르두어로 테스트하고 싶었을 때, 그들은 주로 영어 테스트를 가져와서 번역하는 방식을 사용했습니다.

  • 비유: 어떤 요리사가 정통 이탈리아 음식을 만드는 능력을 평가하기 위해, 프랑스어로 번역된 메뉴판을 주는 상황을 상상해 보십시오. 요리사는 단어는 맞게 적을지 모르지만, 문화적 뉘앙스나 현지 식재료, 혹은 특정 요리가 전통적으로 준비되는 방식은 놓칠 수 있습니다.
  • 실제: 기존의 우르두어 벤치마크는 이러한 번역된 메뉴와 같았습니다. 그것들은 우르두어 교육, 문학, 또는 현지 역사(파키스탄 연구나 이슬람 연구와 같은)의 독특한 풍미를 담아내지 못했습니다.

2. 해결책: 내재적인 "우르두어 시험장" 구축

저자들은 26,431개의 객관식 문제로 구성된 벤치마크인 URDUMMLU를 구축했습니다.

  • 질문은 어디에서 왔는가? 영어 질문을 번역하는 대신, 그들은 원천을 직접 찾아갔습니다. 실제 파키스탄 교과서, 과거 시험지(SSC/HSSC), 그리고 현지 우르두어 문제 은행을 활용했습니다.
  • "더블 체크" 시스템: 일부 오래된 시험지에는 정답지가 없었기 때문에, 팀은 17명의 원어민 우르두어 화자(대부분 대학 학위 소지자)를 고용하여 "감독관" 역할을 맡겼습니다.
    • 규칙: 두 명의 감독관이 모든 문제를 검토하고 정답에 동의해야 했습니다. 만약 의견이 일치하지 않거나 문제가 잘못되었다면, 그 문제는 폐기되었습니다. 이를 통해 "골드 스탠다드(표준)" 정답이 100% 신뢰할 수 있도록 보장했습니다.
  • 범위: 이 시험은 수학 및 물리학(STEM)부터 우르두 문학, 이슬람 연구, 파키스탄 연구에 이르기까지 26개 과목을 다룹니다.

3. 테스트: 30개의 AI 모델을 시험장에 투입하다

연구진은 30개의 서로 다른 AI 모델(구글의 Gemini와 같은 유명한 "폐쇄형" 모델과 오픈 소스 모델 모두 포함)을 선정하여 이 우르두어 시험을 치르게 했습니다. 그들은 두 가지 방식으로 테스트했습니다:

  1. 영어 지시문: "여기에 우르두어 질문이 있습니다. 답을 고르세요." (지시문은 영어로 제공).
  2. 우르두어 지시문: "یہاں ایک سوال ہے، جواب منتخب کریں۔" (지시문은 우르두어로 제공).

4. 결과: "STEM vs. 인문학"의 격차

결과는 마치 수학은 잘하지만 시를 읽는 데는 서툰 학생의 성적표처럼 매우 드러나는 것을 보여주었습니다.

  • 최고의 성능: Gemini-3.5-Flash 모델이 90% 이상의 점수를 기록하며 압도적인 승자가 되었습니다. 이 모델은 85%의 벽을 넘은 유일한 모델이었습니다.
  • 오픈 소스의 격차: 가장 뛰어난 오픈 소스 모델(DeepSeek-V4-Flash)은 약 **82%**를 기록했습니다. 훌륭한 성적이지만, 선두 모델보다 약 8점 뒤처졌습니다.
  • "인문학"의 붕괴: 이것이 가장 중요한 발견입니다.
    • 비유: 복잡한 물리 방정식을 풀 수는 있지만, 시를 분석하거나 종교 텍스트를 설명하라고 하면 처참하게 실패하는 학생을 상상해 보십시오.
    • 실제: 거의 모든 모델이 과학 및 수학 문제에서 훨씬 더 좋은 성적을 거두었습니다. 질문이 우르두 문학, 우르두어 언어, 이슬람 연구로 바뀌었을 때, 많은 모델의 점수가 25~40 퍼센트 포인트 하락했습니다.
    • 예시: 어떤 모델은 물리학에서는 97%를 받지만, 우르두 문학에서는 67%에 그칠 수 있습니다. 이는 모델들이 과학적 사실(보편적인 것)은 알고 있지만, 현지 과목에 필요한 깊은 문화적 및 언어적 이해는 부족하다는 것을 시사합니다.

5. 기타 놀라운 발견들

  • 지시문의 언어는 큰 영향을 미치지 않았다: AI에게 영어로 답하라고 하든 우르두어로 답하라고 하든, 점수 차이는 거의 없었습니다. 문제는 지시문의 언어가 아니라, 모델의 "두뇌" 속에 있는 우르두 문화에 대한 지식 부족이었습니다.
  • 퓨샷 러닝 (Few-Shot Learning, "컨닝 페이퍼"): 연구진은 시험 전에 AI에게 몇 개의 예시 질문을 주는 실험을 했습니다(마치 컨닝 페이퍼처럼). 이는 약간의 도움(1~3점 상승)은 되었지만, 문화적 지식의 큰 격차를 메우기에는 역부족이었습니다.
  • "우르두 특화" 모델들: 흥ered하게도, 오직 우르두어만을 위해 훈련된 모델들(Qalb 및 Alif 등)은 약 35% 정도로 매우 낮은 성능을 보였으며, 이는 일반 모델들보다도 낮은 경우가 많았습니다. 이는 단순히 우르두어 텍스트로 학습하는 것만으로는 충분하지 않으며, 모델이 단순한 채팅이나 뉴스 데이터가 아닌 교육적이고 추론적인 자료를 학습해야 함을 시사합니다.

요약

URDUMMLU는 우르두어 AI를 위한 새로운 엄격한 "운전면허 시험"과 같습니다. 이는 AI가 우르두어로 과학 질문에 답하는 데는 매우 능숙해지고 있지만, 언어의 영혼인 문학, 역사, 현지 문화를 이해하는 데는 여전히 어려움을 겪고 있음을 증명합니다. 현재의 "최고" AI인 Gemini는 강력한 운전자이지만, 오픈 소스 모델들은 특히 우르두어권의 문화적 뉘앙스와 관련하여 여전히 도로 위의 규칙을 배우는 단계에 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →