Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs
이 논문은 현대 표준 아랍어보다 일상적으로 더 많이 사용되는 지역 방언의 번역 격차를 해소하고, 13 개 아랍 국가와 11 개 주요 도메인을 아우르는 107 만 개의 대화 턴으로 구성된 대규모 커뮤니티 주도 데이터셋인 'Alexandria'를 소개하여 다국어 대규모 언어 모델의 문화적 포용성과 언어적 다양성을 강화하는 것을 목표로 합니다.
원저자:Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, AAbdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed
지금까지 AI 가 아랍어를 번역할 때 겪었던 문제는 **공식 언어 (MSA)**와 실제 입말 (방언) 사이의 간극이었습니다.
비유: imagine imagine 아랍어를 배우는 외국인이 있다고 칩시다. 그는 학교에서 **교과서 (공식 언어)**로만 배웠습니다. 하지만 막상 이집트나 모로코, 사우디아라비아의 시장에 가보면, 사람들이 교과서에 없는 생동감 넘치는 속어와 지역별 말투로 대화하고 있습니다.
결과: AI 는 교과서 말투는 잘하지만, 실제 시장에서 일어나는 "오늘 물가가 오르면 어떻게 하지?" 같은 생생한 대화나, 지역 특유의 농담, 성별에 따른 말투 차이를 전혀 이해하지 못해 엉뚱한 번역을 내놓곤 했습니다.
2. 해결책: '알렉산드리아' 프로젝트
연구팀은 이 문제를 해결하기 위해 55 명의 아랍권 연구자들과 일반인이 힘을 모아 **13 개 국가, 11 가지 생활 분야 (의료, 농업, 금융 등)**에 걸친 10 만 7 천 개의 실제 대화 데이터를 만들었습니다.
비유: 마치 전 세계의 다양한 마을에서 '실제 주민들'을 초대하여, 그들이 일상에서 나누는 진짜 대화를 녹음해 모은 거대한 도서관을 만든 것과 같습니다.
특이점:
도시 단위 정밀도: 단순히 "중동"이라고 뭉개지 않고, "이집트 카이로", "모로코 마라케시"처럼 구체적인 도시까지 구분했습니다. (비유: "한국어"라고만 하지 않고 "부산 사투리", "제주 방언"까지 세분화한 셈입니다.)
성별 배려: 대화에서 누가 말하고 누가 듣는지에 따라 (예: 여자가 남자에게, 남자가 여자에게) 말투가 어떻게 변하는지까지 기록했습니다.
3. 데이터 만들기 과정: "요리 레시피"처럼
이 데이터는 AI 가 자동으로 만든 것이 아니라, 사람들이 직접 번역하고 수정했습니다.
재료 준비 (영어 대화 생성): AI 를 이용해 다양한 상황 (농장, 병원, 시장 등) 의 영어 대화 초안을 만들었습니다.
요리 (현지인 번역): 각 지역의 원어민들이 이 영어 대화를 **자신의 지역 말투 (방언)**로 번역했습니다. 이때 전문 용어가 나오면 현지에서 쓰는 표현으로 바꾸거나, 필요한 경우 다른 언어 (프랑스어 등) 를 섞어 쓰는 등 진짜 현지인처럼 만들었습니다.
맛보기 (동료 검토): 같은 지역의 다른 원어민들이 번역된 내용을 다시 읽어보고, "이건 우리 동네 말투가 아니야", "이건 너무 격식 있어"라고 고쳐주었습니다.
4. 실험 결과: AI 는 아직 "현지인"이 되지 못함
이렇게 만든 '알렉산드리아' 데이터를 이용해 최신 AI 모델 (Gemini, Qwen 등) 을 시험해 보았습니다.
결과:
의미 전달: AI 는 대략적인 의미는 잘 전달했습니다. (비유: "밥 먹었어?"라고 물어봤을 때, AI 가 "밥 먹었어"라고 답함)
방언과 뉘앙스: 하지만 진정한 현지인 같은 말투는 여전히 부족했습니다. (비유: 의미는 맞는데, 말투가 너무 딱딱하거나, 교과서 같은 어색한 표현을 썼음)
가장 어려운 지역: 이집트나 시리아 같은 널리 알려진 방언은 잘했지만, 모로코나 모리타니아 같은 북아프리카 지역의 복잡한 방언은 AI 가 여전히 어려워했습니다.
생각하는 AI (Reasoning): AI 가 번역하기 전에 "생각하는 과정"을 거치면 오히려 더 나빠지는 경우가 많았습니다. (비유: 너무 많이 고민하면 오히려 실수를 범하는 경우)
5. 결론 및 의의
이 연구는 **"AI 가 아랍 세계의 진짜 목소리를 들으려면, 교과서가 아닌 실제 거리의 목소리를 들어야 한다"**는 것을 증명했습니다.
핵심 메시지: 앞으로 개발될 AI 는 단순히 문법만 맞는 번역을 하는 것이 아니라, 어떤 도시에서, 누구와, 어떤 상황에서 대화하는지에 맞춰 진짜 현지인처럼 자연스럽게 말해야 진정한 문화적 포용이 가능해집니다.
한 줄 요약:
"AI 가 아랍어 방언을 잘 하려면, 교과서 대신 현장 주민들이 직접 녹음한 생생한 대화를 배워야 한다"는 것을 보여주는 거대한 언어 지도 프로젝트입니다.
1. 문제 제기 (Problem)
아랍어의 이중언어 현상 (Diglossia): 아랍어는 공식적인 문어인 표준 아랍어 (MSA) 와 일상 구어인 지역 방언 (Dialects) 이 공존하는 이중언어 구조를 가집니다. 대부분의 일상 소통은 MSA 가 아닌 지역 방언으로 이루어지지만, 기존 기계 번역 (MT) 시스템은 주로 MSA 나 영어 중심의 데이터로 훈련되어 방언 입력에 대한 일반화 능력이 매우 낮습니다.
기존 데이터셋의 한계:
PADIC, MADAR 등: 주로 여행/관광 위주이거나 통제된 문체로 수집되어 자연스러운 언어 변이 (예: 성별에 따른 호칭, 사회적 거리감, 코드 스위칭) 를 반영하지 못합니다.
FLORES+: 방언 데이터가 MSA 성향이 강하거나, 도시 단위 (City-level) 가 아닌 광역 지역 단위 (Regional-level) 로만 분류되어 미세한 방언 차이를 포착하지 못합니다.
성별 및 문화적 맥락 부재: 대화 맥락과 화자/청자 간의 성별 구성 (Gender Configuration) 이 고려되지 않아, 문화적으로 민감한 번역 오류가 발생합니다.
2. 방법론 (Methodology)
Alexandria는 이러한 격차를 해소하기 위해 커뮤니티 주도 방식으로 구축된 대규모 인간 번역 데이터셋입니다.
데이터 수집 프로세스:
참여 규모: 13 개 아랍 국가 (이집트, 사우디, 모로코 등) 에서 55 명의 참여자 (연구자 및 학생) 가 참여했습니다.
3 단계 워크플로우 (그림 2 참조):
영어 소스 생성: Gemini-2.5 Pro 를 활용하여 11 개 주요 도메인 (농업, 의료, 금융 등) 과 13 개 국가의 문화적 맥락에 맞춘 다중 턴 (Multi-turn) 대화 시나리오를 생성했습니다. (약 6,050 개 대화/국가)
인간 번역: 원어민 번역가들이 각 국가의 특정 도시 방언으로 번역했습니다. 화자/청자의 성별 구성 (예: 여성→남성) 이 메타데이터로 명시되어 성별에 따른 언어 변이를 반영하도록 유도했습니다.
동료 검토 (Peer-Revision): 동일한 국가의 다른 참여자가 번역본을 검토하여 방언의 진정성, 성별 일치도, 어조 (Register), 의미 충실도 등을 평가하고 수정했습니다.
데이터 특성:
규모: 총 107,000 턴 (약 34,488 개 대화) 으로 구성됨.
세분화: 13 개 국가, 11 개 도메인, 100 개 이상의 하위 방언 (도시 단위) 을 커버합니다.
메타데이터: 화자/청자 성별, 지역, 도메인 정보가 상세히 레이블링되어 있습니다.
코드 스위칭: 기술 용어 부족 시 MSA 나 영어/프랑스어 차용어를 사용한 자연스러운 코드 스위칭 현상도 포함됩니다.
3. 주요 기여 (Key Contributions)
대규모 다도메인 방언 데이터셋: 아랍어 방언 번역을 위한 현재까지 가장 크고 세분화된 (City-level granularity) 데이터셋을 공개했습니다.
성별 및 문화적 포용성: 화자와 청자의 성별 조합을 명시적으로 레이블링하여, 성별에 따른 언어적 변이 (Gender-conditioned variation) 를 연구할 수 있는 기반을 마련했습니다.
커뮤니티 주도 접근: 13 개 국가의 현지 전문가들이 직접 참여하여 데이터의 문화적 정확성과 방언의 진정성을 보장했습니다.
엄격한 벤치마크: 기존 모델들의 성능을 평가하기 위한 공개/비공개 테스트 세트와 평가 코드를 공개하여, 아랍어 인식 LLM 의 방언 번역 능력을 객관적으로 측정할 수 있게 했습니다.
4. 실험 결과 (Results)
24 개의 아랍어 대응 LLM(Gemini, Qwen, Command A, Gemma 등) 을 Alexandria 테스트 세트로 평가한 결과는 다음과 같습니다.
방향성 비대칭 (Directional Asymmetry):
방언 → 영어 번역 성능이 영어 → 방언 번역보다 일관되게 높았습니다.
이는 모델들이 방언을 이해하는 능력은 상대적으로 좋으나, 방언을 생성 (번역) 할 때는 MSA 나 표준화된 어휘로 치환하는 경향이 있음을 시사합니다.
방언별 성능 편차:
이집트어 (Egyptian) 와 레반트 (Levantine) 방언은 상대적으로 높은 성능을 보였습니다.
마그레브 (Maghrebi, 모로코, 튀니지, 모리타니 등) 방언은 모든 모델에서 가장 낮은 성능을 보였으며, 특히 모리타니어 (Hassaniya) 는 가장 어려운 과제로 나타났습니다.
메타데이터의 영향:
프롬프트에 성별 및 맥락 정보를 포함하는 것이 일부 모델 (예: Command A) 에서는 성능 향상을 가져왔으나, 모든 모델에 보편적으로 적용되는 것은 아니었습니다.
추론 (Reasoning) 의 효과:
대부분의 모델에서 '생각하는 과정 (Thinking process)'을 거치는 것이 번역 품질을 향상시키지 못하거나 오히려 저하시켰습니다. (Gemini-3-flash 만 예외적으로 향상됨)
인간 평가 (Human Evaluation):
의미 충실도 (Semantic Adequacy): 대체로 양호함 (3/5 이상).
방언성 및 유창성 (Dialectness & Fluency): 의미는 전달되더라도 방언의 자연스러움과 문화적 적절성 (성별 호칭 등) 에서 점수가 낮게 나타났습니다 (약 2/5 수준).
코드 스위칭: 라틴 문자 (영어/프랑스어) 가 포함된 문장은 번역 품질이 저하되는 경향이 있었습니다.
5. 의의 및 결론 (Significance)
기술적 진전: Alexandria 는 아랍어 NLP 분야에서 'MSA 중심'의 편향을 깨고, 실제 일상생활에서 사용되는 방언과 문화적 맥락을 반영한 언어 기술 개발을 위한 필수 인프라를 제공합니다.
문화적 포용성: 성별, 지역, 사회적 지위 등 문화적 요소를 고려한 번역 모델 개발을 촉진하여, 아랍어 사용자들이 디지털 서비스에 더 잘 접근할 수 있도록 돕습니다.
향후 연구 방향: 현재 모델들이 방언의 미세한 뉘앙스와 코드 스위칭, 그리고 마그레브 지역 방언 처리에 여전히 어려움을 겪고 있음을 보여주며, 향후 모델 훈련 및 평가의 중요한 기준이 될 것입니다.
이 논문은 단순한 데이터셋 제공을 넘어, 아랍어 세계의 언어적 다양성을 존중하고 포용하는 AI 시스템 구축을 위한 새로운 패러다임을 제시합니다.