KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
이 논문은 카자흐어의 아랍어, 키릴어, 라틴어 스크립트를 모두 아우르는 합성 OCR 벤치마크를 구축하여, 현재 다중모달 대규모 언어 모델 (MLLM) 이 저자원 아랍계 문자 기반 스크립트 처리와 언어 식별에서 전통적인 OCR 에 비해 현저히 낮은 성능을 보임을 입증했습니다.
원저자:Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran
카자흐어는 중앙아시아에서 쓰이는 언어인데, 지역과 정치 상황에 따라 세 가지 다른 알파벳을 사용합니다.
키릴 문자: 러시아와 중앙아시아에서 주로 씀.
라틴 문자: 서구권이나 터키 등에서 쓰임.
아랍 문자: 중국, 아프가니스탄, 이란 등지에서 쓰임.
마치 한 사람이 상황에 따라 한복, 양복, 그리고 두루마기를 갈아입는 것과 같습니다. 문제는 인공지능 (AI) 이 이 세 가지 옷을 모두 잘 알아보는지가 아직 불분명하다는 점입니다. 특히 아랍 문자와 라틴 문자로 된 카자흐어는 데이터가 너무 부족해서 AI 가 공부할 책이 거의 없는 상태였습니다.
🛠️ 연구의 방법: 가짜 데이터를 만들어 시험지를 만들다
연구진 (고등학생들) 은 실제 카자흐어 문서가 없어서, 컴퓨터로 가짜 (합성) 이미지를 7,200 장이나 만들어 시험지를 만들었습니다.
비유: 실제 학생 (실제 문서) 이 없어서, 컴퓨터로 가상의 학생들을 만들어 시험지를 출제한 셈입니다.
변수: 글씨체, 배경색, 흐릿한 정도, 노이즈 등을 섞어서 실제 스캔한 문서처럼 어렵게 만들었습니다.
이렇게 만든 시험지로 최신 AI 모델 3 개 (Gemma, Qwen, Llama) 를 시험시켰습니다.
📉 결과: AI 의 '눈'이 안 보이는 곳들
시험 결과는 매우 놀라웠습니다.
키릴 문자 (가장 익숙한 옷): AI 가 가장 잘 읽었습니다. 마치 한국인이 한글을 읽는 것처럼 비교적 수월했습니다.
라틴 문자 (양복): 성능이 떨어졌습니다. 글자를 읽는 데 큰 실수가 많았습니다.
아랍 문자 (두루마기 - 가장 큰 문제):완전 실패했습니다.
AI 는 카자흐어가 아랍 문자로 쓰인 것을 보고, "아, 이건 아랍어구나!" 혹은 "페르시아어구나!" 혹은 "쿠르드어구나!"라고 완전히 잘못 추측했습니다.
비유: 한국인이 한글로 쓴 글을 보고 "이건 중국어구나!"라고 착각하는 것과 같습니다. AI 는 카자흐어 아랍 문자를 카자흐어로 인식하지 못했습니다.
⚖️ AI vs 전통적인 OCR: 누가 더 낫나?
연구진은 최신 AI(MLLM) 와 예전부터 쓰던 전통적인 OCR 프로그램 (Tesseract) 을 비교했습니다.
전통적인 OCR: 글자를 읽는 정확도가 훨씬 높았습니다.
최신 AI: 아무리 똑똑해 보여도, 데이터가 부족한 언어 (저자원 언어) 에서는 예전 프로그램보다도 글자를 더 많이 틀렸습니다.
💡 결론 및 시사점: "모두를 위한 AI"가 필요합니다
이 연구는 현재 AI 가 **데이터가 부족한 언어 (특히 카자흐어 아랍 문자)**를 처리하는 데 큰 한계가 있음을 보여줍니다.
핵심 메시지: AI 가 모든 언어와 글자를 공정하게 이해하려면, 데이터가 부족한 언어에도 관심을 가져야 합니다.
비유: AI 는 현재 '부자' 언어 (데이터가 많은 언어) 에만 집중해서 공부하고, '가난한' 언어 (데이터가 적은 언어) 는 무시하고 있는 상태입니다. 이 연구는 그 불평등을 지적하고, 더 포용적인 AI 를 만들기 위해 데이터를 모으고 벤치마크를 공개했다는 점이 의의입니다.
한 줄 요약:
"최신 AI 는 익숙한 글자는 잘 읽지만, 데이터가 부족한 카자흐어 아랍 문자는 전혀 못 읽어서 엉뚱한 언어로 착각합니다. AI 가 모든 언어를 공정하게 이해하려면 더 많은 노력이 필요합니다."
1. 문제 제기 (Problem)
카자흐어의 다중 문자 체계: 카자흐어는 튀르크어족 언어로, 지리적·정치적 맥락에 따라 키릴 문자 (중앙아시아), 라틴 문자 (유럽/미국/터키), 아랍 문자 (중국/아프간/이란 등) 세 가지 다른 문자 체계를 사용합니다.
OCR 및 저자원 (Low-Resource) 환경의 부재: 현재 카자흐어 OCR 연구는 주로 키릴 문자에 집중되어 있습니다. 아랍 문자와 라틴 문자를 위한 OCR 벤치마크나 실제 이미지 데이터는 거의 존재하지 않습니다.
MLLM 의 한계: 최근 등장한 멀티모달 대규모 언어 모델 (MLLM) 은 고자원 언어에서는 우수한 성능을 보이지만, 저자원 언어, 특히 아랍계 문자 (Abjad-based scripts) 인 카자흐어 아랍 문자 처리 능력은 검증되지 않았습니다.
연구 목적: 저자원 카자흐어 문자 (특히 아랍 및 라틴 문자) 를 위한 합성 OCR 벤치마크를 구축하고, 최신 MLLM 들의 OCR 성능 및 언어 식별 능력을 평가하여 기존 기술의 격차를 규명하는 것입니다.
2. 방법론 (Methodology)
2.1 데이터 수집 및 전처리 (Kazakh Text Corpora)
원본 텍스트 확보:
아랍 문자: MC² 코퍼스 (Zhang et al., 2024a) 에서 카자흐어 아랍 문자 원본 텍스트를 확보.
키릴 문자: 카자흐어 위키백과에서 원본 데이터 확보.
라틴 문자: 위키백과 키릴 문자 데이터를 kaznlp 로 정제 후 QazNLTK 패키지를 통해 라틴 문자로 음역 (Transliteration) 변환.
균형 잡기 (Balancing): 아랍 문자 텍스트의 평균 길이 (3,746 자) 가 키릴 (689 자) 및 라틴 (718 자) 보다 훨씬 길어, 각 문자별 텍스트 길이를 유사하게 만들기 위해 무작위 균형 하샘플링 (Random Balanced Subsampling) 을 수행했습니다.
최종 데이터: 아랍 2,417 개, 키릴 2,402 개, 라틴 2,400 개.
2.2 합성 벤치마크 구축 (Benchmark Construction)
실제 문서 스캔 환경을 모방하기 위해 Pillow 라이브러리를 활용하여 다양한 변형을 적용한 7,219 개의 합성 이미지를 생성했습니다.
폰트 (Fonts): Google Fonts 에서 카자흐어 세 문자 체계와 호환되는 폰트 (아랍 135 개, 키릴 431 개, 라틴 1,376 개) 를 필터링하여 무작위 선택. 폰트 크기는 24~56 사이로 변형.
노이즈 (Noise): 노이즈 레벨 (418), 블러 효과 (00.8), 회전 각도 (-3~3 도) 를 무작위로 적용하여 실제 스캔의 불완전성을 시뮬레이션.
색상 (Color): 밝은 배경과 어두운 텍스트로 구성된 2 개의 팔레트 사용. 모든 이미지에서 최소 대비율 (Contrast Ratio) 4.5 를 유지.
2.3 평가 모델 및 베이스라인
평가 대상 MLLM (Multimodal Large Language Models):
Gemma-3-12B-it
Qwen2.5-VL-7B-Instruct
Llama-3.2-11B-Vision-Instruct
각 문자별 200 장 (총 600 장) 의 이미지 서브셋으로 평가.
전통적 OCR 베이스라인:Tesseract 엔진 (사전 학습된 아랍, 라틴, 키릴 모델 사용). 파인튜닝 없이 동일 데이터셋으로 평가.
평가 지표: 문자 오류율 (CER), 단어 오류율 (WER), 언어 식별 정확도 (% Kazakh).
3. 주요 결과 (Key Results)
3.1 문자별 성능 차이
키릴 문자: 모든 모델에서 가장 우수한 성능을 보임.
Qwen2.5-VL: CER 5.3%, WER 13.4% (가장 우수).
Llama: CER 18.2%, Gemma: CER 25.7%.
라틴 문자: 성능이 급격히 저하됨.
Qwen2.5-VL: CER 26.4% (라틴 식별 정확도 99.4%).
Llama 및 Gemma: CER 21.6%31.0% (식별 정확도 13.5%31.1%).
아랍 문자:가장 심각한 실패.
모든 MLLM 이 카자흐어 아랍 문자를 카자흐어로 인식하지 못함.
CER: 35.5% (Qwen) ~ 72.5% (Gemma).
언어 식별: 0.0% ~ 1.1% 만 카자흐어로 정확 식별. 대부분 아랍어, 페르시아어, 쿠르드어로 오분류됨.
3.2 MLLM vs 전통적 OCR (Tesseract)
전통적 OCR 우세: Tesseract 는 모든 문자 체계에서 MLLM 보다 낮은 CER 을 기록했습니다.
특히 아랍 문자에서 격차가 극심함: Tesseract CER 15.0% vs MLLM CER 35.5%~72.5%.
Qwen 의 예외: Qwen2.5-VL 은 키릴 문자에서 Tesseract(CER 4.3%) 와 유사한 수준의 성능을 보였으나, 아랍/라틴 문자에서는 여전히 전통적 OCR 보다 성능이 낮았습니다.
4. 주요 기여 (Key Contributions)
KazakhOCR 벤치마크 공개: 저자원 카자흐어 (아랍, 라틴, 키릴) 를 위한 첫 번째 합성 OCR 벤치마크 (7,219 개 이미지) 를 구축하고 공개했습니다.
MLLM 성능 격차 규명: 최신 멀티모달 모델이 저자원 아랍계 문자 처리에 있어 심각한 한계 (OCR 실패 및 언어 식별 실패) 를 보임을 실증했습니다.
할루시네이션 위험성 지적: MLLM 이 저자원 텍스트를 처리할 때, 예측 가능한 언어 (아랍어, 페르시아어 등) 의 어휘나 문자를 할루시네이션하여 오류를 유발할 수 있음을 이론화했습니다.
포용적 NLP 필요성 강조: 카자흐어 아랍 및 라틴 문자를 지원하는 포용적인 모델과 데이터의 필요성을 강조했습니다.
5. 의의 및 결론 (Significance & Conclusion)
실제 영향: 중국, 아프가니스탄, 파키스탄, 이란 등 카자흐어 아랍 문자를 사용하는 지역 사용자들에게 현재 MLLM 기반 OCR 기술이 제대로 작동하지 않음을 보여줍니다.
기술적 시사점: MLLM 이 고자원 언어에서는 강력하지만, 저자원 문자 체계 (특히 아랍계 문자) 에서는 전통적인 OCR 엔진보다 성능이 떨어질 수 있음을 경고합니다.
향후 방향:
MLLM 의 프롬프트 엔지니어링 최적화.
음역된 데이터가 아닌 실제 문화적 맥락을 반영한 카자흐어 라틴/아랍 텍스트 수집.
저자원 언어를 위한 포용적인 학습 프로세스 및 모델 개발의 필요성.
이 연구는 저자원 언어 처리 분야에서 MLLM 의 현재 한계를 명확히 드러내며, 더 공정하고 포용적인 멀티모달 AI 모델 개발을 위한 중요한 발걸음이 되었습니다.