MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
이 논문은 17 개 언어와 다양한 촬영 조건을 포괄하는 최초의 다국어 문서 파싱 벤치마크인 MDPBench 를 제안하고, 이를 통해 오픈소스 모델이 비로마자 문자와 실제 촬영 문서에서 성능이 급격히 저하되는 반면 클로즈드 소스 모델은 상대적으로 견고함을 보이는 등 언어 및 조건 간 심각한 성능 불균형을 규명했습니다.
지금까지 AI 문서 읽기 기술은 **'완벽하게 깨끗한 디지털 파일'**이나 **'스캔된 문서'**만 다뤘습니다. 마치 AI 가 **'도서관의 책장'**에서만 책을 읽는 훈련을 받았다고 상상해 보세요.
하지만 현실 세계는 다릅니다.
사진으로 찍은 문서: 구겨진 영수증, 책상 위에 놓인 잡지, 스마트폰으로 찍은 수업 노트 등.
다양한 언어: 영어나 중국어뿐만 아니라, 아랍어, 힌디어, 태국어 등 알파벳이 아닌 다양한 문자.
기존 AI 는 이런 **'실전 상황'**에서는 많이 당황합니다. 마치 도서관에서는 책을 잘 읽지만, 밖에서 바람에 날리는 신문을 읽으려 하면 글자가 흐릿해서 못 읽는 것과 비슷합니다. 이 논문은 바로 이 **'실전 능력'**을 측정하기 위해 MDPBench 를 만들었습니다.
🧪 2. MDPBench 란 무엇인가요? (시험지 구성)
이 벤치마크는 3,400 장의 문서 이미지로 구성되어 있습니다.
17 개 언어: 영어, 중국어, 아랍어, 태국어 등 전 세계 주요 언어를 모두 포함합니다.
다양한 상황:
디지털 문서: 깔끔한 원본.
사진 문서: 실제 종이를 구겨서, 휘어서, 그림자를 드리우거나, 창문 밖이나 어두운 방에서 찍은 사진들.
화면 촬영: 컴퓨터 화면을 찍은 사진 (모아레 현상 등).
이 자료들은 전문가들이 꼼꼼히 정답을 확인하고, 사람이 직접 수정하여 정확한 정답지를 만들었습니다.
🏆 3. 시험 결과: 누가 이겼나요? (결과 분석)
연구진은 유명한 AI 모델들 (구글의 Gemini, 오픈소스 모델들 등) 을 이 시험지에 대입해 봤습니다. 결과는 다음과 같습니다.
🥇 유료 AI (Gemini-3-Pro):
비유: "유능한 전문 번역가"
가장 잘했습니다. 하지만 완벽하지는 않았습니다. 사진으로 찍은 문서나 아랍어처럼 글자가 오른쪽에서 왼쪽으로 읽히는 언어에서는 실수가 있었습니다.
🥈 무료 오픈소스 AI:
비유: "열심히 공부한 학생"
디지털 문서에서는 꽤 잘했지만, 사진으로 찍은 문서나 비영어권 언어에서는 점수가 급격히 떨어졌습니다.
특히 아랍어나 힌디어 같은 언어에서는 10% 미만의 점수를 받아, 글자를 거의 못 읽는 수준이었습니다.
⚠️ 4. AI 들이 주로 하는 실수 (문제점)
시험을 통해 발견된 AI 들의 치명적인 약점들은 다음과 같습니다.
사진의 흐릿함에 약함:
구겨진 종이나 그림자가 있는 사진을 보면, AI 는 글자를 아예 놓치거나 (Missing), 없는 내용을 만들어 내는 (할루시네이션) 실수를 합니다.
언어별 편견:
아랍어: 오른쪽에서 왼쪽으로 읽어야 하는데, AI 는 왼쪽에서 오른쪽으로 읽으려 해서 글자 순서가 뒤죽박죽이 됩니다.
태국어/힌디어: 단어 사이에 공백이 없는 언어인데, AI 가 임의로 공백을 넣어서 단어를 잘라버립니다. (예: 'biggest'를 'big ge st'로 잘못 읽는 것)
반복되는 말:
같은 문장을 계속 반복해서 출력하거나, 언어가 갑자기 바뀌는 (예: 베트남어를 중국어로 잘못 읽음) 어이없는 실수를 합니다.
💡 5. 결론 및 의미
이 논문은 **"지금까지의 AI 문서 읽기 기술은 '실전'에 너무 약하다"**는 사실을 명확히 보여줍니다.
의의: 앞으로 개발될 AI 는 깨끗한 책장뿐만 아니라, 구겨진 영수증이나 해외 여행지에서 찍은 메뉴판도 제대로 읽을 수 있어야 합니다.
목표: MDPBench 는 개발자들이 AI 의 약점을 파악하고, 전 세계 모든 언어와 상황에서 작동하는 튼튼한 AI 를 만드는 나침반 역할을 할 것입니다.
한 줄 요약:
"AI 가 도서관의 책만 읽는 게 아니라, 구겨진 종이의 해외 메뉴판까지 완벽하게 읽을 수 있도록, 전 세계 언어와 다양한 상황을 담은 '최고의 실전 시험지'를 만들었습니다."
논문 제목: MDPBench: 실세계 시나리오를 위한 다국어 문서 파싱 벤치마크
1. 문제 제기 (Problem Statement)
기존의 문서 파싱 (Document Parsing) 연구는 주로 깨끗한 디지털 문서 (Digital-born) 나 스캔된 문서에 집중되어 있으며, 소수의 우세한 언어 (주로 영어 등 라틴 문자 기반) 에만 최적화되어 있습니다. 그러나 현실 세계에서는 다음과 같은 중요한 한계가 존재합니다.
실제 촬영된 문서의 부재: 역사적 아카이브, 영수증, 책, 손글씨 노트 등 디지털 버전이 존재하지 않고 사진으로만 존재하는 문서가 많습니다.
다국어 및 저자원 언어의 간과: 다양한 스크립트 (특히 비라틴 문자) 와 저자원 언어에 대한 체계적인 평가 기준이 부족합니다.
모델 성능 편향: 기존 모델들은 표준화된 고자원 언어 입력에는 잘 작동하지만, 다국어 환경이나 실제 촬영 조건 (빛 반사, 구부러짐, 배경 노이즈 등) 에서는 성능이 급격히 저하됩니다.
이러한 문제를 해결하기 위해 실제 촬영된 다국어 문서 파싱을 평가하기 위한 최초의 벤치마크인 MDPBench를 제안합니다.
2. 방법론 (Methodology)
2.1 데이터셋 구성 (Dataset Construction)
규모 및 범위: 총 3,400 개의 문서 이미지로 구성되며, 17 개 언어 (중국어, 영어, 프랑스어, 스페인어, 러시아어, 아랍어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 네덜란드어, 포르투갈어, 태국어, 베트남어, 전통 중국어) 를 포함합니다.
데이터 유형:
디지털 문서 (Digital-born): 850 개. 학술 논문, 비즈니스 리포트, 교과서, 만화 등 다양한 유형의 공개 웹 소스에서 수집.
실제 촬영 문서 (Photographed): 디지털 문서를 종이로 인쇄하거나 화면에 표시한 후, 다양한 환경에서 촬영하여 생성.
조건: 실내/실외 조명, 물리적 변형 (구부러짐, 주름, 접힘), 카메라 각도 (좌우, 역방향, 사선), 이미지 열화 (흐림, 그림자), 배경 변화 등 다양한 실세계 노이즈를 포함.
데이터 분할: 데이터 누출 (Data Leakage) 을 방지하기 위해 **공개 세트 (2,720 개)**와 **비공개 평가 세트 (680 개)**로 분리하여 운영합니다.
2.3 주석 생성 파이프라인 (Annotation Pipeline) 고품질의 주석을 위해 3 단계의 엄격한 파이프라인을 적용했습니다 (Fig. 3 참조):
전문 모델 라벨링 (Expert Model Labeling):dots.ocr, PaddleOCR-VL, Qwen3VL 등 3 개의 최첨단 모델을 사용하여 레이아웃 감지 및 요소 인식 수행. 3 개 모델 결과 간의 유사도 (NED, TEDS) 를 계산하여 가장 일관된 결과를 초기 주석으로 선정. 신뢰도가 낮을 경우 Gemini-3-Pro 를 대안으로 사용.
수정 (Manual Correction): 레이아웃 좌표, 요소 유형, 읽기 순서 (Reading Order) 등을 인간 어노테이터가 검증 및 수정.
검증 (Human Verification): 독립적인 검증자가 주석을 확인하여 오류가 발견되면 수정자에게 피드백을 제공하고 재작업하는 '주석 - 수정 - 검증' 사이클을 반복.
2.4 평가 지표 (Evaluation Metrics)
페이지 단위 집계 (Page-level Aggregation): 언어별 문서 구조 (수식, 표의 비율 등) 의 차이로 인한 편향을 줄이기 위해 요소 단위 평균 대신 페이지 단위 점수를 평균화하여 최종 점수를 산출합니다.
지표:
텍스트 및 읽기 순서: 정규화된 편집 거리 (NED).
수식 인식: CDM (Content-based Distance Metric).
표 인식: 트리 편집 거리 기반 유사도 (TEDS).
3. 주요 기여 (Key Contributions)
최초의 다국어 촬영 문서 파싱 벤치마크: 17 개 언어와 다양한 실세계 촬영 조건을 포괄하는 3,400 개의 고품질 데이터셋을 공개했습니다.
엄격한 주석 품질 관리: 자동 모델 라벨링, 다중 모델 컨센서스, 수동 수정, 인간 검증을 통한 고품질 Ground Truth 를 확보했습니다.
포괄적인 모델 평가: 오픈소스 모델, 상용 (Proprietary) 모델, 파이프라인 기반 시스템을 대상으로 한 광범위한 평가 결과를 제시했습니다.
4. 실험 결과 및 발견 (Results & Findings)
4.1 전체 성능 비교
상용 모델의 우위:Gemini-3-Pro 가 전체 정확도 **86.4%**로 가장 우수한 성능을 보였으며, 17 개 언어 중 14 개 언어에서 SOTA 를 기록했습니다.
오픈소스 모델의 격차: 가장 강력한 오픈소스 모델인 dots.mocr 은 **80.5%**의 정확도를 기록하여 상용 모델 대비 약 7.9% 의 격차가 존재함이 확인되었습니다.
4.2 주요 성능 저하 요인
촬영된 문서 (Photographed Documents): 모든 모델이 촬영된 문서에서 평균 **17.8%**의 성능 저하를 보였습니다. 복잡한 배경, 조명, 기하학적 왜곡이 주요 원인입니다.
비라틴 문자 (Non-Latin Scripts): 라틴 문자 기반 언어 대비 비라틴 문자 (아랍어, 힌디어 등) 에서 평균 **14.0%**의 성능 저하가 발생했습니다.
예시:MinerU2.5나 MonkeyOCR 은 영어/중국어/독일어 등 라틴 계열에는 잘 작동하지만, 아랍어나 힌디어에서는 정확도가 10% 미만으로 급락했습니다.
언어별 고유 오류:
힌디어: 모음 부호 (Diacritics) 를 무시하고 기본 문자만 인식하는 오류.
러시아어: 키릴 문자와 라틴 문자의 시각적 혼동 (예: 'В'를 'B'로 오인).
태국어: 단어 간 공백이 의미 경계만 나타내는 특성상, 모델이 불필요한 공백을 삽입하여 단어를 잘못 분할하는 현상.
아랍어: 오른쪽에서 왼쪽 (RTL) 읽기 순서를 잘못 인식하거나, 내용이 누락되고 반복되는 할루시네이션 발생.
5. 의의 및 결론 (Significance & Conclusion)
현실적 한계 규명: 현재 문서 파싱 기술이 다국어 환경과 실제 촬영 조건에서 얼마나 취약한지를 정량적으로 증명했습니다. 특히 오픈소스 모델의 성능 붕괴는 향후 연구 방향을 제시합니다.
포용적 AI 시스템 개발: 다양한 언어와 문화적 배경을 가진 문서에 대한 접근성을 높이고, 편향된 LLM 전학습 코퍼스를 구축하는 데 기여합니다.
표준화된 평가 플랫폼: MDPBench 는 일반 멀티모달 모델 (VLM) 의 다국어 텍스트 이해 및 OCR 능력을 평가하는 표준 벤치마크로 자리 잡을 것으로 기대됩니다.
이 논문은 문서 파싱 기술이 "깨끗한 디지털 데이터"를 넘어 "복잡한 실세계 다국어 데이터"에서도 견고하게 작동할 수 있도록 하는 중요한 이정표가 됩니다.