기존의 AI 평가 방식은 **"완벽한 철자 검사"**에 너무 집착했습니다. 마치 학생이 시험지를 제출했을 때, 문장 부호나 줄바꿈이 조금만 달라도 0 점으로 처리하는 것과 비슷합니다.
비유: 두 사람이 같은 이야기를 썼는데, 한 사람은 "안녕하세요."라고 쓰고 다른 사람은 "안녕하세요!"라고 썼다고 해서, 두 사람의 이야기 내용이 완전히 다르다고 판단하는 꼴입니다.
이 연구의 접근: "내용이 맞다면, 줄바꿈이나 띄어쓰기 같은 사소한 차이는 무시하자. 중요한 건 내용이 빠지지 않고, 순서가 맞는지다"라고 생각했습니다.
2. 실험은 어떻게 진행되었나요? (가장 어려운 문제만 골라내기)
저자들은 6 만 장의 프랑스어 문서 중에서 AI 가 가장 헷갈려하는 **'악몽 같은 페이지'**들만 골랐습니다.
어떻게 골랐나요? 두 개의 서로 다른 AI 에게 같은 문서를 읽게 했을 때, 두 AI 의 답이 서로 완전히 달랐던 경우를 골랐습니다. (예: 한 AI 는 "이건 표다"라고 하고, 다른 AI 는 "이건 글이다"라고 했을 때)
골라낸 문서들:
손으로 쓴 낡은 문서 (필기체)
복잡한 표가 가득 찬 페이지
글씨가 너무 작아서 눈이 아픈 문서
그림과 글자가 뒤섞인 복잡한 레이아웃
핵심: 이 문서들은 AI 가 가장 많이 실수하는 '진짜 어려운 문제'들입니다.
3. 평가 방식은 어떻게 바꿨나요? (단위 테스트 방식)
기존에는 "문장 전체를 비교해서 점수를 매겼다"면, 이번에는 **"특정 사실 하나하나를 체크하는 방식"**을 썼습니다.
비유: 긴 글을 통째로 비교하는 대신, "이 문서에 '2024 년'이라는 글자가 들어갔는가?", "이 표의 3 행 2 열 숫자가 100 인가?"처럼 **작은 질문 (체크리스트)**을 던져서 맞으면 점수를 주고 틀리면 감점하는 방식입니다.
효과: AI 가 글자 하나를 잘못 읽거나 순서를 헷갈려하면 바로 잡히지만, 줄바꿈이 조금 달라도 점수를 깎지 않아서 실제 활용에 더 유용한 점수를 줍니다.
4. 실험 결과: 누가 이겼나요?
🏆 우승자: 구글의 'Gemini 3 Pro' (상용 모델)
특징: 손으로 쓴 글씨 (필기체) 나 복잡한 양식 (폼) 을 읽는 데 가장 뛰어났습니다.
비유: 마치 수석 비서처럼, 손글씨로 된 낡은 편지도 깔끔하게 정리하고 복잡한 표도 잘 이해합니다. 하지만 비용이 비싸고 느릴 수 있습니다.
🥈 준우승자: 'Chandra' (오픈 소스 모델)
특징: 일반 문서 처리는 훌륭하지만, 손글씨나 복잡한 양식에서는 실수가 많았습니다.
비유:열정적인 인턴처럼 평범한 업무는 잘하지만, 손글씨나 난해한 자료 앞에서는 당황합니다.
📉 하위권 모델들
많은 오픈 소스 모델들이 손글씨나 복잡한 표 앞에서 완전히 작살이 났습니다. (점수가 0 에 가까움)
특히 'dots.ocr' 같은 모델은 그림이 있는 부분을 아예 무시하고 건너뛰는 버그가 있었습니다. (비유: 그림이 있는 페이지를 아예 안 본 척하고 넘어감)
5. 결론 및 시사점
이 연구는 **"프랑스어 문서 처리를 위해 AI 를 고를 때, 단순한 텍스트 인식 능력만 보면 안 된다"**는 것을 보여줍니다.
핵심 메시지:
손글씨나 복잡한 표가 중요한 업무라면, 비싸더라도 **상용 AI (Gemini 등)**를 써야 합니다.
일반적인 인쇄된 문서라면, 오픈 소스 AI도 충분히 쓸만합니다.
앞으로는 AI 가 **실제 업무 환경 (RAG 등)**에서 얼마나 유용하게 쓰일지 평가하는 기준이 더 중요해졌습니다.
한 줄 요약:
"이 논문은 AI 들에게 프랑스어 문서라는 '미로'를 통과하게 했는데, 손글씨와 복잡한 표가 있는 미로에서는 구글의 AI가 가장 잘 빠져나왔고, 다른 AI 들은 길을 잃거나 벽에 부딪혔다는 것을 증명했습니다."
1. 문제 정의 (Problem Definition)
배경: 비구조화된 PDF 문서를 구조화된 텍스트 (Markdown) 로 변환하는 작업은 RAG(검색 증강 생성) 파이프라인의 핵심 단계입니다. 이 단계에서 발생하는 오류 (전사 오류, 레이아웃 왜곡 등) 는 하류의 검색, 요약, 근거 추출 단계로 직접 전파됩니다.
한계점:
기존 벤치마크 (DocVQA, OCRBench 등) 는 주로 영어나 중국어에 초점을 맞추고 있으며, 프랑스어 문서의 복잡성을 충분히 반영하지 못합니다.
기존 평가 지표 (전체 페이지의 편집 거리, 문자 오류율 등) 는 의미적으로 동일한 출력 (예: 다른 줄 바꿈, 리스트 구분 방식, 표 렌더링 차이) 을 과도하게 패널티로 처리하여 실제 운영 환경에서 중요한 오류 (할루시네이션, 생략, 반복 등) 를 간과하는 경향이 있습니다.
손글씨 (Handwriting), 복잡한 레이아웃, 밀집된 표, 그래픽이 풍부한 페이지 등 실제 운영 환경에서 발생하는 '어려운' 실패 사례를 평가할 수 있는 프랑스어 전용 벤치마크가 부재했습니다.
2. 방법론 (Methodology)
2.1 데이터셋 구성 (Dataset Construction)
소스: CCPDF 및 Gallica 에서 수집한 약 60,000 개의 프랑스어 문서.
어댑티브 샘플링 (Adversarial Selection): 두 개의 다른 VLM(dots-ocr, mineru2.5) 이 생성한 결과 간의 편집 거리를 기준으로 '모델 간 불일치 (Model Disagreement)'가 큰 페이지를 선별했습니다. 이는 단순한 난이도가 아니라, 현재 변환 시스템이 불안정하게 작동하는 운영상의 실패 모드를 포착하기 위함입니다.
카테고리:
긴 작은 텍스트 (Tiny text), 다중 컬럼 (Multi-column), 긴 표 (Long tables), 필기/손글씨 (Manuscript/Handwritten), 양식 (Forms), 그래픽 (Graphics).
수식 (Mathematical equations) 은 다른 벤치마크에서 충분히 다루어졌으므로 제외되었습니다.
2.2 평가 프로토콜 (Evaluation Protocol)
유닛 테스트 기반 평가 (Unit-test-style Evaluation): OlmOCR 벤치마크의 방식을 차용하여, 전체적인 편집 거리 대신 구체적인 '사실 (Facts)'을 검증하는 유닛 테스트를 사용합니다.
TextPresenceTest: 특정 텍스트 구절이 마크다운에 존재하는지 확인.
TextOrderTest: 읽기 순서의 정확성 확인.
TableTest: 표의 구조적 제약 조건 (셀 내용, 행/열 관계) 검증.
카테고리별 정규화 (Category-specific Normalization): 의미적 일관성을 해치지 않는 표현적 차이 (줄 바꿈, 공백, 유니코드 변형, 강조 표시 등) 를 배제하기 위해 테스트 유형별로 정규화 단계를 적용합니다. 이를 통해 실제 콘텐츠 오류와 단순 포맷팅 차이를 명확히 구분합니다.
실험 환경:vlmparse 라이브러리를 사용하여 15 개의 상용 및 오픈소스 모델을 통일된 파이프라인으로 평가했습니다.
3. 주요 기여 (Key Contributions)
프랑스어 특화 벤치마크: 필기체, 양식, 복잡한 레이아웃, 밀집된 표 등을 포함하는 어려운 프랑스어 PDF 페이지로 구성된 벤치마크를 최초로 제시했습니다.
강화된 평가 스위트: 포맷팅 차이를 배제하고 의미적 완전성과 구조적 일관성을 중시하는 카테고리별 정규화 프로파일을 갖춘 유닛 테스트 기반 평가 체계를 개발했습니다.
광범위한 모델 비교 연구: 15 개의 상용 (Proprietary) 및 오픈 가중치 (Open-weights) 모델을 통일된 파이프라인 하에서 비교 분석하여 성능 차이를 규명했습니다.
4. 결과 (Results)
4.1 전반적 성능
상위 모델: 상용 모델인 Gemini 3 Pro Preview가 평균 점수 0.76으로 1 위를 차지했으며, Gemini 3 Flash Preview(0.74) 가紧随其后했습니다.
오픈소스 모델:Chandra가 오픈 가중치 모델 중 가장 높은 점수 (0.66) 를 기록했으나, 상용 모델 대비 성능 격차가 존재했습니다.
하위 모델:MinerU2.5, granite-docling 등 일부 오픈소스 모델은 전체 평균 점수가 0.25 미만으로 낮았습니다.
4.2 카테고리별 분석
손글씨 및 양식 (Handwriting & Forms): 가장 난이도가 높은 카테고리였습니다. Gemini 3 Pro 는 상대적으로 높은 점수 (손글씨 0.60, 양식 0.72) 를 보였으나, 많은 소형 모델은 거의 0 점에 가까운 실패를 보였습니다.
그래픽 (Graphics): 일반적이지 않은 VLM 은 그래픽을 텍스트로 변환하는 데 실패했습니다. (Chandra 를 제외하고는 그래픽 추출이 매우 낮음).
다중 컬럼 및 표: 읽기 순서와 구조 보존이 핵심이었으며, 상위 모델들은 다중 컬럼 텍스트에서 0.80 이상의 높은 점수를 기록했습니다.
4.3 처리량 (Throughput) 및 해상도 영향
속도:granite-docling과 MinerU2.5는 페이지당 약 0.9 초로 가장 빠웠으나, 정확도는 낮았습니다. 반면 Chandra는 정확도가 높았지만 페이지당 약 4.3 초로 가장 느렸습니다.
해상도 (DPI): 100 DPI 까지 해상도가 증가하면 처리 속도가 감소하는 비단조적 (Non-monotonic) 경향을 보였습니다. 이는 작은 모델의 디코딩 불안정성으로 인한 반복 생성 (repetitive generations) 이 원인입니다.
5. 의의 및 결론 (Significance & Conclusion)
현실적 통찰: 이 벤치마크는 단순한 OCR 정확도가 아닌, RAG 파이프라인에 투입될 때 실제적으로 중요한 '구조적 일관성'과 '콘텐츠 완전성'을 평가하는 기준을 제시했습니다.
모델 선택 가이드:
복잡한 레이아웃 및 손글씨 처리: 현재는 상용 모델 (Gemini 등) 이 가장 강력한 솔루션입니다.
표준 인쇄 문서:오픈소스 모델도 경쟁력 있는 성능을 보이지만, 필기체나 시각적 노이즈가 있는 문서에서는 한계가 명확합니다.
미래 방향: 이 벤치마크는 일회성 리더보드가 아닌, 커뮤니티가 지속적으로 기여하고 개선하는 '살아있는 리소스 (Living Resource)'로 운영될 예정입니다. 향후 연구에서는 어려운 문서 유형에 대한 소형 VLM 의 파인튜닝을 통해 성능 격차를 해소하는 것이 중요합니다.
이 논문은 프랑스어 문서 처리를 위한 표준 벤치마크를 정립함으로써, RAG 시스템의 전처리 단계에서 발생할 수 있는 오류를 식별하고 개선하는 데 중요한 기여를 했습니다.