PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
이 논문은 물리적 왜곡에 강인한 0.9B 초소형 VLM 인 PaddleOCR-VL-1.5 를 소개하여 OmniDocBench 와 새로운 Real5-OmniDocBench 벤치마크에서 최첨단 성능을 달성하고 도장 인식 및 텍스트 스포팅 기능을 확장했다고 요약할 수 있습니다.
PaddleOCR-VL-1.5는 이 문제를 해결한 **'0.9B(9 억 개 파라미터)'**라는 아주 작고 가벼운 초소형 도서관 사서입니다.
비유: 거대한 도서관 사서 (수백 억 개의 두뇌를 가진 AI) 들은 책 한 권을 읽으려면 거대한 책상과 많은 직원이 필요하지만, 이 모델은 주머니에 들어갈 만큼 작은 지갑만 있어도 모든 일을 척척 해냅니다.
성적: 이 작은 사서가 세계 최고 수준의 시험 (OmniDocBench) 에서 **94.5%**라는 압도적인 점수를 받아 1 위를 차지했습니다.
🌪️ 2. 왜 특별한가요? (변신하는 마법사)
이 모델의 가장 큰 특징은 **'실제 세상 (In-the-Wild)'**에서도 잘 작동한다는 점입니다.
기존의 문제: 대부분의 AI 는 깨끗하게 스캔된 문서만 읽습니다. 하지만 실제로는 책이 구겨지거나 (Warpping), 사진이 찍힐 때 흔들리거나 (Skew), 전등 불빛이 반사되거나 (Illumination) 하는 경우가 많죠.
이 모델의 능력: 이 작은 사서는 변신 마법사처럼 상황에 맞춰 적응합니다.
구겨진 종이: 책이 구겨져서 글자가 비틀려도, 마치 구겨진 천을 펴듯 글자를 바로잡아 읽습니다.
어두운 곳/반사: 사진이 찍힐 때 생기는 번짐이나 반사광이 있어도 글자를 찾아냅니다.
새로운 능력: 단순히 글자만 읽는 게 아니라, **도장 (Seal)**을 인식하거나, 이미지 속의 글자 위치를 정확히 찾아내는 (Text Spotting) 능력까지 생겼습니다. 마치 사서가 책 내용뿐만 아니라 책장 구석에 숨겨진 낙서까지 찾아내는 것과 같습니다.
🧩 3. 어떻게 이렇게 똑똑해졌나요? (두 단계의 마법)
이 모델은 두 가지 핵심 기술을 결합하여 작동합니다.
첫 번째 단계: 구조 파악 (PP-DocLayoutV3)
비유: 책장을 펼쳤을 때, "여기는 제목이고, 여기는 그림이고, 여기는 본문이야"라고 눈으로 빠르게 훑어보는 능력입니다.
특이점: 기존에는 네모난 상자로만 감싸서 인식했지만, 이 모델은 구불구불한 모양이나 기울어진 글자도 정확히 감싸서 인식합니다. 마치 구부러진 줄로 글자를 감싸는 것처럼 정교합니다.
두 번째 단계: 내용 읽기 (PaddleOCR-VL-1.5-0.9B)
비유: 구조를 파악한 후, 글자를 하나하나 읽어내는 능력입니다.
특이점: 수학 공식, 복잡한 표, 도장, 다양한 언어까지 모두 읽을 수 있도록 훈련되었습니다. 특히 '도장'이나 '손글씨'처럼 읽기 어려운 부분도 잘 처리합니다.
🏆 4. 실제 성능은 어떨까요? (실전 테스트)
연구진은 이 모델이 실제 세상에서 얼마나 잘하는지 확인하기 위해 Real5-OmniDocBench라는 새로운 시험을 만들었습니다.
시험 내용: 스캔본, 구겨진 문서, 휴대폰으로 찍은 사진, 어두운 조명, 기울어진 문서 등 가장 험난한 상황 5 가지를 테스트했습니다.
결과: 이 작은 사서는 거대한 AI 들 (Qwen3-VL, Gemini 등) 보다 훨씬 더 높은 점수를 받았습니다. 특히 기울어진 문서를 읽을 때는 이전 모델보다 14% 이상 더 잘 읽었습니다.
🚀 5. 결론: 왜 이 모델이 중요한가요?
이 모델은 "작지만 강한" AI 의 새로운 기준을 세웠습니다.
빠르고 가볍습니다: 거대한 서버 없이도 일반 컴퓨터나 스마트폰에서도 빠르게 돌아갑니다.
튼튼합니다: 어떤 상황에서도 글자를 놓치지 않습니다.
다재다능합니다: 문서 분석, 도장 인식, 글자 찾기 등 여러 일을 한 번에 처리합니다.
한 줄 요약:
"이제 거대한 컴퓨터 없이도, 구겨지고 기울어진 문서 속의 모든 정보를 빠르고 정확하게 읽어내는 '초소형 마법사'가 우리 곁에 왔습니다!"
이 기술은 앞으로 우리가 매일 접하는 복잡한 문서 처리, 자동화된 데이터 입력, 그리고 AI 가 세상을 더 잘 이해하는 데 큰 도움을 줄 것입니다.
PaddleOCR-VL-1.5 기술 요약
1. 문제 정의 (Problem)
기존의 문서 파싱 (Document Parsing) 기술은 주로 디지털 생성 문서 (Digital-born) 나 깨끗하게 스캔된 문서를 대상으로 최적화되어 있었습니다. 그러나 실제 현장 (In-the-Wild) 에서는 다음과 같은 심각한 물리적 왜곡이 발생하여 기존 모델들의 성능이 급격히 저하되는 문제가 존재했습니다.
심각한 기하학적 왜곡: 강한 기울기 (Skew), 비강체 왜곡 (Warping), 페이지의 구부러짐.
환경적 요인: 스크린 촬영 시 발생하는 모아레 패턴 (Moiré patterns), 불규칙한 조명 (Illumination), 스캔 품질 저하.
한계: 기존 최첨단 (SOTA) 모델들조차 이러한 복잡한 물리적 왜곡을 견디며 정확한 구조와 의미론적 레이아웃을 복원하는 데 한계를 보였습니다. 또한, 기존 모델들은 인장 (Seal) 인식이나 텍스트 스포팅 (Text Spotting) 과 같은 특수 작업에 대한 지원이 부족했습니다.
2. 방법론 (Methodology)
PaddleOCR-VL-1.5 는 0.9B(9 억 개) 파라미터의 초경량 VLM(Visual Language Model) 아키텍처를 기반으로 하며, 다음과 같은 핵심 기술적 혁신을 도입했습니다.
가. PP-DocLayoutV3 (통합 레이아웃 분석 엔진)
아키텍처: 기존 직사각형 검출을 넘어, 인스턴스 분할 (Instance Segmentation) 기반의 강력한 프레임워크로 전환되었습니다. RT-DETR 객체 탐지기를 기반으로 하여 마스크 기반 검출 헤드를 채택했습니다.
다중 점 바운딩 박스: 기울어진 페이지나 물리적 곡률이 있는 문서에서도 정밀한 경계를 잡기 위해 2 점 바운딩 박스 대신 다중 점 (4 점 이상) 바운딩 박스를 직접 예측합니다.
통합 읽기 순서 예측: 탐지, 분할, 읽기 순서 추론을 별도의 단계가 아닌 단일 Transformer 디코더 내에서 통합하여 수행합니다. Global Pointer Mechanism 을 통해 객체 간의 위계적 관계를 학습하고, Voting-based Ranking 전략으로 전역적으로 일관된 읽기 순서를 도출합니다. 이는 전파 오차 (Cascading errors) 를 크게 줄입니다.
나. PaddleOCR-VL-1.5-0.9B (요소 인식 및 텍스트 스포팅)
기반 모델: NaViT 스타일의 동적 해상도 인코더와 ERNIE-4.5-0.3B 언어 백본을 유지하면서, 인장 (Seal) 인식과 텍스트 스포팅 기능을 추가했습니다.
학습 전략 (Training Recipe):
Pre-training: 2900 만 쌍에서 4,600 만 쌍으로 데이터 규모를 확장하고, 인장 및 스포팅 관련 데이터를 초기에 주입하여 시각적 패턴 학습을 강화했습니다.
Post-training (Instruction Tuning): OCR, 표, 수식, 차트 인식에 더해 인장 인식과 텍스트 스포팅을 추가했습니다. 텍스트 스포팅의 경우, 기울어진 텍스트를 정밀하게 표현하기 위해 2 점 바운딩 박스 대신 4 점 사각형 (Quadrilateral) 좌표와 텍스트를 결합한 토큰 시퀀스를 사용합니다.
GRPO (Group Relative Policy Optimization): 다양한 라벨 스타일의 불일치를 해결하고 일반화를 강화하기 위해 강화 학습 단계를 도입했습니다.
다. 데이터 구성 전략
Uncertainty-Aware Cluster Sampling (UACS): 시각적 클러스터링과 모델의 예측 불확실성을 기반으로 '어려운 샘플 (Hard Cases)'을 선별하여 학습 효율을 극대화했습니다.
Real5-OmniDocBench: 실제 현장의 5 가지 왜곡 시나리오 (스캔, 왜곡, 화면 촬영, 조명, 기울기) 를 시뮬레이션한 새로운 벤치마크 데이터를 구축하여 모델의 견고성을 평가했습니다.
3. 주요 기여 (Key Contributions)
새로운 SOTA 달성: OmniDocBench v1.5 에서 **94.5%**의 정확도를 기록하여 기존 모델들을 압도하는 새로운 최고 성능을 달성했습니다.
실제 환경 (In-the-Wild) 강건성: 새로 구축된 Real5-OmniDocBench 벤치마크에서 **92.05%**의 정확도를 기록하며, 특히 심한 기울기 (Skew) 상황에서 이전 모델 대비 14.19%p 향상된 성능을 보여주었습니다.
초경량 고효율 모델: 0.9B 파라미터라는 압도적으로 작은 규모로, Qwen3-VL-235B(2350 억 파라미터) 나 Gemini-3 Pro 와 같은 초대규모 일반 VLM 들보다 문서 파싱 작업에서 더 높은 성능을 발휘합니다.
다기능 확장: 기존 OCR 기능을 넘어 인장 (Seal) 인식과 **텍스트 스포팅 (Grounded OCR)**을 단일 모델에서 지원하여 문서 이해의 범위를 확장했습니다.
4. 실험 결과 (Results)
OmniDocBench v1.5: 전체 점수 94.50% (이전 모델 92.86% 대비 상승). 텍스트, 수식 (CDM 94.21%), 표 (TEDS 92.76%), 읽기 순서 등 모든 하위 작업에서 SOTA 기록을 세웠습니다.
Real5-OmniDocBench: 5 가지 왜곡 시나리오 전반에서 가장 높은 성능을 보였습니다. 특히 '기울기 (Skew)' 카테고리에서 91.66%의 정확도를 기록했습니다.
새로운 작업 성능:
텍스트 스포팅: 10 가지 평가 차원 중 9 개에서 최고 정확도 (Overall 86.21%) 를 기록했습니다.
인장 인식: 0.9B 모델이 235B 모델 (Qwen3-VL) 보다 훨씬 낮은 NED(0.138 vs 0.382) 를 기록하여 우수한 성능을 입증했습니다.
추론 성능: FastDeploy 백엔드에서 단일 NVIDIA A100 GPU 기준 초당 1.43 페이지 처리 속도를 달성하여 이전 모델 대비 16.9% 향상된 처리량을 보였습니다.
5. 의의 및 중요성 (Significance)
PaddleOCR-VL-1.5 는 **파라미터 효율성 (Parameter Efficiency)**과 실제 환경 강건성을 동시에 달성한 획기적인 모델입니다.
RAG 및 LLM 응용: 복잡한 실제 문서에서도 고충실도 (High-fidelity) 데이터를 추출할 수 있어, Retrieval-Augmented Generation (RAG) 시스템 및 대형 언어 모델의 하위 작업 신뢰도를 크게 높입니다.
비용 효율성: 초대규모 모델에 의존하지 않고도 0.9B 규모의 경량 모델로 산업 현장의 복잡한 문서 처리 요구사항을 충족시킴으로써, 배포 비용과 리소스 소모를 획기적으로 줄였습니다.
실용성: 단순한 텍스트 인식을 넘어 문서의 구조, 인장, 스포팅까지 포괄하는 통합 솔루션을 제공하여, 금융, 법률, 행정 등 다양한 분야의 디지털 전환을 가속화할 것으로 기대됩니다.