← 최신 논문
💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

이 논문은 물리적 왜곡에 강인한 0.9B 초소형 VLM 인 PaddleOCR-VL-1.5 를 소개하여 OmniDocBench 와 새로운 Real5-OmniDocBench 벤치마크에서 최첨단 성능을 달성하고 도장 인식 및 텍스트 스포팅 기능을 확장했다고 요약할 수 있습니다.

원저자: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 1. 이 모델은 무엇인가요? (작은 도서관 사서)

이전까지 문서 읽기 AI 는 보통 두 가지 문제가 있었습니다.

  1. 너무 커서 무겁다: 거대한 도서관 사서 (대형 AI) 는 책 한 권을 읽는 데 시간이 오래 걸리고 전기도 많이 먹습니다.
  2. 실전에는 약하다: 깨끗하게 스캔된 책만 잘 읽지, 구겨지거나 기울어진 종이는 읽지 못합니다.

PaddleOCR-VL-1.5는 이 문제를 해결한 **'0.9B(9 억 개 파라미터)'**라는 아주 작고 가벼운 초소형 도서관 사서입니다.

  • 비유: 거대한 도서관 사서 (수백 억 개의 두뇌를 가진 AI) 들은 책 한 권을 읽으려면 거대한 책상과 많은 직원이 필요하지만, 이 모델은 주머니에 들어갈 만큼 작은 지갑만 있어도 모든 일을 척척 해냅니다.
  • 성적: 이 작은 사서가 세계 최고 수준의 시험 (OmniDocBench) 에서 **94.5%**라는 압도적인 점수를 받아 1 위를 차지했습니다.

🌪️ 2. 왜 특별한가요? (변신하는 마법사)

이 모델의 가장 큰 특징은 **'실제 세상 (In-the-Wild)'**에서도 잘 작동한다는 점입니다.

  • 기존의 문제: 대부분의 AI 는 깨끗하게 스캔된 문서만 읽습니다. 하지만 실제로는 책이 구겨지거나 (Warpping), 사진이 찍힐 때 흔들리거나 (Skew), 전등 불빛이 반사되거나 (Illumination) 하는 경우가 많죠.
  • 이 모델의 능력: 이 작은 사서는 변신 마법사처럼 상황에 맞춰 적응합니다.
    • 구겨진 종이: 책이 구겨져서 글자가 비틀려도, 마치 구겨진 천을 펴듯 글자를 바로잡아 읽습니다.
    • 어두운 곳/반사: 사진이 찍힐 때 생기는 번짐이나 반사광이 있어도 글자를 찾아냅니다.
    • 새로운 능력: 단순히 글자만 읽는 게 아니라, **도장 (Seal)**을 인식하거나, 이미지 속의 글자 위치를 정확히 찾아내는 (Text Spotting) 능력까지 생겼습니다. 마치 사서가 책 내용뿐만 아니라 책장 구석에 숨겨진 낙서까지 찾아내는 것과 같습니다.

🧩 3. 어떻게 이렇게 똑똑해졌나요? (두 단계의 마법)

이 모델은 두 가지 핵심 기술을 결합하여 작동합니다.

  1. 첫 번째 단계: 구조 파악 (PP-DocLayoutV3)

    • 비유: 책장을 펼쳤을 때, "여기는 제목이고, 여기는 그림이고, 여기는 본문이야"라고 눈으로 빠르게 훑어보는 능력입니다.
    • 특이점: 기존에는 네모난 상자로만 감싸서 인식했지만, 이 모델은 구불구불한 모양이나 기울어진 글자도 정확히 감싸서 인식합니다. 마치 구부러진 줄로 글자를 감싸는 것처럼 정교합니다.
  2. 두 번째 단계: 내용 읽기 (PaddleOCR-VL-1.5-0.9B)

    • 비유: 구조를 파악한 후, 글자를 하나하나 읽어내는 능력입니다.
    • 특이점: 수학 공식, 복잡한 표, 도장, 다양한 언어까지 모두 읽을 수 있도록 훈련되었습니다. 특히 '도장'이나 '손글씨'처럼 읽기 어려운 부분도 잘 처리합니다.

🏆 4. 실제 성능은 어떨까요? (실전 테스트)

연구진은 이 모델이 실제 세상에서 얼마나 잘하는지 확인하기 위해 Real5-OmniDocBench라는 새로운 시험을 만들었습니다.

  • 시험 내용: 스캔본, 구겨진 문서, 휴대폰으로 찍은 사진, 어두운 조명, 기울어진 문서 등 가장 험난한 상황 5 가지를 테스트했습니다.
  • 결과: 이 작은 사서는 거대한 AI 들 (Qwen3-VL, Gemini 등) 보다 훨씬 더 높은 점수를 받았습니다. 특히 기울어진 문서를 읽을 때는 이전 모델보다 14% 이상 더 잘 읽었습니다.

🚀 5. 결론: 왜 이 모델이 중요한가요?

이 모델은 "작지만 강한" AI 의 새로운 기준을 세웠습니다.

  • 빠르고 가볍습니다: 거대한 서버 없이도 일반 컴퓨터나 스마트폰에서도 빠르게 돌아갑니다.
  • 튼튼합니다: 어떤 상황에서도 글자를 놓치지 않습니다.
  • 다재다능합니다: 문서 분석, 도장 인식, 글자 찾기 등 여러 일을 한 번에 처리합니다.

한 줄 요약:

"이제 거대한 컴퓨터 없이도, 구겨지고 기울어진 문서 속의 모든 정보를 빠르고 정확하게 읽어내는 '초소형 마법사'가 우리 곁에 왔습니다!"

이 기술은 앞으로 우리가 매일 접하는 복잡한 문서 처리, 자동화된 데이터 입력, 그리고 AI 가 세상을 더 잘 이해하는 데 큰 도움을 줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →