← 최신 논문
💻 computer science

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

이 논문은 문서 파싱, 레이아웃 분석, 이해를 통합한 4B 파라미터 엔드투엔드 비전 - 언어 모델인 'Qianfan-OCR'을 소개하며, 복잡한 레이아웃 처리를 위해 '생각 (Thinking)' 단계로 레이아웃 정보를 생성하는 'Layout-as-Thought' 기법을 제안하고 다양한 벤치마크에서 최상위 성능을 입증했습니다.

원저자: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu
게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📄 "큐안판-OCR": 문서를 보는 눈과 생각하는 뇌를 하나로 합친 혁신

안녕하세요! 오늘 소개해 드릴 논문은 **'큐안판-OCR(Qianfan-OCR)'**이라는 새로운 인공지능 모델에 대한 것입니다. 이 모델은 복잡한 문서 (계약서, 영수증, 학술지 등) 를 읽는 방식을 완전히 바꿔놓았습니다.

기존 방식과 새로운 방식의 차이를 이해하기 위해, '문서 처리'를 '음식 주문'에 비유해 보겠습니다.


1. 기존 방식: "조리사 - 배달원 - 셰프"의 분리된 팀 (기존 파이프라인)

과거의 OCR(문자 인식) 시스템은 마치 음식 주문을 받는 세 명의 다른 사람이 협력하는 것과 같았습니다.

  1. 배달원 (레이아웃 분석): 먼저 문서를 훑어보며 "여기는 제목, 저기는 표, 여기는 그림"이라고 구분합니다.
  2. 조리사 (문자 인식): 배달원이 구분한 조각조각을 받아 "이건 'A'자, 저건 '1'자"라고 글자를 하나하나 읽습니다.
  3. 셰프 (이해 및 요약): 읽힌 글자들을 받아 "이 문서의 핵심은 뭐지?"라고 이해하고 답변을 만듭니다.

🚨 문제점:

  • 오류 전파: 배달원이 "여기는 표다"라고 잘못 구분하면, 조리사는 그걸로 글자를 읽으려다 엉뚱한 답을 내고, 셰프는 완전히 틀린 결론을 내립니다.
  • 맥락 상실: 글자를 잘라낼 때, 글자들이 원래 어디에 있었는지 (위치, 크기, 배열) 라는 중요한 정보가 사라져 버립니다.
  • 비효율: 세 사람을 모두 고용하고 조율해야 하므로 비용이 많이 들고 느립니다.

2. 새로운 방식: "슈퍼 셰프" 한 명 (큐안판-OCR)

큐안판-OCR은 이 모든 일을 한 명의 천재 셰프가 끝까지 해내는 방식입니다.

  • 한 번에 해결: 문서를 한눈에 보자마자, "여기는 제목이고, 저기는 표이며, 내용은 이렇게 해석된다"를 순간적으로 동시에 처리합니다.
  • 맥락 유지: 글자를 잘라내지 않고, 문서 전체의 분위기 (레이아웃, 그림과 글자의 관계) 를 온전히 기억한 채 이해합니다.
  • 40 억 개의 뇌세포: 이 모델은 약 40 억 개의 파라미터 (뇌세포) 를 가진 4B(4 Billion) 사이즈의 모델로, 작지만 매우 효율적이고 똑똑합니다.

3. 핵심 기술: "생각의 시간" (Layout-as-Thought)

하지만 모든 문서가 똑같은 것은 아닙니다. 아주 복잡한 수학 시험지나 기하학 도형이 섞인 문서는 바로 답을 내기보다 잠깐 생각할 시간이 필요합니다.

큐안판-OCR 은 **'생각의 시간 (Think)'**이라는 기능을 도입했습니다.

  • 🧠 생각 모드 (Think Mode): 복잡한 문서를 볼 때, 모델이 "잠깐! 이 페이지는 제목이 여기고, 표가 저기에 있고, 그림이 이 사이에 끼어 있네..."라고 눈에 보이는 구조를 먼저 정리합니다.
    • 마치 건축가가 건물을 짓기 전에 설계도 (위치, 구조) 를 먼저 그려보는 것과 같습니다.
    • 이 과정을 통해 복잡한 표나 수식이 섞인 문서에서도 훨씬 정확한 답을 낼 수 있습니다.
  • ⚡ 바로 답 모드: 간단한 영수증이나 텍스트만 있는 문서는 생각할 필요 없이 바로 답을 냅니다.

이 기능 덕분에, 모델은 단순한 문서에서는 빠르고, 복잡한 문서에서는 정확하게 작동합니다.


4. 왜 이 기술이 놀라운가요? (성적표)

이 모델은 다양한 시험에서 최고의 점수를 받았습니다.

  • 📊 문서 이해 능력: 표 (Table) 나 차트 (Chart) 를 이해하는 능력에서 기존 모델들을 압도했습니다. 특히 차트 (그래프) 를 보고 질문을 답하는 능력은 기존 방식이 0 점에 가까웠던 반면, 이 모델은 90 점 이상을 받았습니다. (차트의 축과 데이터 관계를 글자만으로는 알 수 없기 때문입니다.)
  • 🌍 한국어 및 다국어: 영어뿐만 아니라 한국어, 중국어 등 다양한 언어의 문서도 잘 읽습니다.
  • 💰 비용 대비 효율: 거대한 모델 (수천 억 파라미터) 을 쓰지 않아도, 이 40 억 파라미터 모델이 거대 모델들과 맞먹는 성능을 내면서 훨씬 빠르고 저렴하게 돌아갑니다.

5. 요약: 무엇을 얻을 수 있나요?

큐안판-OCR은 문서를 처리할 때 **"글자만 읽는 기계"**에서 **"문서의 구조와 의미를 동시에 이해하는 지능형 비서"**로 진화시켰습니다.

  • 기존 방식: "글자를 잘게 썰어서 읽음" → 맥락이 끊김, 오류가 쌓임.
  • 큐안판-OCR: "문서 전체를 한눈에 보고, 필요하면 구조를 먼저 생각한 뒤 답함" → 정확하고 빠름.

이 기술은 이제 구글, 바이두 등 거대 기업들의 클라우드 서비스를 통해 누구나 사용할 수 있게 되었으며, 복잡한 계약서 검토, 학술지 분석, 영수증 자동 처리 등 다양한 분야에서 혁신을 일으킬 것으로 기대됩니다.

한 줄 요약:

"문서를 읽을 때, 글자뿐만 아니라 '배치'와 '맥락'까지 함께 생각하는, 문서 이해의 새로운 표준이 된 AI 입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →