← 최신 논문
💬 NLP

Unlimited OCR Works

이 논문은 표준 디코더 어텐션을 새로운 참조 슬라이딩 윈도우 어텐션(Reference Sliding Window Attention, R-SWA) 메커니즘으로 대체하여 일정한 KV 캐시를 유지함으로써, LLM 기반 OCR 시스템에서 긴 출력 시퀀스로 인해 발생하는 전형적인 메모리 및 속도 저하 없이 수십 페이지를 효율적으로 단일 패스(single-pass)로 전사할 수 있게 하는 Unlimited OCR 모델을 소개한다.

원저자: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 현재 AI의 "메모리 과부하"

당신이 100페이지짜리 책을 손으로 직접 베껴 쓰는 상황을 상상해 보세요.

  • 인간은 어떻게 하는가: 책을 보고 한 문장을 쓴 다음, 방금 쓴 마지막 몇 단어를 슬쩍 다시 확인하며 흐름을 놓치지 않은 채 계속 써 내려갑니다. 첫 페이지부터 지금까지 쓴 모든 단어를 다 기억할 필요는 없습니다. 그저 '지금 이 순간'의 맥락만 명확히 알면 됩니다. 인간의 뇌는 먼 과거의 정보는 자연스럽게 "흐릿하게" 만드는 대신, 직전의 맥락을 날카롭게 유지합니다.
  • 현재의 AI는 어떻게 하는가: 현재의 AI 모델들은 아무것도 잊기를 거부하는 학생처럼 행동합니다. 새로운 단어를 쓸 때마다, 다음에 무엇을 쓸지 결정하기 위해 페이지 1부터 현재 페이지까지의 책 전체를 매번 다시 읽으려고 합니다.
    • 결과: 책이 길어질수록 이 학생은 엄청난 정신적 부하를 짊어지기 때문에 점점 더 느려집니다. 결국 메모리(RAM)가 바닥나서 멈춰버리고, 초기화한 뒤 새 페이지에서 다시 시작해야 합니다. 이것이 현재의 AI가 책 한 권을 통째로 처리하는 데 어려움을 겪는 이유입니다. 마치 루프에 빠진 로봇처럼 페이지 단위로 끊어서 작업해야 하기 때문입니다.

해결책: "Unlimited OCR"과 "슬라이딩 윈도우(Sliding Window)"

바이두(Baidu)의 연구진은 Unlimited OCR이라는 새로운 모델을 제안했습니다. 그들은 인간 복사기처럼 생각하는 AI를 만들고자 했습니다. 이를 위해 그들은 **참조 슬라이딩 윈도우 어텐션(Reference Sliding Window Attention, R-SWA)**이라는 새로운 어텐션 메커니즘을 발명했습니다.

이것이 어떻게 작동하는지 몇 가지 비유를 통해 설명하겠습니다.

1. "참조 도서" vs "슬라이딩 윈도우"

AI가 책상 앞에 앉아 두 가지 물건을 가지고 있다고 상상해 보세요.

  • 참조 도서 (이미지): 스캔 중인 문서입니다. AI는 이 이미지를 작업 내내 책상 위에 펼쳐둡니다. 원본 이미지를 절대 잊지 않습니다.
  • 슬라이딩 윈도우 (최근의 과거): 자신이 쓴 전체 기록을 기억하는 대신, AI는 방금 생성한 마지막 128개의 단어만을 담은 작은 "포스트잇"을 유지합니다. 새로운 단어를 쓸 때마다 포스트잇의 가장 오래된 단어는 떨어져 나가고, 새로운 단어가 추가됩니다.

핵심 원리: AI는 참조 도서(무엇을 베껴 쓸지 알기 위해)와 슬라이딩 윈도우(자신이 어느 과정에 있는지 알기 위해)를 동시에 봅니다. 나머지 과거 기록은 무시합니다. 이 방식 덕분에 1페이지를 베끼든 100페이지를 베끼든 AI의 "정신적 부하"(메모리 사용량)는 일정하게 유지됩니다.

2. "딥 스퀴즈(Deep Squeeze, 깊은 압축)" (고압축 인코더)

AI가 글을 쓰기 전, 먼저 이미지를 살펴봐야 합니다.

  • 기존 방식: 고해Resolution 사진이 있다면, 이는 책의 모든 픽셀 하나하나를 설명하려는 것과 같습니다. 엄청난 공간을 차지하게 됩니다.
  • Unlimited OCR 방식: 이들은 "딥 스퀴즈(DeepEncoder)"를 사용합니다. 고해상도 사진을 중요한 디테일은 잃지 않으면서도 아주 작고 효율적인 요약본으로 압축한다고 상상해 보세요. 이 덕분에 "참조 도서"는 책상 위에서 아주 적은 공간만 차지하게 되어, AI가 작업할 수 있는 충분한 여유 공간을 남겨줍니다.

무엇을 달성했는가?

"딥 스퀴즈"와 "슬라이딩 윈도우"를 결합함으로써, 연구진은 세 가지 주요 성과를 거두었습니다.

  1. 원샷 롱 호라이즌 파싱 (One-Shot Long-Horizon Parsing): 이 모델은 수십 페이지의 문서를 한 번에 처리할 수 있습니다. 중간에 멈추거나 초기화할 필요가 없습니다. 책 한 권을 처음부터 끝까지 하나의 연속된 흐름으로 읽어낼 수 있습니다.
  2. 일정한 속도: AI가 전체 기록을 기억하려고 애쓰지 않기 때문에, 문서가 길어진다고 해서 속도가 느려지지 않습니다. 1페이지에 있든 50페이지에 있든 동일한 속도로 글을 씁니다.
  3. 더 높은 정확도: 놀랍게도, 관련 있는 최근의 맥락과 원본 이미지에만 집중함으로써 AI는 이전의 최고 모델들보다 오히려 실수를 적게 했습니다. 자신의 긴 기록 때문에 혼란을 겪지 않았던 것입니다.

"실제 세상" 테스트

연구진은 이 모델을 OmniDocBench라는 벤치마크로 테스트했습니다.

  • 결과: Unlimited OCR은 기반이 된 모델인 DeepSeek OCR을 포함하여 거의 모든 다른 모델보다 높은 점수를 기록했습니다.
  • 장문 테스트: 40페이지 이상의 책을 입력했을 때, 모델은 높은 정확도를 유지했습니다. 이는 모델이 책 중간에서 "길을 잃지" 않았음을 증명합니다.

이것이 미래에 의미하는 바는?

이 논문은 이것이 단순히 책을 읽는 것에만 국한되지 않는다고 시사합니다. "슬라이딩 윈도우" 로직은 매우 효율적이기 때문에, 지치거나 느려지지 않고 오랫동안 듣거나 번역해야 하는 다른 작업에도 적용될 수 있습니다.

  • ASR (자동 음성 인식): 시스템이 느려지는 현상 없이 몇 시간 분량의 오디오를 받아쓰기.
  • 번역: 긴 문서를 한 번의 통과(one pass)로 번역하기.

요약

Unlimited OCR을 긴 작업에 압도당하는 "사진적 기억력"을 가진 AI에서, 무엇을 기억해야 할지(원본 이미지와 직전의 몇 단어)와 무엇을 안전하게 잊어도 될지를 정확히 아는 "스마트 복사기"로 업그레이드한 것이라고 생각하면 됩니다. 이를 통해 AI는 더 빠르게 작업하고, 메모리를 적게 사용하며, 기존 AI가 한 번에 처리하기 불가능했던 방대한 문서들을 다룰 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →