← 최신 논문
💬 NLP

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD-Parsing은 글로벌 레이아웃 분석과 동시적 블록 단위 콘텐츠 생성 및 점진적 멀티 토큰 예측을 결합한 계층적 병렬 디코딩 패러다임을 도입하여, 경쟁력 있는 정확도를 유지하면서도 기존 모델보다 2.62배 빠른 초당 4,752 토큰의 처리량을 달성했습니다.

원저자: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 크고 복잡한 도서관의 책을 읽으려는데, 그 책이 본드로 붙여져 있다고 상상해 보십시오. 이 책을 이해하려면 첫 페이지부터 마지막 페이지까지 모든 단어를 하나도 빠짐없이 순서대로, 중간에 건너뛰지 않고 읽어야만 합니다. 이것이 현재 많은 현대 컴퓨터 프로그램들이 PDF나 스캔된 문서 같은 문서를 "읽는" 방식입니다. 이들은 시각과 언어를 동시에 이해하는 '시각-언어 모델(Vision-Language Model, VLM)'이라는 매우 똑똑한 로봇과 같은 인공지능을 사용합니다. 이 로봇들은 문서가 무엇을 말하는지 이해하는 데 있어 놀라울 정도로 뛰어나지고 있지만, 종종 고통스러울 정도로 느립니다. 이는 마치 거대한 퍼즐 조각을 맞출 때, 이전 조각을 놓기 전에는 다음 조각을 절대 만질 수 없도록 한 번에 한 조각씩만 보고 있는 것과 같습니다. 문서가 길어지고 텍텍스트, 표, 수학 공식 등으로 복잡해질수록, 이 "하나씩 읽는" 방식은 교통 체증처럼 변하여 수천 권의 문서를 빠르게 처리하는 것을 어렵게 만듭니다.

이 지점에서 HPD-Parsing이라는 새로운 아이디어가 등장합니다. 이 프로젝트의 연구자들은 문서가 전체적인 계획(예: 장의 순서를 아는 것)은 필요하지만, 각 섹션을 실제로 읽는 과정은 반드시 엄격한 선형 구조를 따를 필요는 없다는 사실을 깨달았습니다. 그들은 더 똑똑한 방식을 제안합니다. 문서 전체를 순차적으로 읽는 한 명의 로봇 대신, 팀을 사용하는 것입니다. 한 명의 "관리자" 로봇이 레이아웃을 파악하고 여러 섹션을 가리키면, "일꾼" 로봇 팀이 그 섹션들을 동시에 읽습니다. 또한, 로봇들이 한 번에 여러 단어를 미리 예측하여, 매 단어마다 멈춰서 생각해야 하는 필요성을 건너뛰는 기술도 추가했습니다. 그 결과, 이 시스템은 문서 이해 능력을 전혀 잃지 않으면서도 초당 4,752단어 이상을 처리할 수 있을 만큼 획기적으로 빨라졌습니다.

문제점: 느린 일렬 행렬

전통적인 문서 파서(parser)를 아주 많은 코스로 구성된 거대한 연회 음식을 먹으려는 한 사람으로 생각해 보십시오. 그 사람은 수프를 다 먹기 전에는 샐러드를 만질 수 없고, 샐러드를 다 먹기 전에는 메인 요리를 만질 수 없습니다. 설령 수프가 간단하더라도, 수프가 사라지기 전에는 샐러드를 시작할 수 없습니다. 컴퓨터 과학의 세계에서 이를 **자기회귀 생성(autoregressive generation)**이라고 부릅니다. 컴퓨터는 출력물(문서에서 읽어내는 텍스트)을 아주 작은 단위인 토큰(단어의 조각) 하나씩 생성합니다. 방금 쓴 것을 보고, 다음에 올 것을 결정한 뒤, 그것을 쓰고, 다시 반복하는 식입니다.

짧은 메모라면 이 방식도 괜찮습니다. 하지만 차트, 수학 방정식, 빽빽한 텍스트로 가득 찬 50페이지짜리 문서의 경우, 이 일렬 행렬 방식은 거대한 병목 현상을 만듭니다. 컴퓨터는 다음 단계를 밟기 위해 이전 단계가 끝나기를 기다리는 데 대부분의 시간을 소비합니다. 연구진은 긴 문서의 경우, 텍스트를 해독(decoding)하는 데 걸리는 시간이 단순히 페이지 이미지를 보는 데 걸리는 시간보다 거의 500배나 더 길다는 것을 발견했습니다. 이는 사과 하나를 고르는 데 단 1분을 쓰기 위해 마트에 가는 데만 5시간을 운전하는 것과 같습니다.

해결책: 슈퍼 리더들의 팀

HPD-Parsing의 저자들은 이 일렬 행렬의 줄을 끊기로 했습니다. 그들은 **계층적 병렬 디코딩(Hierarchical Parallel Decoding)**이라는 개념을 도입했습니다. 건설 현장에서 감독관(Layout Branch)이 비계 위에 서서 건물 전체를 내려다보고 있다고 상상해 보십시오. 감독관은 모든 벽돌을 직접 쌓지 않습니다. 대신, 그는 벽의 각 구역을 가리키며 이렇게 말합니다. "당신은 주방을 만드세요! 당신은 침실을 만드세요! 당신은 욕실을 만드세요!"

이 새로운 시스템에서는 다음과 같이 작동합니다:

  1. 관리자 (Layout Branch): 이 AI 부분은 먼저 문서 이미지 전체를 봅니다. 그리고 구조를 파악합니다: "여기는 제목, 여기는 문단, 여기는 표, 그리고 여기는 수학 공식이다." 즉, 문서의 지도를 만듭니다.
  2. 일꾼 (Content Branches): 관리자가 섹션을 식별하자마자, 해당 섹션만을 읽기 위한 독립적인 "일꾼" AI를 새로 생성합니다. 결정적으로, 이 일꾼들은 할당된 섹션들을 동시에 읽기 시작합니다. 주방이 완성될 때까지 침실 만들기를 기다리지 않습니다.
  3. 공유 메모리: 시간을 절약하기 위해, 이 모든 일꾼은 원본 이미지와 관리자의 지도에 대한 동일한 "기억"을 공유합니다. 그들은 전체 그림을 다시 읽을 필요 없이, 자신의 특정 작업에만 집중하면 됩니다.

비밀 병기: 미래를 예측하기

일꾼 팀이 있더라도, 여전히 한 번에 한 단어씩 읽는 것은 다소 느립니다. 그래서 연구진은 **점진적 다중 토큰 예측(Progressive Multi-Token Prediction, P-MTP)**이라는 두 번째 속도 층을 추가했습니다.

당신이 "고양이가 ... 위에 앉아 있다"라는 문장을 읽고 있다고 상상해 보십시오.
일반적인 독자는 "... 위에"를 읽은 후 멈춰서 다음에 올 말을 깊이 생각합니다. 그들은 "매트"라고 추측할 수도 있습니다. 그러고 나서 다시 멈춰서 다음 단어를 생각합니다.
P-MTP 시스템은 "고양이가 ... 위에"를 보고 한 번에 다음 세 단어를 확신하며 예측하는 독자와 같습니다: "매트, 그리고, 잠들었다." 그런 다음 그 추측이 맞는지 확인합니다. 만약 맞다면, 한 번에 모두 써 내려갑니다. 만약 틀렸다면, 스스로 수정하고 다시 시도합니다.

HPD-Parsing 시스템에서는 모든 일꾼(그리고 관리자)이 이 기술을 사용합니다. 한 번에 한 걸음씩 가는 대신, 여러 단어를 앞질러 예측하며 큰 걸음을 내딛습니다. 논문에 따르면, 이 방식 덕분에 시스템은 평균적으로 한 단계에서 단 하나의 토큰이 아니라 약 6.6개의 단어를 수용할 수 있다고 합니다.

결과: 빠르고 정확하게

연구진은 복잡한 레이아웃, 수학, 표를 포함한 온갖 까다로운 문서들이 담긴 OmniDocBench V1.6이라는 표준 벤치마크를 통해 이 새로운 시스템을 테스트했습니다.

  • 속도: 새로운 HPD-Parsing 시스템은 초당 4,752개의 토큰을 달성했습니다. 이는 기존의 "하나씩 읽는" 방식보다 3.06배 더 빠르며, 현재 사용 가능한 가장 빠른 기존 문서 파서보다도 2.62배 더 빠릅니다.
  • 정확도: 이토록 빠름에도 불구하고, 시스템은 결코 허술해지지 않았습니다. 시스템은 94.91이라는 경쟁력 있는 정확도 점수를 유지했는데, 이는 훨씬 더 크고 느린 다른 강력한 모델들보다도 높은 수치입니다.
  • 오류 처리: 연구팀은 이 방식이 더 견고하다는 것을 보여주었습니다. 전통적인 시스템은 초기에 실수를 하면, 이후 문서 전체에서 같은 실수를 반복하며 혼란에 빠지는 경우가 많습니다. 반면, HPD-Parsing은 작업을 독립적인 브랜치로 나누기 때문에, 한 섹션(예: 표)에서의 실수는 그 섹션 안에 머물며 나머지 문서 전체를 망치지 않습니다.

이것이 중요한 이유

이 논문은 우리가 속도와 정확도 사이에서 하나를 선택할 필요가 없다는 것을 시사합니다. 문서에는 자연스러운 구조, 즉 하나의 뇌(관리자)가 관리할 수 있는 전역 레이아웃과 여러 개의 뇌(일꾼)가 협력하여 읽을 수 있는 지역적 콘텐츠가 있다는 점을 깨달음으로써, 우리는 정보를 훨씬 더 효율적으로 처리할 수 있습니다.

연구진은 단순히 더 빠른 컴퓨터를 만든 것이 아닙니다. 그들은 컴퓨터가 문서를 읽는 방식 자체를 바꾸었습니다. 외로운 느린 보행자 대신, 조율된 스프린터 팀을 구축한 것입니다. 이 접근 방식은 대규모 문서 라이브러리를 실시간으로 처리할 수 있는 문을 열어주며, 이전에는 불가능했던 규모로 AI가 정보 추출, 연구 및 데이터 검색을 돕는 것을 가능하게 한다고 그들은 주장합니다. 논문은 결론적으로 이러한 "계층적 병렬" 스타일이 문서 파싱의 미래를 향한 강력하고 새로운 방향임을 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →