DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis
본 논문은 다중 페이지 문서를 청크 단위로 처리함으로써 장거리 의존성과 이질적인 레이아웃을 효과적으로 포착하고 문서 구조 분석 벤치마크에서 최첨단 성능을 달행하는, 트리 가이드 방식의 자기 회귀 프레임워크인 DOSA를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 바닥 위에 흩어져 있는, 낱장으로 인쇄된 수많은 권수의 백과사전을 이해하려고 노력하고 있다고 상상해 보십시오. 어떤 페이지에는 그림이 있고, 어떤 페이지에는 목록이 있으며, 어떤 페이지에는 크고 굵은 제목이 있습니다. 이 혼란을 파악하기 위해서 당신은 단순히 글자를 읽는 것이 아니라, 이 조각들이 어떻게 서로 맞물리는지를 파악해야 합니다. 저 그림은 위의 문단에 속한 부분인가? 저 목록은 제목의 자식 요소인가, 아니면 완전히 별개의 섹션인가? 이것이 바로 '시각적으로 풍부한 문서(visually-rich documents)'의 세계입니다. 여기서 정보는 단순한 텍스트의 흐름이 아니라, 모양, 위치, 스타일이 얽힌 복잡한 퍼즐입니다. 컴퓨터가 이러한 문서들(법률 계약서, 과학 논문, 또는 슬라이드 덱 등)을 진정으로 '읽기' 위해서는, '문서 구조 분석(Document Structure Analysis)'이라는 특정한 퍼즐을 풀어야 합니다. 컴퓨터는 문서의 구성 요소들을 위한 가족 계보와 같은 '의미론적 트리(semantic tree)'를 구축해야 하며, 이는 누가 누구의 부모인지, 그리고 누구를 어떤 순서로 읽어야 하는지를 보여줍니다. 이것이 없다면, 컴퓨터는 제목과 문단을 서로 관련 없는 타인으로 간과하여, 그들이 사실은 부모와 자식 관계라는 사실을 놓치게 될 것입니다.
여기에 긴 다중 페이지 문서를 위한 이 퍼즐을 풀기 위해 Glean Technologies의 연구진이 제안한 새로운 방법론인 DOSA(Document Structure Analyzer)가 등장했습니다. 1,000피스스로 이루어진 레고 성을 한꺼번에 만드는 것을 생각해 보십시오. 그것은 압도적인 일이며, 초기에 실수를 하면 전체가 무너질 수도 있습니다. 기존의 방식들은 문서 전체를 한꺼번에 보려고 시도했는데, 이는 성을 쌓는 동안 손에 성 전체를 들고 있으려는 것과 같아서 너무 무겁고 컴퓨터를 혼란스럽게 만듭니다. DOSA는 다른 접근 방식을 취합니다. 즉, 성을 한 번에 하나씩 작은 구역 단위로 구축합니다. 마치 다음 구역으로 넘어가기 전에 성의 방 하나를 먼저 조립하는 것처럼, 문서를 '청크(chunks)' 단위로 처리합니다. 하지만 여기서 영리한 반전이 있습니다. 새로운 방을 만들 때, DOSA는 단순히 손에 든 벽돌만 보는 것이 아니라, 이미 만들어 놓은 성의 '가장 오른쪽 가지(rightmost branch)'를 살펴봅니다. 이것은 가이드 역할을 하여, 이전의 방들이 새로운 방들과 어떤 부분이 관련이 있는지 컴퓨터에게 정확히 알려줍니다. 이 '트리 유도형(tree-guided)' 지도를 사용함으로써, DOSA는 문서의 엄청난 규모 속에서 길을 잃지 않습니다.
연구진은 이러한 단계별, 자기 유도형 방식이 놀라울 정도로 잘 작동한다는 것을 발견했습니다. 복잡한 다중 페이지 레이아웃으로 가득 찬 DocHieNet이라는 매우 까다로운 데이터셋을 포함하여 다섯 가지 데이터셋에 대해 DOSA를 테스트했을 때, DOSA는 기존의 최선책들을 능가하는 성능을 보였습니다. 이 도전적인 벤치마크에서, DOSA는 F1 스케일에서 최대 4포인트, 그리고 컴퓨터의 트리가 실제 트리와 얼마나 유사한지를 측정하는 TEDS 스케일에서는 거의 20포인트까지 정확도를 향상시켰습니다. 더욱 인상적인 것은, DOSA가 Gemini-2.5-Pro나 GPT-5.2와 같은 강력한 범용 AI 모델들보다 더 뛰어난 성과를 냈다는 점이며, 이는 문서 트리를 구축하는 이 특정 작업에 있어서는 거대한 AI에게 구조를 '추측'하게 하는 것보다 전문화되고 구조화된 접근 방식이 더 낫다는 것을 시사합니다. 논문은 DOSA가 시각적 단서(예: 페이지 상의 박스 위치), 텍스트 내용, 그리고 객체의 크기를 융합함으로써, 문서 전체를 한꺼번에 암기할 필요 없이도 문서의 논리를 높은 정밀도로 재구성할 수 있다고 제안합니다. 그러나 저자들은 이 방법이 견고하긴 하지만 완벽하지는 않다고 언급했습니다. 현재 이 방식은 트리 구조에 집중하고 있어 인용과 같은 더 복잡한 웹 형태의 연결은 아직 다루지 못하며, 초기에 실수를 하여 나중에 이를 바로잡을 수 없는 상황이 발생하면 여전히 휘청거릴 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.