← 최신 논문
🤖 AI

LongDocBench: Benchmarking TOC Hierarchy and Contextual Relationship Recovery in Long Documents

이 논문은 문서 수준의 구조를 평가하는 데 있어 기존 벤치마크의 한계를 해결하기 위해 목차 계층 구조와 문맥적 관계 복구를 위해 인간이 검증한 주석이 포함된 85개의 실제 장문 문서로 구성된 새로운 벤치마크인 LongDocBench를 소개하며, 이러한 구조를 복구하는 것이 다운스트림 장문 질의응답 성능을 유의미하게 향상시킨다는 점을 입증한다.

원저자: Yuefeng Zou, Yichen Lu, Jingxiao Yang, Bingtao Fu, Gaoyang Zhang, Xiongfei Bai, Tian Chen, Xiang Qi

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuefeng Zou, Yichen Lu, Jingxiao Yang, Bingtao Fu, Gaoyang Zhang, Xiongfei Bai, Tian Chen, Xiang Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 도서관을 한 번에 단 하나의 책장만 보면서 이해하려고 노력하는 모습을 상상해 보십시오. 당신은 그 단일한 책장에 있는 모든 단어를 읽고, 제목을 식별하며, 바로 앞에 있는 책들의 배치를 파악할 수 있을 것입니다. 하지만 만약 세 개의 서로 다른 섹션에 걸쳐 있는 특정 논거를 찾아야 하거나, 50페이지에 있는 차트가 200페이지의 각주와 어떻게 연결되는지 추적해야 한다면, 고립된 책장만을 보는 것은 길을 잃게 만듭니다. 이것이 현재 문서 지능(document intelligence) 분야가 직면한 과제입니다. 컴퓨터에게 보고서, 교과서, 학술 논문과 같은 시각적 문서를 읽고 이해하도록 가르치는 작업 말입니다. 수년 동안 연구자들은 개별 페이지에 있는 텍스트, 공식, 표를 높은 정확도로 인식하도록 기계를 가르치는 데 집중해 왔습니다. 그들은 이러한 국소적인 작업에는 매우 능숙해졌습니다. 그러나 실제 세계의 문서는 단순히 고립된 페이지들의 집합이 아닙니다. 그것들은 헤딩(heading)의 깊은 계층 구조와 그림 및 그 설명 사이의 연결을 통해 수백 페이지에 걸쳐 정보가 엮여 있는 복잡한 구조체입니다.

한 새로운 연구는 컴퓨터가 이러한 길고 연결된 문서를 진정으로 이해할 수 있는지 테스트하는 방법을 소개합니다. 연구진은 금융 보고서, 교과서, 학술 논문을 포함하여 85개의 실제 문서를 모은 벤치마크인 'LongDocBench'를 구축했습니다. 이 문서들은 총 2,500페이지가 넘는 분량이며, 개별 보고서 중 일부는 100페이지가 넘기도 합니다. 연구팀은 단순히 이 파일들을 수집한 것이 아니라, 각 문서에 대한 '골드 스탠다드(gold standard)' 지도를 정성스럽적으로 만들었습니다. 인간 전문가들이 전체 구조를 수동으로 추적하여, 모든 헤딩과 그것이 전체 책을 관통하는 목차처럼 어떻게 부모-자식 계층 구조에 속하는지를 식별했습니다. 또한 그들은 차트나 이미지가 캡션, 주석, 또는 멀리 떨어진 다른 페이지에 있는 출처와 어떻게 연결되는지를 기록하며 수천 개의 구체적인 관계를 매핑했습니다. 이러한 세심한 인간의 작업은 현재의 컴퓨터 시스템이 동일한 작업을 수행할 수 있는지 확인하기 위한 기준점을 만들어냈습니다.

연구진이 현존하는 최고의 문서 파서(parser)들을 이 인간이 만든 지도와 대조하여 테스트했을 때, 결과는 상당한 격차를 드러냈습니다. 컴퓨터는 페이지 수준에서는 매우 뛰어난 성능을 보였으며, 텍st와 국소적 레이아웃을 높은 정확도로 올바르게 식별했습니다. 그러나 전체 문서 구조를 재구성하라는 요청을 받았을 때, 그들은 어려움을 겪었습니다. 시스템은 헤딩의 깊은 계층 구조를 올바르게 구성하는 데 실패했으며, 종종 복잡한 챕터와 하위 챕터의 트리를 평면적인 리스트로 붕괴시켰습니다. 마찬가지로, 그림을 멀리 떨어진 노트나 출처와 연결하는 데 어려움을 겪었으며, 데이터에 맥락을 부여하는 유형화된 링크들을 놓쳤습니다. 가장 진보된 모델조차도 올바른 구조적 관계의 약 절반만을 복구해 냈는데, 이는 단일 페이지 작업에서의 완벽에 가까운 성능과는 극명한 대조를 이룹니다. 이는 페이지를 읽을 수 있는 능력이 자동으로 기계가 문서 전체를 이해할 수 있음을 의미하지는 않는다는 것을 시사합니다.

이 연구는 이러한 구조적 이해가 왜 중요한지도 탐구했습니다. 연구진은 인간이 검증한 지도를 사용하여 문서에 관한 질문에 답하는 과정을 실험했고, 이를 구조적 지도가 없는 시스템의 결과와 비교했습니다. 시스템이 올바른 인간 검증 계층 구조와 관계를 사용할 때, 질문 답변 능력은 극적으로 향상되었습니다. 이는 단순한 작은 개선이 아니었습니다. 정확도가 크게 뛰어올랐으며, 이는 문서가 어떻게 조직되어 있는지 아는 것이 컴퓨터가 복잡한 질의를 추론하는 데 도움이 된다는 것을 보여주었습니다. 그러나 시스템이 스스로 복구한 구조에 의존했을 때는 그 개선 폭이 훨씬 작았습니다. 지도를 구축하려는 컴퓨터 자신의 시도는 정보를 활용할 수 있는 잠재력을 끌어내기에 충분히 정확하지 않았습니다.

궁극적으로, 이 작업은 문서 지능의 다음 프런티어가 단순히 단어를 읽는 것이 아니라 정보의 아키텍처를 이해하는 것임을 강조합니다. 연구진은 자신들의 벤치마크와 인간이 검증한 지도를 공개하여 미래 발전을 위한 명확한 목표를 제시했습니다. 그들은 기계가 나무를 보는 데는 탁월하지만, 여전히 숲을 보는 법을 배워야 한다는 것을 보여주었습니다. 컴퓨터가 인간이 당연하게 여기는 깊은 계층 구조와 페이지 간의 연결을 신뢰성 있게 재구성할 수 있을 때까지, 길고 복잡한 문서를 진정으로 이해하는 능력은 제한적일 것입니다. 앞으로 나아갈 길은 단순한 페이지 인식을 넘어, 우리가 현실 세계에서 지식을 조직하고 검색하는 방식을 정의하는 복잡한 다중 페이지 관계를 숙달하는 것으로 나아가야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →