VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
VLD-RAG는 페이지 보존 인덱싱, 하이브리드 검색 전략, 그리고 조정된 멀티 에이전트 워크플로를 활용하여 길고 시각적으로 풍부한 다중 페이지 문서 전반에 흩어져 있는 텍스트 및 시각적 증거를 합성함으로써 질문에 효과적으로 답하는 에이전틱 멀티모달 검색 증강 생성 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 100페이지에 달하는 거대한 미스터리를 풀려고 노력 중이라고 상상해 보세요. 하지만 단서들은 여기저기 흩어져 있습니다. 어떤 단서는 일반 텍스트로 적혀 있고, 어떤 것은 복잡한 차트 안에 숨겨져 있으며, 또 어떤 것은 다이어그램 속에 숨어 있고, 어떤 것은 페이지의 레이아웃 그 자체의 일부이기도 합니다. 이것이 바로 "시각적으로 풍부한 문서(visually-rich documents)"의 세계입니다. 생각해보면 우리가 현실에서 접하는 복잡하고, 화려하며, 정보가 밀집된 보고서, 매뉴얼, 슬라이드 데크 같은 것들이죠. 오랫동안, 이러한 문서를 읽으려는 컴퓨터들은 큰 문제에 직면해 있었습니다. 바로 모든 그림과 레이아웃을 제거하고 오직 글자만을 읽으려 했다는 점입니다. 이는 마치 만화책을 이해하기 위해 대사창만 읽고 그림은 무시하는 것과 같습니다. 그러면 맥락, 유머, 그리고 반전들을 놓치게 됩니다.
이를 해결하기 위해 과학자들은 검색 증강 생성(Retrieval-Augmented Generation, RAG)이라는 기술을 사용합니다. RAG를 단순히 책을 암기하는 것이 아니라, 당신의 질문에 답하기 전에 필요한 정확한 페이지를 찾아 나서는 매우 똑똑한 사서라고 생각해보세요. 하지만 이 "책"들이 이렇게 지저도하고 여러 페이지에 걸친 시각적 문서일 때, 일반적인 사서들은 길을 잃곤 합니다. 그들은 텍스트만 보았기 때문에 잘못된 페이지를 집어 들거나, 이미지를 "보는" 법을 몰라서 중요한 차트를 놓칠 수도 있습니다. 핵심적인 질문은 이것입니다. 어떻게 하면 텍ters의 수십 페이지에 걸쳐 흩어진 증거를 완벽하게 찾아내어 질문에 올바르게 답할 수 있는 시스템을 구축할 수 있을까요?
여기에 이 복잡하고 시각적인 긴 문서들을 위한 궁극의 탐정이 되도록 설계된 새로운 프레임워크, VLD-RAG가 등장합니다. 이 연구의 개발자들은 150페이지에 걸쳐 퍼져 있는 미스터리를 풀기 위해서는 단 하나의 기술에만 의존해서는 안 된다는 것을 깨달았습니다. 대신, 그들은 "에이전트형(agentic)" 시스템, 즉 협력하는 AI 전문가 팀을 구축했습니다. 세 명의 탐정 팀을 상상해 보세요. 한 명은 정확한 단어와 숫자를 스캔하는 **키워드 헌터(Keyword Hunter)**이고, 다른 한 명은 페이지의 전반적인 "분위기"와 레이아웃을 살피는 **비주얼 슬루스(Visual Sleuth)**이며, 세 번째는 그들의 작업을 검토하는 **비판적 검증가(Critical Verifier)**입니다.
이들이 어떻게 협력하는지 살펴보겠습니다. 먼저, 시스템은 질문을 계획으로 분해합니다. 단순히 "이익은 얼마인가?"라고 묻는 것이 아니라, "섹션 3에서 테이블을 찾고, 'Q4 결과'라는 제목의 차트를 찾은 뒤, 특정 달러 금액을 확인하라"고 묻습니다. 그다음, 키워드 헌터와 비주얼 슬루스가 동시에 문서를 찾아 나섭니다. 헌터는 적절한 단어가 포함된 페이지를 잡아내고, 슬루스는 단어가 다르더라도 정답을 포함하고 있을 법한 "모습"을 가진 페이지를 잡아냅니다.
마법은 그들이 서로의 기록을 비교할 때 일어납니다. 만약 헌터가 "12페이지가 좋아 보인다"라고 말하는데, 슬루스가 "12페이지는 전혀 아닌 것 같다"라고 말한다면, 시스템은 그냥 추측하지 않습니다. 시스템은 "일관성 체크(consistency check)"를 사용하여 무언가 잘못되었다는 것을 알아차립니다. 만약 증거가 약하거나 부족하다고 느껴지면, 비판적 검증가가 개입하여 "이봐, 뭔가를 놓쳤어! 질문을 다른 방식으로 다시 해보자"라고 말합니다. 이는 두 번째 검색을 유발하여, 적절한 페이지를 찾을 때까지 단서를 정교하게 다듬습니다. 마지막으로, 시스템은 텍tk, 차트 크롭 이미지, 페이지 번호 등의 증거를 모아 생성기(generator)에 전달하여, 모든 주장이 실제 문서에 의해 뒷받침되도록 최종 답변을 작성합니다.
연구진은 이 탐정 팀을 두 가지 거대한 도전 과제인 MMLongBench-Doc와 LongDocURL로 테스트했습니다. 이들은 수백 개의 문서와 수천 페이지의 내용, 복잡한 표, 까다로운 질문들을 포함하고 있는, 문서 읽기의 "올림픽"과도 같습니다. 결과는 인상적이었습니다. VLD-RAG는 이전 방식들보다 단순히 더 자주 정답 페이지를 찾는 것에 그치지 않고, 더 많은 정답 페이지를 찾아냈습니다. 평균 85.6 페이지의 문서를 다루는 LongDocURL 벤치마크에서, VLD-RAG는 상위 5개 결과 내에서(Recall@5) 정답 증거 페이지를 **81.16%**의 확률로 찾아내며 다른 모든 방법을 앞질렀습니다. 또한 가장 관련성이 높은 페이지를 다른 누구보다도 높게 순위 매겼는데, 이는 정답이 보통 리스트의 맨 위에 놓여 있었음을 의미합니다.
이 논문은 이러한 성공이 컴퓨터에게 "읽기"와 "보기" 중 하나를 선택하도록 강요하지 않았기 때문이라고 시사합니다. 시각적 레이아웃과 텍스트를 별개로 유지하면서도 함께 작동하게 함으로써, 풍부하고 다채로운 문서를 평면적인 텍스트로 단순화할 때 발생하는 실수들을 피할 수 있었습니다. 연구진은 이 접근 방식이 정보가 여러 페이지에 흩어져 있는 문서들에 특화되어 있다고 언급했지만, 이 발견은 복잡한 다중 페이지 미스터리의 경우, 전문화되고 검증하는 에이전트 팀이 단독으로 움직이는 "외로운 늑대"형 검색보다 훨씬 우월하다는 것을 강력하게 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.