← 최신 논문
💬 NLP

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG는 페이지 및 요소 노드를 반복적으로 활성화하고 가지치기함으로써 증거 범위와 노이즈 감소 사이의 균형을 맞추어 LongDocURL 및 MMLongBench-Doc에서 최첨단 성능을 달성하는 긴 문서 멀티모달 질의응답을 위한 다중 입도 적응형 그래프 프레임워크이다.

원저자: Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 해결해야 한다고 상상해 보십시오. 그런데 당신에게 주어진 것은 몇 개의 단서가 놓인 책상이 아니라, 텍스트, 차트, 사진, 그리고 복잡한 다이어그램으로 가득 찬 500페이지 분량의 거대한 백과사전입니다. 당신의 목표는 그 안에 숨겨진 특정 질문에 대한 답을 찾는 것입니다.

이것이 바로 **장문 멀티모달 질의응답(Long-Document Multimodal Question Answering)**의 과제입니다. 이 논문은 이 문제를 해결하기 위해 MAGE-RAG이라는 새로운 시스템을 소개합니다. 그 작동 원리를 쉽게 설명하면 다음과 같습니다.

문제점: "하나의 크기로 모두를 맞추려는(One-Size-Fits-All)" 실수

현재의 시스템들은 이 미스터리를 해결하기 위해 두 가지 결함이 있는 방식을 사용합니다.

  1. "텍스트 전용" 접근 방식: 이 방식은 단어들은 읽지만 그림이나 레이아웃은 버립니다. 이는 영화의 대본만 읽고 배우나 배경은 전혀 보지 않는 것과 같습니다. 차트나 다이어그램 속에 숨겨진 결정적인 단서를 놓칠 수 있습니다.
  2. "전체 페이지" 접근 방식: 이 방식은 책의 페이지 전체를 통째로 가져와 AI에게 보여줍니다. 하지만 만약 정답이 페이지 중간에 있는 아주 작은 문장 하나라면, AI는 주변의 불필요한 정보들(광고, 푸터 또는 관련 없는 이미지 등)에 압도당하게 됩니다. 이는 마치 로봇에게 건초더미 전체를 건네주며 그 안에서 바늘을 찾으라고 하는 것과 같습니다.

두 방법 모두 고정된 모드에 갇혀 있습니다. 즉, 질문이 얼마나 어렵거나 쉬운지에 상관없이 무조건 정해진 수의 페이지나 덩어리(chunk)를 가져옵니다.

해결책: MAGE-RAG (스마트한 탐정)

MAGE-RAG은 단순히 페이지를 긁어모으는 것이 아니라, 문서의 동적인 지도를 만드는 스마트하고 적응력 있는 탐정처럼 행동합니다.

1. 지도 (멀티그래뉼러 그래프 - Multigranular Graph)

탐정이 조사를 시작하기도 전에, MAGE-RAG은 문서 전체에 대한 특별한 "지도"를 구축합니다.

  • 페이지 노드 (Page Nodes): 이것은 큰 랜드마크입니다 (페이지 전체).
  • 요소 노드 (Element Nodes): 이것은 아주 세밀한 디테일입니다 (특정 단락, 표, 차트 또는 리스트).
  • 연결 (Connections): 지도는 이 항목들 사이의 선을 그려 어떻게 서로 연관되어 있는지 보여줍니다. 예를 들어, 특정 섹션 안에 차트가 있다거나, 표가 단락 옆에 있다는 것을 알고 있습니다.

이 지도를 통해 시스템은 필요에 따라 아주 작은 디테일로 줌인(zoom in)하거나, 페이지 전체를 보기 위해 줌아웃(zoom out)할 수 있습니다.

2. 조사 (쿼리 타임 컨트롤 - Query-Time Control)

질문을 던졌을 때, MAGE-RAG은 단순히 데이터를 AI에게 쏟아붓지 않습니다. 대신 엄격한 예산(시간과 메모리 사용 제한)을 가지고 "뜨겁다 차갑다(Hot and Cold)" 게임을 수행합니다.

  • 1단계: 진입점 (The Entry Point): 우선 몇 개의 유력한 페이지를 확보하며 시작합니다 (마치 탐정이 적절한 방으로 들어가는 것과 같습니다).
  • 2단계: 반복적인 추적 (The Iterative Hunt): 시스템에는 프로젝트 매니저 역할을 하는 "컨트롤러"가 있습니다. 이 컨트롤러는 다음과 같이 묻습니다.
    • "정보가 충분한가?"
    • "특정 차트를 열어서 자세히 들여다봐야 할까?" (노드 열기 - Open Node)
    • "이 페이지의 앞이나 뒤를 더 살펴봐야 할까?" (검색/확장 - Search/Expand)
    • "이 단락은 관련이 없는가? 무시하자." (가지치기 - Prune)
  • 3단계: 예산 (The Budget): 탐정에게는 규칙이 있습니다. "나는 5개의 페이지를 보고 10개의 디테일을 열어볼 수 있다." 만약 답이 간단하다면 일찍 멈춥니다. 만약 답이 복잡하고 책 곳곳에 흩어져 있다면, 더 깊이 파고들기 위해 전체 예산을 사용합니다.

3. 최종 보고서 (구조화된 렌더링 - Structured Rendering)

탐정이 적절한 단서들을 모았을 때, 그는 단순히 지저로 된 종이 뭉치를 건네주는 것이 아닙니다. 그는 증거를 깔끔하고 구조화된 보고서로 정리합니다. AI에게 특정 텍스트, 차트의 정확한 크롭 이미지, 그리고 관련 페이지 레이아웃을 보여주며 모든 노이즈를 제거합니다.

왜 더 나은가 (결과)

이 논문은 길고 복잡한 문서들로 구성된 두 가지 어려운 데이터셋(LongDocURL 및 MMLongBench-Doc)을 통해 이를 테스트했습니다.

  • 정확도: MAGE-RAG은 한 테스트에서 약 **52.75%**의 정확도를, 다른 테스트에서는 **53.26%**의 정확도를 달성하며, 고정된 페이지 수를 사용하거나 텍스트 전용 검색에 의존하는 기존 방식들을 앞질렀습니다.
  • 효율성: 이 시스템은 단순히 더 많이 읽어서 이긴 것이 아니라, 더 똑똑하게 읽어서 이겼습니다. MAGE-RAG은 다른 시스템들이 놓쳤던, 여러 페이지에 걸쳐 흩어져 있거나 복잡한 레이아웃 속에 숨겨진 답변들을 성공적으로 찾아냈습니다.
  • 투명성: 시스템이 모든 단계의 "흔적(trace, 실행 로그)"을 남기기 때문에, 우리는 시스템이 왜 성공했는지 혹은 왜 실패했는지 정확히 알 수 있습니다. 적절한 페이지를 놓쳤나요? 아니 단서를 너무 빨리 제거했나요? 이는 시스템을 디버깅하기 훨씬 쉽게 만듭니다.

핵심 요약

MAGE-RAG은 "몇 페이지를 가져와서 운에 맡기는" 방식에서 "지도를 만들고, 단서를 따라가며, 퍼즐을 풀기 위해 필요한 것만 AI에게 보여주는" 방식으로 게임의 판도를 바꿉니다. 이는 큰 그림(페이지)을 보는 능력과 세부 사항(특정 차트나 텍스트)을 보는 능력 사이의 균형을 맞추며, 시간과 자원의 엄격한 예산 범위 내에서 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →