← 최신 논문
💬 NLP

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

MARDoc은 컨텍스트 노이즈를 줄이고 멀티홉 추론을 강화하기 위해 동적으로 업데이트되는 구조화된 메모리를 활용하는 전문화된 탐색(Explorer), 정제(Refiner), 반사(Reflector) 에이전트로 프로세스를 분리함으로써 멀티모달 긴 문서 질의응답을 개선하는 메모리 인지 정제 에이전트 프레임워크입니다.

원저자: Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 텍스트, 차트, 사진, 표 속에 단서가 흩어져 있는 거대한 100페이지 분량의 미스터리 소설을 풀려고 한다고 상상해 보십시오. 당신에게는 특정 질문에 대한 답을 찾기 위해 노력하는 탐정 팀(AI)이 있습니다.

과거의 방식: "모놀리식(Monolithic)" 탐정
대부분의 기존 시스템에서 탐정은 아무것도 버리지 않는 사람처럼 행동합니다. 페이지를 볼 때마다 그들은 페이지 번호, 본 것, 그리고 자신의 생각을 하나의 거대한 공책에 기록합니다.

  • 문제점: 20번의 탐색을 거치고 나면, 이 공책은 엄청나게 커집니다. 그 안에는 실제 단서뿐만 아니라 막다른 길, 무관한 문장, 그리고 "노이즈(소음)"도 가득합니다. 탐정은 압도당하게 됩니다. 중요한 단서들이 쓰레기 더미 아래에 파묻혀, 점들을 연결하기가 어려워집니다. 이것을 "컨텍스트 희석(context dilution)" 문제라고 부릅니다.

새로운 방식: MARDoc ("메모리 인지형" 팀)
이 논문은 단순히 거대한 공책을 들고 다니는 것이 아니라, 동적이고 체계적인 파일링 시스템(구조화된 메모리)을 사용하여 함께 협력하는 세 명의 전문화된 탐정 팀을 사용하는 더 똑똑한 시스템인 MARDoc을 소개합니다.

이 팀이 어떻게 작동하는지 창의적인 비유를 통해 설명하겠습니다.

1. 탐험가 (정찰병)

  • 역할: 이 탐정은 문서를 돌아다니며 단서를 찾습니다. 그들은 단순히 읽는 것이 아니라, 특정 페이지로 점프하거나, 차트를 확대하거나, 키워드를 검색하는 특수 도구를 사용합니다.
  • 행동: 그들은 가공되지 않은 정보를 수집하여 팀으로 가져옵니다.
  • 비유: 이들을 숲을 뛰어다니며 나뭇잎, 돌, 나뭇가지를 주워 모아 한데 쌓아두는 정찰병이라고 생각하십시오.

2. 정제자 (사서)

  • 역할: 이 부분이 가장 중요한 새로운 부분입니다. 정찰병이 지저식한 "가공되지 않은" 증거 더미를 가져오면, 사서는 즉시 이를 분류합니다.
  • 행동: 그들은 노이즈(무관한 나뭇잎)를 버리고, 좋은 것들을 두 가지 깔끔한 카테고리로 정리합니다:
    1. 증거 메모: 확고한 사실들 (예: "27페이지의 차트는 26%라고 말한다").
    2. 추론 메모: 사실들을 연결하는 논리적 단계 (예: "차트가 X라고 말하고 텍스트가 Y라고 말하므로, 우리는 Z를 계산할 수 있다").
  • 비유: 과거의 더미 전체를 보관하는 대신, 사서는 깔끔하고 간결한 요약 카드를 만듭니다. 그들은 예전의 더미를 버리고 이 새로운, 완벽한 카드로 대체합니다. 이는 팀의 "두뇌"를 작고 집중된 상태로 유지하여, 그들이 과거의 정보 속에서 길을 잃는 것을 방지합니다.

3. 반사자 (감독관)

  • 역할: 이 탐정은 사서의 요약 카드를 살펴보고 "우리가 미스터리를 풀기에 충분한가?"라고 묻습니다.
  • 행동:
    • 만약 그렇다면: 최종 답변을 작성합니다.
    • 만약 아니라면: 단순히 "다시 시도하라"고 말하는 데 그치지 않습니다. 그들은 정찰병에게 구체적인 지침을 내립니다. 예를 들어, "너는 설문 조사에 참여한 총 인원수를 놓쳤어. 가서 그 특정 표를 찾아와."라고 말합니다.
  • 비유: 감독관은 지도를 확인합니다. 만약 지도에 핵심적인 랜드마크가 빠져 있다면, 정찰병이 정처 없이 헤매지 않도록 정확히 어디로 가야 할지 알려줍니다.

이것이 왜 중요한가

이 논문은 복잡한 그림과 텍스트가 포함된 긴 문서들을 다루는 두 가지 어려운 벤치마크(MMLongBench-Doc 및 DocBench)에서 이 시스템을 테스트했습니다.

  • 결과: MARDoc은 이전 방식들보다 현저히 우수한 성능을 보였습니다. 심지어 더 작고 덜 강력한 AI 모델을 사용했음에도 불구하고, 훨씬 더 큰 모델을 사용하는 시스템들을 이겼습니다.
  • 이유: 매 단계마다 "메모리"를 지속적으로 정리하고 필수적인 사실과 논리만을 유지함으로써, 시스템이 자신의 기록(history) 때문에 혼란에 빠지는 것을 방지하기 때문입니다. 마치 깔끔한 사건 파일을 가진 탐정처럼, 시스템은 항상 날카롭고 집중된 상태를 유지합니다.

요약하자면: MARDoc은 매 단계마다 증거를 정리하고, 조직하고, 요약하는 데 전념하는 전담 팀원을 둠으로써 "너무 많은 쓰레기 때문에 중요한 것을 잊어버리는" 문제를 해결하며, 이를 통해 팀이 긴 문서 속에서 길을 잃지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →