← 최신 논문
💬 NLP

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

이 논문은 시각적으로 풍부한 문서의 복잡한 구조를 고려하여 검색 및 생성 단계에서 질의 적응형 메커니즘을 도입함으로써 기존 최첨단 방법보다 검색 관련성과 답변 품질을 향상시키는 'MARA' 프레임워크를 제안합니다.

원저자: Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 기존 AI 의 문제: "눈이 멀고, 고집이 세다"

지금까지의 AI 는 문서를 찾을 때 두 가지 큰 실수를 저질렀어요.

  1. 눈이 멀다 (Query-Agnostic Encoding):

    • 상황: 사용자가 "2018 년 1 분기에 미국 고용주가 채용을 계획한 비율은?"이라고 물었을 때, 기존 AI 는 문서 전체를 똑같은 무게로 봅니다.
    • 비유: 도서관에서 책을 찾을 때, 책 제목, 목차, 본문, 그림, 표를 모두 똑같이 중요하게 여기는 상황이에요. 중요한 '정답이 적힌 표'와 '아무런 정보도 없는 장식 그림'을 구별하지 못해서, 정답이 숨겨진 곳을 놓치거나 불필요한 정보에 집중해버립니다.
  2. 고집이 세다 (Static Input Selection):

    • 상황: AI 는 미리 정해진 숫자 (예: 상위 3 개 문서) 만큼만 읽으라고 정해져 있습니다.
    • 비유: 요리사가 레시피를 찾을 때, 무조건 3 권의 책만 펼쳐서 읽는 거예요.
      • 만약 정답이 4 권에 있다면? 정답을 못 찾습니다. (부족함)
      • 만약 정답이 1 권에 있는데, 3 권을 다 읽으라고 하면? 불필요한 정보에 혼란을 겪습니다. (과부하)
    • AI 는 "아직 정보가 부족해, 더 찾아봐야겠다"라고 스스로 판단해서 책을 더 꺼내거나, "이제 충분해, 답을 써보자"라고 멈추는 능력이 없었습니다.

✨ MARA 의 해결책: "스마트한 비서"

이제 MARA 는 두 가지 똑똑한 비서를 고용해서 이 문제를 해결합니다.

1. "질문과 눈이 맞는" 검색 전문가 (Query-Aligned Region Encoder)

  • 역할: 문서를 읽기 전에, 사용자의 질문 내용을 먼저 보고 문서의 어떤 부분이 중요한지 미리 판단합니다.
  • 비유:
    • 기존 AI 는 문서 전체를 회색으로 칠한 사진처럼 보다가 읽습니다.
    • MARA 는 질문을 듣고 **"아, 이 질문에는 '표'와 '숫자'가 중요하구나!"**라고 생각하며, 문서 속의 중요한 부분만 형광펜으로 칠해줍니다.
    • 그래서 문서의 전체적인 구조 (큰 그림) 와 세부적인 숫자 (작은 그림) 를 모두 잘 구분해서, 정답이 숨어 있는 곳을 정확히 찾아냅니다.

2. "스스로 판단하는" 정보 관리자 (Self-Reflective Evidence Controller)

  • 역할: 찾은 정보를 바탕으로 답을 작성할 때, **"이제 정보가 충분한가?"**를 스스로 물어봅니다.
  • 비유:
    • 기존 AI 는 **정해진 시간 (상위 3 개 문서)**이 지나면 무조건 답을 내야 합니다. 정보가 부족해도, 정보가 너무 많아도 상관없습니다.
    • MARA 는 스스로에게 질문합니다.
      • "지금까지 본 정보로 답을 낼 수 있을까?" → 아니면? → "그럼 다음 책 (문서) 을 더 꺼내서 보자!" (적응형 확장)
      • "이제 충분해!" → 그럼? → "지금 바로 답을 써보자!" (조기 종료)
    • 마치 현명한 비서가 "주인님, 이 정도면 충분합니다. 더 이상 불필요한 서류는 안 가져오겠습니다"라고 말하며, 필요한 만큼만 정보를 모아서 정리해 주는 것과 같습니다.

🚀 결과: 왜 MARA 가 더 좋은가?

실험 결과, MARA 는 다음과 같은 장점을 보였습니다.

  • 더 정확한 답: 중요한 정보를 놓치지 않고, 불필요한 정보에 방해받지 않아 정답률이 훨씬 높습니다.
  • 더 빠르고 효율적: 불필요하게 많은 문서를 다 읽지 않아도 되므로, 시간이 덜 걸립니다. (예: 10 권을 다 읽는 대신, 필요한 3~4 권만 딱 읽어서 정답을 냅니다.)
  • 유연함: 질문이 복잡하면 더 많은 정보를 찾고, 간단하면 빨리 끝내는 등 상황에 맞춰 스스로 조절합니다.

📝 한 줄 요약

MARA는 문서를 읽을 때 "질문에 맞춰 중요한 부분을 찾아내고 (검색 전문가)", "정보의 양을 스스로 판단해서 적당히 모으는 (스마트 비서)" 능력을 갖춘, 훨씬 똑똑하고 효율적인 인공지능 프레임워크입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →