← 최신 논문
💬 NLP

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG는 기업 문서를 방향 특화형 파싱 파이프라인을 통해 동적으로 라우팅하여 구조적 정보를 명시적으로 캡처하는 멀티모달 검색 증강 생성 프레임워크를 도입함으로써, 기존의 비전 중심 베이스라인보다 Q&A 정확도 측면에서 크게 뛰어난 성능을 보임과 동시에 FastRAGEval이라는 비용 효율적인 평가 지표를 제공한다.

원저자: Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 혼란스러운 도서관에서 일한다고 상상해 보세요. 이곳의 책들은 두 가지 아주 다른 형태를 가지고 있습니다. 키가 크고 좁은 보고서(재무제제표 같은 것)와 가로로 넓고 납작한 슬라이드 덱(파워포인트 발표 자료 같은 것)입니다.

오랫동안, 이 책들에 대해 질문에 답을 하려는 "로봇"(AI 시스템)들은 게으른 방식을 취해 왔습니다. 그들은 모든 페이지의 사진을 찍어서 로봇의 뇌에 집어넣으라는 명령을 받았습니다. 그들은 로봇이 사진을 보고 페이지의 구조를 "추측"하기를 바랐습니다.

문제점:
이 "사진 전용" 방식은 단순한 슬라이드에는 괜찮을지 모르지만, 복잡한 보고서에서는 처참하게 실패합니다. 이는 마치 상세한 설계도를 흐릿한 사진으로 찌푸려 보며 이해하려는 것과 같습니다. 로봇은 표 안의 구체적인 숫자, 텍스트의 흐름, 그리고 문단과 차트 사이의 관계를 놓치게 됩니다. 로봇은 세부 사항을 보는 대신 "전체적인 모습"을 보는 데만 급급하기 때문입니다.

해결책: MM-BizRAG
저자들은 MM-BizRAG라고 불리는 새로운 시스템을 구축했습니다. 이 시스템은 모든 종류의 문서를 똑같이 취급하는 대신, 각기 다른 종류의 책을 어떻게 다뤄야 하는지 정확히 아는 스마트한 사서처럼 행동합니다.

작동 방식은 다음과 같습니다 (쉬운 비유를 사용함):

1. "스마트 분류기" (문서 구조 인식 분할)

문서가 도착하면, 시스템은 먼저 묻습니다: "이것은 키가 큰 보고서인가, 아니면 가로로 넓은 슬라이드 덱인가?"

  • 보고서인 경우 (세로형): 시스템은 단순히 사진을 찍지 않습니다. 대신 문서를 조각조각 정교하게 자르고, 텍스트를 읽고, 표를 추출하며, 이미지를 묘사합니다. 마치 퍼즐 마스터가 조각들을 순서대로 맞추듯, 페이지의 모든 요소가 어디에 있었는지 추적합니다.
  • 슬라이드 덱인 경우 (가로형): 시스템은 슬라이드 위에서는 텍스트, 이미지, 차트가 하나의 이야기를 전달하기 위해 서로 섞여 있다는 점을 깨닫습니다. 그래서 슬라이드 전체를 하나의 단위로 취급하여, 전체 장면을 한꺼번에 묘사합니다.

2. "두 개의 배낭" 전략 (검색과 생성의 분리)

이것이 시스템의 핵심 비법입니다. 대부분의 다른 시스템은 답을 찾기 위해 모든 것을 하나의 배낭에 쑤셔 넣으려고 합니다. 하지만 MM-BizRAG는 두 개의 서로 다른 배낭을 사용합니다.

  • 배낭 A (검색용): 여기에는 단순화되고 텍스트 중심적인 요약과 설명이 들어 있습니다. 가볍고 빠르기 때문에 수천 권의 문서 중에서 적절한 것을 찾아내기에 용이합니다.
  • 배낭 B (답변용): 적절한 문서가 발견되면, 시스템은 실제 이미지와 표를 포함한 풍부한 원본 버전을 꺼내어 최종 답변을 위해 완벽하게 조립합니다.

이것이 중요한 이유: 이것은 저렴하고 빠른 지도를 사용하여 도시를 찾은 다음(배낭 A), 일단 목적지에 도착하면 고해상도 3D 모델을 사용하여 투어 가이드에게 최상의 경로를 안내하는 것(배낭 B)과 같습니다. 당신은 검색 엔진의 속도와 인간 전문가의 깊이를 모두 얻게 됩니다.

3. "원샷" 판사 (FastRAGEval)

그들의 시스템이 실제로 우수한지 테스트하기 위해, 답변을 채점할 방법이 필요했습니다. 기존의 채점 도구들은 답을 읽고, 문장 단위로 쪼개고, 각 문장을 확인한 뒤, 보고서를 작성해야 하는 선생님과 같았습니다. 이는 시간이 오래 걸리고 비용도 많이 들었습니다.

저자들은 FastRageval을 발명했습니다. 이는 전체 답변을 한눈에 읽고, 사실 관계를 확인하여, 단 한 번의 훑어봄만으로 성적을 매길 수 있는 초고속 선생님과 같습니다. 이는 기존 방식보다 두 배 더 빠르며 인간 채점자와도 더 잘 일치합니다.

결과

이 새로운 시스템을 "사진 전용" 로봇들과 비교 테스트했을 때:

  • 보고서의 경우: 압도적인 승리였습니다. 정확도가 최대 **32%**까지 향상되었습니다. 시스템은 드디어 다른 시스템들이 놓쳤던 복잡한 표와 차트를 이해해 냈습니다.
  • 슬라이드의 경우: 가장 뛰어난 사진 기반 시스템들과 대등한 성능을 보였습니다. 이는 슬라이드를 처리하기 위해 텍스트를 무시할 필요가 없음을 증명합니다.
  • 속도: 그들은 가장 복잡한 버전만큼 정확하면서도 약 두 배 더 빠르게 실행되는 "스위트 스팟(최적의 지점)" 설정을 찾아냈습니다.

요약하자면

이 논문은 우리가 단순히 AI가 사진을 보고 문서의 구조를 "추측"하도록 의존해서는 안 된다고 주장합니다. 대신, 문서의 모양에 따라 적극적으로 **파싱(분석 및 분해)**하고, 빠른 방법으로 정보를 찾은 다음, 최종 답변을 작성할 때만 풍부한 세부 사항을 조립해야 합니다. 이 접근 방식은 특히 기업들이 매일 사용하는 복잡한 문서들에 대해 AI를 훨씬 더 똑똑하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →