ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios
이 논문은 텍스트뿐만 아니라 시각적 요소를 포함한 복잡한 문서에서 정보 검색 및 생성의 정확성을 평가하기 위해 10 개 도메인의 2 만 6 천 페이지 분량과 3,099 개의 다국어 질의로 구성된 대규모 멀티모달 RAG 벤치마크인 'ViDoRe v3'를 제안하고, 이를 통해 최신 모델들의 성능과 한계를 분석했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
비도어 V3 (ViDoRe V3): 복잡한 문서 속 답을 찾는 '초능력의 검색기' 평가 보고서
이 논문은 인공지능 (AI) 이 방대한 문서 속에서 정답을 찾아내는 능력, 즉 '검색 증강 생성 (RAG)' 기술을 얼마나 잘 수행하는지 평가하는 새로운 기준을 소개합니다. 마치 도서관에서 책 한 권을 찾는 것을 넘어, 복잡한 도면, 표, 차트가 섞인 두꺼운 기술 매뉴얼을 읽으며 정확한 답을 찾아야 하는 상황을 상상해 보세요.
이 연구는 기존 테스트들이 너무 단순해서 현실을 제대로 반영하지 못한다는 문제점을 지적하고, ViDoRe V3라는 새로운 '시험지'를 만들었습니다.
1. 왜 새로운 시험지가 필요했을까요? (기존의 문제점)
기존의 AI 테스트는 마치 **"단순한 퀴즈"**처럼 설계되어 있었습니다.
- 과거의 방식: "사과가 몇 개 있나요?"라고 물으면, AI 는 텍스트만 보고 숫자를 세면 됩니다.
- 현실의 문제: 하지만 실제 업무에서는 **"S-3 항공기의 연료 주입구가 어디에 있나요?"**라고 묻고, 그 답이 **복잡한 도면 (Infographic)**이나 표 (Table) 속에 숨겨져 있는 경우가 많습니다.
- AI 는 텍스트만 읽는다면 도면 속의 작은 화살표나 표의 행을 놓쳐버립니다.
- 또한, 여러 장의 문서를 넘겨가며 정보를 조합해야 하는 복잡한 질문에는 약합니다.
- 더 중요한 건, AI 가 "이건 이 페이지의 3 번째 줄에 있어요"라고 **정확한 위치 (사각형으로 표시)**를 알려주지 못하면, 사용자는 그 답을 믿기 어렵습니다.
비유하자면:
기존 테스트는 문자만 적힌 시험지를 주고 답을 맞히는 것이었다면, ViDoRe V3 는 그림, 표, 도면이 섞인 복잡한 기술 매뉴얼을 주고, "여기서 답을 찾아서 페이지 번호와 정확한 위치까지 알려줘"라고 요구하는 실전 훈련과 같습니다.
2. ViDoRe V3 는 무엇인가요? (새로운 기준)
이 연구팀은 10 가지 다른 분야 (금융, 의료, 항공, 물리 등) 의 26,000 페이지에 달하는 실제 문서들을 모았습니다. 그리고 인간 전문가들이 12,000 시간 동안 이 문서들을 분석하며 다음과 같은 데이터를 만들었습니다.
- 3,099 개의 질문: "연료 탱크의 압력 게이지는 어디에 있나요?" 같은 실제 업무 질문들.
- 6 개 언어 지원: 영어, 프랑스어, 스페인어 등 다양한 언어로 질문을 던져 AI 가 언어 장벽을 넘을 수 있는지 봅니다.
- 정답과 위치 표시: 정답뿐만 아니라, 그 답이 문서의 어떤 그림이나 표에 있는지를 사각형 (Bounding Box) 으로 정확히 표시했습니다.
창의적인 비유:
이것은 AI 에게 **"보물 지도"**를 주는 것과 같습니다.
- 기존 테스트: "보물이 어디에 있나요?"라고만 물었습니다.
- ViDoRe V3: "보물은 이 지도의 3 번째 페이지, 오른쪽 상단 구석에 있는 빨간색 표 안에 있어요"라고 정확히 알려주면서, AI 가 그 지도를 제대로 읽었는지, 그리고 그 위치를 정확히 짚어냈는지 확인합니다.
3. 실험 결과: AI 는 얼마나 잘할까요?
연구팀은 최신 AI 모델들을 이 새로운 시험지에 풀어보았습니다. 결과는 흥미롭습니다.
✅ 잘하는 점 (성공 사례)
- 눈이 있는 AI 가 더 잘합니다: 텍스트만 읽는 AI 보다, 문서 이미지 (그림, 표 포함) 를 직접 보는 AI가 훨씬 더 좋은 성적을 냈습니다.
- 비유: 텍스트만 읽는 AI 는 '소문'으로만 정보를 듣고, 그림을 보는 AI 는 '직접 눈으로 확인'한 정보를 얻는 것과 같습니다.
- 혼합 전략이 최고입니다: 텍스트 검색과 이미지 검색을 동시에 사용하는 '하이브리드' 방식이 가장 강력한 성능을 발휘했습니다.
❌ 아직 부족한 점 (과제)
- 복잡한 추론은 힘들어: "A 와 B 를 비교해서 C 의 원인을 찾아라" 같은 여러 단계를 거쳐 추론해야 하는 질문에서는 AI 가 여전히 헷갈려 합니다.
- 위치 찾기는 아직 서툴러: 정답은 찾아내도, **"정답이 도면의 어느 부분에 있는지"**를 정확히 사각형으로 표시하는 능력 (Visual Grounding) 은 인간 전문가에 비해 훨씬 떨어집니다.
- 비유: AI 는 "보물이 이 책장에 있어요"라고 맞췄지만, "정확히 이 책의 3 번째 페이지, 2 번째 줄에 있어요"라고 말하지 못해 사용자를 당황하게 합니다.
- 언어 장벽: 영어와 프랑스어 사이를 오가는 질문에서는 성능이 떨어졌습니다.
4. 이 연구의 의미와 미래
ViDoRe V3 는 AI 개발자들에게 **"우리가 아직 갈 길이 멀다"**는 것을 명확히 보여줍니다.
- 현실적인 평가: 이제 AI 는 단순히 텍스트만 읽는 것이 아니라, 복잡한 도면과 표를 이해하고, 정확한 위치를 찾아낼 수 있어야 진정한 '전문가'가 될 수 있습니다.
- 열린 기회: 이 데이터는 공개되어 있어, 전 세계 개발자들이 이 '어려운 시험'을 풀어서 더 똑똑한 AI 를 만들 수 있도록 돕습니다.
마무리 비유:
ViDoRe V3 는 AI 에게 **"초등학교 수준의 독해 시험"**을 치르는 것을 멈추고, **"실제 현장의 기술자처럼 복잡한 도면을 보고 문제를 해결하는 시험"**을 치르게 한 것입니다. 아직 AI 는 초보 기술자 수준이지만, 이 새로운 기준을 통해 우리는 더 안전하고 정확한 AI 를 만들 수 있는 길을 열었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.