Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
이 논문은 텍스트만 파싱하는 방식의 한계를 극복하기 위해 문서 스크린샷을 직접 추론하여 정확한 바운딩 박스 인용을 제공하고 필수적인 시각적 레이아웃 정보를 보존할 수 있도록 비전-언어 모델을 활용하는 검색기반 독립형 프레임워크인 증거 연쇄 (CoE) 를 Iterative Retrieval-Augmented Generation 에 도입하여 픽셀 수준의 시각적 귀속을 가능하게 한다고 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 미스터리를 해결하려는 형사가 되어 상상해 보세요. 과거에는 수백 페이지에 달하는 타자된 보고서를 일일이 읽어가며 단서를 찾아야 했습니다. 보고서에 "용의자는 파리에 있었다"라고 적혀 있다면, 그 내용을 믿을 수밖에 없었습니다. 하지만 그 보고서가 실제로는 지도, 기차 표 사진, 그리고 손으로 쓴 메모가 섞인 지저분한 전단지라면 어떨까요? 그 전단지의 글자만 타자로 옮긴다면 지도와 사진은 사라지고, 단서가 페이지의 어디에 숨어 있는지 전혀 알 수 없게 됩니다.
이것이 이 논문의 저자들이 **증거 연쇄 (Chain of Evidence, CoE)**라는 새로운 시스템으로 해결하려는 문제입니다.
문제: "흐릿한 복사본"
질문에 답하는 현재 AI 시스템 (검색 증강 생성, RAG) 은 보통 다음과 같이 작동합니다:
- 사용자가 질문을 합니다.
- AI 가 관련 문서를 찾습니다.
- 모든 그림, 차트, 정교한 레이아웃을 제거하여 모든 것을 일반 텍스트 (흐릿한 복사본과 같음) 로 변환합니다.
- 답변을 제시하며 "이것은 문서 A 에서 찾았습니다"라고 말합니다.
핵심 문제: 문서 A 가 그래프가 포함된 슬라이드 덱이거나 복잡한 표가 있는 PDF 라면, 이를 일반 텍스트로 변환하는 것은 논리를 파괴합니다. 마치 조리법을 이해하려 할 때 재료 목록만 읽고 섞는 방법을 보여주는 그림은 무시하는 것과 같습니다. 더 나아가 AI 가 "문서 A"라고 말할 때, 그 문서의 어떤 부분이 답을 담고 있는지 알려주지 않습니다. 특정 문장을 찾기 위해 50 페이지를 수동으로 스크롤해야 합니다. 이것이 바로 "검증 병목 현상"입니다.
해결책: "픽셀 단위 형사"
저자들은 문서를 단순 텍스트가 아닌 **이미지 (스크린샷)**로 취급함으로써 게임의 규칙을 바꾸는 **증거 연쇄 (CoE)**를 제안합니다.
CoE 를 생각할 때, 단순히 보고서를 읽는 것이 아니라 문서의 원본, 편집되지 않은 사진을 보는 형사로 상상해 보세요.
- 더 이상 제거하지 않음: 문서를 먼저 텍스트로 변환하지 않습니다. 스크린샷을 그대로 보며 모든 차트, 화살표, 레이아웃을 온전하게 유지합니다.
- "마법 하이라이터": 단순히 "문서 3 에 있습니다"라고 말하는 대신, CoE 는 답변이 존재하는 이미지 위의 정확한 지점을 정밀하게 상자 (바운딩 박스) 로 표시합니다. 차트의 특정 숫자나 단락의 특정 줄을 직접 가리킵니다.
- 연쇄: "이 영화의 감독은 누구이며, 그 감독은 어디에서 공부했는가?"와 같이 여러 단계가 필요한 복잡한 질문의 경우, CoE 는 시각적 연쇄를 구축합니다. "1 단계: 감독을 찾기 위해 문서 A 의 이 상자를 보세요. 2 단계: 학교를 찾기 위해 문서 B 의 이 상자를 보세요"라고 보여줍니다.
테스트 방법
이 방식이 작동함을 증명하기 위해 팀은 두 가지 새로운 "훈련장 (데이터셋)"을 구축했습니다:
- Wiki-CoE: 위키백과 페이지를 스크린샷으로 변환한 방대한 컬렉션입니다. 여러 페이지를 넘나드는 질문들을 다루며 AI 가 답변의 정확한 시각적 위치를 찾도록 가르쳤습니다.
- SlideVQA: 지저분한 레이아웃, 화살표, 복잡한 다이어그램이 포함된 프레젠테이션 슬라이드 컬렉션입니다. 텍스트 기반 시스템이 보통 실패하는 "하드 모드" 테스트입니다.
결과: 왜 중요한가
이 논문은 CoE 가 특히 일반 텍스트가 아닌 문서에 있어 게임 체인저임을 보여줍니다.
- "어디"에 더 똑똑함: 복잡한 슬라이드에서 텍스트에 의존하는 일반 AI 시스템은 종종 길을 잃습니다. 반면, 시각적 레이아웃을 보는 CoE 는 훨씬 더 자주 증거를 정확하게 식별했습니다.
- 신뢰할 수 있음: CoE 는 증거 주위에 상자를 그리기 때문에 답변을 즉시 검증할 수 있습니다. 추측할 필요가 없습니다. 화면에 있는 증거를 직접 볼 수 있습니다.
- 특정 검색 엔진이 필요 없음: CoE 는 문서를 찾는 어떤 검색 도구와도 작동합니다. 상위 5 개 결과 (이미지 형태) 를 가져와 논리를 파악할 뿐입니다.
결론
저자들은 AI 가 보고서, 슬라이드, 차트와 같은 복잡한 문서에서 진정으로 신뢰할 수 있으려면, 단순히 텍스트 버전 "읽는" 것이 아니라 문서를 "봐야" 한다고 주장합니다. **증거 연쇄 (Chain of Evidence)**는 AI 를 진실을 직접 가리킬 수 있는 시각적 형사로 변모시켜, 추론 과정을 투명하게 만들고 인간이 쉽게 확인할 수 있게 합니다.
간단히 말해: CoE 는 책에 대한 모호한 참고 자료 대신, 책을 건네주고 정확한 페이지를 열어 필요한 문장 주위에 원을 그어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.