← 최신 논문
💬 NLP

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

본 논문은 질문과 관련 있는 시각적 증거를 명시적으로 수집하고 로컬라이제이션(localization)과 추론의 공동 최적화를 개선하기 위한 새로운 RS-GRPO 알고리즘을 채택함으로써 다중 이미지 추론에서의 시각적 환각을 완화하는 증거 가이드 프레임워크인 EVisRAG를 제안하며, 이를 통해 시각적 질의응답 벤치마크에서 상당한 성능 향상을 달성한다.

원저자: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려고 노력 중이라고 상상해 보세요. 하지만 단 하나의 단서 대신, 세 종류의 서로 다른 신문, 사진, 지도가 뒤섞인 엉망진창인 더미를 받게 되었습니다. 당신의 주머니 속에는 글자를 읽고 그림을 볼 수 있는 아주 똑똑한 탐정, 즉 '시각-언어 모델(Vision-Language Model, VLM)'이라는 컴퓨터 프로그램이 있습니다. 이 탐정은 질문에 답하는 데는 뛰어나지만, 엄청난 양의 이미지에 직면하면 가끔 혼란을 겪기도 합니다. 예를 들어, 실제로는 개인데도 사진에 고양이가 있다고 주장하거나, 서로 다른 페이지의 사실을 뒤섞는 등 보지 못한 세부 사항을 지어내곤 합니다. 이것을 '시각적 환각(visual hallucination)'이라고 부릅니다.

이 탐정들을 돕기 위해, 과학자들은 '시각적 검색 증강 생성(Visual Retrieval-Augmented Generation, VRAG)'이라는 시스템을 개발했습니다. 이것은 탐정에게 도서 대출 카드를 주는 것과 같습니다. 질문을 던지면, 시스템은 도서관에서 가장 관련 있는 페이지들을 즉시 뽑아내어 탐정에게 건네줍니다. 핵심 아이디어는 탐정 앞에 적절한 증거가 놓여 있다면, 추측하거나 말을 지어낼 필요가 없다는 것입니다. 하지만 적절한 페이지가 주어져도, 탐정은 노이즈 속에서 자신이 필요로 하는 정확한 문장이나 그림을 찾는 데 어려움을 겪거나, 무관한 세부 사항에 주의를 빼앗겨 여전히 오답을 만들어내곤 합니다. 그렇다면 우리는 어떻게 탐정이 모든 페이지를 꼼꼼히 훑고, 실제로 본 사실만을 기록하며, 추측 없이 미스터리를 해결하도록 가르칠 수 있을까요?

이것이 바로 "VisRAG2.0"(구체적으로는 EVisRAG 프레임워크) 논문이 해결하고자 하는 문제입니다. 중국 대학 연구진들로 구성된 저자들은 이러한 AI 탐정들이 환각을 멈추고 실제 증거를 바탕으로 추론하도록 만드는 새로운 방법을 제안합니다. 그들은 기존 방식이 마치 탐정에게 종이 뭉치를 던져주며 "그냥 알아서 해결해 봐!"라고 말하는 것과 같아서 자주 혼란을 야기한다는 것을 발견했습니다. 대신, EVisRAG는 모델이 **관찰(Observe), 기록(Record), 추론(Reason)**이라는 엄격한 3단계 과정을 따르는 꼼etic한 탐정처럼 행동하도록 강제합니다.

첫째, 모델은 검색된 이미지들을 살펴보고, 페이지별로 무엇이 보이는지 명시적으로 진술합니다. 둘째, 모델은 각 이미지로부터 구체적인 사실을 적어 내려가는 '증거 로그(evidence log)'를 작성하며, 결정적으로 유용한 정보가 없는 이미지는 없다고 기록합니다. 마지막으로, 모델은 오직 그 작성된 로그만을 사용하여 문제를 해결합니다. 모델이 실제로 이 행동을 학습할 수 있도록, 연구진은 RS-GRPO(Reward-Scoped Group Relative Policy Optimization)라는 새로운 훈련 방법을 고안했습니다. 이것은 단순히 최종 답변에 대해서만 점수를 주는 것이 아니라, "올바른 그림을 보았는가?"에 대한 별도의 점수와 "사실을 정확하게 기록했는가?"에 대한 또 다른 점수를 주는 매우 엄격한 코치라고 생각하면 됩니다. 이는 모델이 운 좋게 정답을 맞혀서 좋은 점수를 받는 것을 방지하며, 먼저 증거를 찾는 법을 실제로 배우도록 보장합니다.

이 새로운 접근 방식의 결과는 상당히 인상적입니다. 차트, 문서, 슬라이드 등을 읽는 다양한 시각적 질의응답 벤치마크에서 테스트했을 때, EVisRAG 모델은 표준 "백본(backbone)" 모델들보다 평균 약 19% 더 높은 정확도를 일관되게 보여주었습니다. 더 중요한 점은, 모델이 사실을 지어내는 횟수를 현저히 줄였다는 것입니다. 한 가지 구체적인 테스트에서, 표준 모델은 차트를 보고 숫자를 잘못 읽어 엉뚱한 국가의 인구가 더 많다고 자신 있게 말할 수 있지만, EVisRAG는 차트를 보고 올바른 숫자를 증거 로그에 적은 뒤, 이를 통해 올바르게 추론해 냅니다.

또한 이 논문은 단순히 모델이 "더 오래 생각하게" 만들거나 시스템에 더 복잡한 에이전트를 추가하는 것이 최선의 해결책이라는 생각에 반론을 제기합니다. 대신, 그들은 구조화된 증거 기반 접근 방식과 특정 훈련 방법(RS-GRPO)을 결합하는 것이 더 효과적임을 보여줍니다. 그들은 보상의 범위를 제한함으로써(즉, 적절한 시점에 적절한 행동을 했을 때만 점수를 부여함으로써) 모델이 훨씬 더 안정적이고 신뢰할 수 있게 된다는 것을 입증했습니다. 이 논문이 AI의 모든 문제를 해결했다고 주장하는 것은 아니지만, 실험 결과는 이 방법이 시각적 AI 시스템을 더 신뢰할 수 있고, 정확하며, 여러 이미지를 볼 때 말을 지어내는 경향을 줄이는 데 있어 중요한 진전임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →