← 최신 논문
💻 computer science

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

이 논문은 이미지 섭동, 역전파 또는 외부 검증기를 필요로 하지 않으면서, 해석 가능한 증거 경로를 생성하기 위해 레이어별 시각적 기여도를 분석함으로써 폐쇄형 멀티모달 답변의 신뢰성을 크게 향상시키는 화이트박스 추론 시점 리스크 탐지 방법인 Witness Evidence Portfolios(WEP)를 소개한다.

원저자: Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사진에 대해 질문을 받는 매우 똑똑하고 자신감 넘치는 로봇을 고용했다고 상상해 보세요. 당신이 정원 사진을 보여주며 "여기에 당근이 있나요?"라고 묻습니다. 로봇은 즉시 99%의 확신을 가지고 "아니요!"라고 외칩니다. 하지만 만약 로봇이 실제로는 이미지 구석에 있는 '정원'이라는 단어나 무작위로 떠 있는 구름을 보고 그냥 추측하고 있는 것이라면 어떨까요? 이것이 바로 **멀티모달 거대 언语言 모델(MLLM)**의 까다로운 세계입니다. MLLM은 이미지를 "보고" 텍스트를 "읽으며", 이 둘을 결합하여 질문에 답하는 AI 시스템입니다. 문제는 단순히 정답을 맞히는 것이 아니라, AI가 언제 자신 있게 틀리는지를 아는 것입니다. 현실 세계에서 우리는 로봇의 답변을 신뢰할 수 있는지, 아니면 다시 확인해야 하는지 알아야 합니다. 이 논문은 다음과 같은 질문을 다룹니다. 로봇의 확신이 진짜인지, 아니면 그림의 엉뚱한 부분을 보고 운 좋게 맞춘 추측인지 어떻게 알 수 있을까?

여기서 Feixiang Liu와 동료들이 개발한, 이 AI 로봇들을 위한 탐정 역할을 수행하는 새로운 방법인 **증거 목격자 포트폴리오(Witness Evidence Portfolios, WEP)**가 등장합니다. AI의 두뇌를 모든 사고 과정의 흔적이 빵 부스러기처럼 남겨지는 거대한 도서관이라고 생각해 보세요. 보통 우리는 로봇이 내놓는 최종 답변만을 봅니다. 하지만 WEP는 로봇이 생각하는 그 짧은 순간 동안 남긴 "빵 부스러기"를 거슬러 올라가 확인합니다. WEP는 두 가지 간단한 질문을 던집습니다. 어디를 보고 증거를 찾았는가, 그리고 그 증거가 얼마나 밀도 있게 집중되어 있는가?

WEP가 어떻게 작동하는지 재미있는 비유를 통해 설명하겠습니다. 로봇이 "당근 사건"을 해결하려는 탐정이라고 상상해 보세요.

  1. 목격자 지도: 먼저, WEP는 "목격자"를 식별합니다. 질문이 당근에 관한 것이라면, 목격자는 실제로 당근처럼 보이는 이미지의 부분들입니다.
  2. 증거의 흔적: 로봇이 생각하는 동안, 로봇은 "서명된 증거(signed evidence)"를 수집합니다. 이것은 양수는 "이것이 답변을 뒷받합한다"를 의미하고 음수는 "이것은 답변에 반대한다"를 의미하는 점수판과 같습니다. WEP는 이미지의 정확히 어느 부분이 로봇의 최종적인 "아니요"라는 답변에 기여했는지 추적합니다.
  3. 두 가지 검사:
    • 출처 ( "어디" 검사): 로봇의 긍정적인 증거가 실제로 당근 목격자 위에 놓였나요? 아니면 실수로 배경의 울타리나 차트 제목 위에 놓였나요? 만약 로봇이 "당근 없음"이라고 말하면서 그 긍정적 증거가 울타리에 박혀 있다면, WEP는 이를 위험하다고 표시합니다.
    • 집중도 ( "초점" 검사): 로봇의 증거가 적절한 위치에 빽빽하게 모여 있나요, 아니면 혼란에 빠진 사람처럼 이미지 전체에 흩어져 있나요? 만약 증거가 사방에 퍼져 있다면, 이는 로봇이 보고 있는 것이 아니라 추측하고 있음을 시사합니다.

연구진은 이 "탐정 키트"를 세 가지 서로 다른 AI 모델(Qwen3-VL, LLaVA, InternVL)과 네 가지의 까다로운 시각적 질문 세트에 대해 테스트했습니다. 그들은 WEP가 자신만만하게 틀린 답변을 찾아내는 데 매우 뛰어나다는 것을 발견했습니다. 실제로, 모델과 테스트의 12가지 모든 조합에 걸쳐 West는 (오차 평균 정밀도로 측정된) 평균 0.134만큼 능력을 향상시켰습니다. 이는 만약 당신이 검토해야 할 답변 목록을 가지고 있다면, WEP가 로봇의 확신 점수만 볼 때보다 실수를 훨씬 더 빨리 찾도록 도와준다는 것을 의미합니다.

이것이 특별한 이유는 WEP가 로봇에게 다시 시도하게 하거나, 그림을 바꾸거나, 혹은 두 번째 로봇을 사용하여 작업을 확인하도록 요청할 필요가 없기 때문입니다. WEP는 로봇이 처음 수행했던 것과 정확히 동일한 "사고 경로"를 사용하며, 단지 로봇이 남긴 내부 메모를 훔쳐볼 뿐입니다. 연구팀은 또한 이 방식이 단순히 어떤 무작위 수학적 기교 때문이 아니라, 증거가 실제로 질문과 일치하기 때문에 작동한다는 것을 입증했습니다. 증거를 섞어서 질문과 더 이상 일치하지 않게 만들었을 때 시스템이 작동을 멈췄다는 점은, 증거의 "위치"와 "집중도"가 정말 중요하다는 것을 보여줍니다.

요약하자면, WEP는 AI의 시각적 내부를 들여다볼 수 있는 방법을 제공합니다. WEP는 로봇의 답변을 바꾸지는 않지만, "이봐, 이 답변은 자신감이 있지만, 로봇이 엉뚱한 곳을 보고 있었어"라고 알려주는 "리스크 점수"를 제공합니다. 이를 통해 우리는 로봇이 옳을 때는 신뢰하고, 자신 있게 틀릴 때는 잡아낼 수 있는 더 안전한 시스템을 구축할 수 있으며, 이 모든 과정을 속도를 늦추거나 추가적인 도구를 사용하지 않고도 수행할 수 있습니다. 마치 탐정이 최종 보고서를 제출하기 전에 조용히 탐정의 노트를 확인하는 아주 관찰력 있는 인턴을 둔 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →