← 최신 논문
🤖 AI

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

이 논문은 부분적으로 마스킹된 입력으로부터 로짓(logits)을 집계하고 이를 노이즈 전용 참조(noise-only references)로 정제함으로써 대규모 시각-언어 모델(Large Vision-Language Models)에서 이미지 간 정보 누출을 완화하는, 훈련이 필요 없고 아키텍처에 구애받지 않는 방법론인 FOCUS를 소개하며, 이를 통해 다중 이미지 및 비디오 이해 작업 성능을 크게 향상시킨다.

원저자: Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑한 미술 비평가(AI)라고 상상해 보세요. 당신은 단 한 점의 그림을 묘사하는 데 아주 뛰어납니다. 하지만 만약 두 점의 그림이 나란히 걸려 있을 때, 첫 번째 그림만을 묘사하라는 요청을 받으면 당신은 혼란에 빠집니다. 당신은 실수로 두 번째 그림까지 묘사하기 시작하며, 두 그림을 뒤섞어 엉망이고 틀린 설명을 내놓게 됩니다.

이 논문은 바로 이 특정한 문제를 식별하고, 별도의 학습 없이도 해결할 수 있는 영리한 방법인 FOCUS를 제안합니다.

이들이 발견한 내용과 이를 어떻게 해결했는지, 쉬운 비유를 들어 설명하겠습니다.

문제점: "비주얼 수프(Visual Soup)" 효과

대규모 시각-언어 모델(LVLMs)이 한 번에 여러 이미지를 볼 때, 모델의 내부 "두뇌"는 진흙탕처럼 탁해집나다. 이미지를 각각 분리해서 보는 대신, 마치 블렌더로 스무디를 만드는 것처럼 이미지들을 하나로 섞어버립니다.

  • 시나리오: AI에게 노란 튤립이 담긴 흰색 화병(이미지 A) 사진과 빨간 장미가 담긴 빨간 화병(이미지 B) 사진을 보여준다고 가정해 봅시다.
  • 질문: "첫 번째 이미지에는 무엇이 있습니까?"
  • 실수: "노란 튤립"이라고 말하는 대신, 혼란에 빠진 AI는 "노란 튤립과 빨간 장미"라고 말합니다. 두 번째 이미지의 정보가 첫 번째 답변으로 흘러 들어온 것입니다.
  • 원인: 논문에서는 이를 **교차 이미지 정보 누출(Cross-Image Information Leakage)**이라고 부릅니다. AI가 모든 이미지를 함께 처리하기 때문에, "시각적 토큰(이미지의 디지털 구성 요소)"들이 서로 엉키게 되어, AI는 모든 것이 하나의 거대한 결합된 장면이라고 생각하게 됩니다.

해결책: "눈가리개" 기술 (FOCUS)

저자들은 이 AI 모델들이 사실 한 번에 하나의 이미지만 볼 때는 매우 뛰어나다는 점을 깨달았습니다. 문제는 여러 개를 동시에 보려고 할 때 발생합니다.

그래서 그들은 FOCUS(특정한 기술적 과정을 의미하지만, "하나의 깨끗한 소스에 집중하기"라고 생각하면 됩니다)라는 방법을 만들었습니다. 이 방법은 AI를 재학습시키거나 뇌 구조를 바꿀 필요 없이, 대화 중에 AI가 이미지를 바라보는 방식만을 바꿉니다.

FOCUS의 단계별 작동 방식은 다음과 같습니다.

  1. 눈가리개 (시각적 마스킹, Visual Masking):
    AI에게 이미지 A를 설명하게 하고 싶을 때, 이미지 A와 B를 모두 선명하게 보여주는 대신, 이미지 B에 "디지털 눈가리개(무작위 노이즈)"를 씌웁니다. 이제 이미지 B는 신호가 없는 TV 화면처럼 그저 정지된 노이즈(static fuzz)일 뿐입니다. 이제 AI는 이미지 A만을 명확하게 볼 수 있습니다.

    • 비유: 비평가가 첫 번째 그림만 볼 수 있도록 두 번째 그림 위에 종이를 올려두는 것과 같습니다.
  2. 전환 (이미지별 추론, Image-wise Inference):
    AI는 이 과정을 세트 내의 모든 이미지에 대해 수행합니다.

    • 먼저, 이미지 B를 흐릿하게 만든 상태에서 이미지 A를 명확하게 봅니다.
    • 그다음, 이미지 A를 흐릿하게 만든 상태에서 이미지 B를 명확하게 봅니다.
    • 이 과정을 하나씩 진행함으로써, 두 개의 선명한 이미지를 동시에 보아 혼란을 겪는 일이 없도록 보장합니다.
  3. 노이즈 필터 (대조적 집계, Contrastive Aggregation):
    눈가리개를 씌우더라도, 흐릿해진 이미지에서 아주 미세한 "정적(static)"이 새어 나올 수 있습니다. 이를 해결하기 위해, AI는 완전히 빈 노이즈 화면(그저 정적뿐인 화면)을 함께 살펴보며 "순수한 혼란"이 어떤 모습인지 확인합니다.

    • 그런 다음, AI는 이 "혼란스러운 노이즈"를 자신의 답변에서 빼버립니다.
    • 비유: 만약 AI가 "튤립 그림에서 빨간 장미가 조금 보입니다"라고 말한다면, 시스템은 다음과 같이 확인합니다. "우리가 오직 정적 노이즈만을 보았을 때도 빨간 장미가 보였던가?" 만약 그렇다면, 시스템은 그것이 단순한 오류(glitch)임을 깨닫고 최종 답변에서 해당 내용을 제거합니다.

결과

이 "눈가리개 + 노이즈 필터" 기술을 다양한 AI 모델과 벤치마크에 테스트했을 때의 결과는 다음과 같습니다.

  • 정확도 상승: AI가 이미지를 서로 섞는 현상이 멈췄습니다.
  • 범용성: 이 방법은 작은 모델, 거대 모델, 그리고 프레임이 이미지의 연속인 비디오 이해 작업에서도 모두 작동했습니다.
  • 추가 학습 불필요: AI에게 새로운 것을 가르칠 필요가 없었습니다. 단지 AI가 답변하는 동안 게임의 규칙을 잠시 바꾼 것뿐입니다.

요약

이 논문은 현재의 AI 모델들이 두 개의 라디오 채널을 동시에 들으려다 결국 잡음 섞인 혼합음을 듣게 되는 사람과 같다고 말합니다. FOCUS는 AI가 한 번에 하나의 채널에만 집중하게 하고, 다른 채널에서 오는 잡음을 걸러내어 명확하고 정확한 답변을 얻을 수 있게 하는 간단한 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →