← 최신 논문
💻 computer science

Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

본 논문은 체계적인 계층별 분석을 통해 멀티모달 거대 언어 모델 내 시각-텍스트 융합의 내부 메커니즘을 조사하여, 통합이 특정 층에서 뚜렷한 "리뷰(review)" 현상과 함께 발생함을 밝히고, 이러한 통찰을 활용하여 멀티모달 추론 성능을 향상시키는 학습이 필요 없는 대조적 어텐션 프레임워크를 제안한다.

원저자: Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 보고 읽는 것을 동시에 할 수 있는 세상을 상상해 보세요. 이들을 멀티모달 거대 언어 모델(Multimodal Large Language Models, MLLMs)이라고 부릅니다. 이들은 도서관의 모든 책을 다 읽었을 뿐만 아니라 사진을 볼 수 있는 눈까지 가진 아주 똑똑한 학생들과 같습니다. 하지만 여기에는 미스터리가 있습니다. 이 학생들이 사진을 보고 그에 대한 질문을 읽을 때, 그들의 뇌 속에서 어떻게 사진과 글자를 섞는 걸까요? 사진 전체를 한꺼번에 보는 걸까요? 글을 먼저 읽고 나서 사진을 힐끗 보는 걸까요? 아니면 아예 다른 무언가를 하는 걸까요?

오랫동안 우리는 이 모델들이 훌륭한 답변을 내놓을 수 있다는 것은 알았지만, 그들이 그 내부의 "뇌"(컴퓨터 코드의 층들로 이루어진) 속에서 실제로 어떻게 그 일을 해내는지에 대해서는 알지 못했습니다. 그것은 마치 마술사가 토끼를 꺼내는 트릭을 전혀 보지 못한 채 마술을 구경하는 것과 같았습니다. 이 과정을 이해하는 것은 매우 중요합니다. 왜냐하면 그들이 어떻게 작동하는지 모른다면, 그들이 주의가 산만해지거나 사실을 지어낼 때 고쳐줄 수 없기 때문입니다. 이 논문은 저자들이 마술사의 모자 안을 들여미하며 토끼가 층별로 어떻게 나타나는지 관찰하는 탐정 이야기와 같습니다.


탐정 작업: 모델의 뇌 내부를 들여다보기

이 논문의 저자들은 마법이 어디에서 일리는지 알아내기 위해 컴퓨터의 뇌를 상대로 "숨바꼭질" 게임을 하기로 했습니다. 그들은 여러 가지 서로 다른 MLLM들을 가져와서, 한 번에 한 층씩 그들의 뇌의 일부를 꺼보는 실험을 시작했습니다. 로봇이 장난감을 만드는 공장의 조립 라인을 상상해 보세요. 만약 당신이 3단계에서 로봇을 멈춘다면 장난감은 망가질 것입니다. 만약 20단계에서 멈춘다면, 아마 이미 완성되었을지도 모릅니다. 다양한 층에서 시각 정보를 "마스킹"(또는 끄기) 함으로써, 연구원들은 컴퓨터가 정확히 어느 시점에 사진을 보는 것을 멈추고 텍스트에만 의존하기 시작하는지를 확인할 수 있었습니다.

거대한 발견: 매끄러운 흐름이 아니다
그들이 발견한 가장 놀라운 사실은 컴퓨터가 처음부터 끝까지 사진과 글자를 균등하게 섞지 않는다는 것입니다. 이것은 우유를 커피에 부을 때 천천히 섞이는 것과는 다릅니다. 대신, 섞임은 조립 라인의 특정하고 결정적인 "스테이션"에서 일어납니다.

  • 결정적 구역 (The Critical Zone): 대부분의 모델에서 실제 섞임은 초기에서 중간 단계의 층(대략 18층에서 20층 사이)에서 일어난다는 것을 발견했습니다. 만약 이 구역 직전에 사진을 차단한다면, 컴퓨터는 이미지에 대한 모든 것을 잊어버리고 테스트에 실패합니다.
  • "검토" 현상 (The "Review" Phenomenon): 여기서 재미있는 부분이 나옵니다. 일부 모델(LLaVA-1.5 및 LLaVA-Next와 같은)에서는 컴퓨터가 섞기를 마쳤다고 생각한 직후, 갑자기 사진을 다시 한번 훑어보았습니다! 저자들은 이를 "검토" 단계라고 부릅니다. 이는 마치 시험을 마치고 펜을 내려놓은 학생이 갑자기 "잠깐, 도표를 다시 확인해야 해!"라고 기억해 내며 제출하기 직전의 모습과 같습니다.

문제점: 컴퓨터가 산만해진다
조사하는 동안 저자들은 이상한 결함을 발견했습니다. 컴퓨터가 이미지의 올바른 부분(예: 비행기의 로고)을 보고 있을 때조차도, 하늘이나 비행기의 꼬리처럼 완전히 쓸모없는 부분에 강렬하게 시선을 빼앗기고 있었습니다. 저자들은 이를 "높은 주의 노이즈(high-attention noise)"라고 부릅니다.
당신이 비행기에 적힌 "LAPE"라는 표지판을 읽으려고 노력하고 있다고 상상해 보세요. 당신의 눈은 글자에 집중해야 합니다. 하지만 이 컴퓨터는 비행기 뒤의 구름 같은 쓸모없는 부분에도 강렬하게 시선을 두며, 구름에 글자와 똑같은 주의를 기울이며 주의를 분산시킵니다. 이 현상은 처음부터 발생하며 계속 머물러 모델을 혼란스럽게 만듭니다.

해결책: 학습이 필요 없는 "형광펜"
이 산만함을 해결하기 위해 저자들은 컴퓨터를 다시 가르치는 데 드는 비용이 많이 들고 느린 과정 없이도 사용할 수 있는 영리한 기술을 발명했습니다. 그들은 이를 **대조적 주의력(Contrastive Attention)**이라고 부릅니다.
작동 방식은 다음과 같은 간단한 비유를 사용합니다:

  1. "이전" 스냅샷: 컴퓨터가 프로세스의 초기에(이미지를 막 보기 시작할 때) 무엇을 보고 있는지 사진을 찍습니다. 이 단계에서 컴퓨터는 구름을 포함한 모든 것을 보고 있습니다.
  2. "이후" 스냅샷: 컴퓨터가 답변할 준비가 된 아주 마지막 단계에서 무엇을 보고 있는지 사진을 찍습니다. 이 단계에서 컴퓨터는 마땅히 글자를 보고 있어야 합니다.
  3. 차이점: "이전" 사진에서 "이후" 사진을 뺍니다.
    • 만약 컴퓨터가 두 사진 모두에서 구름을 보고 있었다면, 구름은 상쇄됩니다 (주의력이 변하지 않았기 때문입니다).
    • 만약 컴퓨터가 "이후" 사진에서는 글자를 보기 시작했지만 "이전" 사진에서는 무시했다면, 글자가 밝게 드러납니다!

이 차이는 컴퓨터가 질문 때문에 집중하게 된 부분만을 보여주는 "형광펜" 역할을 합니다. 저자들은 이 형광펜을 사용하여 주의를 분산시키는 부분을 잘라내고, 중요한 부분만을 강조하여 컴퓨터에게 두 번째 시도를 위해 다시 입력합니다.

결과
이 새로운 방법을 테스트했을 때, 컴퓨터는 질문에 훨씬 더 잘 답하게 되었습니다. 모델을 재학습시킬 필요 없이, 단지 노이즈를 무시하도록 살짝 밀어주기만 하면 되었습니다.

  • GQA 데이터셋에서, 그들의 방법은 점수를 66.03에서 69.40으로 향상시켰습니다.
  • VQAv2에서는 74.06에서 77.59로 올랐습니다.
  • TextVQA에서는 57.21에서 59.86으로 뛰어올랐습니다.

이 숫자들은 컴퓨터가 단순히 노이즈(산만한 구름)를 무시하고 올바른 것에 집중하도록 도와주는 것만으로도 세상을 조금 더 잘 이해할 수 있음을 보여줍니다. 저자들은 이 방법이 효과적인 이유가 컴퓨터가 "모든 것을 보는 것"에서 "중요한 것을 보는 것"으로 주의를 전환하는 순간을 포착하기 때문이라고 제안합니다.

배제된 내용
저자들은 또한 이것이 단순히 무작위로 층을 골라 보는 것이 아님을 분명히 했습니다. 그들은 규칙 없이 프로세스의 맨 끝이나 맨 처음 층을 선택하는 실험을 했으나, 그것들은 효과가 좋지 않았습니다. "스윗 스팟(sweet spot)"은 시각 정보와 텍스트 정보가 막 섞이기 시작하지만 아직 완전히 자리 잡지 않은 특정 층들입니다. 또한 그들은 이 방법이 일회성 해결책이 아니며, 다양한 유형의 모델과 다양한 종류의 질문에 걸쳐 작동한다는 것을 보여주었습니다.

요약하자면, 이 논문은 이 똑똑한 컴퓨터들이 시각과 소리를 결로 합치는 특정 "혼합 구역"을 가지고 있으며, 때때로 배경 소음에 의해 산만해진다는 것을 가르쳐 줍니다. 수학적 트릭을 사용하여 그들의 집중도 변화를 강조함으로써, 우리는 새로운 레슨을 가르치기 위해 수년을 소비하지 않고도 그들이 노이즈를 무시하고 더 나은 답을 내놓도록 도울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →