← 최신 논문
🤖 AI

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

본 논문은 멀티모달 대규모 언어 모델에서 인과적 어텐션을 대체하여 이미지 토큰이 텍스트 토큰에 어텐션할 수 있도록 함으로써 비전-언어 불일치를 해결하고 12 개 벤치마크에서 최첨단 성능을 달성하는 파라미터가 없는 아키텍처 수정인 모달리티 상호 어텐션 (MMA) 을 제안합니다.

원저자: Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어보겠습니다.

문제: AI 두뇌의 '일방통행'

멀티모달 대형 언어 모델 (MLLM) 을 사진도 보고 텍스트도 읽을 수 있는 매우 똑똑한 비서라고 상상해 보세요. 현재 대부분의 이런 비서들은 일방통행 도로처럼 설계되어 있습니다.

비서에게 사진에 대한 질문을 할 때의 표준 과정은 다음과 같습니다:

  1. 먼저 사진이 보여집니다.
  2. 그 다음 질문이 읽힙니다.
  3. 마지막으로 답변이 생성됩니다.

이 논문은 이 설정에 큰 결함이 있다고 지적합니다. AI 의 '두뇌' (특히 주의 메커니즘) 가 어떻게 설계되었는지 때문에, 사진은 자신보다 앞서 온 것만 볼 수 있습니다. 사진이 먼저 나오기 때문에, 뒤따라오는 질문을 볼 수 없는 것입니다. 마치 건물에 들어오는 사람들만 볼 수 있고, 벽에 붙은 '출입 금지'라는 표지판을 보지 못하도록 금지된 경비원 같은 상황입니다.

AI 의 '사진' 부분이 '질문' 부분을 읽지 못하기 때문에, 종종 잘못 추측합니다. 예를 들어 사진에 차가 있는데 사용자가 "저게 빨간 페라리인가요?"라고 물었을 때, 차가 실제로는 파란색임에도 불구하고 AI 는 "저게 빨간 페라리입니다"라고 말할 수 있습니다. 이미지 부분이 텍스트의 구체적인 지시사항에 '눈이 멀어' 있기 때문에 AI 는 환각 (사실 없는 것을 만들어냄) 을 일으킵니다.

이전의 해결책: 후진 운전

이 논문 이전까지 연구자들은 AI 를 두 가지 다른 방식으로 훈련시켜 이 문제를 해결하려 했습니다:

  1. 표준 방식: 사진 먼저 보여주고, 그 다음 질문.
  2. 역방향 방식: 질문 먼저 보여주고, 그 다음 사진.

이는 운전자에게 정면 주행을 가르친 뒤, 도로를 제대로 이해했는지 확인하기 위해 후진 주행을 가르치는 것과 같습니다. 이는 조금 도움이 되지만 매우 비싸고 느립니다. 기본적으로 AI 훈련에 필요한 시간과 비용을 두 배로 늘리는 셈입니다.

새로운 해결책: '양방향 도로' (MMA)

저자들은 모달리티 상호 주의 (Modality-Mutual Attention, MMA) 라는 교묘하고 간단한 해결책을 제안합니다.

AI 가 후진 운전을 하도록 만드는 대신, AI 두뇌의 신호등을 해제하기만 합니다.

  • 오래된 방식 (인과적 주의): '이미지' 토큰은 앞줄에 앉은 학생입니다. 이 학생은 칠판 (이전 토큰) 만 볼 수 있습니다. 뒷줄에 앉은 학생 ('텍스트' 토큰) 이 무엇을 쓰고 있는지 뒤돌아 볼 수는 없습니다.
  • 새로운 방식 (MMA): 저자들은 규칙을 바꿔 앞줄 학생이 뒤돌아 볼 수 있도록 허용하여 뒷줄 학생이 무엇을 쓰고 있는지 읽을 수 있게 합니다.

이 특정 경로를 해제함으로써, AI 의 '이미지' 부분이 이제 '질문' 부분을 읽을 수 있게 됩니다. 사진을 설명하기 전에 정확히 무엇을 물어보는지 볼 수 있게 되는 것입니다.

이것이 중요한 이유

  1. 추가 비용 없음: AI 에 새로운 부분을 추가하거나 모델을 크게 만들지 않았습니다. 정보 흐름을 막는 작은 설정 ('마스크') 만 변경했을 뿐입니다. 새로운 집을 짓는 대신 방 안의 가구를 재배치하는 것과 같습니다.
  2. 더 높은 정확도: 이미지가 이제 '질문'을 볼 수 있기 때문에, AI 는 추측을 멈춥니다. 실험 결과, AI 는 특정 객체에 대한 질문 답변, 사물 세기, 공간적 관계 이해 (예: "고양이가 왼쪽에 있거나 오른쪽에 있나?") 에서 훨씬 더 나아졌습니다.
  3. 환각 감소: 존재하지 않는 세부 사항을 만들어내는 실수가 줄어듭니다.

결과

연구자들은 이미지와 텍스트가 포함된 12 가지 다른 테스트에서 이 새로운 '양방향 도로' 설계를 테스트했습니다. 이것이 일반적으로 작동함을 입증하기 위해 세 가지 다른 유형의 AI 두뇌 (백본) 를 사용했습니다.

  • 결과: 새로운 방법은 기존 표준 방법보다 우수했을 뿐만 아니라, 다른 복잡한 최첨단 방법들보다도 더 좋은 성과를 거두었습니다.
  • 향상: 평균적으로 AI 는 모든 테스트에서 이미지와 텍스트 이해 능력이 약 6.2% 향상되었습니다.
  • 효율성: 추가적인 '두뇌 능력' (파라미터) 을 추가하거나 훈련 시간을 두 배로 늘리지 않고도 이 성과를 달성했습니다.

요약 비유

옛날 AI 를 눈가리개를 한 화가로 생각하세요. 이 화가는 사진을 건네받고 그걸 그리라고 지시를 받습니다. 화가는 그리는 동안 사진을 볼 수 없으므로, 먼저 사진을 외워야 합니다. 만약 이때 "파란 차가 아니라 빨간 차를 그려라"라고 속삭여도, 화가는 이미 그리기 시작했기 때문에 그 지시를 들을 수 없습니다.

새로운 AI(MMA) 는 눈가리개를 벗은 화가처럼, 지시를 들으면서 사진을 볼 수 있습니다. 그들은 요청한 내용과 정확히 일치하도록 그림을 실시간으로 수정할 수 있어 훨씬 더 정확한 그림을 완성합니다.

이 논문은 단순히 AI 의 이미지 부분이 텍스트 부분을 '볼' 수 있도록 허용함으로써, 모델을 더 복잡하거나 훈련 비용이 많이 들게 하지 않고도 이러한 모델들이 세상을 얼마나 잘 이해하는지 크게 향상시킬 수 있다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →