← 최신 논문
🤖 AI

Large Vision-Language Models Get Lost in Attention

본 논문은 학습된 어텐션 가중치를 사전 정의된 값으로 대체해도 동등하거나 우수한 성능을 얻을 수 있음을 보여줌으로써 대규모 비전-언어 모델의 어텐션 메커니즘이 기능적으로 중복되고 종종 잘못 할당됨을 드러내는 통합 정보이론적 및 기하학적 프레임워크를 제안한다.

원저자: Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 시각-언어 모델 (LVLM) 을 방문객에게 그림을 설명하려는 매우 정교한 미술관 큐레이터로 상상해 보십시오. 이 큐레이터는 설명을 준비하는 데 도움을 주기 위해 뒷방에서 일하는 두 명의 주요 조수들을 두고 있습니다:

  1. "재배열자" (Attention): 이 조수는 그림의 모든 부분과 방문객의 질문을 살펴본 뒤, 지금 가장 중요한 부분이 무엇인지 파악하기 위해 메모들을 뒤섞습니다.
  2. "발명가" (FFN): 이 조수는 뒤섞인 메모들을 받아 실제로 새로운 아이디어를 작성하고, 설명에 새로운 어휘와 개념을 추가합니다.

이 논문은 오랫동안 우리가 "재배열자"가 그림에서 가장 중요한 세부 사항을 찾기 위해 끊임없이 그림을 훑어보며 중책을 수행한다고 생각했다고 주장합니다. 그러나 이 논문의 저자들은 이러한 조수들이 정확히 무엇을 하는지 관찰하기 위해 새로운 안경 (수학적 프레임워크) 을 개발했고, 놀라운 사실을 발견했습니다: 재배열자는 실제로 뒤섞임 속에서 길을 잃고 있습니다.

간단한 비유를 사용하여 그들의 발견 사항을 다음과 같이 정리해 보겠습니다:

1. 두 조수는 매우 다른 일을 합니다

연구자들은 이 두 조수가 서로 다른 언어를 사용하는 것처럼 완전히 다른 일을 하고 있음을 발견했습니다:

  • 재배열자 (Attention) 는 "셔플러"입니다: 이 조수의 주요 임무는 이미 테이블 위에 있는 정보를 가져와서 섞는 것입니다. 이는 정보의 조직 방식 (재구성) 을 변경하지만, 거의 새로운 것을 추가하지 않습니다. 이는 DJ 가 동일한 플레이리스트를 돌리는 것과 같습니다. 순서는 바뀌지만 노래는 동일합니다.
  • 발명가 (FFN) 는 "창조자"입니다: 이 조수는 실제로 새로운 아이디어를 테이블에 가져오는 사람입니다. 이는 대화의 "부분 공간"을 확장하여 새로운 의미 방향을 추가합니다. 이는 실제로 새로운 줄거리를 생각해 내는 작가와 같습니다.

2. "주의 집중 속의 상실" 문제

이 논문의 큰 제목은 이러한 모델들이 **"주의 집중 속의 상실"**에 시달린다는 것입니다.

재배열자 조수가 질문을 답하는 데 도움이 되도록 그림의 가장 중요한 부분 (예: 들판의 소) 을 가리키려 한다고 상상해 보십시오. 연구자들은 이 조수가 종종 산만해진다는 사실을 발견했습니다. 소에 집중하는 대신, 이 조수는 무작위 배경 세부 사항에 대한 메모를 뒤섞거나 제자리걸음을 하는 데 많은 에너지를 쏟습니다.

그들은 조수가 실제로 시스템에 주입한 "새로운 정보"의 양을 살펴봄으로써 이를 측정했습니다. 그들은 "셔플링"이 종종 불필요하다는 사실을 발견했습니다. 마치 새로운 카드를 뽑지 않고 같은 카드 덱을 반복해서 재배열하는 것과 같습니다.

3. "무작위 노이즈" 실험 (결정적 증거)

재배열자가 시간을 낭비하고 있음을 증명하기 위해 연구자들은 미친 듯한 실험을 시도했습니다: 재배열자의 신중한 계산을 무작위 노이즈로 대체했습니다.

조수가 그림을 보고 무엇을 집중할지 결정하도록 하는 대신, 무작위 패턴 (예: 구형 TV 의 정적) 이나 미리 설정된 규칙을 선택하도록 지시했습니다.

결과? 모델이 충돌하지 않았습니다. 오히려 많은 테스트에서 모델은 자체 "지능형" 주의 점수를 사용할 때와 마찬가지로, 때로는 더 잘 수행했습니다.

이는 요리사에게 "어떤 향료를 추가할지 결정하기 위해 수프를 맛보지 말고, 그냥 소금을 무작위로 뿌리라"고 말하는 것과 같습니다. 놀랍게도 수프는 여전히 훌륭했습니다. 이는 모델이 "주의를 기울이기" 위해 수행했던 복잡하고 비싼 수학이 대부분 불필요했다는 것을 시사합니다. 모델은 셔플링을 과도하게 생각했고, "발명가" 조수가 실제로 중책을 수행하고 있었습니다.

요약

이 논문은 현재의 AI 모델이 비효율적이라고 결론지었습니다. 이들은 종종 제자리걸음을 하거나 세부 사항에 길을 잃는 "재배열자" 조수에 막대한 컴퓨팅 자원을 쏟는 반면, 실제로 지능을 주도하는 것은 "발명가" 조수입니다.

이 사실을 깨닫는다면, 저자들은 AI 모델이 일을 처리하기 위해 그렇게 화려할 필요가 없으므로 "주의를 기울이는" 방식을 단순화함으로써 더 빠르고 저렴한 AI 모델을 구축할 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →