← 최신 논문
💬 NLP

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

이 논문은 멀티모달 거대 언어 모델이 기능적 희소성에 의존한다는 점을 밝히며, 여기서 CoRe 헤드라고 불리는 특화된 어텐션 헤드 하위 집합은 쿼리 관련 시각적 특징을 추출하는 데 결정적인 역할을 하는데, 이는 해당 헤드들을 제거했을 때 성능에 미치는 상당한 영향과 추론 속도를 가속화할 수 있는 잠재력을 통해 입증된다.

원저자: Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 군중 속에서 "특수 요원" 찾기

멀티모달 거대 언어 모델(MLLM)을 거대하고 북적이는 뉴스룸이라고 상상해 보세요. 이 뉴스룸에는 수천 명의 기자(어텐션 헤드, attention heads)들이 동시에 일하고 있습니다. 이들의 임무는 복잡한 이야기(텍스트 프롬프트)를 읽고, 혼란스러운 장면(이미지 또는 비디오)을 살펴본 뒤 특정 질문에 답하는 것입니다.

보통 우리는 이 모든 기자들이 함께 협력하며, 답을 찾기 위해 방 전체를 훑어보고 있다고 생각합니다. 하지만 이 논문은 놀라운 사실을 발견했습니다. 대부분의 기자는 사실 목적 없이 주변을 둘러보거나 배경 소음에 시선을 빼앗기고 있다는 것입니다.

대신, 약 5%의 아주 적은 정예 요원들이 존재하며, 이들이 바로 "특수 요원" 역할을 합니다. 이 요원들만이 답을 찾기 위해 어디를 보아야 하는지 실제로 알고 있습니다. 저자들은 이들을 CoRe 헤드(Context-aware Retrieval heads, 문맥 인식 검색 헤드)라고 부릅니다.

탐정 작업: 요원들을 찾아낸 방법

이를 증명하기 위해 연구진은 **RAM(Retrieval Attention Mass, 검색 어텐션 질량)**이라는 새로운 어텐션 측정법을 고안했습니다.

  • 비유: 당신이 북적이는 주차장에서 특정 빨간 자동차를 찾고 있다고 상상해 보세요.
    • "나쁜" 기자들 (하위 헤드들): 이들은 하늘, 보도블록, 지나가는 사람들, 그리고 나무들을 봅니다. 이들은 빨간 자동차를 제외한 거의 모든 것에 정신이 팔려 있습니다.
    • "CoRe" 기자들: 이들은 하늘이나 사람들을 무시합니다. 대신 그들의 시선은 빨간 자동차에 정확히 고정됩니다.

연구진은 각 "기자"가 올바른 대상(빨간 자동차)에 얼마나 많은 주의를 기울이는지, 반대로 잘못된 것들에는 얼마나 주의를 기울이는지를 측정했습니다. 그 결과, CoRe 헤드들은 일관되게 정답을 직접 가리키는 반면, 나머지 헤드들은 그저 "노이즈"에 불과하다는 것을 발견했습니다.

"만약에" 실험: 요원들을 제거한다면?

이 특수 요원들이 정말 필요한지 확인하기 위해, 연구진은 위험한 실험을 시도했습니다. 바로 이들을 꺼버리는 것이었습니다.

  • 결과: 단 5%의 가장 뛰어난 기자들(CoRe 헤드)을 침묵시켰을 때, 뉴스룸은 붕괴되었습니다. 모델의 답변 능력은 급격히 떨어졌습니다. 이는 마치 미로에서 나가는 길을 아는 유일한 사람을 데려가 버리고, 나머지 군중에게 길을 안내해 달라고 요청하는 것과 같았습니다.
  • 대조: 반면, "주의가 산만한" 기자들(하위 95%)을 껐을 때는 모델이 거의 완벽하게 작동을 유지했습니다. 이는 "노이즈" 기자들은 중복된 존재였지만, "특수 요원"들은 필수적이라는 것을 증명했습니다.

"병목 현상"의 발견

논문은 모델이 커질수록(작은 모델에서 거대한 모델으로) 나타나는 패턴을 포착했습니다.

  • 작은 모델: 특수 요원들이 뉴스룸 곳곳에 흩어져 있어 다소 무질서했습니다.
  • 큰 모델: 모델이 커질수록, 특수 요원들은 건물 중간에서 후반부 섹션에 있는 특정하고 조밀한 클러스터로 모여들었습니다. 이들은 **병목(bottleneck)**을 형성했습니다. 모델은 "잠깐, 모두가 다 볼 필요는 없어. 이 특정 구역에 있는 이 팀이 핵심적인 일을 수행하면 돼"라고 깨달은 것입니다.

초능력: 속도 높이기

연구진은 95%의 기자들이 단순히 "공간을 채우고" 있을 뿐 결정적인 일을 하지 않는다는 것을 증명했기에, 모델을 더 빠르게 만들기 위한 새로운 전략을 시도했습니다.

  • 전략: 95%의 산만한 기자들에게 "이제 방 전체를 둘 다 볼 필요 없어. 그냥 바로 앞의 영역만 봐"라고 지시했습니다. 한편, 5%의 특수 요원들에게는 방 전체를 계속 살피도록 허용했습니다.
  • 결과: 이 전략은 정확도를 잃지 않으면서도 모델을 훨씬 빠르게(최대 2배) 만들었습니다. 이는 마치 군중에게 방 건너편까지 소리 지르지 말고 옆 사람에게 속삭이라고 말하는 것과 같습니다. 중요한 소식은 여전히 전달되지만, 혼란(그리고 그로 인해 걸리는 시간)은 사라집니다.

요약

이 논문은 멀티모달 AI 모델이 답을 찾기 위해 실제로 자신의 모든 뇌 용량을 사용하지 않는다는 사실을 밝혀냈습니다. 모델은 시각적 단서를 찾는 실제 작업을 수행하기 위해 작고 특화된 팀(CoRe 헤드)에 의존하며, 나머지 네트워크는 그저 불을 밝히는 역할만 할 뿐입니다. 이 작은 팀을 식별하고 보호하는 동시에 나머지 부분의 업무를 단순화함으로써, 우리는 이러한 AI 모델을 훨씬 더 빠르고 효율적으로 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →