← 최신 논문
🤖 AI

MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs

본 논문은 시각적 특징에 지시어 유도형 채널별 곱셈 변조를 적용함으로써 멀티모달 거대 언어 모델의 미세한 시각적 접지 능력을 향상시키고, 최소한의 계산 오버헤드로 여러 아키텍처와 벤치마크에서 일관된 성능 향상을 달성하는 경량 변조 어댑터인 MoDA를 제안한다.

원저자: Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: AI 시각의 "탁한 물(Muddy Water)"

당신이 침대 위에 놓인 인형 옆에서 잠자고 있는 프렌치 불도그 사진을 보고 있다고 상상해 보세요. 당신은 다음과 같은 질문에 답하고 싶습니다. "강아지의 귀 색깔은 무엇인가요?"

사람에게 이것은 쉬운 일입니다. 귀를 보고 침대나 인형은 무시하면 되니까요.

하지만 현재의 많은 AI 모델(멀티모달 거대 언어 모델, MLLM이라 불리는)에게 이미지는 하나의 전체 그림으로 보이지 않습니다. 대신, AI는 이미지를 작은 정사각형 타일(패치라고 부름)로 조각냅니다. 문제는 이 타일들이 종종 지저분하다는 점입니다. 어떤 타일에는 강아지의 털 일부, 나무 바닥 일부, 그리고 인형의 일부가 섞여 있을 수 있습니다.

이것은 마치 심포니에서 특정 악기 소리를 들으려고 하는데, 마이크가 바이올린, 첼로, 그리고 관객의 기침 소리를 한꺼번에 잡아내는 것과 같습니다. 저자들이 이를 **"의미론적 얽힘(semantic entanglement)"**이라고 부르는 현상입니다. AI는 시각적 데이터가 "탁하기(muddy)" 때문에 혼란을 겪습니다. 여러 물체가 서로 뒤섞여 있어, 질문이 요구하는 구체적인 세부 사항에 집중하는 것을 어렵게 만듭니다. 이는 종-종 AI가 실제 사진에 없는 내용을 자신 있게 말해버리는 "환각(hallucination)" 현상으로 이어집니다.

해결책: MoDA ("지시어 가이드 필터")

저자들은 MoDA(Modulation Adapter)라고 불리는 새롭고 가벼운 도구를 제안합니다.

기존의 AI 어댑터가 이미지를 단어로 변환하는 번역가라면, MoDA는 번역가 뒤에 서 있는 똑똑한 스포트라이트 조명 기사와 같습니다.

작동 방식은 다음과 같습니다:

  1. 입력: AI는 이미 이미지를 살펴보고 대략적인 묘사(정렬된 특징들)를 생성했습니다.
  2. 질문: 당신은 *"장난감이 침대 위에 있나요, 아니면 바닥에 있나요?"*와 같이 구체적인 질문을 던집니다.
  3. 변조(Modulation): MoDA는 당신의 질문을 듣습니다. 그런 다음 "마스크" 또는 필터를 만듭니다. 데이터를 통째로 버리는 것이 아니라, 관련 없는 부분(배경 소음 등)은 어둡게 만들고, 관련 있는 부분(장난감과 바닥 등)은 밝게 만듭니다.

비유:
당신이 한 가지 특정한 사실을 찾기 위해 두꺼운 교과서를 읽고 있다고 상상해 보세요.

  • MoDA가 없다면: 당신은 그 페이지의 모든 단어, 즉 각주, 광고, 요약문까지 모두 읽으며 건더기 속의 바늘을 찾으려 애써야 합니다.
  • MoDA가 있다면: 친구가 당신의 질문에 답이 되는 문장들만 하이라이트 칠해주고 나머지 페이지는 어둡게 만들어 줍니다. 이제 당신은 즉시 중요한 것에 집중할 수 있습니다.

무엇이 다른가요?

기존의 대부분의 방법은 이 문제를 해결하기 위해 다음과 같은 방식을 사용합니다:

  • 더 복잡한 카메라 추가 (다중 시각 인코더).
  • 책 전체를 다시 쓰기 (모델 전체 재학습).
  • 문단 단위로 무시할 부분 선택 (토큰 수준의 선택).

MoDA는 다음과 같은 점에서 다릅니다:

  1. 세밀함(Granular): 단순히 단어나 문장 전체를 무시하는 것이 아니라, 데이터 내부의 특정 세부 사항의 "볼륨"을 조절합니다 (채널 단위 변조).
  2. 가벼움(Lightweight): 이는 작은 추가 모듈입니다. 계산 비용(FLOPs)을 1% 미만으로 추가하며, 파라미터는 단 **3.7%**만 더 늘립니다. 이는 새로운 도서관을 사는 대신 책에 작은 책갈피 하나를 끼워 넣는 것과 같습니다.
  3. 지시어 가이드(Instruction-Guided): 질문하는 내용에 따라 초점을 바꿉니다. 만약 당신이 강아지의 귀에 대해 묻는다면 귀에 집중하고, 장난감에 대해 묻는다면 장난감에 집중합니다.

결과: 효과가 있나요?

저자들은 세 가지 다른 AI 아키텍처(LLaVA-1.5, LLaVA-MoRE, Qwen3-VL)를 대상으로 12가지 테스트를 진행했습니다. 결과는 매우 긍정적이었습니다:

  • 정확도 향상: 환각 현상을 체크하는 MMVP 테스트에서, MoDA는 한 모델 제품군에서 점수를 12점 높였습니다. 이는 엄청난 도약입니다.
  • 더 똑똑한 추론: 과학 및 논리 질문(ScienceQA)에서 점수를 거의 5점가량 향상시켰습니다.
  • 어디서나 작동: 특정 유형의 AI에서만 작동하는 것이 아닙니다. CLIP(흔히 쓰이는 시각 인코더) 기반 모델뿐만 아니라, 다른 기술을 사용하는 최신 모델인 Qwen3-VL에서도 작동했습니다.
  • 추가 데이터 불필요: 이 기능을 학습시키기 위해 수백만 개의 새로운 이미지를 AI에 입력할 필요가 없었습니다. 기존의 훈련 데이터를 더 효과적으로 사용하여 AI가 더 잘하도록 학습시킨 것입니다.

요약

요컨대, MoDA는 AI 모델이 "한꺼번에 모든 것을 보는 것"을 멈추고 "당신이 묻고 있는 것에 집중하게" 도와줍니다. 질문에 따라 관련 없는 시각적 노이즈는 줄이고 관련 있는 세부 사항은 강조하는 스마트한 필터 역할을 함으로써, MoDA는 근본적인 시스템의 대대적인 업그레이드 없이도 AI 모델을 더 정확하고, 환각 현상이 적으며, 효율적으로 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →