Information Router for Mitigating Modality Dominance in Vision-Language Models
이 논문은 시각-언어 모델의 모달리티 우세 문제를 해결하기 위해 정보 밀도가 낮은 토큰에 더 강력한 모달리티의 정보를 라우팅하여 정보 불균형을 사전에 해소하는 'MoIR(Multi-modal Information Router)'을 제안하고, 이를 통해 모델의 견고성과 성능을 향상시킵니다.
원저자:Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib
증거 A (이미지): 사건 현장의 사진입니다. 하지만 사진이 흐릿하거나, 구석에 찍혀서 중요한 부분이 잘 안 보입니다. (정보량이 적음)
증거 B (텍스트): 목격자의 진술서입니다. 아주 자세하고 명확하게 사건을 설명하고 있습니다. (정보량이 많음)
기존의 AI 는 이 두 증거를 받을 때, **"사진이 흐릿하니까 그냥 진술서만 믿고 결론 내리자"**라고 생각합니다.
결과: 정답을 맞출 수는 있지만, 그건 그림을 보고 추리한 게 아니라, 글자만 읽고 맞춘 것입니다. 만약 진술서가 거짓말을 하거나, 사진이 진짜 중요한 단서를 담고 있는데 AI 가 무시하면 큰 실수가 납니다.
이게 바로 **'모달리티 지배'**입니다. AI 가 한쪽 (보통 텍스트) 에만 쏠려서, 다른 쪽 (이미지) 의 정보가 부족해도 무시해버리는 현상입니다.
2. 기존 해결책의 한계: "집중력 조절"만으로는 부족해
기존 연구자들은 "AI 가 사진에 더 집중하게 하라"고 했습니다. 마치 **"눈을 더 크게 뜨고 사진을 봐!"**라고 명령하는 거죠.
문제점: 하지만 사진 자체가 정보 (단서) 가 없거나 너무 흐릿하다면, 아무리 눈을 크게 뜨고 봐도 소용이 없습니다. 빈 종이를 아무리 자세히 봐도 단서는 나오지 않죠.
3. 새로운 해결책: MOIR (정보 중계소)
이 논문에서 제안한 MOIR은 AI 가 정보를 받아들이기 전에, 정보의 양을 맞춰주는 '중계소' 역할을 합니다.
어떻게 작동할까요?
정보량 체크: MOIR 은 들어온 '사진 조각 (토큰)'들을 하나하나 검사합니다. "이 부분은 정보가 너무 적네 (흐릿하거나 중요하지 않네)"라고 판단합니다.
정보 배달: 정보가 부족한 그 부분을 채우기 위해, 반대쪽 (텍스트) 에서 유용한 정보를 가져와서 빈자리에 채워줍니다.
비유: 사진이 흐려서 '누가 범인인지'가 안 보이면, 텍스트 진술서에서 "범인은 빨간 모자를 썼다"는 정보를 가져와서 사진의 흐릿한 부분에 빨간 모자 정보를 '주입'하는 겁니다.
완성된 증거: 이제 AI 는 정보량이 풍부한 완성된 증거를 보고 판단합니다.
4. 왜 이게 중요한가요? (실제 효과)
이 방법을 쓰면 다음과 같은 변화가 일어납니다.
균형 잡힌 판단: AI 가 텍스트에만 의존하지 않고, 사진의 단서도 진짜로 활용하게 됩니다.
튼튼한 AI: 만약 사진이 심하게 망가졌거나 (노이즈가 생김), 텍스트가 헛소리를 해도, AI 가 서로의 정보를 보완해주기 때문에 실수를 덜 합니다.
진짜 추리: "그냥 글자만 보고 맞춘 게 아니라, 진짜 그림을 보고 답을 찾았다"는 것을 증명합니다.
💡 요약
이 논문은 **"AI 가 한쪽 정보 (텍스트) 에만 의존하는 버그"**를 고치기 위해, **"정보가 부족한 부분에는 다른 쪽 (이미지) 의 정보를 채워주는 중계 시스템 (MOIR)"**을 만들었다고 말합니다.
마치 혼자서 무거운 짐을 들기 힘들 때, 친구가 도와주어 균형을 맞추는 것처럼, 서로 다른 정보 (이미지와 텍스트) 가 서로의 부족함을 채워주게 함으로써 AI 가 더 똑똑하고 신뢰할 수 있게 만든 것입니다.
1. 문제 정의 (Problem Definition)
비전 - 언어 모델 (VLM) 은 다양한 벤치마크에서 뛰어난 성능을 보이지만, **모달리티 지배성 (Modality Dominance)**이라는 심각한 문제를 안고 있습니다. 이는 모델이 예측 시 하나의 모달리티 (주로 텍스트) 에 불균형적으로 의존하고, 다른 모달리티 (이미지 또는 비디오) 의 정보를 제대로 활용하지 못하는 현상을 의미합니다.
기존 접근법의 한계: 기존 연구들은 모델의 '주의 (Attention)' 할당을 조정하여 이 문제를 해결하려 했습니다. 그러나 이는 모든 모달리티가 이미 충분한 정보를 가지고 있다는 전제하에 이루어진 것으로, 주의만 조절한다고 해서 **부족하거나 모호한 정보 (Information Disparity)**가 보충되지는 않습니다.
실제 상황: 현실 세계에서는 입력 모달리티 간의 정보 밀도 (Information Density) 와 신호 대 잡음비 (SNR) 가 크게 다릅니다. 예를 들어, 시각 토큰은 시점 제한으로 인해 희소하거나 모호할 수 있는 반면, 언어 토큰은 밀집되어 있고 명확한 경우가 많습니다. 이러한 정보 불균형을 무시한 채 단순히 주의만 조절하면, 정보가 부족한 모달리티가 여전히 무시당하게 되어 모델의 견고성 (Robustness) 이 떨어집니다.
2. 제안 방법론: MOIR (Methodology)
저자들은 정보 불균형을 해결하기 위해 **MOIR (Multi-modal Information Router)**을 제안합니다. 이는 융합 (Fusion) 이전에 명시적으로 정보 수준에서 상호작용을 조절하는 방법론입니다.
핵심 아이디어: 정보 밀도가 낮은 토큰을 식별하고, 더 강력한 모달리티에서 보완적인 정보를 라우팅하여 정보 밀도가 높은 (Information-dense) 토큰 표현을 구축합니다.
구체적인 단계:
비정보적 토큰 식별 (Identifying Less Informative Tokens): 각 모달리티의 토큰 시퀀스에 대해 특이값 분해 (SVD) 를 수행합니다. 토큰 표현의 주성분 (Principal Components) 에 기여도가 낮은 채널 (Channel) 을 '비정보적 채널'로 정의합니다.
정보 라우팅 (Information Routing): 식별된 비정보적 채널에 대해, 다른 모달리티의 보완적 정보를 선택적으로 주입합니다. 이는 학습 가능한 라우팅 게이트 (α) 를 통해 조절되며, 기존 정보의 손실 없이 부족한 정보를 채워줍니다.
LLM 디코더 통합: 라우팅을 통해 정보가 보강된 토큰 시퀀스를 LLM 디코더에 입력합니다. 이를 통해 모델은 정보의 가용성에 기반하여 자연스럽게 모달리티 간 의존도를 조정하게 됩니다.
3. 주요 기여 (Key Contributions)
MOIR 제안: 모달리티 지배성 문제를 해결하기 위해 교차 모달리티 정보 교환을 수행하는 새로운 융합 방법론을 제시했습니다.
모달리티 지배성 재정의: 각 모달리티의 증거 상태 (evidential status) 를 고려하지 않고 단순히 사용 비율만 변경하는 것은 노이즈가 있거나 정보가 부족한 상황에서 신뢰할 수 없음을 지적했습니다. 정보 밀도 자체를 수정해야 함을 강조합니다.
광범위한 실험 검증: 다양한 데이터셋 (ScienceQA, VizWiz, MMBench-Video) 과 모델 백본 (LLaVA, Qwen2.5-VL) 을 통해 MOIR 이 모달리티 기여도를 균형 있게 만들고, 견고성과 하류 작업 성능을 향상시킨다는 것을 입증했습니다.
4. 실험 결과 (Results)
저자들은 3 가지 주요 벤치마크 (ScienceQA, VizWiz, MMBench-Video) 에서 MOIR 의 효과를 검증했습니다.
하류 작업 성능 (Downstream Performance):
ScienceQA: 다중 선택형 문제 특성상 정확도 향상폭은 작았으나, 모달리티 지배성은 감소했습니다.
VizWiz 및 MMBench-Video: 시각적 근거가 필수적이고 개방형 추론이 필요한 작업에서 MOIR 을 적용한 모델이 기존 모델 대비 정확도가 크게 향상되었습니다. 특히 동적인 시각 콘텐츠에 대한 시간적 추론이 필요한 MMBench-Video 에서 가장 두드러진 개선을 보였습니다.
모달리티 균형 및 정보 밀도:
MDI (Modality Dominance Index) 및 AEI (Attention Efficiency Index): 모든 설정에서 두 지표가 감소하여, 모델이 특정 모달리티에 편향되지 않고 균형을 이룸을 보여줍니다.
Rank ΔI / ΔT: 이미지/비디오와 텍스트 토큰 표현 공간의 유효 랭크 (Effective Rank) 가 모두 증가하여, MOIR 이 한쪽 모달리티를 억제하는 것이 아니라 상호 보완적 정보 교환을 통해 표현의 정보 밀도를 높임을 의미합니다.
견고성 (Robustness):
VizWiz 노이즈 실험: 이미지를 가우시안 노이즈로 대체했을 때, 기존 모델은 시각 입력이 없어도 답변을 변경하지 않는 비율 (62.13%) 이 매우 높았습니다. 반면 MOIR 모델은 이 비율이 29.63% 로 크게 감소하여, 시각적 입력에 더 민감하게 반응하고 근거 기반 추론을 수행함을 입증했습니다.
정성적 분석: 비디오 기반 질문에서 기존 모델은 질문의 문구를 모방하거나 일반화된 답변을 생성하는 반면, MOIR 모델은 프레임의 시각적 증거 (예: 'Paypal Honey' 플러그인 식별) 를 기반으로 정확한 답변을 생성했습니다.
5. 의의 및 결론 (Significance & Conclusion)
이 논문은 VLM 의 모달리티 지배성 문제를 정보 중심 (Information-centric) 관점에서 재조명했습니다.
기존 패러다임의 전환: 단순히 모델의 주의 메커니즘을 조정하는 것을 넘어, 입력 데이터의 정보 불균형을 명시적으로 수정하는 것이 더 근본적이고 효과적인 해결책임을 증명했습니다.
실용적 가치: 시각 정보가 손상되거나 모호한 상황에서도 모델이 텍스트에 의존하지 않고 시각적 근거를 찾아낼 수 있도록 하여, 신뢰할 수 있는 다중 모달리티 시스템 구축에 기여합니다.
결론: MOIR 은 교차 모달리티 간 정보 흐름을 명시적으로 조작함으로써, 정보 수준에서의 개입이 다중 모달리티 추론 모델의 모달리티 지배성을 완화하고 견고성을 높이는 효과적이고 보완적인 전략임을 보여줍니다.