Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning
이 논문은 멀티모달 거대 언어 모델의 추론 과정에서 발생하는 표현 편차와 시각적 저하를 완화하기 위해, 시각적 앵커 프롬프트 주입(Visual Anchor Prompt Injection)과 보조적인 공간-주파수 정렬 손실을 활용하는 공간-스펙트럼 시각적 앵커 학습(Spatial-Spectral Visual Anchor Learning, SSVAL) 방법을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 동시에 "보고" "말할" 수 있는 세상을 상상해 보십시오. 이것은 시각적 이미지를 이해하는 능력과 인간의 언어로 말하는 능력을 결합한 인공지능의 한 형태인 멀티모달 거대 언어 모델(MLLM)의 영역입니다. 로봇에게 지저분한 방의 사진을 보고 무엇이 일어나고 있는지 정확하게 설명하거나, "소파 밑에 고양이가 몇 마리 숨어 있나요?"와 같은 질문에 답하도록 가르치는 것을 생각하면 됩니다. 이를 위해 컴퓨터는 이미지를 보기 위한 "비전 인코더"(눈)와 정보를 처리하고 말하기 위한 "거대 언어 모델"(뇌)을 사용합니다. 문제는 이 두 부분이 자연스럽게 같은 언어를 사용하지 않는다는 점이며, 따라서 과학자들은 그 간극을 메우기 위해 특별한 번역기를 사용합니다. 이러한 AI 시스템은 믿기 힘들 정도로 똑똑해졌지만, 여전히 한 가지 까다로운 문제로 어려움을 겪고 있습니다. 그것은 바로 컴퓨터가 이미지에 대해 더 깊이 생각할수록, 마치 당신이 노트를 사용하지 않고 이야기를 너무 오래 기억하려고 할 때 이야기의 맥락을 놓치는 것처럼, 세부 사항을 잊어버리는 것처럼 보인다는 점입니다.
이 논문은 AI 시각 분야의 이러한 구체적인 "망각" 문제를 다룹니다. 연구진은 이러한 모델들이 "눈"으로는 선명한 이미지를 가지고 시작함에도 불구하고, AI의 뇌를 통과하는 많은 층을 거치면서 정보가 흐릿해지고 왜곡된다는 사실을 발견했습니다. 그들은 흔히 쓰이는 아이디어를 테스트했습니다. 만약 우리가 AI가 생각하는 동안 강력한 외부 비전 모델로부터 가져온 완벽한 참조 사진을 계속 보게 강제한다면 어떻게 될까요? 놀랍게도, 그들은 이것이 효과가 없다는 것을 발견했습니다. 참조 사진이 바로 옆에 있음에도 불구하고 AI는 여전히 혼란을 겪고 세부 사항을 놓쳤습니다. 대신, 그들은 공간-스펙트럼 시각 앵커 학습(SSVAL)이라는 새로운 방법을 제안했습니다. 이것을 AI에게 "시각적 앵커 프롬프트"라고 불리는 마법의 포스트잇을 주고, 훈련하는 동안 그 위에 글을 쓰는 법을 가르치는 것이라고 생각해 보십시오. 이 포스트잇은 참조 사진으로부터 완벽한 세부 사항을 흡수하며, 이후 AI의 주의력을 안정적으로 붙잡아주는 가이드 또는 "앵커" 역할을 하여, 정보를 놓치지 않도록 정보를 고정합니다.
양첸룽(Qianlong Yang)과 그의 팀이 이끄는 연구진은 이 "포스트립" 방식이 이전 방법들보다 훨씬 더 효과적이라는 것을 발견했습니다. 그들은 이 시스템을 AI 시전을 위한 표준화된 시험과 같은 여러 도전적인 벤치마크에서 테스트했습니다. 예를 들어, 70억 개의 파라미터를 가진 언어 모델을 사용하는 특정 설정에서, 그들의 방법은 미세 시각 테스트(CV-Bench2D)의 점수를 58.97%에서 65.44%로 향상시켰습니다. 공간 추론을 확인하기 위해 설계된 또 다른 테스트(MMVP)에서는 점수가 33.47%에서 41.33%로 뛰어올랐습니다. 이 논문은 학습된 프롬프트를 앵커로 사용하고, 여기에 다양한 "각도"(공간)와 "주파수"(예를 들어 매끄러운 그림과 거친 스케치의 차이)의 관점에서 이미지를 살펴보는 추가적인 훈련 검사를 결합함으로써, AI가 시각적 기억을 끝까지 날카롭게 유지할 수 있다고 제안합니다.
여기서 핵심적인 발견은 단순히 AI에게 더 좋은 사진을 보여주는 것만으로는 충분하지 않으며, AI가 생각하는 모든 단계에서 함께 가지고 다닐 수 있는 안정적인 내부 참조점이 필요하다는 것입니다. 연구팀은 자신들의 방법인 SSVAL이 AI가 보는 것을 더 잘 기억하도록 도울 뿐만 아니라, 컴퓨터를 훨씬 더 느리거나 무겁게 만들지 않고도 그렇게 한다는 것을 보여주었습니다. 실제로, 사고 단계에서 시스템에 추가되는 "무게"는 매우 작습니다. 파라미터는 약 1.55%만 더 추가되며, 컴퓨팅 능력의 증가는 무시할 수 있는 수준입니다. 이는 AI가 더 큰 뇌나 더 빠른 프로세서 없이도 자신이 보는 것에 대해 더 똑똑해질 수 있음을 의미합니다. 결과는 이 접근 방식이 시각 정보의 저하를 효과적으로 막아주어, AI가 이전보다 훨씬 높은 정확도로 사물의 위치나 개수에 대한 까다로운 질문에 답할 수 있게 해준다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.