From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model
본 논문은 제로샷 분류를 바세슈타인 최적 운송 문제로 정식화하여 강건한 의사 라벨을 생성하고, 이를 이론적으로 정렬된 InfoNCE 대조 손실에 사용하여 분포 변화 하에서도 최첨단 성능을 달성함으로써 추론과 적응을 연결하는 시각-언어 모델을 위한 통합된 테스트 시간 적응 프레임워크인 \algname을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 세계에서 컴퓨터는 놀라울 정도로 유창하게 보고 읽는 법을 배웠습니다. 시각-언어 모델(vision-language models)이라고 알려진 시스템은 사진을 보고 이를 설명하거나, 문장을 읽고 그에 맞는 이미지를 찾아낼 수 있으며, 이 모든 것을 특정 작업을 위해 명시적으로 학습하지 않고도 수행합니다. 이들은 사진과 단어를 공유된 수학적 언어, 즉 사진 속 고양이와 '고양이'라는 단어가 바로 옆에 놓이게 되는 공통의 공간으로 번역하는 법을 배움으로써 이 능력을 얻습니다. 이러한 능력은 모델이 이전에 본 적 없는 물체를 인식할 수 있게 해주는데, 이를 제로샷 학습(zero-shot learning)이라 부릅니다. 하지만 이러한 모델들은 취약합니다. 현실 세계가 변할 때, 즉 사진이 흐릿하거나 날씨가 좋지 않거나 디지털 노이즈로 왜곡될 때, 공유된 언어는 무너집니다. 이미지와 단어 사이의 연결이 느슨해지고 모델의 확신은 무너져 내리며, 이는 자율 주행이나 의료 진단과 같은 중요한 응용 분야에서 위험한 실수로 이어질 수 있습니다.
연구자들은 모델이 작동하는 동안 실시간으로 학습하게 하는 '테스트 시간 적응(test-time adaptation)'이라는 과정을 통해 이를 해결하려 노력해 왔습니다. 아이디어는 간단합니다. 모델이 새롭고 지저분한 이미지를 마주할 때, 그것들을 이해하기 위해 내부 설정을 조정해야 한다는 것입니다. 그러나 이에 대한 이전의 시도들은 근본적인 문제에 부딪혔습니다. 학습을 하려면 모델이 자신이 무엇을 보고 있는지 알아야 하지만, 이러한 현실 세계의 시나리오에서는 정답을 제공해 주는 사람이 없습니다. 모델은 스스로 레이블을 추측해야 하며, 이 추측은 종종 틀립니다. 모델이 자신의 잘못된 추측으로부터 배우려고 할 때, 모델은 노이즈를 증폭시켜 스스로를 더 악화시키게 됩니다. 더욱이, 기존 방식들은 모든 이미지를 하나의 그룹으로 취급하여 오류를 완화하려 했으나, 이는 매우 거친 접근 방식이었습니다. 이러한 조잡한 방식은 개별 사진의 고유한 세부 사항을 무시했기에, 모델이 특정 이미지와 그 설명 사이의 구체적인 관계를 진정으로 이해하는 것을 방해했습니다.
이제 한 연구팀이 이 문제를 해결할 새로운 방법인 ORIGIN이라는 방법을 제안했습니다. 모델의 가공되지 않은, 종종 혼란스러운 추측에 의존하는 대신, 그들은 이 문제를 전역적 논리(global logic)로 풀어야 하는 매칭 게임으로 취급합니다. 한 방에 사람들이 가득 차 있고 다른 방에 이름들이 가득 차 있다고 상상해 보십시오. 목표는 모든 사람을 올바른 이름과 짝지어 주는 것입니다. 만약 각 사람을 개별적으로만 본다면 실수를 할 수도 있습니다. 하지만 방 전체를 한꺼번에 본다면, 모든 이름이 정확히 한 번씩 사용되어야 한다는 사실을 이용해 오류를 바로잡을 수 있습니다. 연구자들은 정확히 이 작업을 수행하기 위해 최적 운송(optimal transport)이라는 수학적 프레임워크를 사용합니다. 이는 모델이 이미지와 텍ек스트 설명을 함께 전체 배치(batch) 단위로 보도록 강제하여, 가장 논리적인 방식으로 그들을 짝지어 줍니다. 이러한 전역적 관점은 노이즈를 걸러내고 이미지가 무엇인지에 대해 훨씬 더 신뢰할 수 있는 추측을 만들어냅니다.
모델이 이러한 신뢰할 수 있는 추측을 확보하면, 이를 사용하여 스스로를 가르칩니다. 연구자들은 이러한 새롭고 노이즈가 섞인 이미지로부터 학습하는 가장 좋은 방법은 모델이 원래 학습되었던 방식과 밀접하게 유사한 방식을 사용하는 것이라는 점을 발견했습니다. 그들은 모델이 보고 있는 특정 이미지가 공유된 수학적 공간 내에서 올바른 설명에는 더 가까워지도록, 그리고 잘못된 설명으로부터는 더 멀어지도록 내부 설정을 조정하도록 유도합니다. 이것은 미세한 수준(fine-grained)의 접근 방식입니다. 즉, 그룹의 평균이 아니라 모든 개별 사진의 고유한 세부 사항에 주목합니다. 이렇게 함으로써, 모델은 변화하는 세계에 맞춰 스스로를 재정렬하는 법을 배우며, 이미지가 손상된 상황에서도 명확하게 보는 능력을 회복합니다.
이 새로운 접근 방식의 탁월함은 이전에 별개의 단계로 취급되었던 두 가지 과정을 통합했다는 점에 있습니다. 연구자들은 초기 추측을 만드는 데 사용되는 논리와 그것으로부터 배우는 데 사용되는 논리가 실제로는 동전의 양면과 같다는 것을 보여주었습니다. 최적의 매칭 쌍을 찾는 방법은 모델이 개선되도록 가르치는 방법과 수학적으로 동일합니다. 이는 추측하는 과정과 학습하는 과정이 서로 충돌하는 것이 아니라, 서로를 돕고 있다는 것을 의미합니다. 더 나은 추측이 더 나은 학습을 만들고, 더 나은 학습이 더 정확한 미래의 추측을 만듭니다. 이는 모델이 매 단계를 밟을 때마다 더 똑똑해지고 더 견고해지는 개선의 순환을 만들어냅니다.
노이즈, 블러, 날씨 효과로 의도적으로 왜곡된 표준 벤치마크 데이터셋에서 테스트했을 때, 이 새로운 방법은 기존의 그 어떤 방법보다 현저히 효과적임을 입증했습니다. 작고 저해상도인 이미지 데이터셋에서, 이 방법은 기존의 최고 방법들과 비교하여 정확도를 최대 7.4% 향상시켰습니다. 더 복잡한 이미지로 구성된 더 큰 데이터셋에서도 여전히 압도적인 격차로 경쟁자들을 앞질렀습니다. 아마도 똑같이 중요한 점은, 이 과정이 시스템을 느리게 만들지 않았다는 것입니다. 최적의 매칭을 찾기 위해 필요한 추가 계산은 매우 효율적이어서 프로세스에 거의 지연을 주지 않았습니다. 모델은 높은 성능을 유지하면서도 데이터의 흐름에 맞춰 실시간으로 적응할 수 있었습니다.
연구자들은 또한 시스템의 서로 다른 부분들을 분석함으로써 왜 이것이 그렇게 잘 작동했는지 탐구했습니다. 그들은 초기 추측을 생성하는 데 전역적 매칭 논리를 사용하는 것이 결정적이라는 것을 발견했습니다. 이 논리가 없다면 모델은 노이즈가 섞인 데이터로부터 학습하는 데 어려움을 겪습니다. 또한, 광범위한 카테고리만을 바라보는 기존 방식보다 개별 이미지-텍스트 쌍에 집중하는 미세한 학습 방식이 훨씬 우수하다는 것을 발견했습니다. 이 두 가지 요소를 결합했을 때 결과는 일관되게 가장 뛰어났습니다. 시스템은 단순히 분포 변화(distribution shifts)에서 살아남는 것에 그치지 않고, 그 안에서 번창했습니다. 이는 모델이 생각하는 방식과 학습하는 방식을 일치시킴으로써, 우리가 정말로 예측 불가능하고 무질서한 현실 세계에 대해 탄력적인 인공지능을 구축할 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.