FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens
FuseLIP은 이른 결합(early fusion)을 통해 단일 트랜스포머 내에서 텍스트와 이미지 처리를 통합하기 위해 이산 이미지 토크나이저를 활용하는 새로운 멀티모달 임베딩 아키텍처를 도입하며, 이를 통해 더욱 풍부한 교차 모달 상호작용을 가능하게 하여 다양한 임베딩 태스크에서 전통적인 늦은 결합(late fusion) 방식보다 뛰어난 성능을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 컴퓨터는 시각과 언어라는 두 가지 뚜렷한 렌즈를 통해 세상을 이해하는 데 놀라울 정도로 능숙해졌습니다. 수년 동안 가장 성공적인 시스템들은 이 두 가지 감각을 별개의 흐름으로 취급해 왔습니다. 이들은 이미지를 처리하기 위한 하나의 전문화된 뇌와 문장을 처리하기 위한 또 다른 뇌를 사용한 뒤, 프로세스의 맨 마지막 단계에서 이 두 개의 분리된 흐름을 강제로 만나게 합니다. 이러한 방식은 특정 이미지에 대한 사전 학습 없이도 텍스트 설명만으로 특정 사진을 찾아내는 것과 같은 인상적인 성과를 가능하게 했습니다. 하지만 이러한 분리는 사각지대를 만듭니다. 인간이 사진을 보면서 그에 관한 질문을 읽을 때, 인간은 이미지와 단어를 분리하여 처리한 뒤 결합하는 것이 아니라, 두 요소 사이의 관계를 동시에 이해합니다. 기존의 방식은 이미지를 보는 동시에 특정 지시 사항을 읽어야 하는 작업에서 어려움을 겪는데, 이는 두 정보의 흐름이 서로 만나기도 전에 이미 각자 너무 깊게 처리되어 버렸기 때문입니다.
연구진은 시각과 청각을 처음부터 하나로 섞는 인간의 능력을 모방하여, 이러한 시스템을 구축하는 색다른 방법을 제안했습니다. 그들은 'FuseLIP'이라는 새로운 아키텍처를 도입하여 이미지와 텍스트를 위한 별개의 뇌를 사용하는 아이디어를 버렸습니다. 대신, 사진과 단어 모두를 단일하고 통일된 기본 구성 요소, 즉 토큰(token)의 흐름으로 변환하여 하나의 단일한 처리 엔진에 입력합니다. 이렇게 함으로써 시스템은 정보가 프로세스의 끝까지 기다리지 않고, 모든 단계에서 시각적 정보와 언어적 정보가 상호작용할 수 있도록 합니다. 이러한 정보의 조기 혼합은 기존의 분리된 시스템이 놓치는 복잡한 관계를 모델이 학습할 수 있게 해주며, 특히 특정 지시 사항이 시각적 장면을 어떻게 변화시키거나 묘사하는지를 이해해야 하는 작업에서 그 진가를 발휘합니다.
연구진은 먼저 이미지를 컴퓨터가 텍스트에 사용하는 것과 동일한 종류의 이산적인 단위로 변환하는 방법을 찾아내어 이 새로운 시스템을 구축했습니다. 텍스트는 자연스럽게 글자와 단어로 구성되지만, 이미지는 단순히 색상이 있는 픽셀의 격자입니다. 이 간극을 메우기 위해 연구팀은 이미지를 128개의 뚜렷한 코드 시퀀스로 압축하여, 사진을 시각적 단어들의 문장으로 효과적으로 번역하는 도구를 사용했습니다. 그런 다음 이 시각적 단어들을 표준 텍스트 단어들과 결합하여 하나의 긴 목록을 만들었습니다. 이 목록은 맥락과 관계를 이해하도록 설계된 신경망의 일종인 단일 트랜스포머(transformer) 모델에 의해 처리됩니다. 이미지와 텍스트가 처음부터 함께 섞여 있기 때문에, 모델은 "왼쪽"이나 "회전된"과 같은 단어가 자신이 보고 있는 시각적 특징에 어떻게 직접적인 영향을 미치는지 볼 수 있으며, 이를 통해 결합된 입력값에 대해 훨씬 더 풍부한 이해를 형성할 수 있습니다.
이 새로운 시스템을 가르치기 위해 연구진은 모델이 사진과 단어 모두에 주의를 기울이도록 강제하는 커리큘럼을 만들어야 했습니다. 그들은 방대한 양의 표준 이미지 및 텍str 데이터 세트를 수집했지만, 동시에 모델이 퍼즐을 풀도록 요구하는 새로운 방식의 학습 예시들을 고안해 냈습니다. 예를 들어, 텍스트 설명을 바탕으로 이미지가 잘렸거나(cropped), 회전되었거나(rotated), 혹은 뒤집혔는지(flipped)를 식별해야 하는 과제를 만들었습니다. 이러한 시나리오에서는 단순히 그림 속의 객체를 인식하는 것만으로는 충분하지 않았습니다. 모델은 올바른 답을 찾기 위해 구체적인 공간적 지시 사항을 이해해야 했습니다. 또한 연구진은 모델이 이미지에 대한 질문에 답하고, 묘사에 따라 사진의 특정 부분을 찾아내도록 훈련시켰습니다. 결정적으로, 연구진은 오답이 정답과 매우 유사해 보이는 어려운 예시들을 보여줌으로써 모델을 가르쳤고, 이를 통해 모델이 올바르게 방향이 잡힌 객체와 약간 어긋난 객체의 미세한 차이를 학습하도록 강제했습니다.
이 새로운 접근 방식을 이미지와 텍스트 처리를 분리하여 유지하는 전통적인 방식과 비교 테스트했을 때, 결과는 놀라웠습니다. 새로운 시스템인 FuseLIP는 텍스트와 이미지가 어떻게 상호작용하는지에 대한 깊은 이해를 요구하는 작업에서 기존 모델들을 일관되게 능가했습니다. 전통적인 시스템들은 회전된 이미지나 텍text 클루에 기반한 특정 크롭 영역을 식별하라는 요청을 받았을 때 자주 실패했지만, 새로운 시스템은 높은 정확도로 이 문제들을 해결했습니다. 연구진은 이미지를 고립시켜 처리한 후에는 미세한 시각적 세부 정보를 불러올 수 없기 때문에, 정보를 마지막에만 병합하는 기존 시스템들이 이러한 퍼즐을 풀 수 없다는 점을 발견했습니다. 정보를 조기에 혼합하는 이 새로운 시스템의 능력 덕분에, 모델은 언어적 지시 사항을 적용하면서도 필요한 시각적 구조를 유지할 수 있었습니다.
또한 이 연구는 모델을 어떻게 훈련시키느냐가 아키텍처만큼 중요하다는 것을 밝혀냈습니다. 연구진은 이러한 어렵고 혼란스러운 예시들을 학습 데이터에 포함하는 것이 시스템이 학습하는 데 필수적임을 보여주었습니다. 이러한 예시들이 없다면 모델은 비슷하게 생긴 옵션들을 구별하는 데 어려움을 겪었습니다. 나아가, 연구진은 이 새로운 아키텍처가 이중 목적의 학습 방법을 사용하여 훈련될 수 있음을 입증했습니다. 모델은 이미지와 텍스트를 매칭하는 법을 배웠을 뿐만 아니라, 입력값의 누락된 부분을 예측하는 법도 배웠는데, 이 기술은 데이터에 대한 이해를 더욱 강화했습니다. 이러한 조기 혼합과 도전적인 예시에 대한 엄격한 훈련의 결합은 모델이 최첨단 성능을 달성하게 했으며, 멀티모달 데이터 처리에 있어 단일하고 통일된 접근 방식이 가능할 뿐만 아니라 더 우수하다는 것을 증명했습니다.
이 작업의 함의는 단순히 더 높은 테스트 점수를 얻는 것에 그치지 않습니다. 단일 인코더가 이미지와 텍스트를 모두 효과적으로 처리할 수 있음을 보여줌으로써, 연구진은 더 효율적이고 유능한 AI 시스템을 향한 길을 열었습니다. 이러한 시스템은 세상을 이해하기 위해 두 개의 별도이고 무거운 기계 장치를 유지할 필요 없이, 모든 것을 함께 처리하는 하나의 간소화된 엔진을 사용할 수 있습니다. 비록 새로운 시스템이 토크나이저를 통해 단일 이미지를 실행하는 데 더 많은 컴퓨팅 파워를 요구하지만, 전반적인 훈련 과정은 더 효율적이며 결과물인 모델은 더 견고합니다. 연구진은 데이터와 모델 규모를 키우는 데 여전히 발전의 여지가 있다고 인정하지만, 그들의 발견은 멀티모달 이해의 미래가 컴퓨터가 인간처럼 보고 읽는 것을 동시에 배우는 '조기 융합(early fusion)'에 있다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.