← 최신 논문
💬 NLP

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

본 논문은 멀티모달 확산 언어 모델(Multimodal Diffusion Language Models)과 자기회귀 시각 언어 모델(Autoregressive Vision Language Models)을 임베딩 도구로서 비교하는 첫 번째 체계적인 연구를 제시하며, 전자가 불충분한 이미지-텍스트 정렬로 인해 일반적으로 성능이 저하되지만 그 성능 격차는 특정 모델들 사이에서 크게 달라진다는 점을 밝히고 있다.

원저자: Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 책, 사진, 비디오가 선반이 아닌 고유한 "분위기"나 "지문"으로 저장되는 거대한 도서관을 가지고 있다고 상상해 보세요. AI의 세계에서 이 지문들은 **임베딩(embeddings)**이라고 불립니다. 임베딩은 컴퓨터가 강아지 사진과 "강아지"라는 단어가 서로 관련되어 있다는 것을, 비록 하나는 이미지이고 하나는 텍스트일지라도 이해할 수 있게 해줍니다.

오랫동안 이러한 지문을 만드는 가장 좋은 방법은 **자기회귀 모델(Autoregressive Models)**을 사용하는 것이었습니다. 이것은 마치 사람이 이야기를 왼쪽에서 오른쪽으로 한 단어씩 읽는 것과 같습니다. 이 모델들은 단계별로 의미를 구축하기 때문에 문맥을 이해하는 데 매우 능숙합니다.

최근에는 **확산 모델(Diffusion Models)**이라는 새로운 유형의 AI가 인기를 얻고 있습니다. 이것은 마치 조각가가 노이즈로 뒤덮인 대리석 덩어리에서 시작하여 노이즈를 조금씩 깎아내어 조각상을 드러내는 것과 같습니다. 또는, 모델이 한 번에 전체 문장을 보고 누락된 단어들을 하나씩 추측하는 대신 동시에 채워 넣는 사람이라고 생각할 수도 있습니다. 이 모델들은 전체적인 "큰 그림"(양방향 어텐션)을 한꺼번에 볼 수 있기 때문에 매우 뛰어납니다.

핵심 질문
이 논문의 연구진은 간단한 질문을 던졌습니다. 이 새로운 "조각가"(확산) 모델들이 기존의 "독자"(자기회귀) 모델만큼 이 "분위기" 지문을 만드는 데 뛰어날 수 있을까?

실험
결과를 알아내기 위해, 팀은 두 개의 최고의 "조각가" 모델(LaViDaMMaDA)과 두 개의 최고의 "독자" 모델(LLaVA-1.6Qwen2.5-VL)을 선정했습니다. 그들은 이 모델들에게 표준적인 학습 방법(예: 사진을 적절한 설명과 일치하도록 가르치는 방식)을 사용하여 지문을 생성하도록 가르쳤습니다.

그 후, 세 가지 시나리오에서 테스트를 진행했습니다:

  1. 분류(Classification): "이 사진은 무엇인가?" (예: 고양이인가 강 dog인가?)
  2. 시각적 질의응답(VQA): "이 차트를 보고, 가장 높은 수치는 무엇인가?"
  3. 검색(Retrieval): "이 특정 설명과 일치하는 사진을 찾아라."

결과: "조각가"들의 고전
결과는 놀라웠습니다. "조각가" 모델들(확산 모델)은 모든 것을 한꺼번에 볼 수 있는 초능력을 가지고 있음에도 불구하고, 일반적으로 "독자" 모델들에 비해 성능이 떨어졌습니다.

  • "우수한" 조각가 (LaViDa): 이 모델은 꽤 잘 해냈습니다. 최고의 "독자" 모델들보다 아주 약간 뒤처졌을 뿐입니다 (100점 만점 기준으로 약 3~4점 낮음). 특히 생소한 유형의 데이터(도메인 외 데이터)를 처리하는 데 뛰어났는데, 이는 이 모델이 조금 더 유연하다는 것을 시사합니다.
  • "고전하는" 조각가 (MMaDA): 이 모델은 큰 격차를 보였습니다. 모든 분야에서 "독자" 모델들보다 20점 이상 낮게 점수를 기록했습니다. 이 모델은 도저히 따라잡지 못했습니다.

왜 이런 일이 발생했을까요?
연구진은 왜 "조각가"들이 지고 있는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 두 가지 주요 원인을 발견했습니다.

  1. 불일치하는 지문: "독자" 모델의 경우, 사진과 텍의 지문이 매우 가깝게 위치합니다(완벽하게 정렬됩니다). 반면 "조각가" 모델의 경우, 사진 지문과 텍스트 지문이 종종 멀리 떨어져 있었습니다. 마치 두 사람이 손을 잡으려 하지만 방 반대편에 서 있는 것과 같았습니다. 모델들이 이미지와 텍스트를 긴밀하게 연결하는 법을 충분히 배우지 못한 것입니다.
  2. 잘못된 학습 목표: "고전하는" 모델(MMaDA)은 두 가지 일을 동시에 수행하도록 학습되었습니다: 이미지를 이해하는 것과 동시에 새로운 이미지를 처음부터 생성하는 것입니다. 연구진은 "화가"(이미지 생성)가 되려는 노력이 모델이 훌륭한 "사서"(정밀한 지문 생성)가 되는 데 방해가 되었다고 추측합니다.

시사점
확산 모델이 흥미롭고 한꺼번에 전체 그림을 보는 것과 같은 멋진 기능을 가지고 있음에도 불구하고, 검색 친화적인 지문을 만드는 데 있어 기존의 "독자" 모델들을 대체하기에는 아직 준비가 되지 않았습니다. "독자" 모델들은 주로 자신이 보는 것과 읽는 것을 더 긴밀하게 연결하기 때문에 여전히 정확도 면에서 왕좌를 지키고 있습니다.

이 논문은 확산 모델이 잠재력(특히 LaViDa 모델처럼)을 가지고 있지만, 검색용 지문을 만드는 데 있어 기본 선택지가 되기 위해서는 이미지와 텍스트를 정렬하는 능력을 훨씬 더 개선해야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →