← 최신 논문
🤖 machine learning

Multimodal LLMs under Pairwise Modalities

본 논문은 이론적으로 표현 식별성을 분석하고 재구성 및 대비 학습을 통해 공유 잠재 공간을 학습함으로써 오직 쌍별 모달리티 데이터만을 사용하여 다중 모달 대규모 언어 모델의 훈련을 가능하게 하는 2 단계 프레임워크를 제안하며, 이를 통해 완전하게 정렬된 다방향 데이터셋이 필요하지 않으면서도 강력한 교차 모달 전이와 생성을 달성한다.

원저자: Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 문제: "완벽한 저녁 파티" 대 현실

상상해 보세요. 세상 모든 것을 이해하도록 초지능 로봇 (다중 모달 대규모 언어 모델) 을 가르치고 싶다고 가정해 봅시다. 이를 완벽하게 하기 위해서는 보통 모든 것을 한 번에 보여줘야 합니다: 고양이의 사진, 고양이가 야옹거리는 소리 녹음, 고양이에 대한 설명, 그리고 고양이의 3D 모델이 모두 하나의 단일 "패키지"로 묶여 있는 것입니다.

이 논문은 이를 **공동 정렬된 데이터 (Jointly-Aligned Data)**라고 부릅니다. 이는 모든 손님이 정확히 같은 시간에 도착하여 같은 테이블에 앉아 서로 손을 잡고 있어야 하는 저녁 파티를 주최하는 것과 같습니다.

  • 문제점: 이는 조직하기가 매우 어렵고 비용이 많이 듭니다. 현실 세계 (로봇 공학이나 의료 영상과 같은 분야) 에서는 이러한 것들을 한 번에 모두 얻는 경우가 거의 없습니다. 사진과 설명은 있을지 모르지만 3D 모델은 없을 수 있습니다. 또는 터치 센서 판독값과 사진은 있지만 텍스트는 없을 수 있습니다.

이 논문의 해결책: "친구들의 사슬"

저자들은 이렇게 묻습니다: 우리가 가진 것이 쌍 (pair) 만 있다면 로봇을 가르칠 수 있을까요?

  • 쌍 1: 사진과 설명.
  • 쌍 2: 사진과 터치 센서 판독값.
  • 쌍 3: 설명과 3D 모델.

우리는 결코 "사진 + 터치 + 3D"라는 세 가지가 함께 있는 것을 보지 못합니다. 우리는 오직 두 가지씩만 봅니다.

이 논문은 그렇다, 우리가 할 수 있다고 말합니다. 그들은 **MPM(다중 모달 쌍별 모델)**이라는 방법을 제안합니다. 이는 "전화 게임"이나 서로를 소개하는 친구들의 사슬과 같은 게임으로 생각할 수 있습니다.

  • 친구 A친구 B를 알고 있습니다.
  • 친구 B친구 C를 알고 있습니다.
  • 친구 A친구 C를 만난 적이 없더라도, 그들은 친구 B를 통한 공통된 연결고리를 공유하기 때문에 서로를 이해할 수 있습니다.

이 논문은 수학적으로 증명합니다. 만약 당신의 "친구 관계 그래프"(가지고 있는 데이터 쌍들) 가 충분히 연결되어 있다면, 모든 사람을 한 번에 보지 않더라도 그들이 공유하는 "비밀 언어"(잠재 표현) 를 알아낼 수 있다는 것입니다.

작동 방식: 2 단계 구축

저자들은 이 이해를 구축하기 위해 2 단계 건설 부대를 만들었습니다:

1 단계: 범용 번역기 구축 (잠재 정렬)

상상해 보세요. 서로 다른 언어 (이미지, 텍스트, 터치, 3D) 를 사용하는 사람들이 한 그룹에 있다고 가정해 봅시다. 이 모든 것을 한 번에 번역하는 사전이 없습니다.

  1. 자기 점검: 먼저, 건설 부대는 각 언어가 스스로를 번역하도록 가르칩니다. (예: "내가 그림을 본다면, 그것을 다시 스스로에게 설명할 수 있을까?"). 이는 의미가 손실되지 않도록 보장합니다.
  2. 짝짓기: 그런 다음, 그들은 쌍을 이용합니다. "이미지" 번역기가 "텍스트" 번역기와 대화하도록 가르친 다음, "텍스트" 번역기가 "터치" 번역기와 대화하도록 가르칩니다.
  3. 비밀 소스 (부분 정렬): 이 논문은 "터치" 판독값의 모든 것이 "텍스트" 설명과 관련이 있는 것은 아니라고 지적합니다. (텍스트는 "부드럽다"고 말할 수 있지만, 터치는 "거칠다"거나 "차갑다"는 느낌도 받을 수 있으며, 이는 텍스트에 언급되지 않았습니다.) 따라서 시스템은 "좋아, 텍스트 데이터와 일치하는 터치 데이터의 부분만 정렬하겠다"라고 말할 정도로 똑똑합니다. 존재하지 않는 완벽한 일치를 강요하지 않습니다.

결과: 그들은 범용 번역기 공간을 만듭니다. 이제 텍스트의 "부드럽다", 터치에서의 "부드럽다", 3D 의 "부드럽다"는 모두 이 보이지 않는 공간에서 정확히 같은 지점을 가리키게 됩니다.

2 단계: 플러그 앤 플레이 업그레이드 (교차 모달 재구성)

이제 텍스트를 완벽하게 말하고 이미지를 완벽하게 보는 방법을 이미 알고 있는 초지능 로봇 (Qwen3-Omni 와 같은) 이 있다고 상상해 보세요. 로봇 전체를 재학습시키지 않고 (이는 프랑스어를 배우는 동안 영어를 잊어버리는 것과 같습니다) 여기에 터치3D를 추가하고 싶다고 가정해 봅시다.

  1. 다리: 시스템은 새로운 "터치" 데이터를 가져와 1 단계에서 구축된 범용 번역기를 통과시켜 로봇이 이미 이해하는 형식 (텍스트/이미지) 으로 변환합니다.
  2. 인계: 로봇은 이 변환된 신호를 일반적인 텍스트 프롬프트인 것처럼 받습니다. 로봇은 기존의 두뇌를 사용하여 질문에 답하거나 설명을 생성합니다.
  3. 혜택: 로봇의 두뇌는 고정된 상태 (변화 없음) 를 유지합니다. 무엇을 잊어버리지 않습니다. 단지 자신의 모국어로 말하는 새로운 "귀"(또는 "손") 를 얻게 됩니다.

그들이 테스트한 것

이것이 작동함을 증명하기 위해, 그들은 강력한 기존 로봇 (Qwen3-Omni) 을 가져와 이전에 알지 못했던 두 가지 새로운 것을 가르쳤습니다:

  1. 3D 포인트 클라우드: 3D 형태를 이해하는 것.
  2. 촉각 감지: 사물이 어떻게 느껴지는지 (부드럽다, 거칠다 등) 이해하는 것.

그들은 오직 데이터 쌍 (텍스트+3D, 텍스트+터치, 이미지+터치) 만 사용하여 이를 수행했습니다. 그들은 로봇에게 "텍스트 + 이미지 + 3D + 터치"가 모두 한 번에 있는 단일 예시조차 보여주지 않았습니다.

결과: 로봇은 3D 형태와 촉각 감각을 매우 잘 이해하도록 배웠으며, 로봇에게 처음부터 모든 것을 배우도록 강요하거나 완벽하게 정렬된 방대한 양의 데이터를 필요로 했던 다른 방법들보다 더 좋은 성과를 거두었습니다.

요약

  • 옛 방법: 텍스트, 이미지, 소리, 3D 등 모든 정보 조각이 모든 단일 예시마다 완벽하게 동기화되는 완벽하고 비싼 데이터 세트가 필요합니다.
  • 새로운 방법 (이 논문): 텍스트+이미지, 이미지+터치와 같이 쌍만 있는 messy 한 현실 세계 데이터를 사용할 수 있습니다.
  • 방법: 연결된 쌍들이 공유된 의미를 찾는 데 충분함을 수학적으로 증명하고, 새로운 감각이 기존 두뇌를 파괴하지 않고 연결될 수 있도록 하는 "번역기"를 구축함으로써 가능합니다.

이로 인해 전체 시스템을 처음부터 재학습시키기 위한 슈퍼컴퓨터가 필요 없이 AI 에게 터치나 3D 비전과 같은 새로운 감각을 가르치는 것이 훨씬 더 쉽고 저렴해졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →