Deep Multimodal Learning with Missing Modality: A Survey
이 설문 조사는 결측 모달리티가 있는 멀티모달 학습(MLMM)을 위한 딥러닝 방법론에 대한 첫 번째 종합적인 검토를 제공하며, 그 동기, 표준 설정과의 차이점, 현재 기술, 응용 분야, 데이터셋 및 향후 과제를 상세히 다룹니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
큰 그림: "오감(Five Senses)"의 문제
여러분이 영화를 이해하려고 노력하고 있다고 상상해 보세요. 보통 여러분에게는 두 가지 주요 입력값이 있습니다. 바로 시각(비디오)과 청각(대화와 음악)입니다. 이것은 하나의 "멀티모달(multimodal)" 시스템입니다. 즉, 전체 이야기를 파악하기 위해 여러 감각을 사용하는 것이죠.
하지만 현실 세계에서는 문제가 발생합니다. 스피커가 고장 나서 소리가 안 들릴 수도 있고(소리 없음), 화면이 검게 변할 수도 있습니다(비디오 없음). 혹은 안개가 자욱한 숲속에 있어서 앞은 보이지 않지만, 바스락거리는 소리는 들릴 수도 있습니다. 이것이 바로 결측 모달리티(Missing Modality) 문제입니다.
대부분의 AI 모델은 교과서와 오디오 강의 노트를 둘 다 가지고 있을 때만 공부할 줄 아는 학생과 같습니다. 만약 하나라도 가져가 버리면, 그들은 당황하며 실패하고 맙니다. 이 서베이 논문은 연구자들에게 AI가 한 가지 "감각"을 잃더라도 어떻게 침착함을 유지하고 잘 수행할 수 있도록 가르칠 것인가에 대한 거대한 가이드북입니다.
이 논문은 무엇에 관한 것인가?
이 논문은 서베이(Survey) 논문입니다. 즉, 2012년부터 2025년 사이에 이 특정 주제로 쓰인 모든 책(354편의 논문!)을 읽은 사서라고 생각하면 됩니다. 저자인 Renjie Wu와 그의 팀은 이 다양한 해결책들을 명확한 지도로 정리하여, 연구자들이 무엇이 효과적이고 무엇이 그렇지 않은지, 그리고 다음에 어디로 나아가야 할지를 알 수 있게 해주었습니다.
그들은 이 분야를 MLMM(Multimodal Learning with Missing Modality, 결측 모달리티를 포함한 멀티모달 학습)이라고 부릅니다.
두 가지 주요 전략: "데이터 수정" vs "두뇌 수정"
저자들은 모든 해결책을, 고장 난 자동차를 고칠 때 부품을 수리하는 것과 운전자의 운전 방식을 바꾸는 것의 차이처럼 두 가지 큰 진영으로 나눕니다.
1. 데이터 처리: "부품 수정하기"
이 접근 방식은 AI가 생각을 시작하기도 전에 누락된 정보를 채워 넣으려고 시도합니다.
- "빈 페이지" 방식 (모달리티 합성/Composition): 여러분이 책을 읽고 있는데 페이지 하나가 찢겨 나갔다고 상상해 보세요. 여러분은 그냥 빈 흰색 공간(0)으로 남겨두거나, 페이지에 아무 의미 없는 낙서(무작위 값)를 할 수 있습니다. AI는 이 빈 공간을 무시하고 나머지 부분에 집중하는 법을 배웁니다. 단순하지만 아주 똑똑하지는 않은 방식입니다.
- "복사해서 붙여넣기" 방식 (검색/Retrieval): 만약 페이지가 사라졌다면, 도서관에 있는 똑같은 책의 다른 복사본들을 찾아보고, 일치하는 페이지를 찾아 그곳에 붙여넣는 것입니다. 이 방식은 책들이 서로 동일하다면 잘 작동하겠지만, 이야기 내용이 조금씩 다르다면 엉뚱한 장면을 붙여넣게 될 수도 있습니다 있습니다.
- "상상하기" 방식 (모달리티 생성/Generation): 이것이 가장 진보된 방식입니다. AI는 창의적인 작가처럼 행동합니다. 만약 오디오가 없다면, AI는 비디오를 보고 어떤 소리가 나야 하는지 상상하여 그것을 만들어냅니다. 마치 마술사가 모자에서 토끼를 꺼내는 것과 같습니다. 논문은 이 방식이 멋지긴 하지만, 때때로 "환각(hallucinate)"(사실이 아닌 것을 지어냄)을 일으킬 수 있다고 지적합니다.
2. 전략 설계: "두뇌 수정하기"
누락된 데이터를 직접 고치는 대신, 누락된 데이터를 자연스럽게 처리할 수 있도록 AI의 구조(architecture)를 변경하는 방식입니다.
- "스포트라이트" 방식 (어텐션/Attention): 교실에 있는 선생님을 상상해 보세요. 어떤 학생이 결석했다고 해서 선생님이 수업을 중단하지는 않습니다. 대신 선생님은 남아 있는 학생들에게 스포트라이트를 비춥니다. "어텐션" 메커니즘은 AI가 동적으로 사용 가능한 데이터에만 집중하고 누락된 부분은 무시할 수 있게 해줍니다.
- "튜터(개인 과외)" 방식 (지식 증류/Distillation): 모든 책을 다 가진 똑똑한 학생(선생님)이 있다고 상상해 보세요. 덜 똑똑한 학생(학생)은 책의 절반만 가지고 있습니다. 선생님은 학생에게 빠진 챕터들을 설명해 줍니다. 그러면 학생은 물리적인 책이 없더라도 전체 이야기를 이해하는 법을 배우게 됩니다.
- "팀워크" 방식 (모델 조합/Combinations): 하나의 거대한 AI 대신, 전문가 팀을 구성합니다. 비디오가 없다면 "오디오 전문가"에게 묻습니다. 오디오가 없다면 "비디오 전문가"에게 묻습니다. 그들은 함께 답에 대해 투표합니다.
- "슈퍼 브레인" (거대 언어 모델/LLM): 최근에는 챗봇을 움직이는 거대한 AI 모델들이 매우 똑똑해져서 텍스트, 이미지, 소리를 동시에 이해할 수 있게 되었습니다. 이들은 매우 유연해서, 하나의 입력값이 사라지더라도 마치 그림이 보이지 않아도 이야기를 계속할 수 있는 사람처럼 적응하여 계속 진행합니다.
어디에 사용되는가? (실제 사례)
논문은 이 기술이 결정적으로 중요한 많은 분야를 나열합니다:
- 의료 영상: 의사가 환자의 MRI 스캔은 있지만 CT 스캔은 없는 상황일 수 있습니다. AI는 엉뚱한 추측을 하지 않고 MRI만으로 질병을 진단해야 합니다.
- 자율주행 자동차: 자동차의 카메라가 눈(snow) 때문에 앞이 보이지 않거나, 레이더가 고장 날 수 있습니다. 자동차 AI는 여전히 작동 중인 센서만을 사용하여 안전하게 계속 주행해야 합니다.
- 감정 감지: 화상 통화 중에 오디오 상태는 나쁘지만 비디오는 선명할 수 있습니다. AI는 당신의 얼굴을 보고 당신이 행복한지 슬픈지를 여전히 알아낼 수 있어야 합니다.
- 로보틱스: 동굴을 탐사하는 로봇이 GPS 신호를 잃을 수 있습니다. 로봇은 카메라와 촉각 센서만을 사용하여 길을 찾아야 합니다.
우리가 아직 해결하지 못한 문제들
이러한 멋진 기술들이 있음에도 불구하고, 논문은 몇 가지 큰 골칫거리를 지적합니다:
- "가짜 데이터"의 함정: AI가 누락된 데이터를 "상상"할 때, 때때로 잘못된 세부 사항을 지어내기도 합니다. 만약 자율주행 자동차가 낭떠러지가 있는 곳에 도로가 있다고 상상한다면, 그것은 위험합니다.
- "게으른" AI: 때때로 AI가 누락된 부분을 채우려고 노력하더라도, 결국 새로운 정보를 무시하고 자신이 가진 하나의 센서에만 의존하게 되어, 결과적으로 충분하지 않은 정보만 갖게 되는 경우가 있습니다.
- "엉망인 도서관": 단일 표준 테스트가 없습니다. 어떤 연구자는 10%의 데이터가 누락된 상태로 테스트하고, 다른 연구자는 90%가 누락된 상태로 테스트할 수 있습니다. 누가 실제로 더 뛰어난지 비교하기가 어렵습니다.
- 너무 무거운 시스템: 이러한 솔루션 중 상당수는 엄청난 컴퓨터 성능(슈퍼컴퓨터 같은)을 요구합니다. 하지만 실제 세상의 기기들(스마트워치나 드론 등)은 작고 배터리 성능이 약합니다. 우리는 작은 칩에서도 작동하는 "경량화된" 솔루션이 필요합니다.
결론
이 논문은 하나의 로드맵입니다. 우리는 센서가 고장 나거나 데이터가 누락된 상황에 대처하도록 AI를 가르치는 데 큰 진전을 이루었지만, 여전히 엉뚱한 것을 지어내지 않고, 슈퍼컴퓨터를 필요로 하지 않으며, 복잡한 현실 세계의 상황에서도 혼란을 겪지 않는 더 나은 방법들이 필요하다는 것을 알려줍니다. 목표는 시야가 흐릿하거나 마이크가 고장 나더라도 세상을 이해할 수 있는 인간처럼, 견고한(robust) AI를 구축하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.