Continual Video-MLLM Adaptation over Evolving Domains
본 논문은 비디오-MLLM이 치명적 망각과 도메인 간 간섭을 방지하면서 지속적으로 진화하는 도메인에 적응할 수 있도록, 도메인 격리형 경량 전문가와 도메인 내 및 도메인 간 라우팅 메커니즘을 사용하는 매개변수 효율적인 프레임워크인 분포 인식 전문가 라우팅(DAER)을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 똑똑한 로봇에게 영상을 통해 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 "비디오 멀티모달 거대 언어 모델(Video-MLLM)"로, 이미 세상의 모든 책을 읽고 모든 영화를 본 천재적인 학생과 같습니다. 고양이가 레이저 포인터를 쫓는 모습이나 폭풍 속을 달리는 자동차에 대한 질문에 답할 줄 압니다. 하지만 여기 문제가 있습니다. 현실 세계에서 새로운 유형의 영상은 한꺼번에 나타나는 것이 아니라, 매일 하나씩 차례대로 도착한다는 점입니다. 오늘은 교통 카메라 영상이, 내일은 만화가, 그리고 다음 날은 물리 실험 영상이 올 수도 있습니다.
문제는 당신이 로봇에게 새로운 것을 가르칠 때, 로봇이 어제 배웠던 것을 종종 잊어버린다는 것입니다. 이것을 "파괴적 망각(catastrophic forgetting)"이라고 부릅니다. 이는 마치 학생이 수학 시험을 위해 공부해서 통과했지만, 새로운 수학에 너무 집중한 나머지 즉시 읽는 법을 잊어버리는 것과 같습니다. 이를 해결하기 위한 이전의 시도들은 로봇이 모든 것을 하나의 거대한 공유된 뇌에서 배우도록 만들려 했으나 이는 너무 많은 혼란을 야기했고, 혹은 로봇에게 나중에 다시 보여주기 위해 예전 영상들을 저장하려고 했으나 이는 너무 많은 메모리를 차지했습니다. 과학자들은 로봇이 과거의 기술을 잃지 않으면서도 새로운 것을 지속적으로 배울 수 있는 방법, 즉 방대한 옛 영상 도서관이 필요 없는 방법을 원했습니다.
여기에 연구진들이 DAER(Distribution-Aware Expert Routing, 분포 인식 전문가 라우팅)라고 불리는 영리한 해결책을 들고 등장했습니다. 로봇의 뇌를 결코 변하지 않는 거대하고 얼어붙은 도서관이라고 생각해 보세요. DAER는 도서관의 책을 새로 쓰는 대신, 도서관 밖에 위치한 일련의 작고 전문화된 "스터디 그룹" 또는 "전문가 팀"을 구축합니다. 각 팀은 교통 팀, 만화 팀, 과학 팀처럼 특정 유형의 영상에 특화되어 있습니다.
새로운 영상이 도착할 때, 시스템은 단순히 팀을 추측하지 않습니다. 대신, MMD(Maximum Mean Discrepancy, 최대 평균 편차)라는 특별한 "탐정" 도구를 사용합니다. MMD는 영상의 "분위기"를 맡을 수 있는 냄새를 맡는 탐지기라고 상상해 보세요. 만약 영상에서 번잡한 고속도로의 냄새가 난다면, 이 탐지기는 영상을 교통 팀으로 안내합니다. 만약 재미있는 만화의 냄새가 난다면, 그 영상은 만화 팀으로 향합니다. 이를 통해 교통 팀이 만화 때문에 혼란을 겪지 않고 오직 자동차에 대해서만 학습할 수 있도록 보장하며, 그 반대의 경우도 마찬가지입니다. 이는 학습 과정을 깨끗하게 유지하고 로봇이 기억을 뒤섞는 것을 방지합니다.
하지만 로봇이 영상을 보고 있을 때 그 영상의 카테고리 이름을 모른다면 어떻게 될까요? 문제없습니다. 시스템에는 영상의 고유한 지문(fancy way of saying it looks at the video's unique fingerprint)을 살펴보는 "판별 공간(discriminative space)"이라는 두 번째 탐정이 있어, 어떤 전문가 팀이 제 역할을 수행해야 할지 파악합니다. 훨씬 더 나아가, 만약 두 종류의 영상이 매우 유사하다면(예를 들어 서로 다른 종류의 교통 영상들), 시스템은 공간을 절약하기 위해 그들의 스터디 그룹을 부드럽게 병합할 수 있어 로봇이 너무 많은 팀을 갖느라 비대해지는 것을 막아줍니다.
연구진은 로봇에게 "교통 상황은 어떠한가?"부터 "왜 이 마술 트릭이 재미있는가?"까지 매우 다양한 열 가지 유형의 영상 질문을 가르치는 까다로운 과제로 이 아이디어를 테스트했습니다. 그들은 이 방법을 테스트하기 위해 두 개의 강력한 로봇 뇌를 사용했습니다. 결과는 인상적이었습니다. 가장 강력한 로봇 뇌 중 하나인 InternVideo2.5-8B에서, 그들의 방법은 평균 정확도를 **64.38%**에서 **67.59%**로 높였습니다. 더욱 중요한 것은, 이 방법이 로봇이 기존의 교훈을 잊어버리는 것을 막았다는 점입니다. 다른 방법들이 로봇이 알고 있던 것의 **1.81%**를 잊게 만든 반면, DAER는 망각을 **-0.14%**로 줄였습니다. 즉, 로봇이 모든 것을 완벽하게 기억했을 뿐만 아니라 기존 작업에서 오히려 약간 더 발전했다는 것을 의미합니다.
또한 연구진은 이 방법이 훨씬 더 효율적이라는 것을 보여주었습니다. 이전의 최고 방법이 3억 230만 개의 학습 가능한 파라미터와 영상 처리당 1.46초가 필요했던 반면, DAER는 단 1억 3,954만 개의 파라미터와 1.33초만을 필요로 했습니다. 이는 로봇이 더 빠르게 학습하고, 에너지를 덜 사용하며, 실행하기 위해 거대한 컴퓨터를 필요로 하지 않음을 의미합니다.
요약하자면, 이 논문은 메인 뇌를 얼어붙게 유지하고 데이터의 "냄새"에 의해 라우팅되는 스마트하고 전문화된 팀을 사용하는 것이, 변화하는 세상 속에서 AI가 정신을 놓지 않고 지속적으로 학습할 수 있게 한다는 것을 시사합니다. 연구진은 이 접근 방식이 하나의 뇌를 공유하거나 단순히 예전 영상을 재생하는 것보다 더 낫다는 것을 발견했으며, 영상 로봇이 매일 더 똑똑해질 수 있는 안정적이고 효율적인 방법을 제시했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.