Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Mage-VL은 모션 인식 토크나이저와 이중 시스템 아키텍처를 활용하여 정적 및 동적 추론 작업 모두에서 더 큰 규모의 최첨단 모델들과 대등하거나 이를 능가하면서도, 토큰 소비를 크게 줄이고 추론 속도를 높여 실시간 멀티모달 이해를 달성하는 효율적인 코덱 네이티브 스트리밍 파운데이션 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 스마트폰으로 축구 경기를 생중계로 보고 있다고 상상해 보세요. 카메라는 경기장을 가로지르고, 관중들은 환호하며, 선수들은 앞뒤로 질주합니다. 이제, 이 경기를 실시간으로 이해하려고 노력하는 초지능 로봇을 상상해 보세요. 현재 대부분의 로봇은 500페이지짜리 교과서의 모든 단어, 심지어 "잔디가 초록색이다"라는 문장이 백 번 반복되는 부분까지도 하나하나 다 읽어야 한다고 고집하는 학생과 같습니다. 그들은 정적인 영상의 지루한 부분에 매달려 모든 두뇌 전력과 시간을 낭비하며, 정작 골이 들어가는 결정적인 순간은 놓치고 맙니다. 이것은 일종의 역설입니다. 그들은 복잡한 퍼즐을 푸는 데는 천재적이지만, 움직이는 장면을 효율적으로 보는 데는 형편없기 때문입니다.
Microsoft Mage 팀이 작성한 이 논문은 Mage-VL이라는 새로운 종류의 로봇 두뇌를 소개합니다. 이 모델은 인간의 눈처럼 행동하도록 설계되어 기존의 규칙을 깨뜨립니다. 모든 프레임을 뚫어지게 쳐다보는 대신, Mage-VL은 실제로 변화하거나 움직이는 부분에만 주의를 기울입니다. 마치 움직임 감지 센서만 주시하는 보안 요원과 같습니다. 아무것도 움직이지 않는다면 빈 복도를 감시하는 데 에너지를 낭비하지 않습니다. 이렇게 함으로써 로봇은 영상을 훨씬 더 빠르게 이해하고 더 적은 컴퓨팅 자원을 사용할 수 있으며, 경기가 끝난 후 요약본을 주는 것이 아니라 경기가 진행되는 도중에 당신과 대화를 나눌 수 있게 해줍니다.
"코덱 네이티브(Codec-Native)" 시청의 마법
Mage-VL의 비결은 저자들이 코덱 네이티브 접근 방식이라고 부르는 기술입니다. 넷플릭스나 유튜브 같은 비디오 스트리밍의 세계에서 컴퓨터는 공간을 절약하기 위해 "압축"이라는 기술을 사용합니다. 모든 프레임을 다 보내는 것이 아니라, 전체 그림(I-프레임) 하나를 보낸 뒤 다음 몇 초 동안 변하는 아주 작은 부분들(P-프레임)만 보냅니다. 이것이 당신의 스마트폰이 데이터를 과도하게 소비하지 않고 영화를 스트리밍할 수 있는 방법입니다.
Mage-VL은 이 언어를 네이티브하게 구사하도록 구축되었습니다. 영상을 경직된 정지 이미지 격자로 강제로 변환하는 대신, 이 모델은 비디오 압축에서 사용하는 것과 동일한 모션 신호를 사용하여 무엇이 중요한지 결정합니다. 선수가 달리고 있다면 로봇은 선수에게 초점을 맞춥니다. 배경의 관중들이 가만히 서 있다면 로봇은 이를 완전히 무시합니다. 이는 정물화를 찍기 위해 초당 30장의 사진을 찍는 대신, 흥미로운 일이 생길 때만 사진을 찍는 사진가와 같습니다.
그 결과 엄청난 효율성 향상이 나타났습니다. 논문에 따르면 Mage-VL은 "시각적 토큰(컴퓨터가 처리해야 하는 이미지의 작은 조각들)"의 수를 75% 이상 줄일 수 있습니다. 이는 마치 책을 읽을 때 지루한 내용들을 건너뛰고 흥미진진한 장들만 읽어도 전체 이야기를 완벽하게 이해하는 것과 같습니다.
두 가지 시스템을 갖춘 두뇌
스트리밍 비디오를 처리하기 위해 Mage-VL은 인간의 사고방식에서 영감을 얻은 영리한 두 부분의 두뇌를 사용합니다.
- 시스템 1 (반사 신경): 이는 매우 빠르고 가벼운 문지기 역할을 합니다. 비디오 스트림을 지켜보며 "지금 흥미로운 일이 일어나고 있는가?"라고 묻습니다. 답이 '아니오'라면 침묵을 유지합니다. 만약 답이 '예'(예: 골이 들어감)라면, 즉시 두 번째 두뇌를 깨웁니다.
- 시스템 2 (추론기): 이는 본격적인 사고를 담당하는 부분입니다. 문이 열리면, 이 모델은 깊이 파고들어 정확히 무슨 일이 일어났는지 파악하고 응답을 생성합니다.
즉, 로봇은 비디오의 지루한 부분에 대해 생각하느라 시간을 낭비하지 않습니다. 하프타임 쇼가 진행 중이거나 카메라가 경기장을 가로질러 이동할 때는 조용히 있다가, 선수가 공을 차는 순간 바로 의견을 내놓습니다.
발견한 것 (그리고 발견하지 못한 것)
팀은 약 5억 6천만 개의 레이블이 없는 이미지와 1억 개의 레이블이 없는 비디오 프레임을 사용하여 이 모델을 처음부터 학습시켰습니다. 이는 엄청난 양처럼 들리지만, 수십억 개의 이미지-텍스트 쌍이 필요한 다른 거대 모델들과 비교하면 실제로는 꽤 작은 규모입니다. 놀랍게도, 훌륭한 시각적 두뇌를 만들기 위해 반드시 웹 스케일의 방대한 데이터셋이 필요한 것은 아니라는 점을 발견했습니다. Mage-VL의 맞춤형 학습 방식 덕분에, 이 모델은 훨씬 더 큰 모델들과 대등하거나 심지어 비디오 이해 작업에서 능가하는 성능을 보여주었습니다.
주요 발견 사항은 다음과 같습니다:
- 속도: Mage-VL은 믿을 수 없을 정도로 빠릅니다. 정답을 맞히면서도 실제 시간 기준으로 표준 모델보다 최대 3.5배 빠르게 영상을 처리할 수 있습니다.
- "긴 비디오" 학습의 불필요성: 긴 비디오에 대한 질문에 답하는 능력을 키우기 위해 모델을 굳이 긴 비디오로 직접 학습시킬 필요가 없다는 것을 발견했습니다. 짧은 클립에 대한 상세한 설명을 통해 학습시키고 스마트한 "코덱" 방식을 사용함으로써, 모델은 스스로 긴 비디오를 이해하는 법을 배웠습니다.
- 모션이 공간 추론을 돕는다: 움직이는 비디오로 학습시키는 것이 정적인 3D 형태와 공간 관계를 이해하는 데 실제로 도움이 된다는 것을 발견했습니다. 사물이 어떻게 움직이는지를 보는 것이 로봇이 사물들이 공간 속에서 어떻게 배치되는지 이해하는 데 도움을 주는 것으로 보입니다.
- AI가 돕는 AI: 팀은 더 나은 학습 데이터를 작성하기 위해 AI 시스템을 활용했습니다. AI가 생성된 캡션을 검토하고, 오류를 수정하며, 프롬프트를 개선하는 루프를 통해 데이터의 품질을 훨씬 더 높였습니다.
결론
Mage-VL은 AI가 실시간으로 세상의 모습과 소리를 실제로 "보고 듣게" 만드는 데 있어 중요한 진전입니다. 이는 세상을 이해하기 위해 모든 픽셀을 무식하게 밀어붙일 필요가 없다는 것을 증명합니다. 무엇을 볼지 똑똑하게 결정함으로써(비디오 압축 방식과 인간의 눈이 움직임에 집중하는 방식을 모방하여), 이 모델은 더 빠르고, 비용이 적게 들며, 더 즉각적으로 반응하게 되었습니다.
논문은 이 모델이 여전히 복잡한 추론 작업이나 수학적 문제 해결에는 보완할 점이 있다고 언급했지만, 더 작고 효율적인 모델이 역동적이고 움직이는 세상을 이해하는 데 있어 훨씬 크고 느린 거인들을 능가할 수 있음을 성공적으로 입증했습니다. 이는 "모든 것을 읽는 것"에서 "중요한 것을 보는 것"으로의 전환입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.