← 최신 논문
🤖 AI

Zamba2-VL Technical Report

Zamba2-VL은 Mamba2 상태 공간 레이어와 트랜스포머 블록을 결합한 하이브리드 Zamba2 아키텍처를 기반으로 구축된 효율적인 비전-언어 모델 제품군으로, 선도적인 오픈 웨이트 VLM들과 경쟁 가능한 성능을 달성하는 동시에 특히 엣지 배포에 적합한 작은 규모에서 현저히 빠른 첫 토큰 생성 시간(time-to-first-token)을 제공합니다.

원저자: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 이미지를 위한 더 똑똑하고 빠른 두뇌

당신에게 사진을 보고 그에 대한 질문에 답해야 하는 로봇 비서가 있다고 상상해 보세요. 보통 이런 비서들은 거대하게 불어나는 인덱스 카드 더미를 가진 도서관처럼 만들어집니다. 이미지의 새로운 부분을 볼 때마다 카드를 한 장씩 더 쌓는 식이죠. 만약 이미지가 매우 크거나 복잡하다면, 이 카드 더미는 너무 높아져서 로봇은 다음 카드를 찾기 위해 카드를 뒤적거리는 데에만 모든 시간을 허비하게 됩니다. 이는 모델을 느리고 실행 비용이 많이 들게 만듭니다.

Zamba2-VL 팀은 다른 종류의 로봇을 만들었습니다. 늘어나는 카드 더미 대신, 읽는 양에 상관없이 크기가 일정하게 유지되는 컴팩트하고 고속인 메모리 노트를 준 것입니다. 그들은 이 모델이 두 가지 유형의 사고 방식을 혼합했기 때문에 "하이브리드" 모델이라고 부릅니다.

  1. 급행 차선 (Mamba2): 이 부분은 정보의 긴 목록(이미지 전체와 같은)을 읽을 때, 중간에 막히지 않고 일정한 속도로 빠르게 처리하며 업무의 대부분을 담당합니다.
  2. 스포트라이트 (Transformer): 특정 세부 사항을 완벽하게 기억하기 위해 줌인(zoom in)이 필요할 때만 사용하는 작고 특화된 도구입니다.

그들이 해결한 문제

현재의 AI 모델(Transformer라고 불림)은 이미지를 이해하는 데 뛰어나지만, 매우 무겁습니다. 고해상도 사진을 입력하면 모델은 사진을 수천 개의 작은 조각(토큰)으로 나눕니다. 모델은 지금까지 본 모든 조각에 대한 "기억"을 유지해야 합니다. 이미지가 커질수록 메모리 요구량이 폭발적으로 증가하여, 모델의 시작 속도가 느려지고 일반적인 기기(스마트폰이나 노트북 등)에서 실행하기에 비용이 많이 듭니다.

이 문제를 해결하려는 이전의 시도들은 "순수"한 고속 메모리 시스템(SSM)을 사용했지만, 그런 모델들은 사진 속의 특정 세부 사항(예: 군중 속의 특정 사람을 가리키는 것)을 찾아내는 데 서툴렀습니다. 빠르기는 했지만 세부 사항에 대해서는 "멍청"했습니다.

Zamba2-VL의 솔루션

Zamba2-VL 팀은 두 가지 장점을 모두 갖춘 모델을 만들었습니다.

  • 엔진: 그들은 Zamba2라는 새로운 엔진을 사용했습니다. 이것은 하이브리드 자동차와 같습니다. 주로 순항할 때는 전기 동력(빠르고 효율적인 Mamba2 레이어)을 사용하지만, 복잡한 작업을 처리하기 위해 강력한 힘이 필요할 때는 작은 가솔린 엔진(Transformer 레이어)이 작동합니다.
  • 결과: 이 모델은 크고 무거운 모델들만큼 이미지를 잘 이해하면서도, 시작 속도(첫 번째 토큰 생성 시간, Time-to-First-Token)가 10배 더 빠릅니다.

어떻게 학습시켰나

이 빠른 모델을 똑똑하게 만들기 위해, 단순히 무작위 사진을 던져준 것이 아닙니다. 그들은 특정한 "식단"의 학습 데이터를 선별했습니다.

  • "OCR" 식단: 모델이 일반적인 사진에는 강하지만, 텍로 가득 찬 문서(차트나 스캔 된 종이 등)에는 어려움을 겪는다는 것을 발견했습니다. 그래서 문서 및 텍스트 데이터를 추가로 제공하여 독해 능력을 "벌크업" 시켰습니다.
  • "가리키기" 기술: 모델이 이미지 속 사물을 가리키는 법을 가르쳤습니다. 만약 "자전거 타는 사람이 몇 명인가요?"라고 물으면, 모델은 단순히 "6명"이라고 말하는 데 그치지 않고, 각 자전거 이용자를 좌표와 함께 실제로 가리킬 수 있습니다. 이는 아이에게 사과를 세는 법을 가르칠 때, 단순히 숫자만 세는 것이 아니라 사과 하나하나를 손으로 짚으며 세도록 가르치는 것과 같습니다.

성능: 빠르고 정확함

논문은 자신들의 새로운 모델(1.2B, 2.7B, 7B 파라미터의 소, 중, 대형 사이즈로 제공)을 다른 기업들의 현재 최고 수준 모델들과 비교합니다.

  • 정확도: 물체 세기, 차트 읽기, 복잡한 장면 이해 등의 테스트에서 Zamba2-VL은 기존의 무거운 모델들만큼 우수한 성능을 보였습니다.
  • 속도: 이 부분이 바로 강점입니다. "컴팩트한 노트" 형태의 메모리 덕분에, 경쟁 모델들보다 질문에 답변을 시작하는 속도가 약 10배 더 빠릅니다.
  • 최적의 지점(Sweet Spot): 속도 우위는 더 작은 모델(1.2B 및 2.7B)에서 가장 극적으로 나타납니다. 이 크기들은 가볍지만 여전히 매우 유능하기 때문에 노트북이나 스마트폰 같은 개인용 기기에서 실행하기에 가장 유용합니다.

요약

Zamba2-VL을 앞을 내다볼 줄 아는 체스 마스터이자 단거리 선수라고 생각해보세요. 이전의 빠른 모델들은 앞을 내다보지 못하는 단거리 선수 같았고, 이전의 똑똑한 모델들은 너무 느리게 움직이는 체스 마스터 같았습니다. Zamba2-VL은 단거리 선수의 속도와 체스 마스터의 전략적 기억력을 결합하여, 값비싼 컴퓨터 없이도 복잡한 이미지를 빠르게 처리할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →