← 최신 논문
🤖 AI

ZAYA1-VL-8B Technical Report

본 논문은 다양한 시각 이해 벤치마크에서 더 큰 최첨단 모델과 경쟁하거나 능가하는 성능을 달성하기 위해 시각 특화 LoRA 어댑터와 양방향 어텐션을 활용하는 92 억 파라미터 규모의 콤팩트한 혼합 전문가(Mixture-of-Experts) 비전 - 언어 모델인 ZAYA1-VL-8B 를 소개합니다.

원저자: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

ZAYA1-VL-8B 기술 보고서에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.

큰 그림: 이미지와 텍스트를 위한 컴팩트한 "슈퍼 두뇌"

모든 책에 대해 알고 있지만 단 한 장의 그림도 본 적이 없는 천재 사서 (언어 모델) 가 있다고 상상해 보세요. 이제 이 사서에게 사진, 차트, 다이어그램을 이해할 수 있도록 안경을 씌워주고 싶다고 가정해 봅시다.

Zyphra Technologies 팀은 이미지와 텍스트를 동시에 읽을 수 있는 새로운 형태의 "시각 - 언어 모델"인 ZAYA1-VL-8B를 개발했습니다. 이는 컴팩트하고 매우 효율적인 두뇌와 같으며, 80 억 개의 파라미터라는 상대적으로 작은 규모임에도 불구하고 사물 세기, 이미지 내 텍스트 읽기 (OCR), 시각적 퍼즐 해결과 같은 작업에서 훨씬 크고 비싼 모델들과 동등하거나 더 나은 성능을 발휘합니다.

두 가지 비밀 재료

이 논문은 이 작은 모델을 이렇게 똑똑하게 만든 팀이 사용한 두 가지 특별한 "비법"을 강조합니다.

1. "시각 전용" 안경 (시각 특화 LoRA 어댑터)

  • 문제: 일반적으로 모델이 이미지를 보고 텍스트를 읽을 때, 두 가지 작업 모두에 동일한 내부 "근육" (파라미터) 을 사용합니다. 이는 한 손으로 피아노를 치고 동시에 드럼을 치려는 것과 같아 신호가 섞일 수 있습니다.
  • 해결책: 팀은 이미지 처리 부분을 위해 특별히 가볍고 효율적인 "안경" (LoRA 어댑터라고 함) 을 추가했습니다.
  • 비유: 사서가 책을 읽기 위한 메인 책상이 있다고 상상해 보세요. 그림을 보기 위해 완전히 새로운 사무실을 짓는 대신, 기존 책상 위에 특수한 돋보기와 컬러 필터만 걸어두었습니다. 이제 사서가 사진을 볼 때 더 많은 세부 사항을 잘 볼 수 있도록 이 특수 도구를 사용하지만, 더 많은 직원을 고용하거나 건물을 크게 확장할 필요는 없습니다. 이로 인해 모델은 거대해지지 않으면서도 "모달리티 특화" (이미지에 능숙함) 가 됩니다.

2. "파노라마 뷰" (양방향 어텐션)

  • 문제: 표준 AI 모델은 문장처럼 텍스트를 왼쪽에서 오른쪽으로 읽습니다. 만약 이미지를 같은 방식으로 보게 한다면, 모델은 왼쪽 위 구석만 보고 오른쪽 아래 구석을 다시 돌아보며 어떻게 연결되는지 보지 못할 수 있습니다. 이는 한 번에 한 번의 붓질만 보고 전체 그림을 보기 위해 뒤로 물러서지 않고 그림을 이해하려는 것과 같습니다.
  • 해결책: 팀은 모델이 이미지를 볼 때 이미지의 모든 부분이 다른 모든 부분과 즉시 "대화"할 수 있도록 규칙을 변경했습니다.
  • 비유: 텍스트처럼 왼쪽에서 오른쪽으로 그림을 읽는 대신, 모델은 파노라마 뷰를 취합니다. 하늘, 산, 강을 한 번에 모두 보고 서로가 어떻게 관련되는지 즉시 이해할 수 있습니다. 이는 모델이 이미지의 "큰 그림" 구조를 훨씬 더 잘 이해하도록 돕습니다.

어떻게 훈련시켰는가: "교육 과정"

팀은 데이터를 모델에 무작위로 던지지 않고, 학생이 학교를 다니듯 단계별로 가르쳤습니다:

  1. 유치원 (정렬): 저해상도 이미지를 사용하여 모델이 간단한 이미지를 어떻게 설명하는지부터 가르쳤습니다. "두뇌"는 고정하고 "안경" (어댑터) 만 훈련시켜 이미지 데이터가 텍스트와 같은 언어로 말하도록 했습니다.
  2. 초등학교 (사전 훈련): 전체 모델을 풀어서 3 천만 개의 이미지와 텍스트 예제를 공급했습니다. 핵심적으로 작은 이미지로 시작해 점차 해상도를 높여, 모델이 작은 아이콘부터 거대한 고해상도 사진까지 모두 처리하도록 가르쳤습니다.
  3. 고등학교 (임베딩 확장): 모델에 사물을 가리기 위한 새로운 어휘를 가르쳤습니다. 모델이 "이 특정 부분을 봐"라고 말하거나 "그 물체 주위에 상자를 그려"라고 할 수 있도록 특수한 "단어" (토큰) 를 추가했습니다.
  4. 대학원 (지시 미세 조정): 마지막으로, 차트에 대한 질문에 답하거나 어지러운 방에서 특정 물체를 찾는 등 2 천만 개의 복잡한 작업을 모델에게 주어 추론 능력을 연마했습니다.

무엇을 할 수 있는가 (결과)

논문은 ZAYA1-VL-8B 를 다른 최상위 모델들과 비교 테스트했습니다. 여기서 이 모델이 뛰어난 성과를 보인 분야는 다음과 같습니다:

  • 이미지 내 텍스트 읽기: 광학 문자 인식 (OCR) 에 매우 능숙하여, 도로 표지판이나 문서와 같이 사진 속의 텍스트를 읽을 수 있습니다.
  • 세기: 새 떼가 있는 사진을 보여주면 정확하게 세어낼 수 있습니다.
  • 가리키기 및 바운딩 박스: "빨간 차를 가리켜"라고 요청하면 그 차의 정확한 좌표를 제공할 수 있습니다.
  • 효율성: 경쟁사들보다 훨씬 적은 컴퓨팅 파워 (활성 파라미터) 를 사용하면서도 이러한 결과를 달성합니다. 이는 연료 소비가 많은 차와 동일한 주행 거리를 얻으면서도 연료를 절반만 사용하는 하이브리드 차와 같습니다.

요약

ZAYA1-VL-8B 는 이미지와 텍스트를 이해하기 위해 거대하고 비대해진 모델이 필요하지 않음을 보여줍니다. 모델에 이미지를 위한 특수 도구 ("안경") 를 제공하고 한 번에 전체 이미지를 볼 수 있게 ("파노라마 뷰") 함으로써, 팀은 누구나 사용할 수 있도록 작고 효율적이며 매우 능력이 뛰어난 AI 를 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →