← 최신 논문
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

이 논문은 프로브 기반 구조적 가지치기(probe-driven structural pruning)와 계층적 지식 증류(layered knowledge distillation)를 통해 파라미터 수를 9.5% 줄이고 지연 시간을 10% 단축하면서도 2.13B 규모의 교사 모델 성능의 91.7%를 달anim하는, 엣지 배포를 위해 설계된 압축된 멀티모달 임베딩 모델인 Eddy-VL 1.9B를 소개한다.

원저자: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 사진 속의 고양이가 매트 위에 앉아 있는 모습을 이해하는 것과 "매트 위의 고양이"라는 단어를 이해하는 것을 똑같이 잘 이해하며, 이미지와 텍스트를 동시에 "보고" "읽을 수 있는" 세상을 상상해 보십시오. 이것이 바로 **멀티모달 AI(multimodal AI)**의 영역입니다. 이는 기계가 이미지, 텍스트, 비디오를 하나의 공유된 언어로 연결하는 법을 배우는 과학의 한 분야입니다. 이를 위해 이 AI 모델들은 모든 보이는 것을 **임베딩(embedding)**이라 불리는 긴 숫자 목록으로 변환하는 거대한 번역가 역할을 합니다. 임베딩을 콘텐츠의 고유한 지문이라고 생각하십시오. 만약 두 지문이 매우 유사하다면, 컴퓨터는 그 콘텐츠들이 서로 관련이 있다는 것을 알게 됩니다.

하지만 여기에는 함정이 있습니다. 가장 똑똑한 번역가들은 대개 가장 무겁습니다. 그들은 지속적인 고속 인터넷 연결이 필요한 거대하고 클라우드 기반인 슈퍼컴퓨터와 같습니다. 하지만 만약 당신이 비밀 지하실, 경찰 증거 보관실, 또는 인터넷이 끊긴 외딴 현장 스테이션에 있다면 어떻게 될까요? 당신에게는 복잡한 단서를 이해할 만큼 충분히 똑똑하면서도, 로컬 노트북이나 휴대용 기기에 들어갈 수 있을 만큼 충분히 작은 번역가가 필요합니다. 이것이 바로 **엣지 배포(edge deployment)**의 과제입니다. 즉, 강력한 AI를 클라우드 연결 없이 오프라인에서 빠르고 효율적으로 작동하게 만드는 것입니다.

여기에 보안과 속도가 무엇보다 중요한 "에어갭(air-gapped, 외부 네트워크와 차단된)" 상황을 위해 특별히 설계된 새로운 모델, Eddy-VL 1.9B가 등장했습니다. 이 프로젝트의 연구진은 매우 똑똑하지만 매우 무거운 스승 모델인 Qwen3-VL-Embedding-2B에서 시작했습니다. 이 스승 모델은 28개의 깊은 사고 층(layer)을 가진 천재적인 교수님과 같지만, 배낭에 넣고 다니기에는 너무 육중합니다. 연구진은 간단한 질문을 던졌습니다. 이 교수님이 가르치는 법을 잊어버리지 않게 하면서, 이 교수님을 작게 줄일 수 있을까?

그들은 단순히 무작위로 조각을 잘라낸 것이 아니라, **구조적 프루닝(structural pruning, 구조적 가지치기)**이라는 영리한 전략을 사용했습니다. 스승의 뇌를 28층짜리 건물이라고 상상해 보십시오. 연구진은 특수한 "프로브(probe)"를 사용하여 각 층이 바로 위층이나 아래층의 업무를 얼마나 중복해서 수행하고 있는지 측정했습니다. 그들은 네 개의 특정 층이 중복된 업무를 많이 수행하고 있다는 사실을 발견했습니다. 마치 한 줄로 늘어선 네 대의 동일한 복사기 중 하나만 있어도 충분한 상황처럼 말입니다. 그들은 이 네 개의 층을 제거하여 건물을 28층에서 24층으로 줄였습니다.

하지만 여기가 까다로운 부분입니다. 건물의 층을 제거하면 꼭대기 층에 사는 사람들이 길을 잃을 수 있습니다. 이를 해결하기 위해 팀은 **계층적 증류(layered distillation)**를 사용했습니다. 이것을 마스터 건축가(원래의 28층 스승)가 새로운, 더 작은 건축가(24층 학생)를 지도하는 것이라고 생각해 보십시오. 스승은 단순히 "지으라"고 말하는 것이 아니라, 매 단계마다 학생이 어떻게 생각해야 하는지를 정확히 보여줍니다. 그들은 학생의 중간층이 스승의 층과 똑같이 생각하도록 만들기 위해 CKA(두 층의 생각이 얼마나 유사한지 측정하는 기법)를 사용했고, 마지막 답변을 위해 특수한 "마트료시카(Matryoshka)" 방식을 사용하여 학생이 필요에 따라 다양한 크기의 답을 낼 수 있도록 보장했습니다.

그 결과물은 Eddy-VL 1.9B입니다. 이 모델은 약 19.3억 개의 파라미터를 가지고 있으며, 무게는 3.85GB로 현대의 많은 기기에 들어갈 수 있을 만큼 작습니다. 테스트에서 이 "축소된" 모델은 원래 스승 지능의 약 **91.7%**를 유지했습니다. 원래의 스승은 78개의 다양한 작업(MMEB-V2라고 불리는 거대한 테스트)에서 68.9점을 기록했는데, Eddy-VL은 63.2점을 기록했습니다. 이것이 점수가 떨어진 것처럼 보일 수 있지만, 기억하십시오. 이 모델은 사고의 과정인 층 4개를 통째로 잃었습니다! 특별한 교육 기술이 없었다면 점수는 56.8점으로 급락했을 것입니다. 증류 과정은 잃어버린 점수 중 6.4점을 성공적으로 회복해 냈습니다.

또한 이 모델은 속도 향상을 이루었습니다. 처리해야 할 층이 적기 때문에, 원래 모델보다 약 10% 더 빠르게 실행되어 150.0밀리초 대신 136.4밀리초가 소요됩니다. 이것이 엄청난 차이처럼 느껴지지 않을 수도 있지만, 당신이 오프라인에서 수천 장의 압수된 사진을 스캔하는 실제 조사 상황에서는 그 추가적인 초 단위의 시간들이 모여 몇 시간의 시간을 절약해 줍니다.

연구진은 모델이 여전히 어려움을 겪는 부분에 대해서도 주의 깊게 명시했습니다. 모델은 단어와 이미지 사이의 복잡한 관계를 이해하는 데 있어서는 (스승의 86.4%에 근접한 86.1%를 기록하며) 스승만큼 뛰어났지만, Winoground라고 불리는 특정 유형의 퍼즐에서는 6.8점을 기록하여 스승의 8.5점에 비해 다소 어려움을 겪었습니다. 이는 모델이 일반적인 검색에는 탁월하지만, 매우 까다로운 논리 퍼즐에는 여전히 전체가 온전한 뇌가 필요함을 시사합니다.

궁극적으로, Eddy-VL 1.9B는 모든 문제를 해결하는 마법의 탄환은 아니지만, 매우 특정한 직업을 위한 강력한 도구입니다. 이 모델은 거대하고 클라우드에 의존적인 AI를, 영혼을 크게 잃지 않으면서도 가볍고 오프라인 준비가 된 패키지로 압축할 수 있음을 증명합니다. 조사관, 포렌식 전문가, 그리고 인터넷이 사치인 곳에서 일하는 모든 이들에게, 이 모델은 네트워크의 가장자리(edge)에서 불을 밝히고 지능을 높게 유지할 수 있는 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →