← 최신 논문
💻 computer science

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip는 시각 및 텍스트가 교차된 시퀀스를 순수 트랜스포머 내의 압축된 소프트 프리픽스(soft prefixes)로 계층적으로 압축하는 통합 프레임워크를 도입하여, 메모리 사용량을 크게 줄이면서도 기존 방식들을 능가하며 최대 200만 토큰에 달하는 초장기 문맥에 대한 고충실도 추론을 가능하게 합니다.

원저자: Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 장의 사진과 수백만 개의 단어가 뒤섞여 혼란스러운 스크랩북처럼 엉켜 있는 이야기를, 초지능 로봇에게 이해시키려 한다고 상상해 보세요. 이것이 바로 시각-언어 모델(Vision-Language Models, VLMs)의 세계입니다. 이들은 이미지를 '보고' 캡션을 '읽어서' 무슨 일이 일어나고 있는지 파악할 수 있는 AI 두뇌입니다. 현재 이 로보트들은 단일 스냅샷을 보거나 짧은 단락을 읽는 데는 뛰어나지만, 이미지와 텍스트가 몇 시간 동안 번갈아 가며 나타나는 거대한 인터리브드(interleaved) 이야기(예: 비디오)를 건네주면 한계에 부착합니다. 문제는 이들의 두뇌가 모든 정보가 서로 연결되어야 하는 거대한 웹처럼 작동한다는 점입니다. 이야기가 길어질수록 연결의 수가 폭발적으로 증가하여, 로봇의 두뇌가 메모리가 부족해져 충돌을 일으키게 됩니다. 이는 10시간짜리 영화의 모든 단어를 기억하는 동시에 비디오의 모든 프레임을 기억하려고 애쓰는 것과 같습니다. 당신의 뇌는 그 모든 것을 한꺼번에 담아둘 수 없습니다.

과학자들은 이야기의 일부를 버리거나(pruning), 혹은 지능이 다소 떨어지더라도 완전히 새롭고 단순한 두뇌를 만드는 방식으로 이를 해결하려 노력했습니다. 하지만 조각들을 버리는 것은 중요한 세부 정보를 잃는 것을 의미하며, 두뇌 구조를 바꾸는 것은 종종 로봇의 추론 능력을 저하시킵니다. 핵심적인 질문은 이것입니다. 우리는 로봇의 강력한 두뇌를 유지하면서도, 줄거리를 잊지 않고 거대한 이야기를 실어 나를 수 있을 만큼 가볍게 만들 수 있을까요?

여기서 VLZip이라는 새로운 프레임워크가 등장합니다. VLZip을 공간을 아끼기 위해 책을 그냥 버리는 것이 아니라, 각 장의 완벽하고 압축된 요약본을 작성하여 책의 특별한 주머니에 넣어두는 숙련된 사서라고 생각해보세요. VLZip은 로봇이 28만 토큰에 달하는 방대한 이야기의 모든 단어를 읽고 모든 픽셀을 하나하나 보게 만드는 대신, 이미지와 텍스트를 작고 정보가 풍부한 "소프트 프리픽스(soft prefixes)"로 압축합니다. 이것은 단순히 무작위적인 메모가 아닙니다. 이것은 로봇의 다양한 사고 단계에 맞춰 특별히 구성된, 이야기의 핵심 아이디어를 담은 고해상도 스냅샷과 같습니다.

작동 방식은 다음과 같습니다. VLZip은 긴 이미지와 텍스트 시퀀스를 청크(chunk) 단위로 나눕니다. 각 청크에 대해, 특수한 도구를 사용하여 가장 중요한 시각적 및 텍스트적 세부 사항을 압축된 토큰 세트로 추출합니다. 결정적으로, 이 정보는 단 한 곳에만 압축되어 들어가는 것이 아니라, 로봇이 이야기를 처리하는 동안 두뇌의 모든 레이어에 주입됩니다. 이는 마치 투어 가이드가 로봇의 귀에 매 단계마다 핵심 줄거리를 속삭여 주는 것과 같아서, 실제 보고 있는 시퀀스가 매우 작더라도 로봇이 서사의 흐름을 놓치지 않도록 보장합니다.

결과는 인상적입니다. 연구진은 VLZip을 통해 로봇이 표준 모델보다 6배 더 긴 12만 토큰의 시퀀스까지 학습할 수 있음을 보여주었으며, 심지어 28만 토큰이 넘는 시퀀스에 대해서도 실제로 추론(읽고 질문에 답하기)할 수 있음을 입증했습니다. 다른 방식들이 이러한 길이에서 충돌하거나 메모리 부족 현상을 겪는 반면, VLZip은 훨씬 적은 메모리를 사용하면서도 로봇을 원활하게 구동합니다. 실제로 이 설계는 매우 효율적이어서 향후 200만 토큰까지도 처리할 수 있는 명확한 경로를 보여줍니다.

이것이 단순히 쉬운 테스트를 위한 방법이 아니라는 것을 증명하기 위해, 팀은 LongVLBench라는 새로운 벤치마크를 구축했습니다. 기존의 테스트들이 단순히 건초더미에서 바늘을 찾는 식의 단순한 사실 찾기 작업에 집중했다면, LongVLBench는 실제 비디오 내러티브를 사용합니다. 이는 로봇에게 전체 이야기를 이해하고, 캐릭터 간의 상호작용과 시간에 따른 사건의 흐름을 파악하도록 강요합니다. 이 까다로운 테스트에서 VLZip은 단순히 승리한 것에 그치지 않고, 차순위 모델의 점수인 33.1을 압도하는 61.9를 기록하며 새로운 기준을 세웠습니다. 또한 다른 모델들이 완전히 실패하는 가장 길고 복잡한 이야기에서도 강력한 성능을 유지했습니다.

이 논문은 이 접근 방식이 이미지와 단어의 압축을 통합했다는 점에서 게임 체인저라고 주장합니다. 이전의 방법들은 이를 무시하거나 제대로 처리하지 못했습니다. 강력한 "트랜스포머(Transformer)" 두의 구조를 온전히 유지하면서도 긴 입력을 처리할 수 있는 더 스마트한 방법을 제공함으로써, VLZip은 우리가 효율성을 위해 지능을 희생할 필요가 없음을 시사합니다. 적절한 압축 전략이 있다면, AI가 과부하에 걸리지 않고도 상세한 매뉴얼을 따르거나 몇 시간 분량의 영상 자료를 분석하는 것과 같이 현실 세계의 복잡하고 인터리브드된 서사를 마침내 이해할 수 있다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →