OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
OmniPack는 LLM 이전의 구조적 중복 제거와 상호작용 이후의 의미론적 정제 기법을 결합하여 옴니모달 거대 언어 모델의 효율성을 향상시키는 학습이 필요 없는 프레임워크로, 여러 벤치마크에서 우수한 성능-효율성 트레이드오프를 달성하는 동시에 계산 비용을 크게 절감합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 단순히 책 한 권을 읽게 하는 것이 아니라, 영화를 보여주면서 동시에 사운드트랙을 들려주는 것입니다. 이것이 바로 컴퓨터가 보고, 듣고, 읽는 것을 동시에 학습하는 '옴니모달(Omni-modal)' AI의 흥미로운 세계입니다. 하지만 여기 문제가 있습니다. 영화와 사운드트랙은 매우 방대합니다. 비디오나 오디오의 단 1초도 '토큰'이라 불리는 수천 개의 작은 디지털 '벽돌'로 나눌 수 있습니다. 만약 로봇에게 영화 전체를 통째로 먹이려 한다면, 로봇은 마치 1분 안에 도서관 전체를 읽으려는 학생처럼 압도당하고 말 것입니다. 이를 처리하는 데는 엄청난 시간이 걸리고, 막대한 전기 비용이 들며, 정보의 양에 압도되어 종종 혼란에 빠지기도 합니다. 과학자들은 로봇이 읽기 시작하기 전에 '지루한' 벽돌들을 미리 버림으로써 이 문제를 해결하려 노력해 왔으며, 중요한 것들만 남기기를 희ק했습니다. 하지만 기존의 방식들은 다소 투박했습니다. 어떤 방식들은 단순히 이웃한 것들과 다르게 생겼다는 이유만으로 중요한 단서를 버리기도 했고, 로봇이 실제로 이야기를 이해할 기회를 갖기도 전에 무엇이 중요한지 미리 짐작해 버리기도 했습니다.
여기, 이 모든 것을 보고 듣는 로봇들이 정신을 잃지 않고 더 빠르게 작동할 수 있도록 설계된 영리한 전략인 OmniPack이 등장합니다. OmniPack을 혼란스러운 영화 대본을 편집하는 두 단계의 과정이라고 생각해 보세요. 첫째, 로봇이 대본을 읽기 전, OmniPack은 엄격한 편집자처럼 원본 영상을 스캔합니다. 단순히 조용한 부분을 삭제하는 것이 아니라, '큰 소리'가 나는 순간(갑작스러운 충돌음이나 밝은 섬광 등)을 찾아내고, 또한 시간상 멀리 떨어져 있는 조용하지만 중요한 배경 풍경을 놓치지 않도록 합니다. 유사한 벽돌들을 하나로 묶어 불필요한 공간을 차지하지 않게 함으로써, 이야기의 구조를 온전히 유지하는 '하이라이트 영상'을 만들어냅니다.
하지만 진짜 마법은 두 번째 단계에서 일어납니다. 로봇이 대본을 읽으며 스스로에게 말을 걸기 시작하면, OmniPack이 다시 개입합니다. 만약 로봇이 "자동차 색깔이 무엇이었나요?"라고 묻는다면, OmniPack은 설령 그 부분이 조용했거나 작았더라도 자동차와 색상에 관련된 토큰들을 유지해야 한다는 것을 알고 있습니다. OmniPack은 로봇의 호기심을 이용해 정보를 정교하게 다듬고, 가장 유용한 세부 사항들을 하나로 합칩니다. 그 결과, 로봇이 해야 할 작업량이 대폭 줄어듭니다. 특정 모델인 Qwen2.5-Omni-7B를 대상으로 했을 때, OmniPack은 로봇의 원래 지능을 98.0% 유지하면서도 필요한 작업량을 원래 양의 단 **16.7%**로 줄였습니다. 심지어 한계까지 밀어붙여 작업량을 고작 **6.8%**로 줄였을 때도, 로봇은 알아야 할 내용의 **92.9%**를 여전히 기억해 냈습니다. 이는 거대한 백과사전을 단 한 권의 팸플릿으로 줄였음에도 불구하고, 그 팸플릿에 여전히 필요한 모든 답이 들어 있는 것과 같습니다.
연구진은 기존 방식들이 왜 실패했는지 찾아냈습니다. 기존 방식들은 너무 일찍, 혹은 너무 단순하게 모든 것을 압축하려고 했기 때문입니다. 그들은 단순히 '크기'나 '유사성'만을 기준으로 토큰을 버리는 방식이 흩어져 있는 중요한 단서들을 놓칠 수 있다고 주장했습니다. 또한, 로보가 두 감각을 섞기 전에 오디오를 사용해 비디오를 압축하거나 그 반대로 하는 방식은 효과적이지 않다는 점도 보여주었습니다. 대신, OmniPack은 '단계별 특화(stage-specialized)' 접근 방식을 제안합니다. 즉, 먼저 각 미디어 유형(비디오 또는 오디오)에 따라 구조를 정리한 다음, 로봇이 두 감각을 혼합할 기회를 가진 후에, 특정 과업이나 질문을 사용하여 최종적인 스마트 압축을 수행하는 것입니다.
다섯 가지의 서로 다른 도전 과제 세트에 걸친 테스트에서, OmniPack은 비교 대상이었던 모든 다른 방법들을 일관되게 앞질렀습니다. 짧은 클립을 테스트하든 긴 영상을 테스트하든, 이 새로운 방식은 항상 속도와 지능 사이에서 최상의 균형을 보여주었습니다. 저자들은 이 두 단계를 조율함으로써—즉, 구조적 정리 후 질문 기반의 스마트한 정교화 과정을 통해—기존 모델을 처음부터 다시 학습시키지 않고도 훨씬 더 효율적으로 만들 수 있다고 제안합니다. 이는 강력한 AI 모델들을 더 빠르고 저렴하게 운영할 수 있게 하여, 정보의 홍수가 몰아치는 상황에서도 모델이 예리함을 유지할 수 있게 하는 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.