AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
AdaptToken 은 MLLM 의 자기 불확실성 (엔트로피) 을 활용하여 장기간 비디오 이해를 위한 토큰 선택을 적응적으로 수행하고, 불필요한 처리를 조기에 중단함으로써 메모리 효율성과 정확도를 동시에 향상시키는 훈련 없는 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎬 비유: "바쁜 영화 감독과 편집자"
상상해 보세요. 인공지능 (MLLM) 은 바쁜 영화 감독이고, 긴 영상은 수천 개의 원본 필름입니다. 감독은 이 모든 필름을 한 번에 다 보려고 하면 머리가 터질 정도로 피곤해지고 (메모리 부족), 중요한 장면을 놓치기 쉽습니다.
기존의 방법들은 "중요해 보이는 장면 10 개만 골라보자"라고 했지만, 그중에도 쓸모없는 배경이 섞여 있거나, 영화가 끝날 때까지 다 봐야만 어떤 장면이 진짜 중요한지 알 수 없었습니다.
AdaptToken은 이 문제를 해결하는 초능력을 가진 편집자입니다.
1. 🧠 "혼란도 (Entropy)"로 중요도를 재다
이 편집자는 감독이 영상을 볼 때의 **심리 상태 (혼란도)**를 읽습니다.
- 혼란도가 높을 때: "아, 이 장면은 질문과 상관없는 것 같아. 내가 뭐라고 답할지 모르겠네." (이건 중요하지 않음)
- 혼란도가 낮을 때: "오! 이 장면은 정답을 알려주는 단서야! 내가 확실히 답할 수 있겠네." (이건 매우 중요함)
이 편집자는 영상을 쪼개서 한 덩어리씩 보는데, 감독이 "아, 이 부분 알겠다!"라고 확신할 때 (혼란도가 낮을 때) 그 부분을 더 자세히, 더 많은 필름으로 분석합니다. 반대로 감독이 "이건 모르겠는데?"라고 헤매는 부분은 그냥 넘깁니다.
2. 📝 "전체적인 예산"을 현명하게 배분하다
이 편집자는 전체 영상에 쓸 수 있는 **필름의 양 (메모리 예산)**이 정해져 있다고 가정합니다.
- 기존 방식: 모든 장면을 똑같은 양의 필름으로 찍거나, 무작위로 잘라냅니다.
- AdaptToken 방식: "이 10 분 구간은 질문의 핵심이야! 여기는 필름을 90% 할당해 주고, 저 10 분은 그냥 10% 만 할당하자"라고 전체적인 맥락을 보고 예산을 배분합니다.
3. 🛑 "충분했으면 그만!" (AdaptToken-Lite)
가장 멋진 점은 일찍 멈추는 기능입니다.
- 감독이 영상 초반 10 분만 봐도 "아, 이 영화는 '사과를 먹는 남자'에 대한 이야기구나!"라고 확실히 알게 되면, 나머지 50 분은 아예 보지 않고 바로 답을 냅니다.
- 이렇게 하면 처리 시간이 절반으로 줄어듭니다. (비유하자면, 책을 다 읽지 않고도 줄거리만 보고 요약본을 쓰는 것과 같습니다.)
4. 🔄 "중복 제거"로 더 선명하게
비슷한 장면이 연속으로 나오면 (예: 사람이 계속 걷는 장면), 편집자는 "이건 똑같은 내용이니까 하나만 남기자"라고 중복된 필름을 잘라냅니다. 이렇게 하면 기억해야 할 정보는 줄지만, 핵심 내용은 더 선명하게 남게 됩니다.
🏆 이 기술이 가져온 성과
이 "초능력을 가진 편집자 (AdaptToken)"를 다양한 인공지능 모델에 적용했을 때 놀라운 결과가 나왔습니다.
- 정확도 UP: 긴 영상에서도 훨씬 더 정확하게 질문을 답했습니다. (기존 방법보다 평균 6~7 점 이상 향상)
- 긴 영상도 OK: 1 만 프레임 (약 1 시간 이상) 의 아주 긴 영상도 처리할 수 있게 되었습니다.
- 빠른 속도: "AdaptToken-Lite" 버전은 정확도는 그대로 유지하면서 속도를 2 배나 빠르게 만들었습니다.
- 학습 불필요: 이 편집자는 별도의 훈련 없이도 기존 인공지능 모델에 바로 적용할 수 있습니다. (Training-free)
💡 한 줄 요약
"AdaptToken 은 인공지능이 긴 영상을 볼 때, '내가 이걸 이해했어!'라고 확신하는 순간을 포착하여, 중요한 부분만 집중적으로 보고 나머지는 과감히 건너뛰게 해주는 똑똑한 편집자입니다."
이 기술 덕분에 앞으로 인공지능이 긴 강의, 긴 뉴스, 긴 영화 등을 훨씬 빠르고 정확하게 이해할 수 있게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.