← 최신 논문
🤖 machine learning

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

이 논문은 비모달 태스크와 텍스트 기반 선택 메커니즘의 한계를 극복하고, 텍스트 조건 없이 ViT 와 LLM 전반에 걸쳐 시공간 토큰 점수화 (STTS) 를 통해 비전 토큰의 50% 를 제거하여 학습 및 추론 효율을 62% 향상시키면서도 비디오 QA 성능을 거의 유지하는 새로운 방법을 제안합니다.

원저자: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

게시일 2026-03-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영상 AI 의 '불필요한 짐'을 덜어주는 스마트 청소부: STTS

이 논문은 영상 기반 인공지능 (VLM) 이 너무 무거워져서 느려지는 문제를 해결한 새로운 방법, STTS(Spatio-Temporal Token Scoring) 에 대해 설명합니다.

상상해 보세요. AI 가 영화를 볼 때, 매 프레임 (화면) 을 수천 개의 작은 조각 (패치) 으로 잘게 나누어 분석한다고 가정해 봅시다. 영화가 길어질수록 이 조각들의 수는 기하급수적으로 불어나고, AI 는 이 모든 조각을 처리하느라 지쳐버립니다. 마치 거대한 창고에서 모든 박스를 하나하나 세느라 시간이 너무 오래 걸리는 상황과 비슷합니다.

기존 방법들은 이 문제를 해결하기 위해 두 가지 방식 중 하나를 선택했습니다:

  1. 창고 입구에서 무작위로 버리기: 중요한지 아닌지 모르고 그냥 절반을 버립니다. (결과: 중요한 물건도 함께 사라짐)
  2. 창고 안에서만 정리하기: 입구에서는 다 넣고, AI 가 분석할 때만 일부만 버립니다. (결과: 입구에서 이미 많은 에너지를 써버려서 비효율적)

이 논문이 제안한 STTS는 이 두 가지의 단점을 모두 없앤 **똑똑한 '스마트 청소부'**입니다.


🧹 STTS 가 어떻게 작동할까요? (3 가지 핵심 비유)

1. "눈을 감고도 아는" 공간 지능 (Spatial Scoring)

STTS 는 단순히 "이게 사람인가, 배경인가?"를 구분하는 것이 아니라, AI 가 나중에 문제를 풀 때 (질문 답변) 어떤 정보가 진짜 중요한지를 학습합니다.

  • 비유: 영화 한 장을 볼 때, 배경의 나무나 하늘은 똑같아도 주인공의 표정이나 움직이는 자동차는 중요합니다. STTS 는 "이건 나중에 질문을 풀 때 꼭 필요할 거야!"라고 판단하여 중요한 조각만 남기고, 배경 같은 불필요한 조각은 과감히 버립니다.
  • 특이점: 사람이 직접 "여기 버려"라고 지시하지 않아도, AI 가 문제를 풀면서 "아, 이 부분은 중요했구나"라고 스스로 배워냅니다.

2. "시간의 흐름"을 읽는 지능 (Temporal Scoring)

영화는 여러 장의 그림이 이어진 것입니다. 1 초 동안 배경이 전혀 변하지 않는다면, 100 장의 그림을 다 볼 필요가 없습니다.

  • 비유: 같은 장면을 10 번 반복해서 보여주는 영화를 볼 때, 우리는 1 번만 보고 나머지는 "아, 똑같은 거네"라고 넘깁니다. STTS 는 인접한 프레임끼리 비교하여 변화 없는 부분 (중복된 정보) 은 자동으로 찾아내어 제거합니다.
  • 도움: 이를 위해 '보조 점수'라는 특별한 훈련을 시켜, "이건 너무 비슷하니까 버려도 돼"라고 가르칩니다.

3. "꽉 채우는" 포장 기술 (Packing)

불필요한 조각을 버리면 남는 조각들이 불규칙해집니다. 컴퓨터는 불규칙한 데이터를 처리하는 게 서툴러서, 버린 조각을 그냥 지우기만 하면 오히려 비효율이 생길 수 있습니다.

  • 비유: 버린 박스를 치우고, 남은 박스들을 빈 공간 없이 빽빽하게 다시 쌓아 올리는 작업입니다. 이렇게 하면 컴퓨터가 한 번에 더 많은 데이터를 빠르게 처리할 수 있게 됩니다.

🚀 STTS 의 놀라운 성과

이 방법을 적용하자마자 놀라운 변화가 일어났습니다:

  • 반으로 줄인 짐, 62% 빠른 속도: 영상 데이터의 50% 를 버려도 성능은 거의 떨어지지 않았습니다. 오히려 훈련과 실행 속도가 약 1.6 배에서 2.2 배까지 빨라졌습니다. (영상이 길어질수록 효과가 더 큽니다.)
  • 오류는 0.7% 만: 13 가지 다양한 영상 퀴즈 테스트에서 평균 점수가 0.7% 만 떨어졌습니다. 이는 "불필요한 잡음만 제거하고 핵심은 그대로 남겼다"는 뜻입니다.
  • 긴 영상도 잘 처리: 기존에는 긴 영상을 처리하려면 메모리가 부족해서 끊어졌는데, STTS 를 쓰면 같은 메모리 안에서 더 많은 프레임을 처리할 수 있게 되어 긴 영화나 뉴스도 잘 이해합니다.

💡 결론: 왜 이것이 중요한가요?

기존의 방법들은 "무작위 삭제"나 "복잡한 규칙"에 의존했지만, STTS 는 AI 스스로가 "무엇이 중요한지"를 배우게 했습니다.

마치 현명한 비서가 방에 들어와서, "이건 쓸모없는 잡동사니니까 치우고, 중요한 문서만 남겨두세요"라고 말해주면서 방을 정리하는 것과 같습니다. 덕분에 AI 는 더 적은 에너지로 더 똑똑하게, 더 긴 영상도 빠르게 이해할 수 있게 되었습니다.

이 기술은 앞으로 우리가 스마트폰이나 클라우드에서 더 빠르고 똑똑한 영상 AI 를 사용할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →