← 최신 논문
🤖 AI

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

이 논문은 Mamba 스타일의 분할 시공간 어텐션 메커니즘과 소프트맥스 시간적 어텐션을 결합하여 K400 및 SSv2 벤치마크에서 기존의 Vision Transformer 및 Mamba 모델보다 우수한 정확도와 해상도 강건성을 입증하는 확장 가능하고 효율적인 비디오 분류 모델인 VideoSEMA를 소개한다.

원저자: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 영화를 이해하는 법을 가르치려 한다고 상상해 보세요. 단순히 사진 한 장을 보여주는 것만으로는 부족합니다. 시간이 흐르며 변하는 이미지의 전체 스트림을 보여줘야 합니다. 이것이 바로 컴퓨터 과학의 한 분야인 **비디오 이해(video understanding)**의 세계입니다. 여기서는 기계가 감자 껍질을 까거나 자동차가 코너를 도는 것과 같은 동작을 인식하는 법을 배웁니다. 오랫동안 이를 수행하는 가장 좋은 방법은 **트랜스포머(Transformer)**라고 불리는 거대하고 탐욕스러운 뇌를 사용하는 것이었습니다. 트랜스포머를 도서관의 모든 책의 모든 페이지를 한꺼번에 읽어 연결 고리를 찾아내는 매우 조직적인 사서라고 생각해 보세요. 그것은 믿기지 않을 정도로 똑똑하지만, 도서관(비디오)이 너무 커지거나 책(프레임)이 너무 상세해지면 과부하가 걸리고 느려집니다.

이를 해결하기 위해, 과학자들은 최근 **맘바(Mamba)**라고 불리는 새로운 종류의 뇌를 발명했습니다. 만약 트랜스포머가 모든 것을 한꺼번에 읽는 사서라면, 맘바는 복도를 걸어가며 단서들을 기억하는 탐정과 같습니다. 이는 훨씬 더 빠릅니다. 하지만 맘바조차도 고화질이거나 매우 긴 비디오 앞에서는 어려움을 겪을 수 있습니다. 연구자들의 큰 과제는, 우리가 어떻게 하면 무거운 트랜스포머만큼 똑똑하면서도 새로운 맘바 탐정처럼 빠르고 효율적인 비디오 뇌를 만들 수 있을 것인가 하는 점입니다. 이것이 바로 "VideoSEMA"라는 논문이 풀고자 하는 퍼즐입니다.

Qualcomm AI Research와 캘리포니아 대학교 어바인(UC Irvine)의 연구진과 함께 이 논문을 저술한 저자들은 VideoSEMA라는 새로운 모델을 구축했습니다. 그들은 단순히 새로운 재료를 솥에 던져 넣은 것이 아니라, 영리한 분리 시스템을 만들어냈습니다. 마치 두 가지 서로 다른 방식으로 주의를 기울이며 영화를 보는 것과 같습니다. 먼저, 단일 프레임(정지 영상)을 보고 SEMA라고 불리는 특별한 "맘바 스타일"의 눈을 사용합니다. 이 눈은 지치지 않으면서도 세부적인 창(예: 감자 껍질의 질감)을 관찰하는 동시에 장면 전체의 빠른 전역 평균(global average)을 잡아낼 만큼 똑똑합니다. 그다음, 이야기의 흐름을 이해하기 위해 모델은 표준적인 "소프트(soft)" 어텐션을 사용하여 한 프레임에서 다음 프레임으로 어떻게 변화하는지를 살펴봅니다.

이 논문은 이러한 분리 접근 방식이 단순히 운 좋은 추측이 아니라, 특정 조건 하에서 이 분리 방법이 비디오 전체를 한꺼번에 보는 것만큼이나 효과적이라는 것을 수학적으로 증명했음을 보여줍니다. 연구진이 K400(400가지 유형의 인간 행동 포함) 및 SSv2(까다롭고 미세한 움직임에 집중)와 같은 유명한 비디오 데이터셋에서 VideoSEMA를 테스트했을 때, 결과는 인상적이었습니다. K400 데이터셋에서 VideoSEMA는 더 크고 무거운 모델들, 즉 다른 맘바 기반 모델들과 거대한 트랜스포머들을 제치고, 더 적은 컴퓨터 자원을 사용하면서도 우수한 성적을 거두었습니다. 예를 들어, 16 × 224² 해상도에서 VideoSEMA는 이전의 맘바 모델인 VideoMamba가 **80.8%**를 기록한 것에 비해 **82.4%**의 정확도를 달성했으며, 심지어 VideoSEMA의 파라미터 수는 더 적었습니다.

가장 흥러운 발견 중 하나는 VideoSEMA가 고화질 비디오를 처리하는 방식입니다. 연구진은 모델을 다시 학습시키지 않고도 해상도를 224²에서 1024²(상당한 디테일의 도약)까지 높여가며 모델에 훨씬 높은 해상도의 비디오를 입력했을 때 어떤 일이 일어나는지 테스트했습니다. 기존의 맘바 모델(VideoMamba)은 정확도가 **80.8%**에서 **40.8%**로 급격히 떨어지며 처참하게 무너졌습니다. 반면, VideoSEMA는 훨씬 더 잘 버텨내며 **54.6%**까지만 떨어졌습니다. 이는 VideoSEMA가 시각적 디테일이 복잡해질 때 훨씬 더 견고하다는 것을 시사합니다. 또한 SSv2 데이터셋에서 VideoSEMA는 다른 모델들이 16 프레임을 필요로 할 때 단 8 프레임만으로도 더 나은 결과를 얻을 수 있음을 보여주었으며, 이는 모델이 적절한 정보를 빠르게 포착하는 데 매우 효율적임을 입증합니다.

이 논문은 몇 가지 아이디어를 배제하기도 했습니다. 연구진은 단순한 3D 컨볼루션(비디오를 보는 표준적인 방식)과 시간적 측면을 위한 순수 맘바 블록을 테스트했지만, 둘 다 시간 차원에 대해 표준적인 어텐션 메커니즘을 사용하는 것만큼 잘 작동하지 않는다는 것을 발견했습니다. 그들은 맘바가 공간을 다루는 데는 훌륭하지만, 이 특정 설정에서 시간 차원을 다루는 데는 최선의 선택이 아니었음을 보여주었습니다. 저자들은 자신들의 모델이 매우 유망하지만 여전히 진행 중인 작업임을 신중하게 언급했습니다. 그들은 향에 더 긴 비디오를 처리하기 위해, 속도를 늦추지 않으면서 추가적인 시간을 다룰 수 있는 "희소(sparse)" 또는 "확장(dilated)" 어텐션을 미래에 추가할 수도 있다고 제안합니다. 하지만 현재로서는, VideoSEMA는 우리가 움직이는 세상을 이해하기 위한 강력하고 효율적이며 확장 가능한 새로운 방법으로서 확고한 위치를 차지하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →