Otter: Mitigating Background Distractions of Wide-Angle Few-Shot Action Recognition with Enhanced RWKV
이 논문은 광각 Few-Shot 행동 인식에서 배경 간섭을 줄이고 시계열 관계를 복원하기 위해 Compound Segmentation Module 과 Temporal Reconstruction Module 을 통합한 'Otter'라는 RWKV 기반 모델을 제안하여 다양한 벤치마크에서 최첨단 성능을 달성함을 보여줍니다.
원저자:Wenbo Huang, Jinghui Zhang, Zhenghao Chen, Guang Li, Lei Zhang, Yang Cao, Fang Dong, Takahiro Ogawa, Miki Haseyama
일반적으로 우리가 영상을 볼 때는 주인공이 화면의 중앙에 크게 잡혀 있습니다. 하지만 **넓은 시야 (Wide-Angle)**로 찍은 영상은 어떨까요?
상황: 눈썰매를 타는 사람이 있는데, 화면에는 눈썰매를 타는 사람보다 **하얀 눈 (배경)**이 훨씬 더 많이 보입니다.
AI 의 혼란: 기존 AI 는 "눈"이라는 배경 정보가 너무 많아서, 정작 중요한 '사람'을 놓치고 "아, 이건 눈이 많은 곳이구나"라고 착각합니다.
시간의 흐림: 또한, 배경이 비슷한 장면들이 이어지면 "어? 이 장면과 저 장면이 어떻게 연결되지?"라고 시간적인 흐름을 잃어버리기도 합니다.
이런 문제를 **배경 소음 (Background Distractions)**이라고 부릅니다.
🦦 해결책: 'Otter(수달)' 모델의 두 가지 능력
저자들은 이 문제를 해결하기 위해 **'Otter'**라는 모델을 만들었습니다. 수달이 물속에서 먹이를 찾아내는 것처럼, 이 모델도 영상 속에서 중요한 '주인공'을 찾아냅니다.
1. CSM (주인공 찾기 안경)
비유: 넓은 들판을 한눈에 보는 대신, **작은 창문 (패치)**으로 나누어 하나씩 살펴보는 것입니다.
작동 원리: 영상을 작은 조각들로 잘게 쪼갠 뒤, "여기엔 사람이 있네?", "저기엔 그냥 눈만 있네?"를 구분합니다. 그리고 사람이 있는 조각에는 '초점'을 맞추고, 배경이 많은 조각은 살짝 흐리게 만듭니다.
효과: AI 가 "눈"에 집중하는 대신, "눈썰매를 타는 사람"에 집중하게 만들어 줍니다.
2. TRM (시간 연결 고리)
비유: 영화를 볼 때 앞뒤 장면을 동시에 보며 스토리를 이해하는 것과 같습니다.
작동 원리: 기존 AI 는 시간을 한 방향으로만 보다가 흐려진 연결 고리를 놓칩니다. 하지만 Otter 는 앞으로 읽기도 하고, 뒤로 읽기도 하는 (양방향) 방식으로 시간을 분석합니다.
효과: "어? 이 장면이 저 장면과 어떻게 이어지지?"라는 혼란을 해결하고, 행동의 흐름을 완벽하게 재구성해 줍니다.
🏆 결과: 왜 이것이 특별한가요?
이 모델은 여러 가지 테스트 (SSv2, Kinetics 등) 에서 **가장 높은 점수 (State-of-the-Art)**를 기록했습니다.
배경 소음 제거: 넓은 화면에서도 주인공을 정확히 찾아냅니다.
빠른 속도: 복잡한 계산 없이도 빠르게 작동합니다. (Transformer 모델보다 가볍습니다.)
실전 강함: 비나 눈, 흔들리는 카메라 등 실제 촬영 환경에서도 잘 작동합니다.
📝 한 줄 요약
"너무 넓은 화면에 숨겨진 주인공을 찾아내고, 흐려진 시간의 흐름을 다시 연결해 주는, 똑똑한 '수달' AI 가 등장했습니다!"
이 기술은 헬스케어, 운동 분석, 보안 감시 등 우리가 매일 마주하는 다양한 영상 데이터를 더 정확하게 이해하는 데 큰 도움을 줄 것입니다.
1. 문제 정의 (Problem Definition)
배경: Few-Shot Action Recognition (FSAR, 소수 샘플 행동 인식) 은 제한된 학습 데이터로 새로운 행동을 인식하는 과제입니다. 기존 연구는 주로 정면 뷰 (Regular Viewpoint) 에 집중했으나, 실제 환경에서는 넓은 시야각 (Wide-Angle, FoV > 80°) 을 가진 비디오가 많습니다.
핵심 문제: 넓은 시야각 비디오는 행동 주체 (Subject) 가 프레임 내에서 차지하는 비율이 작고, 배경 정보가 과도하게 포함됩니다. 이로 인해 두 가지 주요 어려움이 발생합니다.
주체 강조의 부재 (Lack of Subject Highlighting): 기존 RWKV(Receptance Weighted Key Value) 와 같은 글로벌 모델링 기법은 배경 (예: 눈, 숲 등) 과 같은 부수적인 정보에 집중하여 실제 행동 주체 (예: 스키어) 를 놓치는 경향이 있습니다.
시간적 관계의 저하 (Degraded Temporal Relation): 유사한 배경이 연속된 프레임에 반복적으로 나타나면, 주체의 움직임 (행동의 진화) 이 흐려져 시간적 관계 (Temporal Relation) 를 재구성하기 어렵습니다.
목표: 넓은 시야각 FSAR 에서 발생하는 배경 간섭 (Background Distractions) 을 완화하고, 주체를 명확히 강조하며 시간적 관계를 복원하여 인식 성능을 극대화하는 것.
2. 제안 방법론 (Methodology: Otter)
저자들은 Otter (CompOund SegmenTation and Temporal REconstructing RWKV) 라는 새로운 아키텍처를 제안했습니다. 이는 RWKV 기반 모델에 두 가지 핵심 모듈을 추가하여 구성됩니다.
A. Compound Segmentation Module (CSM, 복합 분할 모듈)
목적: 프레임 내에서 주체를 강조하고 배경 정보를 억제합니다.
작동 원리:
각 프레임을 p×p 크기의 패치 (Patch) 로 분할합니다.
공간 혼합 (Spatial Mixing), 시간 혼합 (Time Mixing), 채널 혼합 (Channel Mixing) 을 통해 각 패치의 특징을 추출합니다.
학습 가능한 가중치 (lw) 를 통해 각 패치가 주체 (Subject) 에 해당하는지 여부를 적응적으로 학습합니다.
학습된 가중치를 사용하여 주체에 해당하는 패치를 강조하고, 원래 위치로 재조립 (Reassemble) 합니다.
효과: 특징 추출 단계 전에 주체를 선별하여 RWKV 가 배경 잡음에 휘둘리지 않도록 합니다.
B. Temporal Reconstruction Module (TRM, 시간 재구성 모듈)
목적: 넓은 시야각에서 왜곡된 시간적 관계를 복원합니다.
작동 원리:
양방향 스캐닝 (Bidirectional Scanning): 순방향 (Ordered) 과 역방향 (Reversed) 으로 프레임 특징을 스캔합니다.
각 스캔 결과에 학습된 가중치를 적용하여 시간적 맥락을 강화합니다.
두 방향의 스캔 결과를 평균화하고 원래 입력과 결합하여 시간적 관계를 재구성합니다.
효과: 유사한 배경으로 인해 흐려진 행동의 흐름을 명확히 하여, 행동의 방향성과 프레임 정렬을 개선합니다.
C. 전체 아키텍처 및 학습 목표
프로토타입 구성:
Temporal-Enhanced Prototype: TRM 을 적용하여 시간적 관계가 복원된 프로토타입.
Regular Prototype: CSM 만 적용된 일반 프로토타입.
손실 함수 (Loss Function):
Lce: 분류 오차 (Cross-Entropy).
L1P,L2P: 각 프로토타입 간의 유사도를 최소화하여 클래스 간 구분을 명확히 하는 보조 손실.
최종 목표 함수 (Ltotal) 는 이들을 가중치로 결합합니다.
3. 주요 기여 (Key Contributions)
RWKV 의 FSAR 적용 및 개선: 넓은 시야각 FSAR 에 RWKV 를 처음 적용한 연구이며, 배경 간섭 문제를 해결하기 위해 CSM 과 TRM 모듈을 도입했습니다.
CSM (주체 강조): 적응적 패치 분할과 가중치 학습을 통해 넓은 시야각 프레임에서 미약한 주체를 효과적으로 강조합니다.
TRM (시간 관계 복원): 양방향 스캐닝을 통해 배경 유사성으로 인해 손상된 시간적 관계를 복원합니다.
성능 입증: 다양한 벤치마크 (SSv2, Kinetics, UCF101, HMDB51) 와 실제 넓은 시야각 데이터셋 (VideoBadminton) 에서 SOTA(State-of-the-Art) 성능을 달성했습니다.
4. 실험 결과 (Results)
벤치마크 성능:
SSv2, Kinetics, UCF101, HMDB51: Otter 는 기존 SOTA 모델들 (Manta, SOAP, MoLo 등) 보다 1-shot 및 5-shot 설정에서 모두 높은 정확도를 기록했습니다.
Backbone 비교: ResNet-50, ViT-B, VRWKV-B 등 다양한 백본에서 일관된 성능 향상을 보였습니다. 특히 VRWKV-B 기반의 Otter 는 효율성과 정확도 면에서 우수했습니다.
넓은 시야각 평가 (VideoBadminton):
VideoBadminton 데이터셋 (모든 샘플이 넓은 시야각) 에서 다른 방법론들과 비교했을 때, Otter 는 압도적인 성능 우위를 보였습니다.
FoV(시야각) 변화 실험: 시야각이 넓어질수록 (Lv.0 -> Lv.4) 기존 모델들의 성능이 급격히 하락하는 반면, Otter 는 성능 저하가 완만하여 넓은 시야각 환경에서의 강건성을 입증했습니다.
시각화 (CAM & t-SNE):
CAM (Class Activation Mapping): Otter 를 적용하지 않은 모델은 배경에 집중하는 반면, Otter 는 행동 주체 (예: 배드민턴 선수) 에 정확히 집중함을 확인했습니다.
t-SNE: Otter 는 동일한 클래스의 샘플을 더 밀집하게 군집화하고 다른 클래스와 명확히 분리했습니다.
강건성 (Robustness):
노이즈 (샘플 레벨, 프레임 레벨, 시각적 노이즈) 와 교차 데이터셋 테스트에서도 다른 방법론들보다 우수한 성능을 유지하여 실용성을 입증했습니다.
효율성: Transformer 기반 모델에 비해 추론 속도가 빠르고 계산 비용이 낮습니다.
5. 의의 및 결론 (Significance)
실제 환경 대응: 기존 FSAR 연구가 간과했던 '넓은 시야각'이라는 실제적인 문제를 체계적으로 해결했습니다.
기술적 혁신: RWKV 의 글로벌 모델링 능력에 '주체 강조'와 '시간 관계 복원' 메커니즘을 결합하여, 배경이 복잡한 환경에서도 정확한 행동 인식이 가능하도록 했습니다.
미래 연구 방향: 이 연구는 FSAR 커뮤니티가 실제 응용 분야 (헬스케어, 모션 분석 등) 에서 마주치는 복잡한 시나리오를 해결하는 데 중요한 이정표가 될 것으로 기대됩니다.
요약하자면, Otter는 넓은 시야각 비디오에서 발생하는 배경 잡음과 시간적 관계 왜곡 문제를 해결하기 위해 고안된 혁신적인 Few-Shot 행동 인식 모델로, 기존 방법론들을 능가하는 성능과 강건성을 입증했습니다.