Pixels or Positions? Benchmarking Modalities in Group Activity Recognition
이 논문은 2022 년 월드컵 데이터를 기반으로 비디오와 선수 위치 추적을 동기화한 'SoccerNet-GAR' 데이터셋을 구축하고, 그래프 신경망을 활용한 위치 기반 모델이 비디오 기반 모델보다 정확도가 높으면서도 훨씬 적은 계산 자원으로 효율적인 그룹 활동 인식 (GAR) 이 가능함을 입증했습니다.
원저자:Drishya Karki, Merey Ramazanova, Anthony Cioppa, Silvio Giancola, Bernard Ghanem
이 논문은 "축구 경기에서 팀의 움직임을 분석할 때, '화면 속 픽셀 (영상)'을 보는 게 더 좋은가, 아니면 '선수들의 위치 데이터 (좌표)'를 보는 게 더 좋은가?" 라는 아주 흥미로운 질문을 던집니다.
연구진은 이 질문에 답하기 위해 2022 년 월드컵 64 경기의 데이터를 모아서 새로운 기준 (SoccerNet-GAR) 을 만들었고, 놀라운 결과를 발견했습니다.
이 내용을 마치 축구 해설처럼 쉽게 설명해 드릴게요.
1. 두 가지 관점: "화면 속의 그림" vs "지도 위의 점"
이 연구는 두 가지 다른 방식으로 축구를 보는 모델을 비교했습니다.
픽셀 (영상) 모델: TV 중계 화면을 그대로 봅니다. 선수들의 얼굴, 유니폼, 배경, 공의 움직임 등 모든 시각적 정보를 AI 가 직접 눈으로 보고 분석합니다.
비유: 마치 화려한 영화를 보는 감독 같습니다. 모든 디테일이 보이지만, 데이터 양이 너무 많고 컴퓨터가 처리하느라 지칩니다.
포지션 (위치) 모델: 화면은 무시하고, 선수들이 경기장 어디에 있는지, 어디로 움직이는지 숫자 (좌표) 만 봅니다.
비유: 마치 전술판에 말 (말뚝) 을 꽂고 분석하는 코치 같습니다. 선수 얼굴은 안 보지만, "수비수가 미드필더와 연결되어 있다"는 전술적 구조는 숫자로 바로 파악합니다.
2. 실험 결과: "작고 빠른 코치"가 이겼다!
결과는 매우 놀랐습니다. 위치 데이터 (포지션) 를 보는 모델이 영상 모델을 압도적으로 이겼습니다.
성적: 위치 모델은 **77.8%**의 정확도를, 영상 모델은 **60.9%**의 정확도를 기록했습니다.
비용: 위치 모델은 영상 모델보다 479 배 더 적은 메모리를 쓰고, 7 배 더 빠르게 학습했습니다.
비유: 영상 모델은 거대한 슈퍼컴퓨터로 영화를 분석하는 반면, 위치 모델은 작은 스마트폰으로 전술도를 분석해서 더 빠르고 정확하게 결과를 냈습니다.
3. 왜 위치 데이터가 더 잘할까요?
연구진은 그 이유를 이렇게 설명합니다.
영상의 함정: 영상 모델은 선수의 얼굴이나 유니폼 색깔 같은 '겉모습'에 너무 집착합니다. 비가 오거나 카메라가 흔들리면 혼란을 겪습니다.
위치의 강점: 위치 모델은 **선수들의 관계 (전술)**에 집중합니다. 예를 들어, "공을 차는 순간 수비수 3 명이 모여들었다"는 사실은 숫자만으로도 명확하게 드러납니다.
비유: **소란스러운 파티 (영상)**에서 누가 누구와 대화하는지 눈으로 찾는 것은 어렵지만, **명부 (위치 데이터)**만 보면 "A 는 B 와, C 는 D 와 대화했다"는 것을 바로 알 수 있는 것과 같습니다.
4. 재미있는 발견들
드문 상황에서도 강함: '골 (Goal)'이나 '하이패스 (High Pass)'처럼 잘 일어나지 않는 상황은 데이터가 적어 영상 모델이 완전히 망가졌습니다. 하지만 위치 모델은 데이터가 거의 없어도 전술 구조를 통해 잘 알아맞혔습니다.
혼동하는 상황: 두 모델 모두 '태클 (Tackle)'을 구별하는 데는 어려움을 겪었습니다. 두 선수가 붙어서 싸우는 순간은 영상에서도, 위치 데이터에서도 비슷하게 보이기 때문입니다.
5. 결론: "픽셀"보다 "위치"가 더 중요할 수 있다
이 논문은 **"스포츠에서 팀의 행동을 이해하려면 화려한 영상보다, 선수들의 움직임을 나타내는 숫자 (위치) 가 더 강력한 신호가 될 수 있다"**는 것을 증명했습니다.
핵심 메시지: 복잡한 영상을 분석하는 거대한 AI 보다, 선수들의 전술적 관계를 숫자로 표현한 작고 효율적인 AI가 더 똑똑하고 빠를 수 있습니다.
이 연구는 앞으로 스포츠 분석뿐만 아니라, 군중의 움직임을 분석하거나 로봇이 협동하는 방식을 설계할 때도 화면보다는 '관계와 위치'에 집중하는 것이 더 효율적일 수 있다는 새로운 방향을 제시합니다.
이 논문은 그룹 활동 인식 (Group Activity Recognition, GAR) 분야에서 비디오 (픽셀) 모달리티와 추적 (위치/궤적) 모달리티 중 어떤 것이 더 효과적인지 비교 분석한 연구입니다. 저자들은 기존에 존재하지 않았던 표준화된 벤치마크를 구축하고, 이를 통해 두 모달리티의 성능과 효율성을 정량적으로 평가했습니다.
주요 내용은 다음과 같습니다.
1. 연구 배경 및 문제 정의
문제점: 그룹 활동 인식은 주로 RGB 비디오 데이터를 기반으로 수행되어 왔습니다. 하지만 비디오 기반 접근법은 계산 비용이 높고, 가려짐 (occlusion) 및 편집 컷에 민감하며, 외형적 특징 (appearance cues) 에 과도하게 의존하는 경향이 있습니다. 반면, 선수들의 위치와 궤적 (트래킹) 데이터는 공간적 상호작용을 명시적으로 인코딩하며 컴팩트하고 효율적이지만, 비디오와 동기화된 표준 벤치마크가 부재하여 두 모달리티를 공정하게 비교하기 어려웠습니다.
목표: 비디오와 트래킹 데이터를 동일한 이벤트 수준에서 동기화하여 '공정한 비교 (apples-to-apples comparison)'가 가능한 벤치마크를 구축하고, 어떤 모달리티가 그룹 활동 인식에 더 적합한지 규명하는 것입니다.
2. 주요 기여 (Contributions)
SoccerNet-GAR 데이터셋 구축:
2022 년 월드컵 64 경기의 원시 데이터를 정제, 동기화, 통합하여 구축한 새로운 멀티모달 데이터셋입니다.
규모: 총 87,939 개의 그룹 활동 이벤트 (10 가지 클래스) 를 포함하며, 각 이벤트마다 방송 비디오와 선수 트래킹 데이터가 시간적으로 동기화되어 있습니다.
특징: 기존 GAR 데이터셋 중 두 번째로 크며, 비디오와 트래킹 데이터를 동시에 제공하는 유일한 데이터셋입니다.
새로운 평가 프로토콜 및 모델 제안:
비디오 기반 분류기와 트래킹 기반 그래프 신경망 (GNN) 분류기에 대한 통일된 평가 프로토콜을 정의했습니다.
역할 인식 그래프 아키텍처 (Role-aware Graph Architecture): 선수들의 전술적 역할 (골키퍼, 수비수, 미드필더, 공격수) 을 기반으로 그래프의 엣지 연결성을 정의하는 새로운 트래킹 기반 모델을 제안했습니다. 이는 전술적 구조를 명시적으로 인코딩합니다.
비교 분석 및 통찰 도출:
픽셀 (비디오) 대 위치 (트래킹) 의 성능, 효율성, 설계 원칙을 비교하여 그룹 활동 인식에 대한 새로운 통찰을 제시했습니다.
3. 방법론 (Methodology)
데이터 전처리: PFF FC 의 원시 데이터 (비디오, 트래킹, 이벤트 주석) 를 UTC 타임스탬프로 동기화하고, 품질 필터링 (시간 오차 제거, 누락 데이터 제거, 중복 레이블 해결) 을 거쳐 4.5 초 윈도우 단위로 추출했습니다.
비디오 모델: 사전 훈련된 비전 트랜스포머 (VideoMAEv2) 를 백본으로 사용하여 시공간 정보를 인코딩합니다.
트래킹 모델 (제안):
그래프 구성: 각 프레임에서 선수와 공을 노드로, 전술적 역할에 기반한 계층적 구조 (인접한 전술 라인 연결) 를 엣지로 정의합니다.
아키텍처: 20 층 DeepGCN (GIN 레이어 사용) 을 사용하여 공간적 상호작용을 모델링하고, MaxPool 을 통해 시간적 특징을 집계합니다.
입력: 선수의 좌표, 속도, 공의 높이, 엔티티 타입 (1-hot) 등을 8 차원 특징 벡터로 사용합니다.
4. 실험 결과 (Results)
SoccerNet-GAR 데이터셋을 기반으로 한 실험 결과는 다음과 같습니다.
성능 비교:
트래킹 모델: 균형 잡힌 정확도 (Balanced Accuracy) 77.8%, Macro F1 57.0% 달성.
비디오 모델 (최고 성능): 균형 잡힌 정확도 60.9%, Macro F1 50.1% 달성.
결과: 트래킹 모델이 비디오 모델보다 정확도에서 16.9%p, F1 에서 6.9%p 더 높은 성능을 보였습니다. 특히 골 (GOAL), 하이 패스 (HIGH PASS) 등 드문 이벤트나 전술적 구조가 명확한 이벤트에서 트래킹 모델의 우위가 두드러졌습니다.
효율성 비교:
파라미터 수: 트래킹 모델은 180K개, 비디오 모델은 86.3M개 (약 479 배 차이).
학습 시간: 트래킹 모델은 4 GPU 시간, 비디오 모델은 28 GPU 시간 (약 7 배 빠름).
데이터 부족 상황: GOAL(30 개), HIGH PASS(12 개) 와 같이 데이터가 극도로 부족한 클래스에서도 트래킹 모델은 높은 성능을 유지했으나, 비디오 모델은 성능이 급격히 저하되었습니다.
Ablation Study:
엣지 연결성: 전술적 역할 기반의 'Positional Edges'가 거리 기반이나 완전 연결 그래프보다 성능이 월등히 우수했습니다.
시간 집계: 복잡한 Attention 나 TCN 보다 단순한 MaxPool이 정확도 면에서 가장 우수한 성능을 보였습니다.
5. 의의 및 결론
핵심 통찰: 스포츠에서의 그룹 활동 인식은 외형적 특징 (픽셀) 보다 **명시적인 공간적 관계 (위치/궤적)**가 더 강력한 신호를 제공합니다.
효율성: 트래킹 데이터는 컴팩트한 표현을 통해 대규모 비디오 모델보다 훨씬 적은 자원으로도 더 높은 정확도를 달성할 수 있음을 입증했습니다.
미래 방향: 두 모달리티의 실패 패턴이 상호 보완적이므로, 향후 멀티모달 퓨전, 동적 역할 할당, 그리고 온라인 배포를 위한 인과적 (과거만 참조) 시간 윈도우 연구가 필요함을 제시했습니다.
이 연구는 스포츠 분석 및 그룹 활동 인식 분야에서 트래킹 데이터의 잠재력을 재조명하고, 효율적이고 정확한 모델 설계를 위한 새로운 기준을 마련했다는 점에서 의의가 큽니다.