EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
본 논문은 EPIC-KITCHENS 챌린지를 위한 주관적 행동 탐지를 위한 통합 프레임워크인 EgoAction 을 제시하며, 이는 동사와 명사의 시간적 모델링을 분리하고 스트림별 신뢰도에 기반하여 예측을 적응적으로 결합하는 새로운 동적 가중 융합 전략을 도입함으로써 국소화 정확도를 향상시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마치 누군가의 머리 위에 장착된 카메라로 촬영된, 주방에서 요리하는 사람의 길고 편집되지 않은 영상을 보고 있다고 상상해 보세요. 영상은 흔들리고, 카메라는 그 사람의 머리와 함께 움직이며, 시야에는 수많은 물건들이 어지럽게 쌓여 있습니다. 당신의 역할은 초정밀 편집자처럼 행동하는 것입니다: "냉장고 열기"나 "팬 저어주기"와 같은 특정 행동이 정확히 언제 시작되어 언제 끝나는지를 찾아내어 올바르게 라벨링해야 합니다.
EgoAction이라는 제목의 이 논문은 컴퓨터가 흔히 실수하는 세 가지 주요 문제를 해결함으로써 특정 챌린지 (EPIC-KITCHENS 행동 감지 챌린지) 에서 승리하도록 설계된 시스템을 설명합니다.
간단한 비유를 사용하여 그들의 해결책을 다음과 같이 분해해 보겠습니다:
문제: 두 명의 전문가, 하나의 난감한 업무
연구자들은 무엇이 일어나고 있는지 ( "컵"과 같은 명사) 와 무엇이 행해지고 있는지 ("집어오기"와 같은 동사) 를 인식하는 것은 서로 다른 기술이며, 종종 서로 다른 방식으로 실패한다는 사실을 깨달았습니다.
- "명사" 전문가: 이 전문가는 물체를 찾아내는 데 뛰어납니다. 하지만 컵이 손 뒤에 가려져 있거나 접시 더미에 묻혀 있다면, 이 전문가는 혼란을 겪고 행동이 발생한 시간을 잘못 추측할 수 있습니다.
- "동사" 전문가: 이 전문가는 움직임을 찾아내는 데 뛰어납니다. 하지만 움직임이 매우 미묘하거나 천천히 일어나면, 이 전문가는 혼란을 겪고 시작 또는 종료 시간을 잘못 추측할 수 있습니다.
과거의 방식: 이전에는 시스템이 두 전문가가 추측한 것의 평균을 취하기만 했습니다. 명사 전문가가 확신하지만 동사 전문가가 완전히 길을 잃은 경우, 평균은 정답을 잘못된 방향으로 끌어당겨 타이밍을 망쳐버렸습니다.
해결책: "신뢰도 인식형" 관리자
EgoAction 시스템은 두 직원의 의견을 단순히 평균내는 것이 아니라, 그 특정 순간에 누가 더 확신하는지 경청하는 똑똑한 관리자처럼 행동합니다.
1. 두 개의 분리된 팀 (분리된 감지)
컴퓨터에게 "냉장고 열기"를 하나의 거대하고 복잡한 개념으로 학습시키는 대신, 시스템은 두 개의 분리된 팀을 훈련시킵니다:
- 명사 팀: 냉장고, 컵, 칼과 같은 물체만 찾습니다.
- 동사 팀: 열기, 집어오기, 저어주기 같은 행동만 찾습니다.
이들은 수천 개의 주방 영상으로 사전 훈련된 강력한 시각적 뇌 (VideoMAE-L 이라고 함) 를 사용하여 독립적으로 작업합니다.
2. "동적 가중치 융합" (똑똑한 관리자)
이것이 이 논문의 가장 큰 혁신입니다. 두 팀이 작업을 마치면 행동의 시작과 종료 시간을 제안합니다.
- 과거의 규칙: "그냥 두 시간의 평균을 내자."
- 새로운 규칙 (DWF): 시스템은 각 팀의 신뢰도 점수를 살펴봅니다.
- 명사 팀이 컵을 본 것에 대해 99% 확신하지만, 동사 팀이 "집어오기" 동작에 대해 50% 만 확신한다면, 시스템은 "좋아, 이 클립의 시작과 종료 시간에 대해서는 명사 팀의 타이밍을 신뢰하자"라고 말합니다.
- 동사 팀이 "분명히 저어주는 걸 봤어!"라고 외치지만, 팬이 흐릿해서 명사 팀이 확신이 없다면, 시스템은 동사 팀의 타이밍을 신뢰합니다.
이는 마치 경기의 심판이 "공을 보고 가만히 서 있는 선수가 혼란스럽게 뛰어다니는 선수보다 플레이가 어디서 시작되었는지 결정할 권리가 있다"고 말하는 것과 같습니다.
3. 퍼즐 맞추기 (구성)
시스템이 가장 신뢰할 수 있는 팀으로부터 최상의 타이밍을 얻으면, 최상의 "동사"와 최상의 "명사"를 결합하여 최종 라벨을 생성합니다 (예: "집어오기" + "컵" = "컵 집어오기"). 이는 가장 가능성이 높은 10 개의 동사와 명사에 대해 수행되어 상위 후보 목록을 생성한 다음, Soft-NMS 라는 필터를 사용하여 동일한 행동에 대해 열 개의 "컵 집어오기" 라벨이 표시되지 않도록 중복 추측을 제거합니다.
결과
이 시스템은 방대한 주방 영상 데이터셋에서 테스트되었습니다.
- 공식 리더보드에서 25.94% 점수 (mAP 라고 함) 를 달성하여 모든 경쟁자 중 3 위를 차지했습니다.
- "명사"와 "동사" 전문가들이 별도로 작업하다가 한쪽이 명확히 더 신뢰할 수 있을 때만 결합함으로써, 시스템이 언제 일이 일어나는지에 대해 더 적은 실수를 한다는 것을 증명했습니다.
요약
EgoAction 을 흔들리는 영상에서 작업하는 두 명의 전문가 (하나는 물체, 다른 하나는 움직임 담당) 팀으로 생각하세요. 상충되는 의견을 맹목적으로 평균내는 대신, 시스템은 똑똑한 감독처럼 행동합니다: "지금 더 확신하는 사람이 정확한 타이밍을 결정한다." 이 간단한 전략의 전환을 통해 그들은 경쟁에서 다른 많은 복잡한 시스템들을 이길 수 있었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.