Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Solution
이 논문은 극한 환경에서 단일 모달리티의 무효성을 고려한 새로운 RGBT 추적 벤치마크 (MV-RGBT) 와 '언제 융합할지'라는 새로운 문제를 제시하고, 전문가 혼합 (MoE) 기반의 MoETrack 을 통해 융합이 항상 유익하지 않음을 입증하며 최첨단 성능을 달성함을 보여줍니다.
지금까지 컴퓨터 비전 연구자들은 물체를 추적하는 AI 를 훈련시킬 때, 날씨가 맑고 빛이 좋은 날에 찍은 영상들만 주로 사용했습니다. 마치 **"화창한 날에만 축구 연습을 해온 선수"**와 같습니다.
문제점: 이런 선수들은 경기장 (실제 세상) 에 나가서 **비 (안개), 눈 (어둠), 혹은 반사 (유리창)**가 심한 날에는 공을 놓치거나 길을 잃어버립니다.
현실: 실제 세상에서는 밤이 되거나 안개가 끼면 일반 카메라 (RGB) 가 아무것도 못 봅니다. 이때는 열화상 카메라 (TIR) 가 도움이 됩니다. 하지만 기존 데이터는 이런 '위험한 상황'을 제대로 다루지 못했습니다.
2. 새로운 해결책 1: "위험한 상황 전용 훈련장 (MV-RGBT)"
저자들은 이 문제를 해결하기 위해 **새로운 훈련 데이터셋 (MV-RGBT)**을 만들었습니다.
비유: 이제부터는 비, 안개, 밤, 눈이 쏟아지는 극한 상황에서만 촬영한 영상으로 AI 를 훈련시킵니다.
특징: 이 데이터는 "어떤 상황에서는 일반 카메라가 망하고, 어떤 상황에서는 열화상 카메라가 망한다"는 점을 정확히 보여줍니다. 마치 **"날씨에 따라 어떤 선수가 더 잘할지 테스트하는 특수 훈련장"**과 같습니다.
효과: 이 훈련장을 통해 만든 AI 는 어떤 상황에서도 물체를 놓치지 않는 '강철 같은' 추적 능력을 갖게 됩니다.
3. 새로운 해결책 2: "무조건 합치지 말고, 상황에 따라 선택하라 (MoETrack)"
기존 기술은 "두 개의 카메라 정보를 항상 섞어서 (Fusion) 사용하자"라고 생각했습니다. 하지만 저자들은 **"아니야, 섞는 게 항상 좋은 건 아니야"**라고 반박합니다.
비유 (전문가 팀):
일반 카메라 전문가 (RGB): 해가 쨍쨍한 날엔 천재지만, 밤엔 눈이 안 보입니다.
열화상 전문가 (TIR): 밤엔 천재지만, 안개 낀 날엔 시야가 흐릿합니다.
합성 전문가 (RGBT): 두 사람의 정보를 섞은 결과물입니다.
기존 방식: 두 전문가의 말을 항상 섞어서 결정합니다. (예: 밤에 눈이 안 보이는 일반 카메라의 망친 말을 섞어버리면 오히려 엉망이 됩니다.)
새로운 방식 (MoETrack):상황을 보고 가장 잘하는 전문가의 말만 듣습니다.
밤이 되면? → 열화상 전문가의 말만 듣습니다.
안개가 끼면? → 일반 카메라 전문가의 말만 듣습니다.
날씨가 좋으면? → 두 전문가의 말을 섞어서 더 정확한 결정을 내립니다.
핵심: "언제 정보를 섞을지 (When to fuse)"를 스스로 판단하는 스마트한 의사결정 시스템입니다.
4. 결론: "왜 이 연구가 중요한가?"
이 연구는 단순히 "더 좋은 AI"를 만든 것을 넘어, **"무조건 정보를 합치는 것이 정답이 아니다"**라는 중요한 통찰을 줍니다.
일상적인 비유: 요리할 때 재료를 무조건 다 섞는 게 맛있는 게 아니라, 재료의 상태에 따라 어떤 재료를 얼마나 넣을지 선택하는 게 더 맛있습니다.
성과: 이 새로운 방법 (MoETrack) 은 기존에 없던 새로운 기록을 세웠으며, 특히 밤이나 안개 낀 날 같은 극한 상황에서도 물체를 놓치지 않는 데 탁월한 성능을 보여줍니다.
한 줄 요약:
"날씨가 나쁜 날에도 물체를 놓치지 않게 하려면, 두 카메라의 정보를 무조건 섞지 말고, 어떤 카메라가 그 순간 더 잘보이는지 스스로 판단하게 하라!"
논문 요약: 모달리티 유효성 관점에서 RGBT 추적 벤치마크 재검토
이 논문은 기존 RGB-T (가시광선 - 열적외선) 추적 벤치마크의 한계를 지적하고, 실제 열악한 환경 (Multi-Modality Warranting, MMW) 에 적합한 새로운 벤치마크, 문제 정의, 그리고 해결 방법을 제안합니다.
1. 문제 정의 (Problem)
기존 벤치마크의 한계: 현재 존재하는 대부분의 RGBT 추적 벤치마크 (RGBT234, LasHeR 등) 는 일반적인 시나리오에서 수집된 데이터를 기반으로 합니다. 이러한 데이터는 가시광선 (RGB) 과 열적외선 (TIR) 모두의 품질이 양호한 경우가 많아, 실제 적용 시 발생할 수 있는 극단적인 촬영 조건을 반영하지 못합니다.
MMW (Multi-Modality Warranting) 시나리오의 부재: 야간, 안개, 과노출, 반사, 투명 물체 통과 등 한 가지 모달리티가 정보를 잃거나 (Non-informative) 오작동하는 심각한 환경 (MMW) 에서 기존 추적기는 성능이 급격히 저하됩니다.
무조건적인 융합의 비효율성: 기존 방법들은 모든 프레임에서 RGB 와 TIR 정보를 무조건 융합 (Fusion) 합니다. 그러나 한 모달리티가 유효하지 않은 MMW 환경에서는 오히려 해로운 정보를 추가하여 추적 실패를 초래할 수 있습니다. 즉, "언제 융합할 것인가 (When to fuse)" 라는 근본적인 문제가 제기됩니다.
2. 주요 기여 (Key Contributions)
새로운 벤치마크: MV-RGBT
특징: 오직 MMW 시나리오 (야간, 악천후, TIR 반사/차단 등) 에서만 수집된 122 개의 비디오 쌍으로 구성됨.
다양성: 기존 벤치마크보다 더 많은 물체 카테고리 (36 개) 와 장면 (19 개) 을 포함하며, 총 89.9k 프레임 쌍을 제공.
세분화: 데이터의 유효성에 따라 MV-RGBT-RGB (TIR 만 유효한 경우) 와 MV-RGBT-TIR (RGB 만 유효한 경우) 로 나누어 분석 가능하도록 구성됨.
새로운 문제 정의: "When to Fuse"
MMW 환경에서는 항상 융합이 유익한 것이 아니므로, 각 프레임에서 어떤 모달리티를 사용할지, 혹은 융합할지를 동적으로 결정하는 전략의 필요성을 제기함.
새로운 방법론: MoETrack (Mixture of Experts Tracker)
구조: RGB 전문가, TIR 전문가, 융합된 RGBT 전문가 등 3 개의 추적기 (Expert) 를 병렬로 운영.
동작 원리: 각 전문가가 독립적으로 예측 결과와 신뢰도 점수 (Confidence Score) 를 생성. 최종 예측은 가장 높은 신뢰도 점수를 가진 전문가의 결과를 선택하는 방식으로 결정됨 (융합이 필요할 때만 RGBT 전문가를 선택).
학습: 각 전문가가 별도의 손실 함수를 통해 학습되며, 최종 손실은 세 가지 손실의 평균으로 계산됨.
3. 방법론 상세 (Methodology)
네트워크 아키텍처:
Backbone: ViT-Base (Vision Transformer) 를 공유하며, RGB 와 TIR 입력을 각각 토큰화하고 위치 임베딩을 추가하여 인코더에 입력.
Expert Heads:
RGB Expert: RGB 입력만 처리.
TIR Expert: TIR 입력만 처리.
RGBT Expert: RGB 와 TIR 특징을 요소별 덧셈 (Element-wise addition) 으로 융합하여 처리.
의사결정 (Decision Level Fusion):
추론 시 각 전문가의 분류 맵 최대값을 신뢰도 점수로 사용.
pi=argmax(csrgb,cstir,csrgbt)에 따라 해당 전문가의 바운딩 박스를 최종 결과로 선택.
이를 통해 특정 프레임에서 한 모달리티가 무효할 경우, 해당 모달리티의 전문가를 배제하고 유효한 모달리티나 융합 결과를 선택할 수 있음.
4. 실험 결과 (Results)
성능 (Quantitative Analysis):
제안된 MoETrack은 새로운 벤치마크 MV-RGBT뿐만 아니라 기존 표준 벤치마크 (RGBT234, LasHeR, VTUAV-ST) 에서도 State-of-the-Art (SOTA) 성능을 달성함.
특히 MV-RGBT에서는 2 위 모델 (GMMT) 대비 PR(정밀도) 2.3%, SR(성공률) 2.2% 향상.
VTUAV-ST에서도 PR 83.6%, SR 69.5% 로 1 위 기록.
분석 (Ablation & Analysis):
MoETrack vs 단일 전문가: MoETrack 은 단일 전문가 (RGB 만 또는 TIR 만) 보다 모든 벤치마크에서 월등히 좋은 성능을 보임.
When to Fuse 분석: MMW 시나리오 (MV-RGBT-TIR 등) 에서는 TIR 전문가가 단독으로 가장 좋은 성능을 내는 경우가 많았으며, 무조건적인 융합 (RGBT 전문가) 이 오히려 성능을 저하시킬 수 있음을 입증. 반면 일반적인 시나리오에서는 융합이 성능 향상에 기여함.
효율성: ViPT 와 비교하여 약간의 FPS 감소 (23 FPS) 가 있으나, ViPT 를 포함한 다른 SOTA 모델들보다 전반적으로 우수한 성능과 효율성을 동시에 달성.
5. 의의 및 결론 (Significance)
벤치마크의 재정의: 기존 벤치마크가 실제 열악한 환경 (MMW) 을 반영하지 못했다는 점을 지적하고, 이를 해결하기 위한 MV-RGBT를 제시함으로써 RGBT 추적 연구의 방향을 실용적인 환경으로 전환시킴.
융합 전략의 패러다임 변화: "항상 융합한다"는 기존 관념을 깨고, "언제 융합할 것인가" 를 결정하는 적응형 전략의 중요성을 강조.
범용성: 이 연구에서 제안된 모달리티 유효성 (Modality Validity) 분석 및 전문가 선택 (Mixture of Experts) 접근법은 RGBT 추적뿐만 아니라 RGB-D, RGB-E 추적 및 객체 감지 등 다양한 멀티모달 작업에도 확장 적용 가능.
결론적으로, 이 논문은 열악한 환경에서의 RGBT 추적 성능을 극대화하기 위해 데이터의 질적 변화 (MMW 데이터 수집) 와 알고리즘의 유연성 (적응형 융합) 을 동시에 해결한 획기적인 연구로 평가됩니다.