← 최신 논문
🤖 AI

STORM: End-to-End Referring Multi-Object Tracking in Videos

이 논문은 텍스트 쿼리에 기반한 비디오 내 다중 객체 추적을 위해 검출기 없이 언어, 외관, 운동을 통합적으로 추론하는 엔드투엔드 MLLM 인 'STORM'과 새로운 데이터셋 'STORM-Bench'를 제안하며, 기존 방법론보다 뛰어난 성능과 일반화 능력을 입증합니다.

원저자: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

게시일 2026-04-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🌪️ STORM: "비디오 속의 물체를 언어로 지시하는 마법사"

상상해 보세요. 친구가 "저기 빨간 모자를 쓴 사람과 그 옆에 있는 개를 찾아서 계속 따라가 줘"라고 요청합니다.
기존의 기술들은 이 일을 두 단계로 나누어 처리했습니다.

  1. 탐색: "빨간 모자"와 "개"가 어디 있는지 일일이 찾아본다.
  2. 추적: 찾은 물체가 움직이면 계속 눈으로 쫓아간다.

하지만 이 두 단계가 따로 놀다 보니, "빨간 모자를 쓴 사람"이 "개"와 섞여 움직일 때 혼란이 생기거나, 복잡한 문장을 이해하지 못해 실수를 하곤 했습니다.

STORM은 이 두 단계를 하나로 합친 완벽한 마법사입니다.

  • 하나의 뇌로 생각: 별도의 탐지기나 추적기를 따로 붙이지 않고, 거대한 언어 모델 (LLM) 이 영상과 언어를 동시에 이해합니다.
  • 자연스러운 대화: "저기 왼쪽에 있는 파란 차와 그 뒤에 있는 사람"이라고 말하면, STORM 은 문장의 의미를 깊이 이해하고 (추론), 그 물체들을 정확히 찾아내어 (바운딩 박스) 시간이 흘러도 잃어버리지 않고 쫓아갑니다.

🧩 핵심 전략 1: "레고 조립법" (작업 조합 학습, TCL)

STORM 을 처음부터 가르치려면 엄청난 양의 '비디오 + 언어 + 추적' 데이터가 필요합니다. 하지만 이런 데이터는 구하기 너무 어렵고 비쌉니다. (마치 어린아이를 위해 수만 권의 특수한 그림책을 직접 만들어야 하는 상황과 비슷하죠.)

그래서 연구자들은 **TCL(작업 조합 학습)**이라는 clever 한 방법을 썼습니다.

  • 단계 1 (기본기 다지기): 먼저, 사진 속 물체를 찾는 일 (이미지 그라운딩) 과 한 물체만 쫓는 일 (단일 객체 추적) 을 많이 가르칩니다. 이는 이미 데이터가 풍부한 레고 블록들입니다.
  • 단계 2 (복합 미션): 이제 그 기본기를 바탕으로, "여러 물체를 동시에 언어로 지시해서 추적하라"는 복잡한 미션을 가르칩니다.

비유하자면?
먼저 '사과 찾기'와 '한 명 따라가기'를 잘하는 훈련을 시킨 뒤, "빨간 사과와 초록 사과를 동시에 찾아서 따라가라"는 복잡한 지시를 내리는 것입니다. 이렇게 하면 적은 데이터로도 뛰어난 능력을 발휘할 수 있습니다.


📚 핵심 전략 2: "완벽한 교재 만들기" (STORM-Bench)

기존에 있던 데이터들은 문제점이 많았습니다.

  • "저기 사람"이라고만 적혀있는데, 사람이 여러 명이라 누구를 따라야 할지 모호했습니다.
  • 추적 경로가 엉망이거나, 설명과 실제 물체가 안 맞는 경우가 많았습니다.

연구자들은 STORM-Bench라는 새로운 데이터셋을 만들었습니다.

  • 하향식 (Top-down) 이 아닌 상향식 (Bottom-up) 접근: 먼저 영상 속 물체를 정확히 찾고, 그 물체에 대한 설명을 AI 가 직접 만들어낸 뒤, 또 다른 AI 가 "이 설명이 정말 그 물체를 가리키는가?"를 검증합니다.
  • 결과: "오른쪽 의자에 앉은 노란 옷 입은 아이"처럼 정확하고 모호하지 않은 설명들이 20 만 개 이상 담긴, 마치 명품 교재 같은 데이터셋이 완성되었습니다.

🏆 성과: 왜 이것이 중요한가요?

STORM 은 기존 기술들보다 훨씬 뛰어난 성과를 냈습니다.

  1. 정확한 이해: "왼쪽의 개와 오른쪽의 고양이"처럼 여러 물체와 관계 (위치, 색상, 행동) 를 동시에 이해합니다.
  2. 장애물 극복: 물체가 가려지거나 (가림 현상), 화면 밖으로 나갔다가 다시 들어와도 "아, 저게 그 물체구나"라고 기억하며 계속 추적합니다.
  3. 범용성: 도시의 차량뿐만 아니라, 일상생활의 사물, 동물, 사람 등 다양한 상황에서 잘 작동합니다.

📝 한 줄 요약

STORM은 복잡한 언어 지시를 듣고, 비디오 속 여러 물체를 찾아내어 시간이 흘러도 잃어버리지 않고 쫓아내는 **최고의 '언어 기반 추적 마법사'**입니다. 기존에 따로따로 하던 일을 하나로 통합하고, 부족한 데이터를 clever 한 학습법과 새로운 교재로 해결하여, 비디오 이해의 새로운 기준을 세웠습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →