← 최신 논문
💻 computer science

SAM 2++: Tracking Anything at Any Granularity

본 논문은 단일 모델 내에서 마스크, 상자, 점과 같은 다양한 대상 세분성 수준을 처리하기 위해 프롬프트 인코딩, 출력 디코딩, 메모리 표현을 통합한 통합 비디오 추적 프레임워크인 SAM 2++ 를 소개하며, 이를 통해 다양한 추적 작업에서 최첨단 성능을 달성하기 위한 최초의 대규모 다중 세분성 데이터셋을 함께 제시합니다.

원저자: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇 도우미를 상상해 보세요. 이 로봇의 일은 비디오를 시청하면서 특정 대상을 주시하는 것입니다. 이 새로운 논문이 나오기 전까지, 로봇에게 움직이는 자동차를 추적하도록 하려면 한 가지 특정 방식으로 가르쳐야 했습니다. 사람의 얼굴을 추적하게 하려면 완전히 다른 방식으로 가르쳐야 했죠. 공 위의 작은 점을 추적하게 하려면 세 번째로 완전히 별개의 교사가 필요했습니다.

**SAM 2++**를 개발한 연구자들은 다음과 같은 간단한 질문을 던졌습니다. 왜 같은 일을 위해 세 명의 다른 교사가 필요한가요? 그들은 자동차 전체 (상자) 나 사람의 몸 (마스크) 또는 단일 점 (포인트) 을 추적하든, 로봇이 수행하는 정신적 작업은 정확히 동일하다는 사실을 깨달았습니다. "1 초 전 이 사물이 어떻게 생겼는지 기억하고, 지금 다시 찾아내라."

이것이 바로 모든 것을 수행하는 '범용 추적기 (Universal Tracker)'를 어떻게 단순하게 구축했는지에 대한 설명입니다:

1. 문제: 너무 많은 특화 도구

과거 방식을 생각해보면, 가위를 대신해 나사를 사용하려면 손잡이 전체를 교체해야 하는 스위스 아미 나이프와 같습니다. 기존 비디오 추적기는 오직 한 가지 작업만을 위해 설계되었습니다.

  • **상자 추적기 (Box Trackers)**는 물체 주위에 사각형을 그리는 방법만 알았습니다.
  • **마스크 추적기 (Mask Trackers)**는 물체의 정확한 모양을 채우는 방법만 알았습니다.
  • **포인트 추적기 (Point Trackers)**는 단일 점을 따라가는 방법만 알았습니다.

이로 인해 로봇은 세 가지 다른 '뇌'를 지녀야 했으며, 이는 비효율적이었고 동시에 모든 유형의 비디오에서 학습하는 것을 어렵게 만들었습니다.

2. 해결책: 하나의 뇌, 세 가지 언어

이 팀은 **SAM 2++**를 만들었습니다. 이는 여러 언어를 구사하는 (polyglot) 로봇과 같습니다. 하나의 주요 뇌를 가지고 있지만, 세 가지 다른 '지시 언어'를 이해할 수 있습니다.

  • "상자" 언어: "여기 자동차 주위의 사각형이 있습니다."
  • "마스크" 언어: "여기 사람의 정확한 윤곽선이 있습니다."
  • "포인트" 언어: "여기 공 위의 작은 점이 있습니다."

번역기 (작업별 프롬프트):
로봇에게 상자, 마스크, 또는 점을 주면, 특수한 번역기가 즉시 그 지시를 로봇의 뇌가 이해하는 보편적인 '생각'으로 변환합니다. 이렇게 하면 로봇은 당신이 상자나 점을 줬는지 상관없이 "알겠습니다, 이 것을 추적해야 합니다."라고만 알면 됩니다.

범용 출력 (통합 디코더):
로봇이 물체를 찾으면 상자나 점만 내뱉는 것이 아닙니다. 먼저 물체의 완벽한 '그림자 (마스크)'를 그립니다. 그런 다음 상자를 요청했다면 그림자를 측정하여 상자를 그리고, 점을 요청했다면 그림자의 중심을 찾습니다. 이렇게 하면 과정이 단순하고 일관되게 유지됩니다.

3. 기억: "스마트 노트"

비디오 추적에서 가장 어려운 부분은 물체가 나무 뒤에 숨거나 빠르게 움직일 때 그 모양을 기억하는 것입니다. 로봇은 과거 프레임을 저장하기 위해 '기억 노트'를 사용합니다.

연구자들은 상자, 마스크, 포인트에 대해 로봇에게 정확히 같은 노트 페이지를 사용하도록 강요하면 로봇이 혼란을 겪는다는 사실을 발견했습니다. 상자는 대략적인 스케치가 필요하고, 마스크는 상세한 그림이 필요하며, 점은 정확한 좌표가 필요합니다.

해결책 (작업 적응형 메모리):
하나의 경직된 노트 대신, 그들은 로봇에게 스마트하고 유연한 노트를 주었습니다.

  • 상자를 추적할 때는 '대략적인 스케치' 스타일로 씁니다.
  • 마스크를 추적할 때는 '상세한 예술' 스타일로 씁니다.
  • 점을 추적할 때는 '정밀한 수학' 스타일로 씁니다.

이를 통해 로봇은 하나의 주요 뇌를 유지하면서도 작업에 따라 작성 스타일을 전환할 수 있게 되어 혼란을 방지하고 기억 능력을 크게 향상시킵니다.

4. 훈련장: "TAG" 데이터셋

이 로봇을 가르치기 위해 과거 교과서만 사용할 수는 없었습니다. 과거 교과서에는 한 가지 유형의 연습 문제만 있었기 때문입니다. 대신 그들은 **TAG(Tracking-Any-Granularity)**라는 완전히 새롭고 거대한 도서관을 구축했습니다.

  • 구축 방법: 그들은 '인간 - 로봇 협업 (human-in-the-loop)' 시스템을 활용했습니다. 인간이 몇 개의 프레임 (예: 클립의 시작과 끝) 에 라벨을 붙이면 로봇이 나머지를 채웠습니다. 그런 다음 인간이 로봇의 작업을 검토하고 오류를 수정했습니다.
  • 특별한 점: 이 도서관의 모든 비디오는 동일한 물체에 대해 **세 가지 라벨 (상자, 마스크, 점)**을 가지고 있습니다. 이를 통해 로봇은 세 가지 기술을 동시에 학습할 수 있게 되었고, 진정한 추적의 대가가 되었습니다.

결과

이 새로운 로봇을 테스트했을 때, 세 가지 작업 모두에서 '그럭저럭' 한 것이 아니라, 수년 동안 오직 한 가지 작업만을 위해 훈련된 특화 로봇들을 능가했습니다.

  • 상자 추적은 상자 전문가들보다 더 잘했습니다.
  • 마스크 추적은 마스크 전문가들보다 더 잘했습니다.
  • 점 추적은 점 전문가들보다 더 잘했습니다.

간단히 말해: SAM 2++ 는 모든 작업마다 다른 도구가 필요하지 않음을 증명합니다. 올바른 설계만 있다면, 하나의 똑똑하고 유연한 시스템이 적절한 '언어'로 말하기만 하면 어느 곳에서나, 어느 수준의 디테일에서든 무엇이든 추적할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →