← 최신 논문
💻 computer science

Tracking and Understanding Object Transformations

이 논문은 객체의 상태 변화를 통한 추적 문제를 해결하기 위해 "Track Any State" 태스크와 VOST-TAS 벤치마크를 소개하며, 유실된 트랙을 복구하고 진화하는 객체 역학을 설명하기 위한 의미론적 상태 그래프를 생성하는 제로샷 시스템인 TubeletGraph를 제안한다.

원저자: Yihong Sun, Xinyu Yang, Jennifer J. Sun, Bharath Hariharan

게시일 2026-01-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yihong Sun, Xinyu Yang, Jennifer J. Sun, Bharath Hariharan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 사과 한 알이 조각조각 잘리거나, 애벌레가 나비로 변하는 장면입니다. 만약 당신이 일반적인 영화 카메라 촬영 기사라면, 사과가 잘리는 순간 그 '사과'를 놓칠 수도 있습니다. 왜냐하면 갑자기 빨갛고 둥근 것 하나가 아니라 다섯 개의 하얀 덩어리들을 보고 있기 때문입니다. 또한, 애벌레가 껍질 안으로 사라졌다가 나중에 나비가 나타나면 애벌레를 놓칠 수도 있습니다.

이것이 바로 **"Tracking and Understanding Object Transformations"**라는 논문이 해결하고자 하는 문제입니다. 코넬 대학교의 저자들은 현재의 컴퓨터 비전 시스템이 마치 서툰 영화 감독과 같다고 주장합니다. 이 시스템들은 캐릭터가 똑같이 생겼을 때는 잘 따라가지만, 캐릭터가 의상을 갈아입거나, 부서지거나, 변형되면 캐릭터를 완전히 놓쳐버립니다.

다음은 그들의 해결책인 TubeletGraph와 그 작동 방식에 대한 간단한 설명입니다.

문제점: 군중 속의 "실종된 사람"

현재의 추적 시스템은 주로 **외형(appearance)**에 크게 의존합니다. 그들은 "나는 빨간 사과를 보고 있다. 나는 그 빨간 사과를 따라가겠다"라고 말합니다. 하지만 사과가 잘리면 빨간 껍질은 사라지고 하얀 속살은 모습이 달라집니다. 그러면 시스템은 "빨간 사과가 사라졌다!"라고 생각하며 추적을 중단합니다. 그들은 이 하얀 조각들이 단지 새로운 상태가 된 '사과'일 뿐이라는 사실을 깨닫지 못합니다.

저자들은 특정한 패턴을 발견했습니다. 이러한 시스템들은 보통 **거짓 음성(false negatives)**을 발생시킨다는 것입니다. 즉, 물체가 실제로 형태만 바뀐 것인데도 물체가 사라졌다고 판단해 버리는 것입니다.

해결책: TubeletGraph (그물을 던지는 탐정)

저자들은 TubeletGraph라는 시스템을 만들었습니다. 이것은 단순히 한 사람만을 쫓는 것이 아니라, 넓게 그물을 던져 현장의 모든 것을 잡아낸 다음, 논리를 사용하여 누가 누구인지 파악하는 탐정이라고 생각하면 됩니다.

작동 방식은 세 단계로 이루어집니다.

1. 그물 던지기 (The "Tubelets")

특정 물체(예: 사과)만을 추적하는 대신, TubeletGraph는 전체 영상을 **"tubelets"**라고 불리는 작고 움직이는 조각들로 나눕니다.

  • 비유: 영상이 강물이라고 상상해 보세요. 특정 잎사귀(사과) 하나만을 쫓는 대신, 시스템은 물속에 그물을 던져 나타나는 모든 잎사귀, 나뭇가지, 돌멩이를 다 잡아냅니다.
  • 시스템은 원래의 사과를 추적할 뿐만 아니라, 나중에 나타나는 새로운 것들(사과 조각이나 거기서 나온 나비 등)도 추적하기 시작합니다.

2. 탐정의 논리 (근접성과 의미론)

이제 시스템에는 많은 다양한 트랙들이 섞인 "수프"가 생겼습니다. 이제 시스템은 이 새로운 트랙들이 원래의 물체에 속하는 것인지 파악해야 합니다. 이를 위해 두 가지 규칙을 사용합니다.

  • "포옹" 규칙 (공간적 근접성): 사과가 잘린다면, 조각들은 원래 사과가 있던 곳 바로 옆에 있을 것입니다. 만약 멀리 떨어진 곳에서 새로운 물체(예: 칼을 든 손)가 나타난다면, 그것은 사과의 일부가 아닐 가능성이 높습니다. 시스템은 확인합니다: "이 새로운 조각이 원래 사과와 가까이 있는가?"
  • "정체성" 규칙 (의미론적 일관성): 시스템은 "이 새로운 것이 이전 것의 버전으로서 타당한가?"라고 묻습니다.
    • 적절한 매칭: 사과 조각은 사과 속살처럼 보입니다.
    • 부적절한 매칭: 사과를 쥐고 있는 손은 손처럼 보이지, 사과처럼 보이지 않습니다.
    • 비유: 당신이 강아지를 찾고 있는데 근처에서 골든 리트리버를 발견했다면, 당신은 "저게 내 강아지구나!"라고 말할 것입니다. 하지만 바로 옆에 고양이가 있다면, 설령 고양이가 아주 가까이 있더라도 "아니, 저건 내 강아지가 아니야"라고 말할 것입니다.

3. 이야기꾼 (상태 그래프)

시스템이 누락된 조각들(사과 조서 혹은 나비)을 복구하고 나면, 단순히 그것들을 추적하는 데 그치지 않고, 강력한 AI(대규모 언어 모델)에게 무슨 일이 일어났는지 설명하도록 요청합니다.

  • 시스템은 "이전 상태"(온전한 사과)와 "이후 상태"(사과 조각)를 살펴봅니다.
  • 그리고 AI에게 묻습니다: "여기서 무슨 일이 일민 것인가?"
  • AI는 답합니다: "사과가 잘려서 조각이 되었습니다."
  • 시스템은 그 후 타임라인을 보여주는 지도(상태 그래프)를 그립니다: 사과 -> 잘림 -> 조각.

성과

이 논문은 **"Track Any State"**라는 새로운 과제를 제시합니다. 이는 단순히 물체를 쫓는 것이 아니라, 물체의 변화를 추적하고 그 변화를 설명하는 것에 관한 것입니다.

이를 테스트하기 위해, 그들은 사물이 변하는 과정(바나나 껍질을 까거나 토마토를 써는 등)을 담은 상세한 라벨이 붙은 VOST-TAS라는 새로운 데이터셋을 만들었습니다.

결과:

  • 더 나은 추적 능력: 그들의 시스템인 TubeletGraph는 형태가 변하는 물체를 추적하는 데 있어 기존의 최고 수준 시스템(SAM2 등)보다 뛰어납니다. 이 시스템은 다른 시스템들이 놓쳐버리는 "누락된" 조각들을 복구해 냅니다.
  • 더 나은 이해력: 단순히 물체 주위에 박스를 그리는 것을 넘어, 변형 과정을 텍스트로 설명해 냅니다 (예: "애벌레가 번데기에서 나왔다").
  • 제로샷(Zero-Shot): 이 시스템은 모든 유형의 변형(예: "자르기"와 "껍질 까기"의 차이)에 대해 매번 다시 학습될 필요가 없습니다. 일반적인 지식을 사용하여 실시간으로 문제를 해결합니다.

요약

요컨대, 이 논문은 다음과 같이 말합니다. "현재의 컴퓨터는 물체가 변할 때 추적을 놓칩니다. 우리는 모든 것을 잡기 위해 넓게 그물을 던지고, 어떤 새로운 것들이 사실은 변장한 예전의 것인지 논리를 통해 파악하며, 그 변형이 어떻게 일어났는지 AI에게 이야기를 써달라고 요청하는 시스템을 만들었습니다."

이를 통해 컴퓨터는 "나비"와 "번데기"가 하나의 이야기 속에 있다는 것을 이해할 수 있고, "사과 조각"이 더 이상 원래의 과일처럼 보이지 않더라도 여전히 "사과"라는 것을 이해할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →