← 최신 논문
💻 computer science

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

이 논문은 희소한 키프레임에서의 멀티모달 시맨틱 이해와 후속 프레임에서의 조밀한 마스크 예측을 위한 효율적인 피처 공간 조건화(feature-space conditioning)를 분리함으로써, 모바일 지향 모델보다 최대 14배 낮은 지연 시간을 달나오는 실시간 오픈 보캐블러리 비디오 인스턴스 세그멘테이션을 위한 이중 스트림 fast-slow 프레임워크인 SegFS를 소개한다.

원저자: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 스마트폰으로 번화한 거리의 장면을 촬영하고 있다고 상상해 보세요. 그리고 당신의 휴대폰이 움직이는 모든 자동차, 강아지, 사람의 완벽한 외곽선을 즉각적으로 그려내기를 원합니다. 심지어 당신이 한 번도 본 적 없는 것(예: "보라색 스쿠터")을 찾아달라고 요청하더라도 말이죠. 이것을 **개방형 어휘 비디오 인스턴스 분할(Open-Vocabulary Video Instance Segmentation)**이라고 부릅니다.

문제는, 이렇게 높은 정확도로 수행하려면 슈퍼컴퓨터가 필요하다는 것입니다. 이런 무거운 두뇌를 모바일 폰에서 실행하려고 하면, 영상이 끊기거나 버벅거리거나 멈춰버리게 됩니다.

이 논문은 **SegFS (Segmenting, Fast and Slow)**라는 새로운 시스템을 소개하며, 이 시스템은 "빠르고 느린" 팀 접근 방식을 사용하여 이 문제를 해결합니다. 이 방식이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "무거운 두뇌"의 병목 현상

현재의 고성능 비디오 시스템은 수프를 내놓기 전에 모든 재료를 맛보는 마스터 셰프와 같습니다.

  • 셰프 (느린 경로/The Slow Path): 이것은 무겁고 정확한 AI 부분입니다. 비디오를 살펴보고, 당신의 텍스트 프롬프트(예: "강아지를 찾아줘")를 읽고, 그 강아지가 정확히 어떻게 생겼으며 어디에 있는지 신중하게 파악합니다.
  • 병목 현상: 이 셰프는 믿을 수 없을 정도로 느립니다. 만약 이들에게 초당 30번씩 모든 프레임을 맛보라고 요구한다면, 휴대폰은 과열되고 영상은 멈추게 될 것입니다.

2. 해결책: "빠르고 느린" 팀

모든 프레임을 맛보는 대신, SegFS는 업무를 두 가지 역할로 나눕니다.

느린 경로: 마스터 셰프 (키프레임/Keyframes)

  • 하는 일: 이 헤비급 AI는 몇 초마다 한 번씩만(키프레임) 비디오를 봅니다.
  • 역할: 어려운 일을 수행합니다. 사물을 식별하고, 텍스트 프롬프트를 읽으며, 발견된 모든 사물에 대해 상세한 "ID 카드"(임베딩)를 생성합니다. 예를 들어, "좋아, 바로 이 순간 여기에 강아지가 한 마리 있고, 고양이가 한 마리 있군"이라고 판단하는 것입니다.
  • 비유: 이것은 장면의 고화질 사진을 찍고 그 안에 있는 모든 사람에 대한 상세한 설명을 쓰는 것과 같습니다.

빠른 경로: 퀵 스케치 화가 (프레임 간/Inter-frames)

  • 하는 일: 이 가벼운 AI는 키프레임 사이에 있는 모든 프레임을 살펴봅니다.
  • 역할: 다시 "생각"하거나 텍스트를 "읽으려" 하지 않습니다. 대신, 마스터 셰프가 만든 "ID 카드"를 가이드로 사용합니다. 비디오의 가공되지 않은 픽셀을 보며 다음과 같이 묻습니다. "셰프의 메모에 따르면, 지금 저 강아지는 어디에 있지?"
  • 기술: 빠른 경로는 매우 영리합니다. 이미지의 기본적인 "골격"(형태와 가장자리)은 이미 비디오 데이터에 존재한다는 것을 알고 있습니다. 단지 셰프의 지시에 따라 그 외곽선을 "그리기"만 하면 됩니다.
  • 비유: 마스터 셰프가 강아지의 위치를 나타내는 지도를 그린다고 상상해 보세요. 스케치 화가는 다음 몇 초 동안 그 지도 위에서 강아지의 움직임을 빠르게 따라 그리는 역할을 합니다. 스케치 화가는 매우 빨라서 마스터 셰프가 수프를 맛보는 속도보다 14배나 더 빠르게 그릴 수 있습니다.

3. 그들은 어떻게 서로 소통하는가

논문은 특별한 "주입(injection)" 과정을 설명합니다.

  • 마스터 셰프(느린 경로)가 강아지를 찾으면, 단순히 사진을 보내는 것이 아닙니다. 강아지의 디지털 지문을 보냅니다.
  • 스케치 화가(빠른 경로)는 이 지문을 받아 비디오 데이터에 직접 "주입"합니다.
  • 이를 통해 스케치 화가는 "아, 왼쪽으로 움직이는 이 흐릿한 형체가 셰프가 식별한 그 강아지구나"라는 것을 즉시 알 수 있습니다. 처음부터 강아지를 다시 식별할 필요 없이, 그 지문을 따라 추적하기만 하면 됩니다 됩니다.

4. 결과: 품질을 유지하면서 얻은 속도

논문은 삼성 갤럭시 S25 울트라(매우 강력한 스마트폰)에서 이 시스템을 테스트했습니다.

  • 속도: 이 새로운 시스템은 기존의 모바일 친화적 모델보다 14배 더 빠릅니다. 매끄러운 실시간 영상을 위한 표준인 초당 30프레임으로 비디오를 처리할 수 있습니다.
  • 정확도: 매우 빠름에도 불구하고, 성능은 느리고 무거운 모델들과 거의 대등한 정확도를 보여줍니다. "스케치 화가"는 "마스터 셰프"의 상세한 메모에 의해 안내되기 때문에 실수를 거의 하지 않습니다.
  • 효율성: 복잡한 "맛보기"(복잡한 계산)는 드물게 일어나고, "스케치하기"(가벼운 계산)는 지속적으로 일어나기 때문에 배터리와 컴퓨팅 자원을 엄청나게 절약합니다.

요약

SegFS지휘자와 오케스트라라고 생각해 보세요.

  • **지휘자 (느린 경로)**는 몇 초마다 한 번씩 단상에 서서 악보를 보고, 오케스트라에게 정확히 무엇을 연주할지 알려줍니다.
  • **오케스트라 (빠른 경로)**는 지휘자의 마지막 지시를 따르되, 그 순간의 템포에 맞춰 즉각적으로 조정하며 음악을 끊임없이 연주합니다.

"생각하는 것"(느린 경로)과 "행하는 것"(빠른 경로)을 분리함으로써, 이 시스템은 슈퍼컴퓨터 없이도 스마트폰에서 실시간 비디오 이해를 달성합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →