X2SAM: Any Segmentation in Images and Videos
X2SAM 은 LLM 과 마스크 메모리 모듈을 결합하여 이미지에서 비디오로 확장된 임의 분할 기능을 통합한 멀티모달 대규모 언어 모델로, 다양한 분할 작업에서 대화형 지시와 시각적 프롬프트 모두로부터 고품질의 시간적 일관성을 갖춘 마스크 생성을 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 사진이나 동영상을 보고 정확히 무슨 일이 일어나고 있는지 알려줄 수 있는 초지능 비서가 있다고 가정해 봅시다. 오랫동안 이러한 비서들은 '큰 그림'(예: "공원에서 노는 개") 을 설명하는 데는 뛰어났지만, "개 왼쪽 발 주위에 원을 그려라"와 같은 구체적인 세부 사항을 지적하는 데는 매우 서툴렀습니다.
반면, 물체 주위에 정밀한 원(마스크) 을 그리는 데는 놀라운 능력을 가진 전문 도구들이 있습니다. 하지만 이들은 "여기 클릭"이나 "상자 그리기"와 같은 단순한 명령만 이해하는 로봇과 같습니다. "빨간 공을 쫓는 개를 찾아서 그 주위를 그려라"와 같은 복잡한 문장은 이해하지 못합니다.
X2SAM은 이러한 격차를 해소하는 새로운 '초연결자'입니다. 대화형 AI 의 두뇌와 정밀한 그리기 도구의 손을 결합하여, 정지된 사진과 움직이는 동영상 모두에서 작동합니다.
다음은 일상적인 비유를 사용하여 작동 원리를 설명한 것입니다:
1. 사진과 동영상을 위한 '보편적 번역기'
X2SAM 을 '인간 언어'와 '픽셀 언어' 모두를 구사하는 보편적 번역기로 생각해 보세요.
- 과거의 방식: 동영상에서 특정 물체를 찾고 싶다면, 동영상을 이해하는 도구와 윤곽선을 그리는 도구를 따로 사용해야 했습니다. 이 두 도구는 서로 원활하게 소통하지 못했습니다.
- X2SAM 의 방식: 자연스러운 대화로 요청할 수 있습니다. "흰 벽 근처를 오가는 사람을 보여줘"라고 말하거나, 화면의 특정 지점을 가리키며 "이 영역에 있는 것을 찾아줘"라고 말할 수 있습니다. X2SAM 은 지시를 이해하고 단 한 장의 사진이든 10 초짜리 동영상 클립이든 즉시 윤곽선을 그려줍니다.
2. 움직이는 이미지를 위한 '기억 은행'
이것이 X2SAM 을 동영상 분야에서 특별하게 만드는 비결입니다.
- 문제점: 표준 AI 에게 동영상 속 사람을 추적하라고 요청하면, 종종 각 프레임(순간순간의 이미지) 을 마치 새로 생성된 것처럼만 봅니다. 사람이 나무 뒤로 사라지거나 카메라가 흔들릴 때 사람을 놓쳐버릴 수 있습니다.
- X2SAM 의 해결책: X2SAM 에는 마스크 메모리 모듈이 있습니다. 이를 '메모지' 시스템으로 상상해 보세요. 동영상이 재생되는 동안 X2SAM 은 이전 프레임에서 물체가 어디에 있었는지 메모지에 적어 주머니에 보관합니다. 다음 프레임을 볼 때 메모지를 확인하며 "아, 이 사람이 방금 여기에 있었으니 아마도 여전히 여기에 있을 거야"라고 판단합니다. 이를 통해 물체가 움직이거나 숨겨지거나 모양이 변하더라도 물체의 윤곽선이 매끄럽고 일관되게 유지됩니다.
3. 다양한 작업을 수행하는 '스위스 아리도'
이 논문은 X2SAM 이 각 작업마다 다른 도구가 필요한 것이 아니라, 단일 시스템으로 방대한 다양한 작업을 처리할 수 있다고 주장합니다. 다음과 같은 작업을 수행할 수 있습니다:
- 일반 분할: "이 사진에 있는 모든 것의 윤곽선을 그려줘."
- 지시 분할: "모자를 쓴 고양이를 그려줘."
- 추론 분할: "유리잔에 물을 부을 수 있는 물체를 찾아줘." (단순히 '주전자'라는 단어를 찾는 것이 아니라, 그것이 주전자임을 '추론'해야 함)
- 시각 기반 분할: 화면의 특정 지점을 가리키면 가리키는 물체의 윤곽선을 그려줍니다.
- 대화: 마스크를 그리면서 동시에 이미지나 동영상에 대해 대화할 수 있습니다.
4. 학습 방법 (훈련)
이렇게 훌륭해지기 위해 연구자들은 한 가지씩 가르치는 것이 아니라 통합 결합 훈련 전략을 사용했습니다.
- 비유: 학생을 가르치는 상황을 상상해 보세요. 월요일에는 수학, 화요일에는 역사를 가르치는 대신, 수학 문제를 풀 때 역사 사실을 활용하고 그 반대의 경우도 동시에 가르치는 것입니다.
- X2SAM 은 방대한 양의 이미지와 동영상을 동시에 훈련받았습니다. 이를 통해 사진 속 '개'를 찾는 규칙과 동영상 속 '개'를 찾는 규칙이 유사하지만, 1 초 전 개가 어디에 있었는지 기억해야 한다는 추가적인 twist 가 있음을 학습했습니다.
5. 새로운 '시험' (V-VGD)
저자들은 또한 Video Visual Grounded (V-VGD) 분할이라는 새로운 시험을 개발했습니다.
- 비유: 과거의 시험은 주로 "개를 찾을 수 있는가?"를 물었습니다. X2SAM 의 새로운 시험은 "이 동영상에서 화면의 특정 지점을 가리키고 있습니다. 제가 가리키는 물체를 찾아서 움직이는 동안 추적할 수 있는가?"를 묻습니다. 이는 AI 가 시각적 단서와 움직이는 물체 사이의 연결을 정말로 이해하는지 테스트합니다. X2SAM 은 이 시험에서 압도적인 성과를 거두어 이전 모델들을 능가했습니다.
요약
X2SAM 은 인간 예술가에게 모든 픽셀을 볼 수 있는 눈, 복잡한 문장과 논리를 이해하는 두뇌, 그리고 순간 전의 물체 위치를 기억하는 기억력을 부여하는 것과 같습니다. 이를 통해 사진과 동영상에서 특정 물체를 찾고 윤곽선을 그리는 자연스러운 대화를 컴퓨터와 나눌 수 있으며, 모든 작업을 한 번에 수행할 수 있습니다.
하지 않는 것 (논문에 기반):
이 논문은 이미지와 동영상에서 물체를 분할 (윤곽선 그리기) 하는 기술적 능력에 전적으로 초점을 맞추고 있습니다. 의료 진단, 자율 주행 자동차, 보안 감시 등에 사용된다고 주장하지는 않지만, 이러한 기술의 잠재적인 미래 활용 분야일 수는 있습니다. 이는 지시에 기반하여 시각 콘텐츠를 이해하고 윤곽선을 그리는 데 전념하는 도구일 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.