← 최신 논문
💻 computer science

SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM

본 논문은 텍스트 유도형 희소 프롬프팅, 얕은 마스크 집합, 그리고 분리된 마스크 주입을 채택하여 SAM의 과분할 및 레이블 통합 문제를 효과적으로 해결하는 동시에 정확도와 추론 속도를 크게 향상시키는 새로운 마스크 주입 프레임워크인 SAM-MI를 제안한다.

원저자: Lin Chen, Yingjian Zhu, Qi Yang, Xin Niu, Kun Ding, Shiming Xiang

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Lin Chen, Yingjian Zhu, Qi Yang, Xin Niu, Kun Ding, Shiming Xiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 사진을 보고 단어 목록을 읽는 것만으로 세상을 이해하도록 가르치려 한다고 상상해 보세요. 당신은 로봇이 이전에 본 적 없는 특정 종류의 개일지라도, 사진 속의 모든 "개", "나무", 또는 "피자"를 찾아내기를 원합니다. 이것이 바로 **오픈 보캐블러리 시맨틱 세그멘테이션(Open-Vocabulary Semantic Segmentation)**의 과제입니다. 이는 마치 로봇에게 사전과 카메라를 주고, 보이는 모든 것의 지도를 그리되 각 부분을 정확하게 라벨링하라고 요청하는 것과 같습니다. 이를 위해 과학자들은 두 가지 강력한 도구를 사용해 왔습니다. 첫 번째는 **비전-언어 모델(VLM)**로, 단어가 이미지와 어떻게 연결되는지 알고 있는 매우 똑똑한 사서와 같지만 정밀한 윤곽선을 그리는 데는 서툽니다. 두 번째는 **SAM(Segment Anything Model)**으로, 10억 개의 다양한 이미지를 학습한 로봇 화가이며, 당신이 가리키는 거의 모든 것에 대해 완벽한 윤곽선을 그릴 수 있지만, 당신이 말해주지 않으면 그것들이 무엇이라 불리는지는 알지 못합니다.

문제는 이 두 가지를 함께 작동시키려 할 때, 서로 발을 헛디디는 경우가 많다는 것입니다. 화가(SAM)는 너무 의욕이 앞서서 모든 잎사귀나 그림자 주변에 작고 불필요한 윤곽선을 그리기도 하고, 사서(VLM)는 그림이 잘못되었더라도 억지로 라벨을 붙이려 합니다. 이는 퍼즐 조각이 끊임없이 모양을 바꾸고 상자 속 그림과 가지고 있는 조각이 일치하지 않는 퍼즐을 맞추려는 것과 같습니다. 이 논문인 SAM-MI는 이 두 기능이 혼란 없이 하나의 팀으로서 작동할 수 있는 새로운 방법을 소개합니다.

문제점: 지나치게 열정적인 화가와 경직된 사서

연구진은 SAM과 사서를 결합하려는 이전의 시도들에 두 가지 큰 결함이 있다는 것을 발견했습니다. 첫째, SAM은 **과잉 분할(over-segment)**하는 경향이 있습니다. 만약 "고양이"를 찾으라고 하면, 고양이의 수염, 꼬리, 그리고 고양이가 드리운 그림자를 각각 별개의 객체로 취급하여 별도의 윤곽선을 그릴 수도 있습니다. 이는 작고 혼란스러운 조각들의 무더기를 만들어냅니다. 둘째, 기존 방식들은 **"하드 결합(hard combination)"**을 사용했습니다. 그들은 SAM으로부터 고정된 윤곽선을 가져와서, 그 윤곽선이 아무리 형편없더라도 라벨을 붙여버렸습니다. 만약 SAM이 구름 주위에 원을 그렸는데 사서가 "고양이"라고 말했다면, 시스템은 그 실수를 무시하고 그냥 받아들였습니다. 이는 실수를 인정하지 않는 경직된 "받아들이든지 말든지" 식의 접근 방식이었습니다.

해결책: 새로운 워크플로우를 가진 스마트한 팀

저자들은 SAM-MI(Mask-Injected)라고 불리는 새로운 프레임워크를 제안합니다. 예술가와 사서가 직선적으로 작업하도록 강요하는 대신, 예술가의 그림이 최종 명령이 아닌 유용한 힌트로 사용되는 유연한 워크플로우를 만듭니다. 이들은 세 가지 영리한 기술을 사용하여 다음과 같이 수행합니다.

1. 스마트 스카우트 (Text-guided Sparse Point Prompter)
옛날에는 사진 속의 모든 것을 그리게 하려면, 이미지 전체에 소금을 뿌리듯 수천 개의 점을 격자 형태로 찍어야 했습니다. 이는 느리고 계산량이 많았습니다. SAM-MI는 TSPP라는 "스마트 스카우트"를 도입합니다. 이 스카우트는 모든 곳을 찌르는 대신, 사진과 당신이 원하는 단어(예: "개")를 살펴보고 정확히 어디를 찔러야 할지 파악합니다. 이 스카우트는 객체를 찾을 가능성이 가장 높은 곳에만 점을 찍는 법을 배웁니다.

  • 결과: 1,024개의 점을 찍는 밀집 격자 방식 대신, 스카우트는 평균적으로 약 41개의 점만을 찍습니다. 이는 과정을 1.6배 더 빠르게 만들고 탭 횟수를 96% 줄이면서도, 객체를 찾는 성능은 그대로 유지합니다.

2. 필터 (Shallow Mask Aggregation)
적은 횟수의 탭을 사용하더라도 SAM은 여전히 지나치게 많은 작고 파편화된 조각들을 그릴 수 있습니다. **Shallow Mask Aggregation (SMAgg)**은 필터나 체 역할을 합니다. 이 기능은 SAM이 만든 지저받은 작은 윤곽선 뭉치를 살펴보고, "이 조각들이 서로 연결되는가?"라고 묻습니다. 만약 몇 개의 작은 패치들이 모두 같은 "개"의 일부처럼 보인다면, SMAgg는 이들을 다시 하나의 깨끗한 모양으로 합칩니다. 이는 사서가 보기 전에 노이즈와 "관심 외" 패치(예: 무작위 그림자)를 제거합니다.

3. 부드러운 가이드 (Decoupled Mask Injection)
이것이 가장 중요한 변화입니다. 나쁜 윤곽선이 나쁜 라벨을 강요하는 "하드 결합" 대신, SAM-MI는 **Decoupled Mask Injection (DMI)**을 사용합니다. 사서의 지도를 흐릿한 스케치라고 생각해보세요. 예술가의 윤곽선은 그 스케치를 선명하게 만드는 "가이드"로 사용되지만, 사서는 가이드가 잘못되어 보인다면 이를 무시할 수 있습니다.

  • 저주파 주입 (Low-Frequency Injection): 이 부분은 윤곽선을 사용하여 사서가 큰 그림과 사물의 일반적인 형태(전역 문맥, global context)를 이해하도록 돕습니다.
  • 고주파 주입 (High-Frequency Injection): 이 부분은 윤곽선을 사용하여 가장자리와 세부 사항(지역적 세부 사항, local details)을 날카롭게 다듬습니다.
    이 둘을 분리함으로써, 시스템은 잘못된 윤곽선에 굴복하지 않고도 사서의 흐릿한 지도를 수정할 수 있습니다. 만약 예술가가 구름 주위에 원을 그렸지만 사서가 그것이 "의자"라는 것을 안다면, 시스템은 실수를 수용하는 대신 지도를 수정할 수 있습니다.

연구 결과

팀은 도시 거리부터 의료 스캔, 농업에 이르기까지 광범위한 내용을 담은 MESS라는 거대한 이미지 컬렉션을 포함하여 여러 데이터셋에서 SAM-MI를 테스트했습니다.

  • 성능: MESS 벤치마크에서 SAM-MI는 이전의 최고 방법인 Grounded-SAM에 비해 정확도(mIoU로 측정)를 16.7% 향상시켰습니다.
  • 속도: 또한 Grounded-SAM보다 1.6배 더 빨랐습니다.
  • 다재다능함: ADE20K와 PASCAL-Context 같은 표준 데이터셋에서도 잘 작동하여, SAM을 사용하지 않은 다른 상위 방법들보다 각각 **4.2%**와 **3.5%**의 향상을 보여주었습니다.

한계와 미래

저자들은 자신들의 시스템이 완벽하지 않다는 점을 신중하게 밝히고 있습니다. 그들은 여전히 어려움을 겪는 두 가지 주요 영역을 발견했습니다.

  1. 작거나 가느다란 객체: 만약 객체가 극도로 작거나(예: 의자 다리) 매우 가늘다면(예: 선풍기 날개), "스마트 스카우트"가 몇 개의 점만 배치하기 때문에 이를 놓칠 수 있습니다. 또한 사서(CLIP)가 작은 객체를 찾더라도 이를 인식하는 데 서투르다는 점을 인정합니다.
  2. 혼란스러운 배경: 겹쳐진 가구가 가득한 방이나 나무가 뒤엉킨 숲처럼 매우 복잡한 장면에서는 시스템이 혼란을 느껴 객체들을 서로 섞어버리기도 합니다.

연구진은 또한 현재의 테스트들이 누락된 라벨이나 잘못된 카테고리 같은 결함을 가지고 있어, 기술의 진정한 한계를 알기 어렵다는 점을 언급했습니다. 그들은 향-후 연구가 이러한 벤치마크를 수정하는 데 집중해야 하며, 이 "마스크 주입(mask-injected)" 아이디어를 특정 객체의 인스턴스를 찾거나 전체 파노라마 지도를 만드는 등의 다른 작업에 적용해야 한다고 제안합니다.

요약하자면, SAM-MI는 강력한 "Segment Anything" 모델을 경직된 상사가 아닌 유용한 가이드로 대함으로써, 우리가 시각적 세계를 훨씬 더 잘, 더 빠르게, 그리고 더 적은 실수를 통해 이해하고 지도할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →