← 최신 논문
💻 computer science

SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation

이 논문은 SAM3 파운데이션 모델을 경량 디코더로 적응시키고, 자기 증류(self-distillation) 기법, 이미지 수준의 다중 스케일 테스트 단계 증강(test-time augmentation), 그리고 공격적인 광도 왜곡(photometric distortion)을 통해 성능을 향상시킴으로써 69.73%의 mIoU를 달정한 ICRA 2026 GOOSE 2D 미세 정밀 의미론적 분할(Fine-Grained Semantic Segmentation) 솔루션의 4위 수상작에 대해 제시한다.

원저자: Xuesong Wang

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuesong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 오프로드 주행을 가르치고 있다고 상상해 보세요. 하지만 로봇은 단순히 "나무"나 "바위"를 보는 것이 아니라, "낮은 풀", "덤불", "이끼", "킥스쿠터"와 같이 64가지의 구체적인 유형을 구분해야 합니다. 이것이 바로 Xuesong Wang 저자가 ICRA 2026 GOOSE 경진대회를 위해 해결했던 과제입니다. 목표는 카메라 이미지의 모든 픽셀에 올바른 객체 이름을 라벨링할 수 있는 시스템을 구축하는 것이었습니다.

저자의 작품은 **69.73%**의 점수로 4위를 차지했습니다. 그들이 어떻게 해냈는지, 쉬운 비유를 통해 설명해 드리겠습니다.

핵심 아이디어: 똑똑한 학생과 슈퍼 선생님

팀은 로봇의 두뇌를 처음부터 직접 만들지 않았습니다. 대신, 그들은 SAM3(Segment Anything Model 3)라고 불리는 사전 학습된 "슈퍼 선생님"을 사용했습니다. SAM3를 수백만 장의 이미지를 보았고, 당신이 어떤 곳을 가리키기만 하면 거의 모든 사물의 윤곽선을 정확하게 그려낼 줄 아는 천재 화가라고 생각해보세요.

하지만 이 천재 화가는 다소 경직되어 있습니다. 특정 종류의 프롬프트(지시어)에만 잘 작동하며, 로봇이 배워야 할 구와 64가지의 구체적인 "오프로드" 클래스는 알지 못합니다.

해결책:

  1. 학생: 그들은 천재 선생님(SAM3)의 "두뇌"(이미지 인코더)를 가져온 뒤, 특정 오프로드 클래스를 배울 수 있도록 작고 단순한 "머리"(디코더)를 붙여주었습니다.
  2. 부분 학습: 그들은 천재의 두뇌 전체를 다시 학습시키지 않았습니다. 대신 복잡한 세부 사항을 처리하는 상위 레이어(층)만 미세하게 조정하고, 기본적인 모양과 가장자리를 파악하는 하위 레이어는 고정해 두었습니다. 이는 숙련된 셰프를 새로 오픈한 레스토랑에 고용하는 것과 같습니다. 셰프에게 양파 써는 법을 다시 가르칠 필요는 없습니다(그들은 이미 알고 있으니까요). 단지 당신만의 비밀 소스 레시피를 가르치기만 하면 됩니다.

세 가지 비밀 재료

논문은 점수를 높이는 데 기여한 세 가지 구체적인 기술을 강조합니다.

1. "오라클 박스(Oracle Box)" 자기 증류 (선생님이 학생을 돕다)

보통 학생은 선생님이 문제를 푸는 것을 보고 배웁니다. 여기서 학생(로봇)과 선생님(SAM3)은 사실 같은 모델 계열입니다.

  • 기술: 학습 전, 팀은 "천재 선생님"(SAM3)에게 정답 박스(Ground-truth boxes, 일종의 치트키)를 사용하여 객체의 완벽한 윤곽선을 그리도록 요청했습니다.
  • 함정: 선생님도 모든 것에 완벽하지는 않습니다. "트럭"이나 "나무"를 그리는 데는 뛰어나지만, "울타리"나 "이끼" 같은 것은 잘 그리지 못합니다(선 밖으로 삐져나갑니다).
  • 해결책: 팀은 선생님이 학생보다 확실히 더 잘하는 클래스에서만 선생님의 도움을 받도록 했습니다. 트럭, 버스, 교통 콘과 같은 22개의 특정 클래스에 대해서는 학생이 선생님의 완벽한 그림을 그대로 복사하도록 강제했습니다. 나머지 클래스에 대해서는 학생 스스로 학습하게 했습니다.

2. "공격적인 색상 메이크오버" (가장 어려운 수업)

오프로드 장면은 급격하게 변합니다. 겨울의 눈, 봄의 진흙, 여름의 밝은 햇살, 그리고 가을의 비까지 말이죠. "초록색은 풀이다"라는 것에 의존하는 로봇은 풀이 눈에 덮이거나 겨울이라 갈색으로 보일 때 실패할 것입니다.

  • 기술: 학습 중에 팀은 모든 이미지의 색상을 공격적으로 망가뜨렸습니다. 밝기, 대비, 채도, 색조를 무작위로 변경했습니다.
  • 비유: 학생에게 "정지 표지판"을 인식할 때 단순히 빨간색 때문이 아니라 팔각형 모양 때문에 인식하도록 훈련시킨다고 상상해 보세요. 흑백, 네온 그린, 세피아 톤, 혹은 어두운 곳에서도 표지판을 보여주는 것입니다.
  • 결과: 이것이 단일 항목 중 가장 큰 개선(+0.86점)을 가져왔습니다. 이를 통해 로봇이 색상에 근거해 추측하는 것을 멈추고, 형태와 질감을 인식하도록 강제했습니다.

3. "줌 인, 줌 아웃" 기술 (멀티 스케일 테스트)

대부분의 현대 AI 모델은 고정된 렌즈를 가진 카메라와 같습니다. 특정 크기로만 이미지를 볼 수 있죠. 만약 너무 작은 이미지를 넣으면 흐릿해지고, 너무 큰 이미지를 넣으면 픽셀이 깨집니다.

  • 문제: 이를 해결하는 일반적인 방법은 모델의 크기를 조절하여 다양한 크기를 보게 하는 것이지만, 이 모델은 렌즈를 바꿀 만큼 유연하지 않았습니다.
  • 우회 방법: 모델을 바꾸는 대신, 이미지를 바꿨습니다. 모델에 이미지를 넣기 전에, 크기를 75%로 줄였다가 다시 125%로 키웠습니다.
  • 과정:
    1. 원본 사진을 가져옵니다.
    2. 크기를 줄인 후, 로봇의 두뇌를 통과시켜 답을 기록합니다.
    3. 크기를 키운 후, 두뇌를 통과시켜 답을 기록합니다.
    4. 원본 크기로도 실행합니다.
    5. 결과를 평균 냅니다.
  • 왜 작동하는가: 멀리서(축소된 상태) "교통 콘"을 보는 것은 로봇이 전체적인 객체를 파악하는 데 도움을 줍니다. 가까이서(확대된 상태) 보는 것은 미세한 디테일을 보는 데 도움을 줍니다. 이 두 가지 뷰를 결합하면 예측이 훨씬 정확해집니다. 이는 추가 학습 없이도 +0.34점을 더해주었습니다.

무엇이 효과가 없었나?

저자는 시도했지만 실패했던 부분에 대해서도 솔직하게 밝혔습니다.

  • 더 무거운 두뇌: 모델에 더 복잡한 "머리"(디코더)를 사용해 보았지만, 오히려 작고 희귀한 객체를 찾아내는 능력을 떨어뜨렸습니다.
  • 다른 선생님들: 다른 유명한 AI 모델들(DINOv2 등)을 테스트해 보았지만, 이 특정 작업에는 SAM3만큼 좋지 않았습니다.
  • 무작위 크기 조절: 학습 도중에 이미지를 무작위로 크기 조절하는 것은 공격적인 색상 변화만큼 큰 도움이 되지 않았습니다.

결론

이 로봇은 강력한 사전 학습된 AI를 기반으로 사용하고, "천재 선생님"이 쉬운 클래스를 배우도록 돕게 하며, 색상 단서에 의존하지 않고 형태를 배우도록 강제하고, 마지막 테스트 단계에서 여러 거리에서 객체를 보기 위해 영리한 "줌 기술"을 사용하여 4위를 차지했습니다.

여전히 어려워하는 점은 무엇일까요? 바로 "이끼"입니다. 로봇은 이끼를 낮은 풀이나 숲 바닥과 계속 혼동하는데, 이는 아마도 데이터셋 내에서 이끼가 매우 드물고 다른 것들과 매우 비슷하게 생겼기 때문일 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →