← 최신 논문
💻 computer science

SAM3-I: Segment Anything with Instructions

이 논문은 복잡한 자연어 지시를 직접 해석하면서도 기존 개념 기반의 강점을 유지하도록, 대규모 지시 중심 데이터셋 (HMPL-Instruct) 과 지시 인식 계단식 적응 메커니즘을 도입하여 SAM3 를 확장한 'SAM3-I'를 제안합니다.

원저자: Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao Zou, Huchuan Lu, Li Cheng

게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao Zou, Huchuan Lu, Li Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **'SAM3-I'**이라는 새로운 인공지능 모델을 소개합니다. 이 모델을 쉽게 이해하기 위해 **'똑똑한 사진 편집기'**와 **'명령을 잘 듣는 비서'**의 이야기를 해보겠습니다.

1. 기존 모델 (SAM3) 의 한계: "너무 직관적인 비서"

기존의 'SAM3'라는 모델은 아주 똑똑하지만, 매우 직관적이고 단순한 비서였습니다.

  • 상황: 사용자가 "축구 선수"라고만 말하면, 사진 속 모든 축구 선수를 찾아서 반짝반짝 빛나게 해줍니다.
  • 문제: 하지만 현실에서는 "오른쪽 구석에 있는 파란 유니폼을 입고 공을 차려는 축구 선수"처럼 상세하고 복잡한 설명을 하곤 합니다.
  • 기존 방식의 불편함: SAM3 는 이런 복잡한 말을 이해하지 못해서, 중간에 다른 AI(외부 에이전트) 를 불러와서 "축구 선수"라는 짧은 말로 요약하게 했습니다. 하지만 이 요약 과정에서 세부적인 정보 (파란 유니폼, 오른쪽 구석 등) 가 사라져버려서 정확한 사람을 찾지 못하는 경우가 많았습니다. 마치 "파란 유니폼 입은 오른쪽 선수"를 "축구 선수"라고만 줄여버려서, 사진 속 모든 선수를 다 찾아오는 것과 비슷합니다.

2. 새로운 모델 (SAM3-I): "복잡한 지시도 완벽히 이해하는 비서"

이제 등장한 SAM3-I은 그 비서가 직접 복잡한 지시도 이해할 수 있도록 훈련된 버전입니다.

🌟 핵심 기능: "명령을 한 번에 듣는 마법"

  • 이전: 복잡한 말을 → (다른 AI 가 요약) → → (SAM3 가 실행) → → (결과 확인) → → (틀리면 다시) → → (수정)
    • 비유: 요리사가 주문을 받으면, 다른 사람이 메뉴를 요약해서 전달하고, 요리사가 요리를 하고, 다시 확인하는 식이라 시간이 오래 걸리고 실수가 많습니다.
  • SAM3-I: 복잡한 말을 → (직접 이해) → → (한 번에 정확한 요리 완성)
    • 비유: 요리사가 주문자 옆에 앉아 "오른쪽 구석에 있는 파란 유니폼 입은 선수"라고 말하면, 한 번에 그 사람만 정확히 찾아냅니다.

3. 어떻게 이렇게 똑똑해졌을까? (기술적 비유)

① '계단식 학습' (Cascaded Adaptation)
이 모델은 두 가지 뇌를 가지고 있습니다.

  • S-Adapter (기본 뇌): "빨간 차", "왼쪽 개"처럼 단순한 설명을 잘 이해합니다.
  • C-Adapter (고급 뇌): "차를 타고 가는 사람"처럼 추론이 필요한 복잡한 설명을 이해합니다.
  • 비유: 초등학생 (S) 이 먼저 기초를 배우고, 그 지식을 바탕으로 고등학생 (C) 이 복잡한 문제를 푸는 방식입니다. 이렇게 계단식으로 배우니까, 기초 실력은 잃지 않으면서 고급 능력도 얻은 것입니다.

② '정답을 잃지 않는 나침반' (Alignment Losses)
복잡한 말을 배우는 과정에서 원래 가지고 있던 '개념 이해 능력 (예: '축구 선수'가 뭔지 아는 능력)'을 잃어버리면 안 됩니다.

  • 비유: 새로운 언어를 배우면서 모국어를 잊어버리면 안 되죠. 이 모델은 새로운 지시어를 배우면서도 원래의 개념을 잊지 않도록 여러 가지 '나침반 (손실 함수)'을 통해 길을 잃지 않게 도와줍니다.

③ '엄청난 연습장' (HMPL-Instruct Dataset)
이 모델을 가르치기 위해 **새로운 연습 문제집 (데이터셋)**을 만들었습니다.

  • 이 문제집에는 "개" 같은 단순한 문제부터, "소파 위에 앉아 있는 하얀색 개" 같은 복잡한 문제, 그리고 "소파 위에 앉아 있는 하얀색 개 중 가장 왼쪽에 있는 개"처럼 여러 개 중 하나를 골라야 하는 문제까지 다양하게 담겨 있습니다.
  • 이 문제집은 사람이 직접 꼼꼼히 검수해서, AI 가 헷갈리지 않고 정확히 학습할 수 있도록 만들었습니다.

4. 왜 이것이 중요한가요?

이 기술은 로봇, 자율주행차, 증강현실 (AR) 등에 큰 도움이 됩니다.

  • 예시: 로봇에게 "주방에서 가장 더러운 접시를 찾아서 닦아줘"라고 말하면, SAM3-I 는 '접시'라는 개념뿐만 아니라 '더러운', '주방', '가장'이라는 조건을 모두 이해해서 정확한 접시 하나만 찾아냅니다.

요약

SAM3-I은 "축구 선수"라고만 말하면 다 찾아오던 예전 모델에서, **"오른쪽 구석에 있는 파란 유니폼 입은 선수"**라고 구체적으로 말하면 정확히 그 사람 하나만 찾아주는 초고성능 비서로进化한 것입니다. 복잡한 지시도 한 번에 이해하고, 원래의 능력은 잃지 않는, 정말 똑똑한 사진 분석 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →