← 최신 논문
💻 computer science

Sapiens2

이 논문은 0.4 억에서 50 억 파라미터 규모의 고해상도 트랜스포머 모델 패밀리인 Sapiens2 를 소개하며, 개선된 사전 학습 전략과 10 억 장의 고품질 인간 데이터, 4K 해상도 지원을 통해 포즈 추정, 신체 부위 분할, 법선 추정 등 다양한 인간 중심 비전 작업에서 기존 모델을 크게 능가하는 새로운 최첨단 성능을 달성했다고 요약할 수 있습니다.

원저자: Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito

게시일 2026-04-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

SAPIENS2: 사람에 대한 '초고해상도' 이해를 가진 AI 의 새로운 등장

이 논문은 메타 (Meta) 의 Reality Labs 팀이 발표한 SAPIENS2라는 새로운 인공지능 모델에 대한 이야기입니다. 이전 버전인 Sapiens 를 훨씬 더 발전시킨 이 모델은 **"사람을 보는 눈"**을 가진 AI 로, 단순히 사람 얼굴을 인식하는 것을 넘어 피부 주름, 머리카락, 옷의 주름, 심지어 입술 안쪽까지 아주 정밀하게 이해하고 분석할 수 있습니다.

이 복잡한 기술 내용을 일상적인 비유로 쉽게 설명해 드리겠습니다.


1. SAPIENS2 란 무엇인가요? (마치 '초능력자' 같은 AI)

기존의 AI 는 사람을 볼 때 "아, 저건 사람이다"라고 대략적으로만 알았거나, 아주 선명하지 않은 사진만 봤습니다. 하지만 SAPIENS2는 마치 초고해상도 현미경을 들고 있는 전문 의사와 예술가가 합쳐진 존재와 같습니다.

  • 크기: 이 모델은 0.4 억 개에서 50 억 개까지 다양한 크기의 '뇌'를 가지고 있습니다. 가장 큰 모델 (50 억 개) 은 시각적 AI 역사상 가장 많은 계산 능력 (FLOPs) 을 자랑합니다.
  • 해상도: 일반 카메라가 1,000 화소 (1K) 정도를 본다면, SAPIENS2 는 **4,000 화소 (4K)**까지 볼 수 있습니다. 마치 4K TV 를 보는 것과 1K TV 를 보는 것의 차이처럼, 훨씬 더 선명하고 디테일한 세상을 봅니다.

2. 어떻게 배웠나요? (두 가지 학습법: '퍼즐 맞추기'와 '비교하기')

SAPIENS2 가 이렇게 똑똑해진 이유는 두 가지 독특한 학습 방법을 섞었기 때문입니다.

  1. 퍼즐 맞추기 (Masked Image Modeling):

    • 비유: 사진의 일부를 가리고, AI 가 가려진 부분을 상상해서 채워 넣는 게임입니다.
    • 효과: 이 과정을 통해 AI 는 피부 질감, 머리카락 끝, 옷의 주름 같은 아주 작은 '저수준의 디테일'을 배우게 됩니다. 마치 화가가 붓터치 하나하나를 익히는 것과 같습니다.
  2. 비교하기 (Contrastive Learning):

    • 비유: 두 장의 사진을 보여주고 "이 두 장은 같은 사람이다"라고 가르치는 것입니다.
    • 효과: 이 과정을 통해 AI 는 **사람의 의미 (의미론)**를 배웁니다. "이건 코다, 저건 귀다, 이 사람은 웃고 있다" 같은 개념을 이해하게 됩니다.

SAPIENS2 의 혁신: 이전 모델들은 이 두 가지를 따로 하거나 한쪽만 잘했습니다. 하지만 SAPIENS2 는 두 가지를 동시에 배워서, "디테일도 완벽하게 보면서도, 그게 무슨 의미인지도 정확히 아는" 완벽한 지식을 갖게 되었습니다.

3. 무엇을 할 수 있나요? (다재다능한 '사람 전문가')

이 모델은 사람과 관련된 거의 모든 일을 할 수 있습니다. 마치 사람에 대한 만능 해부학자이자 3D 모델링 전문가가 된 것입니다.

  • 자세 분석 (Pose): 사람의 뼈대 308 개 지점을 정확히 찾아냅니다. 손가락 끝이나 발가락까지도 놓치지 않습니다.
  • 부위 분할 (Segmentation): 사람 몸의 29 가지 부위 (입술, 혀, 귀걸이, 치아, 잇몸 등) 를 픽셀 단위로 정확하게 잘라냅니다. 치아와 잇몸을 구분하거나 귀걸이와 머리카락을 분리할 정도로 정밀합니다.
  • 3D 깊이와 방향 (Pointmap & Normals): 2D 사진에서 3D 공간의 깊이를 계산하고, 피부나 옷의 **표면이 어느 방향으로 기울어져 있는지 (법선)**를 알아냅니다. 이는 가상 현실 (VR) 아바타를 만들 때 얼굴의 주름이나 옷의 주름을 사실적으로 표현하는 데 필수적입니다.
  • 알베도 (Albedo): 빛의 영향을 제거하고 피부색과 옷의 본래 색상을 복원합니다. 어두운 곳에서도 피부색을 정확히 알아내는 능력입니다.

4. 왜 이것이 중요한가요? (실제 생활에서의 변화)

이 기술은 단순히 점수만 높이는 것이 아니라, 실제 우리 삶에 큰 변화를 줍니다.

  • 가상 아바타의 혁명: 게임이나 메타버스에서 내 아바타가 내 얼굴의 미세한 표정, 피부 주름, 머리카락 하나하나까지 그대로 따라 할 수 있게 됩니다.
  • 의료 및 헬스케어: 피부 질환을 더 정밀하게 분석하거나, 재활 운동 시 자세를 픽셀 단위로 교정해 줄 수 있습니다.
  • 영화 및 게임: 거대한 촬영 세트 없이도, 한 장의 사진만으로도 사실적인 3D 캐릭터를 만들어낼 수 있습니다.

5. 결론: SAPIENS2 의 핵심 메시지

SAPIENS2 는 **"사람을 보는 AI"**의 새로운 기준을 세웠습니다.
이전에는 "사람이 있다"는 것만 알아도 충분했다면, 이제는 "그 사람의 피부 결, 표정, 옷감의 질감까지 완벽하게 이해하고 4K 화질로 재현할 수 있는" 시대가 열렸습니다.

이 모델은 10 억 장의 사람 사진을 학습하여, 어떤 상황 (실내, 실외, 다양한 인종과 나이) 에서도 흔들리지 않는 강력한 능력을 보여주었습니다. 앞으로 우리가 만들어낼 모든 '사람 관련' 디지털 콘텐츠는 이 SAPIENS2 를 기반으로 더욱 사실적이고 정교해질 것입니다.


한 줄 요약:

SAPIENS2 는 10 억 장의 사진을 보고 배운, 사람에 대한 디테일과 의미를 동시에 완벽하게 이해하는 '초고해상도 AI 전문가'입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →