← 최신 논문
💻 computer science

DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints

이 논문은 수정된 디코더, 새로운 디노이징 키포인트 기술, 그리고 확장된 Varifocal 손실을 활용하여 훨씬 적은 파라미터와 더 빠른 추론 속도로 최첨단 정확도를 달상하는, 실시간 엔드투엔드 트랜스포머 기반 다인원 포즈 추정 모델 제품군인 DETRPose를 소개한다.

원저자: Sebastian Janampa, Marios Pattichis

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sebastian Janampa, Marios Pattichis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이는 파티에 있다고 상상해 보세요. 당신의 목표는 모든 사람의 춤 동작을 사진으로 찍는 것입니다. 당신의 목표는 모든 사람을 즉각적으로 포착하고, 그들 위에 스틱 피겨(졸라맨)를 그려서 모든 관절(어깨, 팔꿈치, 무릎 등)을 올바르게 연결하는 것입니다. 컴퓨터 과학자들은 이것을 **다인원 포즈 추정(Multi-Person Pose Estimation)**이라고 부릅니다.

오랫동안 컴퓨터는 이를 빠르게 수행하는 데 어려움을 겪었습니다. 어떤 모델은 매우 정확하지만 느렸고(마치 예술가가 한 명의 인물을 그리는 데 몇 시간을 들여 정성껏 그리는 것과 같습니다), 어떤 모델은 빠르지만 엉망이었습니다(마치 속사로 그림 그리기 대회에서 팔다리가 서로 뒤섞여 버리는 것과 같습니다).

이 논문은 DETRPose라는 새로운 시스템을 소개합니다. 이 시스템은 '초고속, 초정밀 파티 사진작가'처럼 행동하며, **트랜스포머(Transformer)**라고 불리는 특별한 종류의 AI 두뇌를 사용합니다. 작동 원리는 다음과 같이 간단한 개념으로 나뉩니다.

1. 문제점: "탐색 및 크롭(Search and Crop)"의 병목 현상

대부분의 빠른 방식들은 클럽의 가드(bouncer)처럼 작동했습니다. 먼저 가드가 사람을 발견하면, 이미지에서 그 사람을 잘라내어(크롭) 추출한 다음, 그 사람의 골격을 그리려고 시도합니다.

  • 결함: 만약 파티에 50명이 있다면, 가드는 이 과정을 50번 반복해야 합니다. 사람이 많아질수록 과정은 더 느려집니다.
  • 기존 트랜스포머의 문제: 더 똑똑한 AI 모델(트랜스포머)들은 군중 전체를 한 번에 볼 수 있었지만, 실시간으로 사용하기에는 너무 느렸습니다. 마치 아이가 1분 만에 풀 수 있는 퍼즐을 해결하기 위해 일주일 동안 고민하는 천재와 같았습니다.

2. 해결책: DETRPose

저자들은 실시간으로 이 작업을 수행할 수 있는 최초의 트랜스포머 모델인 DETRPose를 구축했습니다. 이 모델은 이미지 전체를 한 번에 보고 모든 사람의 골격을 동시에 그립니다.

이를 가능하게 하기 위해, 저자들은 세 가지 "비법"을 도입했습니다.

비법 A: "노이즈 제거" 학습 (Denoising Keypoints)

당신이 학생에게 지도상의 특정 지점을 찾는 법을 가르치고 있다고 상상해 보세요.

  • 기존 방식: 단순히 정확한 지점만 보여줍니다.
  • DETRPose 방식: 정확한 지점을 보여주되, 약간 어긋난 "가짜" 지점들도 함께 보여줍니다(너무 왼쪽이나 오른쪽으로 치우친 지점들). 그리고 학생에게 이렇게 가르칩니다. "이것이 진짜이고, 저것들은 비슷하지만 틀린 것이다."
  • 결과: AI가 "실제" 관절과 "노이즈가 섞인" 가짜 관절을 구별하도록 훈련함으로써, 모델은 훨씬 더 빠르게 학습하고 훨씬 더 확신을 갖게 됩니다. 이것을 **디노이징 키포인트(Denoising Keypoints)**라고 합니다.

비법 B: "품질 관리" 점수 (KSVF Loss)

보통 AI 모델은 관절의 위치를 추측하고 점수를 부여합니다. 하지만 포즈 추정에서 "좋은 추측"이란 단순히 위치가 가까운 것만을 의미하지 않습니다. 그것은 관절이 사람의 신체 형태에 얼마나 잘 들어맞느냐의 문제입니다.

  • 저자들은 키포인트 유사도 변형 포컬(KSVF) 손실 함수라는 새로운 채점 규칙을 만들었습니다.
  • 이것은 단순히 "가까움"만을 기준으로 성적을 매기는 것이 아니라, 답변이 전체적인 맥란 속에서 타당한지를 확인하는 엄격한 선생님과 같습니다. 이는 AI가 잘못된 추측을 무시하고 고품질의 추측에만 집중하게 하여 컴퓨팅 자원을 절약하도록 돕습니다.

비법 C: "정교한 디코더" (GroupPose 업그레이드)

실제로 선을 그리는 부분(디코더)이 업그레이드되었습니다.

  • 속도를 늦추는 불필요한 단계들을 제거했습니다.
  • Pose-LQE라고 불리는 특별한 레이어를 추가했습니다. 이것은 최종 사진이 전송되기 전에 그림을 재검토하는 '두 번째 눈'과 같습니다. 이를 통해 어깨와 팔꿈치가 완벽하게 배치되도록 보장하면서도 프로세스의 속도를 늦추지 않습니다.

3. 결과: 속도 대 정확도

논문은 DETRPose를 현재의 챔피언들(YOLO 모델 및 다른 무거운 트랜스포머 모델들)과 비교합니다.

  • "작은" 모델 (DETRPose-S): 가장 크고 무거운 YOLO 모델만큼 정확하면서도, 메모리 자원을 81% 적게 사용하고 속도는 52% 더 빠릅니다.
  • "큰" 모델 (DETRPose-X): 매우 혼잡한 데이터셋(CrowdPose)에서 거의 모든 다른 트랜스포머 모델을 능가하면서, 13배 적은 컴퓨팅 파워(FLOPs)를 사용합니다.
  • "분포 외(Out-of-Distribution)" 테스트: 모델이 본 적 없는 매우 이상하거나 혼잡하거나 특이한 포즈의 사람들 데이터셋(OCHuman)에서 테스트했을 때, DETRPose는 다른 모든 모델보다 뛰어난 성능을 보였습니다. 이는 DETRPose가 단순히 훈련 데이터를 암기하는 것이 아니라 견고하다는 것을 보여줍니다.

4. 단 하나의 아쉬운 점

저자들은 한 가지 한계점을 인정합니다. DETRPose가 수학적으로는 효율적이지만, 순수 속도 면에서는 절대적으로 가장 빠른 "YOLO" 모델들보다 약간 느립니다. 이는 사람들을 그룹화하는 방식이 데이터를 재배열하는 과정(마치 카드를 섞는 것과 같은)을 필요로 하여 약간의 추가 시간을 소요하기 때문입니다. 하지만 이는 실시간 작업에 충분히 빠른 수준이며, 이전의 트랜스포머 시도들에 비해 훨씬 더 효율적입니다.

요 요약

DETRPose는 트랜스포머 AI의 "똑똑하고 모든 것을 보는" 힘을 실시간 포즈 추정에 마침내 가져온 획기적인 성과입니다. 이는 AI가 실수로부터 더 빨리 배우도록 하고(디노이징), 답변을 더 지능적으로 채점하며(KSVF loss), 그리고 그리는 과정을 간소화함으로써 가능해졌습니다. 그 결과, 놀라운 정확도를 갖추고 군중을 더 잘 처리하며, 가상 현실이나 활동 인식과 같은 실제 응용 분야에서 실행될 수 있을 만큼 빠른 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →