← 최신 논문
💻 computer science

Human action recognition based on cascade graph convolutional network

본 논문은 관절 간의 상관관계를 동적으로 모델링하기 위한 동작 인식 계층적 인접 행렬과 복잡도가 증가하는 동작을 단계적으로 분류하기 위한 단계적 캐스케이드 구조를 활용하여, 여러 데이터셋에 걸쳐 인식 정확도와 계산 효율성 사이의 우수한 균형을 달하는 캐스케이드 그래프 합성곱 네트워크(CGCN)를 제안한다.

원저자: Mengai Yan, Jianying Xiong, Ben Huang, Jiabin Chen, Leiyue Yao

게시일 2026-08-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mengai Yan, Jianying Xiong, Ben Huang, Jiabin Chen, Leiyue Yao

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 어떻게 인간의 동작을 인식할 수 있는지 이해하려면, 먼저 컴퓨터가 사람을 어떻게 보는지부터 이해해야 한다. 전통적인 비디오 분석은 종종 장면의 색상과 형태에 의존하며, 옷차림이나 그 사람이 서 있는 배경을 통해 사람을 식별하려고 시도한다. 이러한 방식은 취약하다. 조명이 변하거나 복잡한 군중이 나타나면 기계를 혼란에 빠뜨릴 수 있기 때문이다. 더 견고한 방법은 신체 자체, 즉 어깨, 팔꿈치, 무릎과 같은 관절의 위치로 정의되는 골격 지도에 집중한다. 이러한 지점들을 시간에 따라 추적함으로써, 컴퓨터는 환경의 방해 요소를 무시하고 순수하게 움직임에만 집중할 수 있다. 이것이 골격 기반 동작 인식의 기초이며, 이 분야는 단순한 규칙 준수에서 복잡한 학습 시스템으로 발전해 왔다. 이들 중 그래프 합성곱 신경망(graph convolutional network)이라 불리는 인공지능 유형이 표준적인 도구가 되었다. 이는 인체를 연결된 그래프로 취급하는데, 여기서 관절은 노드가 되고 이들을 잇는 뼈는 에지가 되어, 컴퓨터가 신체의 한 부분의 움직임이 다른 부분에 어떤 영향을 미치는지 학습할 수 있게 한다.

이러한 발전에도 불구하고 상당한 병목 현상이 남아 있다. 대부분의 기존 시스템은 모든 움직임이 전체 신체의 상세한 지도를 필요로 하는 것처럼 취급한다. 그들은 단순한 손 흔들기든 복잡한 점프든 상관없이, 컴퓨터가 모든 동작에 대해 15개의 관절을 모두 처리하도록 강요한다. 이는 마치 단 하나의 단어를 찾기 위해 백과사전 전체를 읽는 것과 같이 계산 비용이 많이 들고 느리다. 더욱이, 이러한 시스템은 종-종 물리적으로 맞닿아 있는 관절만이 서로에게 영향을 줄 수 있다고 가정하는 고정된 연결 지도를 사용하는 경우가 많다. 이는 발걸음에 맞춰 손이 어떻게 움직이는지, 혹은 상체가 뻗는 팔을 어떻게 안정시키는지와 같이 복 복잡한 동작 중에 발생하는 미묘한 비물리적 관계를 간과한다. 그 결과, 실시간 사용에는 너무 느리거나 미세한 인간 행동의 뉘앙스를 포착하기에는 너무 경직된 시스템이 만들어진다.

장시 의과대학교와 난창 대학교의 연구진은 속도와 정확도라는 두 가지 문제를 해결하기 위해 새로운 접근 방식을 제 제안했다. 그들은 캐스케이드 그래프 합성곱 신경 네트워크(Cascade Graph Convolutional Network)라고 불리는 시스템을 개발했다. 이 시스템은 모든 동작에 대해 컴퓨터가 전신을 분석하도록 강요하는 대신, 위험도에 따라 사람을 걸러내는 보안 검문소처럼 단계별로 작동한다. 과정은 머리와 네 사지의 주요 관절만을 사용하는 매우 단순한 신체 뷰로 시작된다. 만약 컴퓨터가 이 희소한 정보만으로 충분히 확신할 수 있다면, 거기서 멈추고 동작을 식별했다고 선언한다. 움직임이 모호하거나 복잡한 경우에만 시스템은 다음 단계로 진행하여, 처음에는 10개, 마지막에는 15개의 전체 관절 세트로 분석을 확장하며 정보를 추가한다. 이러한 단계적 정교화 덕분에 일어서기나 걷기와 같은 단순한 동작은 최소한의 데이터로 거의 즉각적으로 인식되는 반면, 어렵고 미묘한 움직임에 대해서만 완전한 골격의 전체 계산 능력을 요구하게 된다.

연구진은 이 시스템을 더욱 정밀하게 만들기 위해 컴퓨터가 관절 사이의 연결을 이해하는 방식 또한 변경했다. 전통적인 방식은 손이 팔꿈치에만 연결되어 있는 것처럼 해부학에 기반한 정적인 지도를 사용한다. 그러나 새로운 시스템은 동작 자체에 따라 변화하는 동적인 지도를 학습한다. 이는 신체의 서로 다른 부분들이 시간에 따라 서로와 어떤 관계를 맺으며 움직이는지를 계산하여, 물리적으로 연결되어 있지는 않지만 기능적으로 연결된 숨겨진 관계를 식별한다. 예를 들어, 무릎의 움직임 속도가 손목의 가속도와 상관관계가 있다는 것을 감지할 수 있는데, 이는 두 부위가 신체상 멀리 떨어져 있음에도 가능하다. 관절이 어디에 있는지뿐만 아니라 얼마나 빨리 움직이고 가속하는지를 포함하는 더 풍부한 데이터를 통해 이 시스템은 동작에 대한 훨씬 더 깊은 이해를 얻는다.

연구팀은 일상적인 움직임을 수집한 새로운 데이터셋을 포함하여 세 가지 다른 데이터 세트로 이 새로운 방법을 테스트했다. 결과에 따르면, 이 시스템은 높은 정확도로 동작을 식별하는 동시에 이전 방법들보다 현저히 빠른 속도를 보여주었다. UT-3D 데이터셋에서 이 새로운 접근 방식은 97.50%의 정확도를 달성하여 새로운 최첨단 벤치마크를 설정했으며, 두 번째로 우수한 방법을 5.00 퍼센트 포인트 차이로 앞질렀다. Florence-3D 데이터셋에서는 93.48%에 도달하여, 훨씬 느리고 복잡한 시스템에 이어 두 번째를 기록했다. 결정적으로, 새로운 방법은 극도로 효율적이었다. 다른 시스템들이 단 하나의 동작을 처리하는 데 수백 밀리초가 걸린 반면, 이 캐스케이드 시스템은 종종 16 밀리초 미만으로 작업을 마쳤다. 속도와 정확도 사이의 전반적인 균형을 평가할 때, 새로운 방법은 거의 완벽한 점수를 받은 반면, 더 느리고 정확한 시스템들은 현저히 낮은 점수를 받았다.

연구진은 자신들의 시스템에 한계가 있음을 인정한다. 신체의 일부가 시야에서 가려지거나 프레임 내에 여러 사람이 겹칠 경우, 골격 지도가 불완전해지기 때문에 어려움을 겪는다. 또한 통제된 환경에서 수집된 데이터에 의존하므로, 아직은 번잡한 거리나 붐비는 방의 혼란스러운 예측 불가능성에는 준비가 되지 않았을 수 있다. 그러나 핵심적인 혁신은 명확한 진로를 제시한다. 컴퓨터가 단순한 동작을 이해하기 위해 전신을 볼 필요가 없다는 것을 증명하고, 움직이는 부품들 사이의 숨겨진 연결을 찾도록 기계를 가르침으로써, 이 연구는 효율성과 지능이 공존할 수 있음을 보여준다. 이 시스템은 단순히 사람이 무엇을 하고 있는지를 인식하는 것이 아니라, 이전에는 훨씬 더 느리고 자원 집약적인 모델들에 국한되었던 수준의 뉘앙스로 동작을 이해하며, 실시간 지능형 동작 분석의 가능성을 현실로 한 걸음 더 가깝게 가져온다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →