← 최신 논문
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo 는 물리 기반 IMU 시뮬레이션과 LLM 정렬을 활용하여 다양한 웨어러블 장치와 미처 보지 못한 데이터셋 전반에 걸쳐 견고하고 일반화 가능한 인간 운동 이해를 가능하게 하는 기하학적 인식을 갖춘 설정 무관 프레임워크로, 제로샷 활동 인식, 교차 모달 검색, 운동 캡셔닝에서 기존 방법들을 크게 능가합니다.

원저자: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스마트워치, 피트니스 트래커, 혹은 신발에 부착된 센서까지 상상해 보세요. 이러한 장치들은 몸의 움직임을 감지하는 데 탁월합니다. 하지만 여기엔 문제가 있습니다: 센서의 위치에 따라 움직임은 완전히 다르게 보입니다.

손을 흔들면 손목에 있는 센서는 크고 빠른 흔들림을 감지하지만, 엉덩이에 있는 센서는 아주 작고 미묘한 흔들림을 감지합니다. 머리에 있는 센서는 거의 아무것도 감지하지 못하죠. 현재의 AI 모델들은 오직 하나의 특정 시험만을 위해 공부한 학생과 같습니다. 센서를 다른 위치로 옮기거나 장치의 브랜드를 변경하면 AI는 혼란에 빠져 실패합니다.

이 논문은 AnyMo라는 새로운 AI 프레임워크를 소개합니다. 이는 센서가 어디에 배치되든 상관없이 인간 움직임을 위한 '보편적 번역기'로 설계되었습니다.

AnyMo의 작동 원리를 간단한 개념으로 나누어 설명해 보겠습니다.

1. "가상 체육관" (기하학적 인식 시뮬레이션)

인간 몸의 모든 가능한 위치에서 수백만 개의 실제 센서를 수집하는 것 (불가능합니다) 대신, AnyMo는 가상 체육관을 구축합니다.

  • 유사성: 3D 디지털 인형을 상상해 보세요. 연구자들은 단순히 인형의 손목에 센서를 부착하는 데 그치지 않았습니다. 그들은 인형의 피부 전체, 즉 팔꿈치, 무릎, 등, 이마 등에 수천 개의 미세한 센서를 가상으로 '페인트'로 칠했습니다.
  • 물리 법칙: 그들은 물리 법칙을 이용해 인형이 걷거나, 뛰거나, 춤출 때 그 센서들이 어떻게 진동하고 회전할지 정밀하게 시뮬레이션했습니다. 이를 통해 '만약에' 시나리오의 거대한 라이브러리를 생성했고, AI에게 '걷기'라는 동작이 무릎에서는 다르게 보이지만 어깨에서는 다르게 보일지라도 근본적으로는 같은 행동임을 가르쳤습니다.

2. "눈가리개 퍼즐" (설치 무관 사전 학습)

AI 가 가상 체육관에서 학습한 후, 센서가 누락되거나 무작위로 배치된 실제 상황을 처리하도록 가르쳐야 했습니다.

  • 유사성: 걷는 사람의 퍼즐 전체를 AI 에게 보여준 다음, 눈가리개를 씌워 실제 사람身上的 센서인 2~3 개의 퍼즐 조각만 볼 수 있게 해 보세요.
  • 기법: AI 는 그 몇 조각만을 바탕으로 전체 그림이 어떻게 생겼을지 추론해야 합니다. 다양한 '눈가리개'(다른 센서 구성) 로 이를 반복적으로 연습함으로써, AI 는 특정 센서 위치를 암기하는 대신 움직임의 핵심 구조를 학습합니다. 이는 센서 데이터의 '피부'가 아니라 움직임의 '영혼'을 배우는 것입니다.

3. "번역기" (토큰화 및 대규모 언어 모델)

원시 센서 데이터는 가속도, 속도 등의 숫자 스트림일 뿐입니다. 이 논문에서 사용된 것과 같은 대규모 언어 모델 (LLM) 은 단어를 이해하는 데 뛰어나지만, 원시 숫자 앞에서는 막힙니다.

  • 유사성: AnyMo 는 번역기 역할을 합니다. 그것은 센서 숫자의 messy 한 연속 스트림을 가져와 '운동 토큰'(문장의 단어와 같은) 으로 압축합니다.
  • 결과: AI 에게 백만 개의 숫자를 공급하는 대신, '운동 단어'로 이루어진 짧은 문장을 공급합니다. 이를 통해 AI 는 움직임을 언어와 직접 연결할 수 있게 됩니다.

AnyMo 는 무엇을 할 수 있을까요?

이 논문은 AnyMo 를 세 가지 주요 작업으로 테스트했으며, 이전 모든 방법을 능가하는 성과를 거두었습니다.

  1. 제로샷 인식 ("활동 추측" 게임):

    • AnyMo 는 14 개의 서로 다른 데이터셋을 보였는데, 이는 센서, 사람, 활동이 모두 달랐으며 AI 가 단 한 번도 본 적 없는 것이었습니다.
    • 결과: AnyMo 는 해당 특정 데이터셋에 명시적으로 훈련된 적 없이도 사람이 무엇을 하고 있는지 ("요리", "걷기", "춤추기" 등) 정확하게 추측할 수 있었습니다. 이는 다음으로 가장 좋은 방법보다 약 12% 의 정확도 향상을 보였습니다.
  2. 크로스모달 검색 ("검색 엔진"):

    • 텍스트에서 운동으로: "사람이 냉장고 문을 열고 있다"고 입력하면, AI 는 이에 정확히 일치하는 비디오 클립이나 센서 데이터를 찾습니다.
    • 운동에서 텍스트로: 센서 녹음 파일을 업로드하면, AI 는 이에 일치하는 텍스트 설명을 찾습니다.
    • 결과: AnyMo 는 다른 모델들보다 훨씬 더 정확하게 일치하는 항목을 찾았으며, 데이터가 완전히 다른 장치에서 왔을 때도 마찬가지였습니다.
  3. 운동 캡션 작성 ("이야기꾼"):

    • AI 에게 센서 녹음 파일을 주면, 발생한 일을 설명하는 문장을 작성합니다.
    • 결과: "팔이 움직인다"와 같은 일반적인 말 대신, AnyMo 는 "한 사람이 복도를 걸어 오른쪽으로 돌아서 캐비닛을 연다"와 같은 구체적인 설명을 작성했습니다. 이는 물리 법칙이 아니라 움직임의 이야기를 포착한 것입니다.

결론

이 논문은 센서 배치를 무작위 변수가 아닌 신체의 모양을 활용한 구조화된 기하학적 문제로 취급하고, AI 에게 움직임을 언어로 번역하도록 가르침으로써 AnyMo 가 웨어러블 운동을 위한 범용 모델을 창출한다고 주장합니다.

AnyMo 는 특정 시계에서 특정 활동을 인식하는 것을 넘어, 어떤 장치든, 어떤 신체 부위든, 야외 환경에서도 작동할 수 있도록 인간 운동의 개념을 이해합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →