← 최신 논문
💻 computer science

GenHAR: Generalizing Cross-domain Human Activity Recognition for Last-mile Delivery

GenHAR는 센서 데이터를 토큰화하고 효율적인 어텐션을 활용한 선택적 마스킹을 적용하여 도메인 간 분포 변화를 해결함으로써 최첨단 정확도와 효율성을 달성하는 새로운 인간 활동 인식 프레임워크이며, 이는 라스트마일 배송 분야의 대규모 실세계 배포를 통해 검증되었습니다.

원저자: Zhiqing Hong, Zelong Li, Xiubin Fan, Guang Yang, Baoshen Guo, Haotian Wang, Tian He, Desheng Zhang

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiqing Hong, Zelong Li, Xiubin Fan, Guang Yang, Baoshen Guo, Haotian Wang, Tian He, Desheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

배송 드라이버가 걷고 있는지, 계단을 오르고 있는지, 아니면 가만히 서 있는지 인식하도록 로봇을 가르치려 한다고 상상해 보세요. 베이징의 특정 드라이버 그룹에서 수집한 데이터로 로봇을 훈련시킵니다. 하지만 그 로봇을 상하이의 드라이버들과 함께 일하게 하거나, 같은 도시의 다른 드라이버들과 함께 일하게 하면 실수가 시작됩니다. 데이터의 '목소리'가 다르기 때문에 혼란을 겪는 것입니다. 아마도 휴대폰을 다른 주머니에 넣었거나, 드라이버들이 걷는 스타일이 다르기 때문일 수 있습니다.

이것이 논문 GenHAR이 해결하는 문제입니다. 이는 훈련된 환경과 완전히 다른 '세계'에서 온 데이터라도 인간 활동 (걷기나 계단 오르기 등) 을 인식할 수 있도록 고안된 새로운 시스템입니다.

다음은 이를 단순한 개념으로 분해한 작동 원리입니다:

1. 문제: '사투리' 이슈

휴대폰이나 시계에서 나오는 센서 데이터를 사람이 말하는 것과 같다고 생각해 보세요. 특정 사람의 사투리를 이해하도록 번역기를 훈련시켰다면, 그 사람이 다른 사투리를 가진 친구와 대화할 때 어려움을 겪을 수 있습니다. 배송 세계에서는 모든 couriers 가 약간씩 다르게 움직이고, 휴대폰을 다른 위치에 착용하며, 다른 기기를 사용합니다. 이로 인해 '분포 변화 (distribution shift)'가 발생합니다. 데이터가 너무 달라서 기존 AI 는 혼란을 겪고 실패하게 됩니다.

대부분의 이전 AI 는 훈련 중에 새로운 그룹 ( '타겟' 도메인) 의 예시를 보여줌으로써 이를 해결하려 했습니다. 하지만 현실 세계에서는 사전에 그 데이터를 얻는 것이 종종 불가능합니다. 한 그룹에서 학습하고 추가 훈련 없이 즉시 어떤 다른 그룹에서도 작동하는 시스템이 필요합니다.

2. 해결책: '단어'가 아닌 '음악'에 귀 기울이기

저자들은 원시 데이터 ( '단어' 또는 이동의 타임라인) 를 보는 것은 너무 노이즈가 많다고 깨달았습니다. 대신 그들은 이동을 **주파수 공간 ( '음악')**으로 변환하기로 결정했습니다.

  • 비유: 두 사람이 같은 노래를 부른다고 상상해 보세요. 한 사람은 빠르게, 다른 한 사람은 느리게 부릅니다. *단어 (시간)*를 보면 매우 다르게 보이지만, *악보 (주파수)*를 보면 선율과 음표는 거의 동일합니다.
  • 혁신: GenHAR 은 원시 이동 데이터를 이 '주파수 악보'로 변환합니다. 특정 활동 (예: 걷기) 의 '선율'은 '템포'나 '악기' (특정 휴대폰이나 사람) 가 변해도 동일하게 유지된다는 것을 발견했습니다. 이로 인해 AI 는 훨씬 더 견고해집니다.

3. 비결: '센서 오케스트라'

데이터가 이 주파수 형식으로 변환되면, GenHAR 은 특수한 유형의 어텐션 메커니즘을 사용합니다.

  • 비유: 오케스트라를 상상해 보세요. 일반적인 AI 는 바이올린 섹션만 듣고 바이올린 음표가 시간에 따라 어떻게 변하는지 살펴봄으로써 전체 곡을 이해하려 할 수 있습니다.
  • GenHAR 의 접근: GenHAR 은 바이올린, 첼로, 드럼이 서로 어떻게 대화하는지 듣는 지휘자처럼 행동합니다. 서로 다른 센서 (가속도계와 자이로스코프) 간의 관계가 활동을 이해하는 핵심임을 깨닫습니다.
  • 선택적 마스킹: 에너지를 절약하기 위해 모든 가능한 악기 간의 대화를 듣지는 않습니다. '좌 - 우' 가속도계는 '상 - 하' 자이로스코프와 실제로 대화할 필요가 없다는 것을 알고 있습니다. 불필요한 대화를 침묵시킴으로써 시스템을 매우 빠르고 효율적으로 만듭니다.

4. 결과: 더 빠르고, 더 똑똑하며, 현실 세계에서 검증됨

논문의 주장에 따르면 세 가지 주요 성과가 있습니다:

  • 정확도: 현재 최첨단 방법보다 훨씬 정확합니다 (평균 약 10% 향상). 단순히 추측한 것이 아니라 활동의 진정한 '선율'을 학습했습니다.
  • 효율성: 훨씬 가볍습니다. 기존 최상위 모델보다 6.4 배 적은 컴퓨팅 파워가 필요합니다. 이는 배송 드라이버들이 배터리와 처리 능력이 제한된 휴대폰에서 이 모델을 사용하기 때문에 매우 중요합니다.
  • 현실 세계 배포: 팀은 실험실에서만 테스트한 것이 아닙니다. 중국의 주요 배송 회사인 JD 물류와 파트너십을 맺었습니다. GenHAR 을 4 개 도시의 9,985 명의 couriers 휴대폰에 설치했습니다.
    • 단 한 달 만에 시스템은 21.5 억 개의 활동을 성공적으로 감지했습니다.
    • 완전히 다른 사람들로부터 수집된 데이터로 훈련되었음에도 불구하고, couriers 가 걷고 있는지, 계단을 오르고 있는지, 아니면 가만히 서 있는지 정확하게 식별했습니다.

5. 배송에 이것이 중요한 이유

논문의 강조에 따르면 이 기술이 물류 회사에 도움을 주는 두 가지 구체적인 방식이 있습니다:

  1. 공정한 업무량: couriers 가 얼마나 많은 계단 오르기나 걷기를 하는지 정확히 알면, 회사는 업무를 더 공정하게 배정할 수 있습니다. 건물에 엘리베이터가 없다면, 시스템은 해당 couriers 가 '추가 작업'을 했음을 인지하고 이에 따라 급여나 업무량을 조정할 수 있습니다.
  2. 더 나은 지도: 시스템은 배송 주소를 확인하는 데 도움을 줍니다. couriers 가 특정 주소에 있다고 말하지만 휴대폰이 지속적으로 운전 중이라고 감지하면, 시스템은 주소가 잘못되었을 수 있음을 알 수 있습니다. 이를 통해 680 만 개 이상의 배송 주소를 높은 정확도로 매핑하는 데 성공했습니다.

요약하자면: GenHAR 은 인간 이동의 '보편적인 선율'을 학습하는 똑똑하고 가벼운 AI 입니다. 서로 다른 휴대폰과 사람들의 노이즈를 무시하여, 재훈련 없이 언제 어디서나 활동을 완벽하게 인식할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →