S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking
이 논문은 광각 왜곡과 가려짐이 있는 파노라마 환경에서 정밀한 3D 다중 객체 추적을 위해 구면 상태 공간 표현과 확장 칼만 필터링을 결합한 새로운 프레임워크인 S3KF 를 제안하고, 실제 산업 현장 데이터와 Jetson AGX Orin 플랫폼을 통한 실시간 성능을 검증합니다.
이 논문은 거대한 공간에서 여러 사람이나 물체를 동시에, 정확하게, 그리고 끊김 없이 추적하는 새로운 기술을 소개합니다. 제목은 'S3KF'인데, 이를 쉽게 풀어서 설명해 드릴게요.
🌍 핵심 비유: "구형 지구본 위의 추적 게임"
상상해 보세요. 우리가 사는 세상은 평평한 종이 (평면) 가 아니라 **둥근 지구본 (구면)**입니다.
기존 방식의 문제점 (평면 지도의 함정):
기존 카메라 추적 기술은 마치 평평한 세계 지도를 사용하는 것과 같습니다.
문제는 지구본을 평평하게 펼치면 남극이나 북극 근처가 기괴하게 늘어나거나 찢어지는 (왜곡) 현상이 생긴다는 거예요.
또한, 3D 공간에서 방향을 나타낼 때 불필요하게 많은 숫자 (좌표) 를 써야 해서 계산이 복잡해지고, 물체가 가려지거나 멀리 가면 추적이 헛되게 끊기기도 합니다.
이 연구의 해결책 (지구본 그 자체로 생각하기):
이 연구팀은 "아, 우리가 추적하는 대상은 지구본 위에 있는 점이야!"라고 생각했습니다.
그래서 평면이 아니라 '구면 (Spherical)' 그 자체를 기준으로 삼았습니다.
비유: 지구본 위에 스티커를 붙여놓고 그 스티커가 어떻게 움직이는지 추적하는 겁니다. 지구본을 펼치지 않고 그대로 사용하니까, 북극 근처에서도 모양이 찢어지지 않고 자연스럽게 움직임을 쫓아갈 수 있습니다.
🛠️ 어떻게 작동할까요? (두 가지 눈과 하나의 뇌)
이 시스템은 두 가지 센서를 합쳐서 작동합니다.
두 개의 눈 (센서):
물고기 눈 (피시아이 카메라): 360 도를 한 번에 다 볼 수 있는 카메라입니다. 하지만 거리가 잘 안 보입니다.
회전하는 레이저 (LiDAR): 빙글빙글 돌면서 거리 (깊이) 를 정확히 재는 레이저입니다.
이 두 눈이 서로 다른 정보를 주고받습니다. 카메라는 "저기 사람 있네!"라고 하고, 레이저는 "그 사람까지 거리는 5 미터야"라고 알려줍니다.
한 개의 뇌 (S3KF 알고리즘):
이 두 눈의 정보를 지구본 (구면) 위에서 하나로 합칩니다.
**칼만 필터 (Kalman Filter)**라는 수학적 두뇌가 "아, 카메라가 보기에 저 사람이 오른쪽으로 갔는데, 레이저는 거리가 5 미터라고 하네? 그럼 저 사람은 저쪽으로 움직이고 있겠구나"라고 예측하고 보정합니다.
특히 물체가 가려지거나 (예: 다른 사람 뒤에 숨음), 카메라가 흔들릴 때에도 지구본 위에서의 위치를 기억하고 있기 때문에 추적이 끊기지 않습니다.
🏃♭️ 실험 결과: "현실 세계에서의 성공"
이 기술이 실제로 얼마나 좋은지 확인하기 위해, 연구팀은 다음과 같은 실험을 했습니다.
실험 환경: 넓은 야외 공간과 실내, 그리고 **개 로봇 ( quadruped)**과 드론 위에도 장치를 올렸습니다.
참여자: 사람들이 자유롭게 돌아다니며, 각자 등이나 머리에 작은 레이저 장치를 달고 다녔습니다. (이게 바로 정답을 알려주는 '진짜 위치'입니다.)
결과:
정확도: 사람 위치를 10 센티미터 (약 손가락 두 마디) 이내로 정확히 추적했습니다.
연속성: 기존 기술 (ByteTrack) 은 사람이 돌아다니거나 가려지면 "누구지?"라고 헷갈려서 ID 를 바꾸는 경우가 많았는데, 이 기술은 ID 를 거의 바꾸지 않고 한 번 잡으면 끝까지 쫓아갔습니다.
안정성: 드론이 날아다니거나 로봇이 급하게 방향을 틀어도 추적이 끊기지 않고 부드럽게 움직였습니다.
💡 왜 이것이 중요한가요?
이 기술은 공장, 대형 창고, 건설 현장처럼 넓고 복잡한 곳에서 안전을 지키는 데 큰 역할을 할 수 있습니다.
안전: 로봇과 사람이 함께 일할 때, 사람이 어디에 있는지 정확히 알면 사고를 막을 수 있습니다.
편의성: 거대한 카메라나 센서 네트워크를 설치할 필요 없이, 한 대의 장비로 360 도를 모두 볼 수 있습니다.
유연성: 땅 위 (로봇) 이든 하늘 위 (드론) 이든, 어떤 플랫폼에 달아도 똑같이 잘 작동합니다.
한 줄 요약:
"이 연구는 구형 지구본을 기준으로 삼아, 카메라와 레이저의 정보를 합쳐 넓은 공간에서 사람과 물체를 끊김 없이, 정확하게 쫓아내는 똑똑한 시스템을 만들었습니다."
1. 문제 정의 (Problem Statement)
산업 안전 모니터링, 광역 로봇 인식, 대규모 작업 공간의 인프라 경량화 배포 등에서는 360 도 전 방향 (Full-surround) 커버리지, 미터 단위 기하학적 정보, 그리고 광각 왜곡 및 가림 (Occlusion) 하에서의 안정적인 대상물 연관성 확보가 필수적입니다. 기존 기술들은 다음과 같은 한계를 가지고 있습니다.
기존 이미지 기반 추적기 (Image-plane trackers): 피시아이 (Fisheye) 나 이구리 (Equirectangular) 와 같은 파노라마 영상에서 발생하는 비선형 왜곡과 극점 (Pole) 부근의 특이점 (Singularity) 으로 인해 신뢰도가 떨어집니다.
기존 3D 유클리드 기반 추적기: 방향을 표현하기 위해 3 개의 파라미터와 단위 노름 (Unit-norm) 제약 조건을 사용함으로써 불필요한 중복성을 가지며, 필터링 및 융합을 복잡하게 만듭니다. 또한, 깊이 (Depth) 와 물리적 크기를 부수적인 정보로만 취급하여 외관이 모호할 때 견고성이 떨어집니다.
2. 제안 방법론 (Methodology: S3KF)
이 논문은 회전식 LiDAR 와 4 개의 피시아이 카메라 어레이를 통합한 하드웨어 플랫폼을 기반으로, **단위 구 (Unit Sphere, S2) 위의 기하학적 일관성을 가진 상태 공간 (Geometry-consistent State Space)**을 정의한 S3KF 프레임워크를 제안합니다.
가. 기하학적 일관성 상태 표현 (Geometry-consistent State Representation)
접평면 파라미터화 (Tangent-plane Parameterization): 객체의 방향 (Bearing) 을 3D 유클리드 공간이나 왜곡된 이미지 평면이 아닌, 단위 구 S2 위의 2 자유도 접평면 좌표로 모델링합니다.
상태 벡터 구성: 방향의 접평면 좌표 (w1,w2) 및 그 속도, 객체의 박스 종횡비 (ℓ) 와 높이 (h) 및 그 속도, 그리고 LiDAR 로부터 얻은 깊이 (d) 와 깊이 속도 (d˙) 를 포함한 10 차원 상태 벡터를 정의합니다.
이 방식은 이미지 평면의 특이점을 제거하고, 유클리드 모델의 중복성을 없애며, 2D 와 3D 추적을 하나의 상태 공간 모델로 통합합니다.
나. 확장된 구형 칼만 필터링 (Extended Spherical Kalman Filtering)
예측 단계: 일정한 속도 (Constant Velocity) 모델을 가정하여 상태 전이 행렬을 적용합니다.
측정 모델 및 융합:
방향 측정: 카메라 검출기를 구면 로그 맵 (Log-map) 을 통해 접평면 좌표로 변환합니다.
깊이 및 크기 측정: 회전식 LiDAR 의 깊이 관측치와 이미지 검출기의 박스 크기를 상태 벡터에 통합합니다.
비동기 처리: 이미지와 LiDAR 데이터의 동기화 문제를 해결하기 위해 순차적 업데이트 (Sequential updates) 방식을 적용합니다.
업데이트 단계: 표준 칼만 필터 업데이트를 접평면 (Locally Euclidean space) 에서 수행한 후, 지수 맵 (Exp-map) 을 통해 다시 구면으로 투영하여 방향을 갱신합니다. 접평면의 기저 (Basis) 를 병행 이동 (Parallel transport) 하여 국부 좌표계의 불필요한 회전을 방지합니다.
다. 데이터 연관성 (Data Association)
ByteTrack 스타일의 Mahalanobis 거리 게이팅을 기반으로 하며, 파노라마 이미지의 특성을 고려하여 **구면 IoU (Spherical IoU)**와 LiDAR 깊이 일관성 검사를 추가하여 연관성 비용을 계산합니다.
3. Ground Truth 생성 파이프라인
대규모 실외 환경에서 모션 캡처 인프라 없이 정량적 평가를 가능하게 하기 위해 맵 기반 Ground Truth 생성 파이프라인을 구축했습니다.
웨어러블 로컬라이제이션: 각 대상 (사람) 이 LiDAR 와 무선 모듈이 탑재된 웨어러블 장치를 착용합니다.
맵 매칭: 사전에 구축된 전역 LiDAR 맵에 실시간 스캔을 매칭하여 6 자유도 (6-DoF) 궤적을 생성합니다.
장점: 외부 인프라나 장치 간 보정이 필요 없으며, 실내/외부 환경 모두에서 센티미터 수준의 정밀도를 제공합니다.
4. 주요 기여 (Key Contributions)
하드웨어 통합 플랫폼: 회전식 LiDAR 와 4 개 피시아이 카메라를 동기화하여 통합된 360 도 기하학적 및 외관 관측을 제공하는 임베디드 플랫폼 개발.
기하학적 일관성 구면 상태 표현:S2 위의 2 자유도 접평면 파라미터화를 통해 방향, 크기, 깊이를 통합 모델링.
확장된 구형 칼만 필터: 파노라마 이미지 검출과 LiDAR 깊이 정보를 통합한 안정적 상태 추정 및 연관성 알고리즘 도출.
인프라 경량 Ground Truth 생성: 웨어러블 장치를 이용한 전역 맵 기반의 정량적 평가 파이프라인 구축.
5. 실험 결과 (Results)
실험 환경: NVIDIA Jetson AGX Orin 에서 실시간으로 실행되었으며, 실외 환경에서 3 명의 참가자가 다양한 운동 패턴 (정지, 원운동, 빠른 이동, 가림 발생 등) 으로 이동하는 시나리오로 평가되었습니다.
정확도: 수평면 (x-y) 에서 **데시미터 (Decimeter) 수준 (평균 RMSE 약 0.187m)**의 추적 정확도를 달성했습니다.
ID 스위칭 감소: 기존 2D 기반 ByteTrack 과 비교하여, 파노라마 왜곡과 가림이 발생하는 환경에서 ID 스위칭 (Identity Switches) 이 획기적으로 감소했습니다.