로봇이 사람과 함께 컵을 받거나 물건을 옮기는 일을 한다고 상상해 보세요. 보통은 잘하지만, 가끔은 로봇이 실수를 하거나 사람이 예상치 못한 행동을 할 수 있습니다.
예시: 사람이 컵을 놓는 위치가 조금 어긋나서 로봇이 컵을 떨어뜨리는 경우 (그림 1 참조).
기존 방식의 한계: 기존 로봇들은 주로 "카메라 화면"만 보고 이상을 감지했습니다. 하지만 카메라는 단순히 '화면'을 볼 뿐, 로봇의 몸이 얼마나 힘들어하는지, 혹은 컵과 사람 사이의 관계가 어떤지까지 깊이 이해하지 못합니다. 마치 눈만 뜨고 귀는 막힌 상태에서 위험을 감지하는 것과 비슷하죠.
2. 이 연구가 제안한 해결책: MADRI (세 가지 감각을 갖춘 로봇)
저자들은 MADRI라는 새로운 시스템을 만들었습니다. 이 시스템은 로봇이 이상을 감지할 때 세 가지 정보를 동시에 활용합니다.
눈 (비전): 카메라로 보는 장면.
몸 (센서): 로봇 관절의 힘 (토크) 이나 잡는 힘.
관계도 (Scene Graph): 사람과 사물 사이의 관계를 나타내는 지도.
이를 한 마디로 비유하자면?
MADRI 는 로봇에게 "눈 (카메라)", "근육 감각 (센서)", "상황 파악 능력 (관계도)"을 모두 갖춘 완벽한 감시관을 붙여주는 것입니다.
3. 어떻게 작동할까요? (작동 원리)
단계 1: 장면 이해하기 (눈) 로봇은 카메라 영상을 그대로 보지 않습니다. 대신, 영상을 **"의미 있는 요약"**으로 바꿉니다. 예를 들어, "사람이 컵을 들고 있다"는 식의 핵심 정보만 뽑아냅니다. (기존 방식은 모든 픽셀을 다 보느라 너무 느리고 비효율적이었습니다.)
단계 2: 몸 상태 확인하기 (몸) 로봇은 자신의 관절이 얼마나 힘들게 움직이는지, 힘이 얼마나 들어가는지 체크합니다. 만약 로봇이 컵을 떨어뜨리려고 할 때, 관절에 무리가 가거나 힘이 비정상적으로 변하면 이를 감지합니다.
단계 3: 관계도 확인하기 (관계) "사람과 컵이 너무 멀다", "예상치 못한 사람이 갑자기 나타났다" 같은 관계적 이상을 파악합니다.
단계 4: 정상 패턴과 비교하기 (재구성) 이 세 가지 정보를 합쳐서 **"정상적인 상황"**이 어떤지 학습시킵니다. 그리고 실제 일이 일어날 때, 이 정보가 학습된 '정상 패턴'과 얼마나 다른지 (오차) 를 계산합니다.
비유: 로봇이 "오늘은 컵을 받을 때 힘이 10 단위만 들어갔어야 하는데, 50 단위가 들어갔네? 아니면 컵이 떨어지는 모양이 이상하네?"라고 생각하며 **"이상하다!"**라고 경보를 울리는 것입니다.
4. 실험 결과: 무엇이 달라졌나요?
연구팀은 실제 사람과 로봇이 컵을 주고받는 실험을 했습니다. (컵을 떨어뜨리거나, 충돌하는 등의 실수를 일부러 만들었습니다.)
눈만 가진 로봇 (Vision-only): 화면이 흔들리거나 빛이 반사되면 "아, 이상한 일이 일어났다!"라고 잘못 알기도 했습니다 (거짓 경보).
세 감각을 다 가진 로봇 (Multimodal):
정확도 UP: 로봇이 관절에 무리를 느끼면서 컵을 떨어뜨리는 경우, 눈만으로는 늦게 감지했지만 센서까지 활용하면 훨씬 빠르게 감지했습니다.
오류 감소: 화면이 흔들릴 때처럼 헛갈리는 상황에서도, 센서 데이터가 "아, 몸은 정상인데 화면만 흔들리는구나"라고 판단해 거짓 경보를 줄였습니다.
5. 결론: 왜 중요한가요?
이 연구는 **"로봇이 안전하려면 눈만 믿지 말고, 몸의 감각과 상황 파악 능력까지 함께 써야 한다"**는 것을 증명했습니다.
마치 운전할 때를 생각해 보세요.
기존 방식: 앞유리 (카메라) 만 보고 운전하다가, 엔진 소리가 이상하거나 핸들이 떨리는지 모르고 사고가 날 수 있습니다.
이 연구의 방식: 앞유리도 보지만, **엔진 소리 (센서)**와 **주변 차량과의 거리 (관계도)**도 함께 확인하므로 훨씬 안전하고 똑똑하게 운전할 수 있습니다.
이 기술이 발전하면, 로봇이 사람과 함께 일할 때 더 안전하고, 로봇이 스스로 "내가 지금 위험해!"라고 알려주어 사고를 미리 막을 수 있게 될 것입니다.
논문 제목: 인간 - 로봇 상호작용 (HRI) 을 위한 다중 모달 이상 탐지 (MADRI)
1. 문제 정의 (Problem)
배경: 물류, 제조, 의료 등 인간 중심 환경으로 로봇 시스템이 통합되면서 인간 - 로봇 상호작용 (HRI) 의 안전성과 신뢰성이 핵심 과제가 되었습니다.
한계: 기존 안전 메커니즘은 알려진 위험을 완화할 수 있지만, 정의된 '정상' 상태와 일치하지 않는 **예상치 못한 이상 행동 (Anomalous Behaviours)**을 탐지하는 데에는 한계가 있습니다.
기존 접근법의 문제점:
기존 이상 탐지 모델 (오토인코더 등) 은 주로 비디오의 **원시 픽셀 데이터 (Raw Pixels)**를 직접 재구성하는 방식을 사용합니다.
이는 계산 비용이 매우 높고, 배경 텍스처나 조명 변화 등 작업과 무관한 시각적 세부 사항에 과도하게 민감하여 동적인 환경에서 일반화 능력이 떨어집니다.
또한, 로봇 내부의 기계적 고장 (예: 조인트 토크 이상) 은 시각적 데이터만으로는 탐지하기 어렵습니다.
2. 제안 방법론 (Methodology: MADRI Framework)
저자들은 **MADRI (Multimodal Anomaly Detection for Human-Robot Interaction)**라는 새로운 프레임워크를 제안합니다. 이 프레임워크는 시각, 센서, 관계적 정보를 통합하여 이상을 탐지합니다.
핵심 아이디어: 원시 비디오 재구성이 아닌, 의미 있는 특징 벡터 (Feature Vectors) 공간에서의 재구성을 수행합니다.
데이터 모달리티 (3 가지):
시각적 행동 (Visual): RGB 비디오 스트림.
물리적 역학 (Physical): 로봇의 내부 센서 데이터 (조인트 토크, 그리퍼 위치).
관계적 (Relational): 장면 그래프 (Scene Graph, 사람과 객체 간의 관계).
시스템 파이프라인:
시각 특징 추출: 사전 학습된 Swin3D 모델을 인간 - 로봇 상호작용 태스크 (Pick-and-Place) 에 맞게 파인튜닝합니다. 분류 레이어를 제거하고, 각 비디오 클립에 대한 768 차원의 고수준 의미 특징 벡터를 추출합니다.
센서 데이터 통합: 로봇의 조인트 토크 및 그리퍼 데이터를 시간 축을 따라 Max Pooling하여 차원을 축소하고, 이를 시각 특징 벡터와 연결 (Concatenate) 합니다.
장면 그래프 (Scene Graph): OED 모델을 사용하여 사람과 객체 간의 관계를 그래프로 표현하고 행렬로 변환하여 특징 벡터에 추가합니다.
재구성 모델 (Reconstruction Model): 통합된 다중 모달 특징 벡터를 입력받아 **오토인코더 (Autoencoder)**로 학습합니다. 이 모델은 '정상' 데이터 분포만 학습하도록 훈련됩니다.
이상 점수 산출: 추론 시 입력 데이터의 재구성 오차 (Reconstruction Error) 를 계산합니다. 사전 정의된 임계값을 초과하면 이상으로 판별합니다.
3. 주요 기여 (Key Contributions)
MADRI 프레임워크 제안: 비디오 스트림, 로봇 센서 데이터, 장면 그래프를 결합하여 HRI 작업의 이상을 정확하게 식별하는 다중 모달 이상 탐지 프레임워크를 개발했습니다.
의미 있는 특징 공간 재구성: 원시 픽셀 대신 시맨틱 특징 공간에서 재구성 기반 이상 탐지를 수행하는 것이 비디오 기반 이상 탐지에 효과적임을 입증했습니다.
커스텀 데이터셋 구축: 인간 - 로봇 컵 인계 (Handover) 및 픽 - 앤 - 플레이스 작업을 수행하는 정상 및 이상 조건을 포함한 맞춤형 데이터셋을 수집 및 공개했습니다.
포괄적인 실험 평가: 단일 모달 (비전 전용) 방법과 비교하여 다중 모달 접근법이 이상 탐지 성능을 유의미하게 향상시키고 오탐지 (False Positives) 를 줄임을 입증했습니다.
4. 실험 결과 (Results)
데이터셋: 6 명의 참가자가 72 회 (1 회당 12 회) 수행한 컵 인계/배치 작업 데이터. 17 건의 자연스러운 실패 사례 (컵 떨어뜨림, 충돌, 추가 인물 출현 등) 를 포함.
성능 비교:
비전 전용 (Vision-only): 시각적 이상 (예: 컵 떨어뜨림) 탐지는 가능하나, 로봇 내부 고장이나 미세한 동작 이상 탐지에는 한계가 있었습니다.
비전 + 센서 (Vision + Sensor):가장 우수한 성능을 보였습니다. 특히 로봇 조인트 한계에 도달하거나 토크가 비정상적으로 변하는 경우 (Fig. 5 참조) 시각 모델보다 명확하게 이상을 탐지했습니다. 또한, 시각적 요동으로 인한 오탐지를 줄여 안정성을 높였습니다.
장면 그래프의 영향: 현재 데이터셋의 이상 사례가 '관계적' 오류보다는 물리적/시각적 오류에 치중되어 있고, 장면 그래프 생성기의 성능 한계로 인해, 장면 그래프를 추가한 모델은 오히려 성능이 저하되는 경향을 보였습니다.
결론: 센서 데이터를 통합하는 것이 시각 정보만 사용하는 것보다 이상 탐지 성능을 크게 향상시킵니다.
5. 의의 및 결론 (Significance)
안전성 강화: 로봇이 예상치 못한 환경 변화나 내부 고장을 실시간으로 감지하고 대응할 수 있게 하여, 인간과 로봇이 안전하게 협업할 수 있는 기반을 마련했습니다.
계산 효율성: 원시 픽셀 재구성 대신 특징 벡터 재구성을 사용하여 계산 부하를 줄이고, 의미 있는 정보에 집중하도록 했습니다.
미래 방향: 더 다양한 작업으로 데이터셋을 확장하고, 추가 모달리티를 통합하며, 단순 이상 탐지를 넘어 구체적인 고장 유형 분류 (Failure Classification) 로 모델을 발전시킬 계획입니다.
이 연구는 인간 - 로봇 협업 시스템의 신뢰성을 높이기 위해 다중 모달 데이터의 통합과 고수준 특징 공간 활용이 필수적임을 보여주는 중요한 사례입니다.