특정 미로를 인간이 완벽하게 통과하는 비디오를 보여줌으로써 로봇에게 미로 통과를 가르친다고 상상해 보세요. 이를 모방 학습이라고 합니다.
보통 로봇은 인간의 경로를 단계별로 정확히 복사하려 합니다. 하지만 미로의 벽을 이동하면 어떻게 될까요? 비디오를 완벽히 따르려던 로봇은 벽을 정면으로 들이받고 갇혀 실패합니다. 단순히 비디오를 암기했을 뿐이므로 "생각"하거나 적응하는 방법을 모릅니다.
이 논문은 적응형 에르고딕 모방이라는 더 지적인 로봇 교육 방식을 제안합니다. 간단한 비유를 통해 작동 원리를 설명하겠습니다.
1. "GPS 대 안개" 비유
로봇의 훈련 데이터 (인간의 비디오) 를 GPS 경로로 생각하세요.
일반 모드 (추적): 로봇이 비디오에 표시된 경로를 걷고 있을 때, 그것은 엄격한 GPS 처럼 행동합니다. 선을 정확히 따릅니다.
문제 모드 (갇힘): 로봇이 벽에 부딪히거나 경로가 바뀌면 GPS 는 "경로에서 벗어났습니다!"라고 말합니다.
해결책 (에르고딕 탐색): 당황하거나 포기하는 대신 로봇은 "안개 모드"로 전환합니다. 정확한 선을 따르려던 시도를 멈추고 선 주변을 탐색하기 시작합니다. 약간 헤매며 장애물을 우회할 길을 찾지만, 길을 잃지 않도록 원래 경로 근처에 머뭅니다.
2. 로봇이 언제 전환해야 하는지 아는 방법
로봇에는 내장된 "정체 카운터"가 있습니다.
비디오 속 인간이 단계와 함께 작동하는 가상 시계를 가지고 있다고 상상해 보세요.
로봇도 자체 시계를 가지고 있습니다.
로봇이 인간의 시계를 따라가고 있다면 "엄격한 GPS 모드"에 머뭅니다.
로봇이 뒤처지면 (벽에 부딪히거나 혼란을 겪을 때), 두 시계 사이의 간격이 너무 커집니다. 이것이 "안개 모드"로 전환하는 트리거가 됩니다. 로봇은 "내가 갇혔구나; 새로운 길을 찾기 위해 탐색해야 한다"고 깨닫습니다.
3. "자석 고무줄"
이 논문은 이 "안개 모드"를 만들기 위해 수학적 트릭을 사용합니다. 원래 경로를 고무줄로 상상해 보세요.
추적 시: 고무줄은 팽팽합니다. 로봇은 경로 중앙으로 강하게 당겨집니다.
탐색 시: 고무줄은 느슨하고 신축성이 생깁니다. 로봇이 벽의 틈을 찾기 위해 중심에서 더 멀리 헤매도 허용됩니다.
형태: 이 논문은 이 고무줄을 "이방성"으로 만듭니다. 이는 앞뒤로 뻗는 것보다 옆쪽으로 더 많이 늘어나는 (벽을 우회하기 위해) 것을 의미하는 고급 표현입니다. 이는 로봇이 장애물을 피하면서도 전반적으로 올바른 방향으로 이동하도록 유지합니다.
4. 성공의 "히트맵"
로봇은 어디로 가야 할지 단순히 추측하지 않습니다. 본 모든 성공적인 비디오를 살펴보고 히트맵을 생성합니다.
인간이 자주 걷던 지역은 "뜨겁습니다" (높은 확률).
로봇은 MMD 라는 특수 수학 도구를 사용하여 헤매는 동안 원을 그리지 않고 새로운 지역을 효율적으로 커버하도록 보장합니다. 이는 직접적인 경로가 막혔을 때 덤불 주변을 코로 냄새 맡을 만큼 영리한, 실종자 수색 구조견처럼 행동합니다.
결과
실험에서 연구자들은 로봇을 좁은 간격이 있는 미로에 넣었습니다.
그들은 간격 (장애물) 을 로봇이 본 적 없는 새로운 곳으로 이동시켰습니다.
기존 방법: 로봇은 원래 비디오를 따르려다 새로운 벽에 부딪혀 100% 실패했습니다.
이 새로운 방법: 로봇은 자신이 갇혔음을 깨닫고 "고무줄"을 느슨하게 풀었으며, 원래 경로 주변의 지역을 탐색하여 새로운 간격을 찾고 성공적으로 목표에 도달했습니다.
요약하자면: 이 논문은 로봇을 "지능적인 추종자"로 가르칩니다. 일이 쉬울 때는 지시를 완벽히 따르지만, 갇히게 되면 원래 목표를 잊지 않고 창의적으로 주변을 탐색하여 문제를 해결하는 법을 알게 됩니다.
기술 요약: 증명을 중심으로 한 적응적 탐색을 위한 에르고딕 모방
문제 제기 로봇공학에서 모방 학습 (IL) 은 환경 변화, 불완전한 관측, 또는 제어 오차로 인해 발생하는 훈련 조건과 배포 환경 간의 불일치라는 치명적인 과제를 직면합니다. 로봇이 이러한 불일치 하에서 명목 궤적을 따르려 할 때, 종종 갇혀 작업을 완료하지 못합니다. 심층 생성 모델이 모방 학습에 사용되기는 하지만, 이러한 모델들은 종종 증례 데이터에 과적합되어 일반화 가능한 정책을 학습하기보다는 특정 행동 시퀀스를 암기하는 경향이 있습니다. 결과적으로 현재의 접근 방식은 최소한의 분포 변화 하에서도 취약합니다. 또한, 기존 적응적 탐색 방법들은 이산적 전이에 크게 제한되어 있어, 로봇 조립과 같은 작업에서 미세한 상태 공간 조정에 필요한 연속적 탐색 능력을 결여하고 있습니다. 핵심 문제는 훈련 분포에서 환경이 이탈할 때 경직된 추적을 탐색으로 적응적으로 전환할 수 있으면서도 증례에 기반을 둔 온라인 전략의 필요성입니다.
방법론 저자들은 단일 제어기 내에서 추적과 탐색을 통합하는 적응형 에르고딕 모방 접근법을 제안합니다. 이 방법은 명시적인 행동 레이블을 생략하고 상태 공간 커버리지에 집중하기 위해 전문가 상태 궤적 데이터셋을 기반으로 작동합니다.
위상 복원 및 진행도 추정: 재계획 간격마다 시스템은 현재 로봇 상태에 기반하여 가장 관련성 높은 맥락을 찾기 위해 전문가 데이터셋을 조회합니다. 현재 상태와 전문가 궤적의 가장 가까운 점을 비교하여 "위상 오차" e(t) 를 정의합니다. 진행도를 추적하기 위해 가상 참조 시계 τ(t) 를 사용합니다:
추적 모드: 위상 오차가 임계값 (ϵ) 이내인 경우, 시계가 진행되고 시스템이 증례를 추적합니다.
탐색 모드: 오차가 임계값을 초과할 경우 (정체를 나타냄), 시계가 멈추고 정체 카운터가 증가합니다. 이 신호는 탐색으로의 전환을 촉발합니다.
기하학 유도 분포 생성: 이 방법은 온도 유사 진행 변수 θ 에 기반하여 세 가지 구성 요소를 혼합하는 확률 미분 방정식 (SDE) 을 사용하여 목표 입자 분포 {qj} 를 생성합니다:
명목 인력: 입자들을 참조 궤적의 가장 가까운 점으로 끌어당기는 드리프트 항.
히트 커널 점수: 입자들을 높은 참조 밀도 영역으로 편향시키는 점수 기반 항.
이방성 확산: 궤적의 접선 방향보다는 궤적에 수직인 방향에서 더 크게 설계된 확산 항. 이는 경로에 대한 일관성을 유지하면서 경로에 수직인 방향으로의 탐색을 장려합니다.
위상 오차와 정체 카운터가 증가함에 따라 확산 포락선이 넓어져 로봇이 참조 궤적의 더 넓은 이웃을 탐색할 수 있게 됩니다.
MMD 를 활용한 커버리지 인식 에르고딕 제어: 시스템은 생성된 목표 분포와 로봇의 시간 평균 상태 방문 간의 차이를 최소화하기 위해 최대 평균 불일치 (MMD) 지표를 사용하는 재귀적 지평선 제어기를 사용합니다. MMD 목적 함수에 최근 10 개의 궤적을 포함시킴으로써, 제어기는 새로운 계획이 이전에 커버된 영역을 재방문하는 대신 이를 보완하도록 보장합니다. 이 프레임워크는 기하학적 인식을 갖춘 커널을 활용하여 $SE(3)$ 및 기타 곡면 공간으로 자연스럽게 확장됩니다.
주요 기여 본 논문은 네 가지 주요 기여를 제시합니다:
적응형 에르고딕 모방에 의해 지배되는 경직된 모방부터 적응적 탐색까지의 연속적인 행동 스펙트럼을 가능하게 하는 통합 방법.
목표 분포를 적응적으로 수정하기 위해 증례를 통한 작업 진행도 추정 메커니즘.
추적과 탐색을 모두 유도하는 목표 분포를 합성하기 위한 기하학 유도 이방성 확산의 활용.
검색 기반 모방 학습 프레임워크 내에서 MMD 에르고딕 지표의 통합.
결과 이 방법은 좁은 수직 간격과 복잡한 목표 영역을 특징으로 하는 2 차원 항해 환경에서 평가되었습니다.
실험 설정: 명목 레이아웃에서 성공적인 증례가 수집되었습니다. 테스트 중에는 배포 불일치를 유도하기 위해 간격 위치가 이동되었습니다.
성능: 에이전트가 벽에 막히는 경우 (불일치 시나리오), 누적된 위상 오차를 통해 작업 진행도 불일치를 감지했습니다. 이는 이방성 확산을 통한 목표 분포의 확장을 촉발하여 에르고딕 제어기가 장애물을 탐색하고 우회할 수 있게 했습니다.
정량적 분석: 명목 레이아웃 주변의 가우시안 분포에서 샘플링된 50 개의 게이트 위치 오프셋을 포함하는 테스트에서, 제안된 방법은 일관되게 해결책을 찾았습니다. 반면, 저자들은 검색 기반 또는 생성 기반 방법들은 이동된 간격 위치를 처리할 수 없는 능력 부족으로 인해 이러한 분포 이탈 시나리오에서 0% 의 성공률을 보일 것이라고 지적합니다.
의의 및 주장 본 논문은 에르고딕 제어를 단순한 영역 커버리지 또는 탐색 도구가 아닌, 모방 학습에서의 적응적 실행을 위한 원칙 있는 메커니즘으로 위치시킵니다. 그 의의는 순수 궤적 재생에서 상황적 적응으로의 패러다임 전환에 있습니다. 추적을 탐색의 특수한 경우로 취급함으로써, 이 방법은 환경이 허용할 때 증례의 시간적 특성을 재현하면서도 로봇이 "갇힐" 때 에르고딕 탐색으로 자율적으로 전환할 수 있게 합니다. 이 접근법은 증례에 기반을 두면서도 환경적 이탈을 처리할 수 있는 연속적인 행동 스펙트럼을 제공함으로써 현재 모방 학습 방법들의 취약성을 해결합니다.