← 최신 논문
🤖 AI

MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference

MemCorr-DP는 2D 특징 매칭을 참조 궤적과의 명시적인 3D 관계로 격상시키고 반사실적 조건화를 활용하여 기하학적 구조를 현재의 장면과 정렬함으로써, 복합적인 공간 및 시점 변화 하에서 시각-운동 강건성을 향상시키는 확산 정책이다.

원저자: Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간이 과업을 수행하는 것을 보고 배우는 로봇들이 점점 더 흔해지고 있지만, 이들은 한 가지 고질적인 한계에 직면해 있다. 바로 세상이 조금만 변해도 자주 실패한다는 점이다. 만약 로봇이 한 지점에 서서 문을 여는 법을 배웠다면, 문이 불과 몇 인치만 이동하거나 장면을 관찰하는 카메라의 각도가 바뀌더라도 혼란에 빠질 수 있다. 이는 많은 로봇 제어기가 물리적 상호작용의 근본적인 기하학적 구조를 이해하기보다, 특정 위치에 있는 문 손잡이의 정확한 모양과 같은 특정 시각적 패턴을 암기하는 데 의존하기 때문에 발생한다. 장면이 변하면 익숙한 패턴이 사라지고, 로봇의 계획은 무너진다. 진정으로 적응할 수 있는 기계를 만들기 위해, 연구자들은 로로봇에게 화면상의 픽셀이 아니라 객체와 자신의 움직임 사이의 공간적 관계에 집중하도록 가르치는 방법을 탐구하고 있다. 이 접근 방식은 객체가 어디에 놓여 있든, 혹은 카메라가 어떻게 보고 있든 상관없이 그리퍼가 객체에 대해 어떻게 움직여야 하는지를 이해하는 일종의 '근육 기억'을 형성하는 것을 목표로 한다.

새로운 연구에서 연구자들은 장면이 매우 다르게 보이더라도 기록된 성공 사례에 맞춰 자신의 행동을 정렬하도록 로봇을 가르침으로써 이 문제를 해결하는 MemCorr-DP라는 시스템을 개발했다. 핵심 아이디어는 단순하지만 강력하다. 성공적인 시도의 외형을 암기하려고 노력하는 대신, 로봇이 현재 상황의 물리적 기하학을 저장된 성공 궤적의 기하학에 맞추는 법을 배우는 것이다. 로봇이 문을 열려고 시도하는 상황을 상상해 보자. 연구자들은 로로봇에게 성공적으로 문을 여는 영상 기록을 제공한다. 로봇이 새로운 위치에서 다른 카메라 각도로 과업을 시도할 때, 로봇은 시각적 매칭 시스템을 사용하여 실시간 화면과 기록된 영상 모두에서 문과 로봇의 손에 해당하는 지점들을 찾아낸다. 그런 다음 로봇은 이 매칭되는 지점들을 공유된 3차원 공간으로 끌어올려, 로봇의 손이 문에 대해 어디에 있는지, 그리고 기록 속의 손이 같은 순간에 문에 대해 어디에 있었는지를 설명하는 일련의 관계를 생성한다. 이를 통해 로봇은 비록 문이 다른 곳에 위치하더라도 손과 손잡이 사이의 물리적 관계는 동일하다는 것을 파악할 수 있으며, 올바른 움직임을 진행할 수 있다.

연구진은 로봇이 문을 열고 닫아야 하는 시뮬레이션된 과업을 통해 이 시스템을 테스트했다. 그들은 로봇이 훈련 중에 보았던 범위를 훨씬 벗어난 위치로 문을 옮기거나 카메라 각도를 15도 변화시킴으로써 의도적으로 과업을 어렵게 만들었다. 이러한 도전적인 조건에서, 이 새로운 시스템은 시도의 96.67%에서 성공했다. 이와 대조적으로, 시각적 이미지만에 의존하는 표준 로봇 제어기는 이 기하학적 매칭 없이 88%의 성공률만을 보였다. 이 차이는 작아 보일 수 있지만, 로보틱스의 세계에서 12%의 실패율과 3%의 실패율은 신뢰성 측면에서 거대한 격차를 의미한다. 연구는 시스템의 성공이 지점 간의 전체 3차원 관계를 사용하는 것에 크게 의존한다는 것을 보여주었다. 연구진이 상세한 지점 간 매칭을 제거하고 문의 중심이나 일반적인 이동 방향과 같은 더 단순한 정보로 대체했을 때, 성공률은 현저히 떨어졌다. 이는 로봇이 까다로운 변화를 헤쳐 나가기 위해 매칭 시스템이 제공하는 정밀한 공간 지도가 필요했음을 입证明한다.

로봇이 단순히 추측하는 것이 아니라 정말로 참조 영상의 지침을 따르고 있는지 확인하기 위해, 연구진은 영리한 훈련 방법을 도입했다. 그들은 로봇에게 동일한 시작 위치와 동일한 노이즈가 섞인 불확실한 입력을 주되, 두 개의 서로 다른 참조 영상을 바탕으로 두 가지 다른 결과에 대한 행동을 예측하도록 함으로써 문을 여는 것과 닫는 것을 구분하도록 가르쳤다. 만약 참조 영상이 바뀌었을 때 로봇이 여는 것과 닫는 것의 차이를 구별하지 못한다면, 그것은 올바른 교훈을 배우고 있지 않은 것이다. 이러한 '반사실적(counterfactual)' 훈련은 시스템이 참조 궤적의 구체적인 세부 사항에 주의를 기울이도록 강제했다. 결과는 로봇에게 잘못된 참조 영상이 주어졌을 때 잘못된 행동을 시도한다는 것을 보여주었으며, 이는 로봇이 미리 학습된 습관에 의존하는 것이 아니라 제공된 참조의 안내에 진정으로 반응하고 있음을 입증했다.

또한 연구는 시각적 매칭 과정의 오류를 시스템이 얼마나 잘 처리하는지 조사했다. 현실 세계에서 두 개의 서로 다른 이미지 사이의 지점을 매칭하는 것은 결코 완벽할 수 없으며, 항상 작은 오차가 존재한다. 연구진은 계산된 위치가 몇 센티미터 정도 어긋나더라도 높은 성공률을 유지하며 시스템이 견고하게 작동한다는 것을 발견했다. 이러한 회복 탄력성은 시스템이 작동하기 위해 픽셀 단위의 완벽한 정렬이 필요한 것이 아니라, 로봇의 행동을 안내할 수 있는 충분히 좋은 수준의 3차원 관계 근사치만 있으면 된다는 것을 시사한다. 연구진은 시스템이 시뮬레이션에서는 잘 작동했지만, 아직 실제 로봇이나 다른 유형의 과업에 대해서는 테스트되지 않았다고 언급했다. 평가는 단일한 문 사례와 특정 유형의 움직임 및 카메라 변화로 제한되었다. 그러나 이 결과는 로봇, 객체, 그리고 참조 사례 사이의 3차원 관계를 명시적으로 모델링하는 것이 로봇이 새롭고 예측 불가능한 환경에 기술을 일반화할 수 있도록 만드는 유망한 경로라는 강력한 증거를 제공한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →