← 최신 논문
💻 computer science

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

AffordTrajDP는 검색된 앵커 어포던스를 객체의 SE(3) 포즈를 통해 전파함으로써 시간적으로 일관되고 상태를 인식하는 가이드 궤적을 생성하여 정적 어포던스의 한계를 극복하고 정밀도가 중요한 작업에서 우수한 성공률을 달성함으로써 로봇 조작을 향상시키는 동적 프레임워크이다.

원저자: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 집안일을 가르치는 상황을 상상해 보세요. 오랫동안 과학자들은 로봇에게 인간이 과업을 수행하는 영상을 보여주며, 로봇이 그저 "보고 배우기를" 기대하며 가르치려 노력했습니다. 하지만 로봇은 상황이 변할 때 이를 수행하는 데 매우 서툽니다. 만약 컵을 왼쪽으로 3인치 옮기거나 조명이 바뀌면, 예전 설정에 맞춰 훈련된 로봇은 혼란에 빠져 컵을 떨어뜨릴 수도 있습니다. 이는 특정 주방을 위해 작성된 레시피를 따르려는데, 갑자기 가스레인지를 다른 방으로 옮겨버린 것과 같습니다. 그러면 그 지침은 더 이상 말이 되지 않습니다.

이를 해결하기 위해 연구자들은 "어포던스(affordance, 행동 유도성)"라고 불리는 영리한 기술을 개발했습니다. 어포던스를 로봇에게 어디를 잡거나 만져야 하는지 정확히 알려주는 "마법의 하이라이트"라고 생각해보세요. 로봇은 지저도한 방 전체를 보는 대신, 그 하이라이트된 지점만을 봅니다. 하지만 여기에는 함정이 있습니다. 대부분의 이러한 하이라이트는 정적(static)이라는 점입니다. 그것들은 마치 움직이는 자동차에 붙여놓은 스티커와 같습니다. 자동차가 앞으로 달려나가면 스티커는 공중의 같은 위치에 머물러 있고, 로고를 만지려던 로봇은 결국 자동차를 놓치고 말 것입니다. 이 논문은 바로 그 문제, 즉 어떻게 하면 "마법의 하이라이트"가 물체와 함께 움직이게 하여 로봇이 결코 움켜쥐는 데 실패하지 않도록 만들 것인가를 다룹니다.

AffordTrajDP(이름은 길지만, "어포던스 궤적 동적 정책"이라고 생각하세요)를 개발한 연구진은 기존의 정적인 하이라이트를 사용하는 방식이 로보가 USB 드라이브를 삽입하거나 블록을 쌓는 것과 같은 까다로운 과업에서 실패하는 주요 원인임을 깨달았습니다. 그들의 해결책은 하이라이트를 고정된 스티커로 취급하는 대신 움직이는 목표물로 취급하는 것입니다.

이 새로운 시스템이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다. 당신이 친구가 던진 프리스비(Frisbee)를 잡으려고 한다고 가정해 봅시다.

  • 기존 방식 (정적 어포던스): 친구가 당신에게 "프리스비가 저 큰 참나무 나무 옆에 있을 거야"라고 말합니다. 당신은 나무로 달려가 기다립니다. 하지만 친구는 프리스비를 나무 너머로 던져버립니다. 당신은 나무에서 프리스비가 도착하기만을 기다리며 서 있지만, 실제 프리스비는 그 옆을 지나쳐 날아갑니다. 이것이 로봇이 정적인 접촉점을 사용할 때 발생하는 현상입니다. 로봇은 물체가 '있었던' 곳이 아니라 '가고 있는' 곳을 기준으로 접촉 지점을 계산합니다.
  • 새로운 방식 (AffordTrajDP): 단 하나의 지점 대신, 친구가 움직이는 경로를 알려줍니다. "프리스비가 여기, 그다음엔 여기, 그다음엔 저기에 있을 거야." 당신은 단순히 한 지점으로 달려가는 것이 아니라, 프리스비의 비행 궤적에 맞춰 경로를 따라 달립니다.

로봇의 세계에서 이 "경로"는 **동적 어포던스 궤적(dynamic affordance trajectory)**이라고 불립니다. 시스템은 먼저 메모리 뱅크에서 "소스(source)" 예시를 찾습니다. 예를 들어 컵 사진을 보고 컵 손잡이의 완벽한 위치를 찾는 것과 같습니다. 그런 다음, 단순히 그 지점을 복사하는 대신, 로봇은 몇 초 후에 물체가 어디에 있을지 예측합니다. 로봇은 그 완벽한 잡기 지점을 찾아내어 이를 앞으로 "전파(propagate)"시키고, 예측된 물체의 움직임을 따라 끌고 갑니다. 이를 통해 매 밀리초마다 업데이트되는 움직이는 가이드가 생성되며, 물체가 흔들리거나 위치가 바뀌더라도 로봇의 손이 항상 물체와 정렬되도록 보장합니다.

연구팀은 이 아이디어를 두 가지 방식으로 테스트했습니다. ManiSkill3라는 매우 정확한 컴퓨터 시뮬레이션과 실제 로봇 팔(Galaxea A1 및 UR7e)을 사용한 실제 환경에서의 테스트입니다.

시뮬레이션에서 그들은 큐브를 집는 것부터 충전기를 꽂는 것까지 여섯 가지의 다양한 과업으로 로봇에게 도전했습니다. 결과는 명확했습니다. 기존 방식들(DP3 및 AffordDP)은 약 **52.2%**에서 **57.8%**의 성공률을 보였습니다. 하지만 새로운 동적 가이드를 사용하자 성공률이 **70.0%**로 뛰어올랐습니다. 개선 효과는 충전기 플러그를 삽입하는 것과 같이 기존 방식들이 접촉 후 정렬을 유지하지 못해 어려움을 겪었던 가장 어려운 과업에서 가장 극적으로 나타났습니다.

그들은 시뮬레이션에 그치지 않았습니다. 연구진은 실제 실험실로 로봇을 가져가 큐브 쌓기, 컵 집기, 그리고 매우 까다로운 어댑터 삽입(Adapter Insertion, 특정 플러그를 좁은 소켓에 끼우는 작업) 과 같은 과업을 수행했습니다. 그들은 로봇이 이전에 본 적이 있는 물체와 본 적이 없는 물체(다른 모양이나 색상)를 대상으로 테스트했습니다.

  • Galaxea A1 로봇에서 새로운 방식은 모든 과업에 대해 **66.1%**의 성공률을 달성한 반면, 기존의 가장 좋은 방식은 **35.0%**에 그쳤습니다.
  • UR7e 로봇에서는 새로운 방식이 **72.5%**의 성공률을 기록하며, 기존 최선책인 **55.8%**를 앞질렀습니다.

연구진은 또한 시스템의 어떤 부분이 실제로 핵심적인 역할을 하고 있는지 확인하기 위해 "탐정" 실험을 진행했습니다. 그들은 퍼즐의 조각들을 하나씩 제거해 보았습니다:

  1. 특정 지점 없이 경로만 있는 경우: 로봇에게 경로를 따르라고 지시했지만 어디를 잡아야 할지 구체적인 지점을 알려주지 않자, 로봇은 혼란에 빠져 실패했습니다(때로는 기존 방식보다 성능이 떨어졌습니다).
  2. 경로 없이 특정 지점만 있는 경우: 로봇에게 완벽한 잡기 지점을 알려주었지만 물체가 움직일 때 이를 업데이트하지 않자, 특히 까다로운 과업에서 접촉 후 경로를 벗어나는 현상이 발생했습니다.
  3. 둘 다 함께 있는 경우: "어디를 만질 것인가"라는 구체적인 지점과 "어떻게 움직이는가"라는 경로를 결합했을 때만 로봇이 일관되게 성공했습니다.

이는 로봇이 복잡하고 변화하는 세상에서 정밀한 과업을 수행하기 위해서는 단순히 잡을 곳에 대한 스냅샷 이상의 것, 즉 실시간으로 업데이트되는 움직이는 로드맵이 필요하다는 것을 시사합니다. 저자들은 자신들의 방식이 중요한 진전이지만, 여전히 매우 정밀한 공차가 요구되는 작업(USB 삽입 과업처럼 모두에게 가장 어려웠던 작업)에는 여전히 과제가 남아 있다고 언급했습니다. 그러나 동적이고 움직이는 가이드가 정적인 가이드보다 더 효과적임을 입증함으로써, 계획대로 되지 않는 상황에서도 로봇이 실수할 확률을 낮추는 새로운 문을 열었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →