← 최신 논문
💻 computer science

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory는 말단 장치(end-effector) 궤적과 전신 동작을 공동으로 예측하여 조정된 움직임을 유도함으로써 기존의 시각-언어-행동(Vision-Language-Action) 정책을 개선하고, 실행된 동작을 계획된 궤적에 정렬시키기 위해 테스트 타임 정교화를 위한 경량 세계 모델을 채택함으로써 시뮬레이션과 실제 접촉이 빈번한 작업 모두에서 성공률을 크게 높이는 모바일 매니퓰레이션용 궤적 가이드 프레임워크이다.

원저자: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단순히 테이블이나 공장 바닥에 갇혀 있는 것이 아니라, 거실을 돌아다니며 커피 머그잔을 집어 들어 당신에게 건네줄 수 있는 로봇을 상상해 보세요. 이것이 바로 **모바일 매니퓰레이션(mobile manipulation)**의 꿈입니다. 이는 로봇이 두 가지 일을 동시에 해야 하기 때문에 매우 까다로운 영역입니다. 로봇은 적절한 위치로 가기 위해 바퀴를 굴려야 함과 동시에, 물체를 잡기 위해 팔을 움직여야 하며, 그 와중에 머리에 달린 카메라는 회전하고 변화하는 세상을 바라봐야 합니다. 이것은 마치 외발자전거를 타면서 저글링을 하는 것과 같습니다. 저글링에만 집중하면 자전거에서 떨어질 수 있고, 자전거에만 집중하면 공을 떨어뜨리게 됩니다.

오랫동안 로봇들은 사진 한 장과 "오렌지를 집어라"와 같은 명령어를 보고, 모든 바퀴와 관절에 대한 일련의 모터 명령어를 즉각적으로 내뱉는 방식으로 이 일을 학습해 왔습니다. 하지만 이는 줄거리 개요 없이 한 번에 모든 글자를 추측하며 소설을 쓰려는 것과 같습니다. 로봇은 너무나 많은 선택지 속에서 길을 잃기 쉬우며, 이는 서투른 움직임이나 충돌로 이어집니다. 게다가 일단 로봇이 무엇을 할지 결정하면, 그저 잘 되기를 바라며 맹목적으로 실행할 뿐입니다. 만약 바닥이 미끄럽거나 물체가 예상보다 무겁다면, 로봇은 이미 머그잔을 떨어뜨린 후에야 자신의 계획이 실패했다는 것을 깨닫게 됩니다. 과학자들은 로봇에게 더 나은 계획 수립 방식과 움직이기 전에 자신의 작업을 재확 검토하는 방법을 제공함으로써 이 문제를 해결하려 노력하고 있습니다.

여기, 로봇의 공연을 위한 스마트한 감독 역할을 하는 새로운 접근 방식인 **드림 트래젝토리(DreamTrajectory)**가 등장했습니다. 이 시스템은 단순히 최종 모터 명령을 추측하는 대신, 로봇의 손(end-effector)이 따라가야 할 "꿈"의 경로를 먼저 스케치합니다. 이는 무용수들이 움직이기 전에 화이트보드에 안무를 그리는 안무가와 같습니다. 그런 다음 로봇은 그 스케치를 따라가기 위해 필요한 구체적인 바퀴와 팔의 움직임을 생성합니다. 하지만 여기서 영리한 점은, 로봇이 실제로 움직이기 전에 빠른 정신적 시뮬레이션을 실행한다는 것입니다. 로봇은 "내가 이 특정 움직임을 시도한다면, 내 손이 정말로 내가 계획한 곳에 도착할까?"라고 스스로에게 묻습니다. 로봇은 여러 가지 버전의 움직임을 테스트하고, "꿈"의 경로와 가장 잘 일치하는 것을 선택한 다음, 그제서야 실행에 옮깁니다.

연구진은 이 아이디어를 두 가지 방식으로 테스트했습니다. 첫째, 로봇들이 가상의 테이블과 냉장고에서 연습하는 MS-HAB이라는 컴퓨터 시뮬레이션에서 실행했습니다. 그 결과, 이러한 추가적인 계획과 검토 과정이 없었을 때 로봇의 성공률은 약 **32.3%**였습니다. "꿈"의 경로를 추가하자 성공률은 **47.5%**로 뛰었습니다. 움직임을 재검토하기 위한 정신적 시뮬레이션 단계를 추가하자 성공률은 **54.8%**까지 높아졌습니다. 이 향상은 특히 냉장고 문을 열거나 카운터를 닫는 것처럼, 로봇이 움직임을 통해 감을 잡아야 하는 접촉이 포함된 까다로운 작업에서 매우 컸습니다.

그들은 컴퓨터 화면에 머물지 않았습니다. 실제 물리적 로봇인 ARX LIFT를 사용하여 실제 환경에서도 테스트했습니다. 결과는 더욱 인상적이었습니다. 과일을 집거나 서랍을 여는 작업에서, 로봇은 경로 계획을 통해 성공률이 **63.3%**에서 **81.7%**로 상승했고, 마지막으로 정신적 재검토를 추가했을 때는 **90.0%**에 도달했습니다. 이 시스템은 다음에 어떤 일이 일어날지 예측하는 작고 빠른 뇌인 경량화된 "월드 모델(world model)"을 사용하여 서로 다른 행동 선택들에 점수를 매듭으로써 작동합니다. 매번 다시 학습시킬 필요 없이, 그저 메인 로봇이 실시간으로 더 현명한 결정을 내릴 수 있도록 보조 역할을 수행합니다.

이 논문은 이 방법이 두 가지 큰 문제를 해결한다고 제안합니다. 첫째, 방대한 가능성의 공간 속에서 로로봇이 맹목적으로 추측하는 것을 막아주며, 둘째, 계획과 대조하여 검토함으로써 잘못된 아이디어를 실행하는 것을 방지합니다. 저자들은 이 시스템이 매우 효율적이며, 이러한 큰 이득을 얻기 위해 추가되는 계산 능력은 아주 미미한 수준(단계당 약 11.75밀리초의 지연 시간)이라고 언급했습니다. 비록 결과는 유망하지만, 이는 특정 시뮬레이션과 제한된 실제 작업들을 기반으로 하고 있으므로, 이 접근 방식이 효과적이긴 하지만 모든 로봇 문제에 적용되는 마법 같은 해결책이 아닌, 이러한 유형의 이동형 로봇을 위한 특정한 도구라는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →