← 최신 논문
💻 computer science

DynaRetarget: Dynamically-Feasible Retargeting using Sampling-Based Trajectory Optimization

본 논문은 샘플링 기반 궤적 최적화 (SBTO) 프레임워크를 활용하여 인간의 움직임을 강인하고 동적으로 실현 가능한 휴머노이드 제어 정책으로 동적으로 정제함으로써 대규모 합성 로코-매니퓰레이션 데이터셋 생성을 가능하게 하는 새로운 파이프라인인 DynaRetarget 을 소개합니다.

원저자: Victor Dhedin, Ilyass Taouil, Shafeef Omar, Dian Yu, Kun Tao, Angela Dai, Majid Khadiv

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Victor Dhedin, Ilyass Taouil, Shafeef Omar, Dian Yu, Kun Tao, Angela Dai, Majid Khadiv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

재능 있는 인간 무용수가 차기, 들어 올리기, 무거운 상자를 밀기 등 복잡한 안무를 수행한다고 상상해 보세요. 이제 이 안무를 정확히 모방하도록 무겁고 서투른 로봇을 만들고자 합니다.

문제는 인간과 로봇의 구조가 매우 다르다는 점입니다. 단순히 로봇에게 인간의 관절 각도를 모방하라고 지시하면 (이 과정을 '리타겟팅'이라고 합니다), 로봇은 존재하지 않는 발로 상자를 차거나, 특정 모터의 힘으로는 들어 올릴 수 없는 상자를 들어 올리려고 할 수 있습니다. 그 결과, 종이 위에서는 올바로 보이지만 실제로 실행할 수 없는 '운동학적' 계획이 만들어집니다. 로봇은 넘어지거나 미끄러지거나 충돌하게 됩니다.

이 논문은 이러한 깨진 계획을 수정하여 실제 작동하는 로봇 움직임으로 변환하도록 설계된 새로운 시스템인 DynaRetarget을 소개합니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다.

1. 문제: "나쁜 지도"

초기 로봇 계획을 지형지를 본 적이 없는 사람이 그린 지도라고 생각해 보세요. 경로는 보여주지만 구멍 (발 접촉 부재) 이 있거나 절벽으로 이어지는 (불가능한 물리 법칙) 부분이 있습니다. 로봇이 이 지도를 맹목적으로 따르려 한다면 실패합니다.

이전 방법들은 이 지도를 작은 단계로 수정하려 했습니다. 마치 발 앞쪽의 땅만 바라보는 등산객을 상상해 보세요. 지도에 "점프"라고 쓰여 있으면 등산객은 점프합니다. 하지만 점프 거리가 너무 멀면 떨어지고, 한 걸음 앞만 바라보았기 때문에 달리기를 시작하라는 결정을 되돌릴 수 없습니다. 그들은 "근시안적"입니다.

2. 해결책: "등반용 사다리" (SBTO)

저자들은 **샘플링 기반 궤적 최적화 (Sampling-Based Trajectory Optimization, SBTO)**라는 새로운 방법을 개발했습니다.

단 한 걸음만 보거나 10 분짜리 안무 전체를 한 번에 해결하려 (이는 너무 어렵고 혼란스럽습니다) 하지 않고, SBTO 는 한 계단씩 사다리를 쌓아 올리는 등산객처럼 작동합니다.

  • 1 단계: 안무의 처음 몇 초를 최적화합니다.
  • 2 단계: 처음 몇 초가 견고해지면, 첫 부분을 안정적인 기반으로 삼아 다음 몇 초를 추가합니다.
  • 3 단계: 시간을 계속 추가하며 전체 계획을 정제해 나갑니다.

이는 긴 문장을 첫 단어를 완벽하게 다듬고, 그 다음 구절을 다듬고, 그 다음 문장을 다듬는 식으로 수정하는 것과 같습니다. 안무의 끝에 도달할 때쯤이면 전체 시퀀스가 물리적으로 일관되게 됩니다. 이는 단순히 다음 한 걸음만 보는 것이 아니라, 미래 전체를 염두에 두어 시작부의 "차기"가 끝부분의 "착지"를 완벽하게 준비하도록 보장합니다.

3. 결과: "연마된" 공연

이 시스템은 거칠고 불완전한 인간에서 로봇으로의 모방을 매끄럽게 다듬습니다.

  • 물리 법칙 수정: 로봇이 지면을 닿아야 하는데 수학적으로 공중에 떠 있다고 계산되었다면, SBTO 는 관절을 조정하여 발이 실제로 바닥에 닿도록 합니다.
  • 무거운 물건 들어 올리기 처리: 원래 인간 시연보다 무겁거나 모양이 다른 상자를 어떻게 움직일지 알아냅니다. 새로운 인간이 방법을 보여줄 필요 없이 가능합니다.

4. 결실: 로봇에게 학습시키는 법

DynaRetarget 이 이 "완벽한" 물리 계획을 생성하면, 이를 로봇의 두뇌 (강화 학습 사용) 에 공급합니다. 계획이 물리적으로 현실적이기 때문에 로봇 두뇌는 훨씬 빠르게 학습합니다.

  • 비유: 학생에게 운전법을 가르친다고 상상해 보세요. 존재하지 않는 다리가 있는 지도를 주면 그들은 충돌하고 혼란에 빠집니다. 실제 도로 지도를 주면 그들은 부드럽고 빠르게 운전을 배우게 됩니다.
  • 논문의 주장: 저자들은 차기, 밀기, 들어 올리기 등 수백 가지 다른 동작으로 이를 테스트했습니다. 그들의 방법은 이전 최선 방법보다 거의 두 배 더 높은 성공률을 보였습니다. 또한, 이러한 "완벽한" 계획으로 훈련된 로봇은 "거친" 계획으로 훈련된 로봇보다 실제 세계에서 작업을 수행하는 능력이 훨씬 뛰어났습니다.

요약

DynaRetarget은 인간의 거칠고 불완전한 운동 데이터를 받아, 물리 법칙을 수정하기 위해 스마트한 단계별 최적화 사다리를 사용하고, 인간형 로봇을 위한 완벽한 현실 준비 지시서를 생성하는 파이프라인입니다. 이는 "근시안적"인 계획의 문제를 해결하여 로봇이 공을 차거나 선반을 밀기 등 접촉이 많은 복잡한 작업을 높은 성공률로 학습할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →