← 최신 논문
🤖 AI

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation

Instant-Fold는 그래디언트 업데이트나 추가적인 미세 조정 없이 단 한 번의 인간 시연으로부터 다양한 실행 모드를 추론함으로써, 시뮬레이션으로 학습된 인컨텍스트 모방 학습 프레임워크를 통해 제로샷 실세계 변형 가능한 객체 조작을 가능하게 합니다.

원저자: Yilong Wang, Cheng Qian, Edward Johns

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yilong Wang, Cheng Qian, Edward Johns

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 로봇에게 접기는 어렵습니다

로봇에게 셔츠를 접는 법을 가르친다고 상상해 보세요. 딱딱한 상자나 컵과 달리, 셔츠는 흐물흐물하고 잘 늘어나며 끊임없이 모양이 변합니다. 만약 당신이 로봇에게 "셔츠를 접어"라고 말한다면, 로봇은 어떻게 해야 할지 모릅니다. 소매를 먼저 접어야 할까요? 몸통을 먼저 접어야 할까요? 아니면 두 가지를 동시에 해야 할까요?

현실 세계에서 인간은 단순히 "접어"라고 말하지 않습니다. 우리는 누군가에게 하는 법을 보여줍니다. 우리는 "나를 봐"라고 말하며 특정 방식으로 접는 모습을 보여줄 수 있습니다. 이 논문은 바로 그 일을 수행하도록 하는 Instant-Fold라는 로봇 시스템을 소개합니다. 이 시스템은 인간이 셔츠를 접는 단 하나의 영상을 보고, 재프로그래밍하거나 수학을 배울 필요 없이 즉시 그 특정 스타일을 복제하는 법을 배웁니다.

해결책: "Instant-Fold"

연구진은 마치 아주 관찰력이 뛰어난 견습생처럼 행동하는 시스템을 만들었습니다. 작동 방식은 다음과 같이 세 단계로 나뉩니다.

1. 원단을 "보는" 법 배우기 (눈)

로봇이 옷감을 접기 전에, 먼저 천이 움직일 때 어떤 모습인지 이해해야 합니다.

  • 비유: 젖은 수건을 짜낼 때 특정 지점을 추적한다고 상상해 보세요. 천은 늘어나고, 뒤틀리고, 자신의 일부를 가려버립니다. 일반적인 카메라는 혼란에 빠져 수건이 다른 물체로 변했다고 착각할 수 있습니다.
  • 해결책: 연구진은 로봇에게 옷감을 바라보는 특별한 방식을 가르쳤습니다. 그들은 **시계열 대조 사전 학습(Temporal Contrastive Pretraining)**이라는 방법을 사용했습니다. 이것은 영상 시작 부분의 특정 파란색 천 조각이, 설령 늘어나거나 구겨지거나 손에 가려지더라도 영상 끝부분의 동일한 파란색 천 조각임을 인식하도록 로봇을 교육하는 것과 같습니다. 로봇은 "노이즈"(주름이나 조명 변화 등)를 무시하고 천의 형태가 가진 "본질"에 집중하는 법을 배웁니다.

2. "보고 따라 하기" 메커니즘 (두뇌)

로봇이 옷감을 명확하게 볼 수 있게 되면, 이제 작업의 순서를 배워야 합니다.

  • 비유: 당신이 춤을 배우고 있다고 상상해 보세요. 당신은 동작을 숫자의 목록으로 외울 필요가 없습니다. 대신, 무용수가 춤추는 영상을 보고 있으면 뇌가 즉시 "아, 왼쪽 다리를 들고, 그다음 회전하고, 그다음 점프하는구나"라고 파악합니다. 그러면 당신은 즉시 그 춤을 똑같이 출 수 있습니다.
  • 해결책: 이것을 **인-컨텍스트 모방 학습(In-Context Imitation Learning)**이라고 합니다. 로봇은 인간이 셔츠를 접는 단 하나의 영상(데몬스트레이션)을 가져옵니다. 로봇은 뇌를 다시 훈련시키거나 복잡한 수학적 업데이트를 실행할 필요가 없습니다. 그저 영상을 보고 패턴(예: "소매를 먼저 접고, 그다음 밑단을 위로 접는다")을 파악하여 즉시 실행합니다. 심지어 영상 속의 특정 순서에 따라 왼쪽 소매를 오른쪽보다 먼저 접는 것과 같은 다양한 변형도 처리할 수 있습니다.

3. 움직임의 "흐름" (손)

마지막으로, 로봇은 실제로 접기 위해 두 팔을 움직여야 합니다.

  • 비유: 로봇의 팔이 강물을 따라 흐르는 물과 같다고 상상해 보세요. 강물은 바다(완성된 접힌 상태)에 도달하기 위해 정확히 어디로 가야 할지 알고 있습니다. 로봇은 단순히 다음 동작을 추측하는 것이 아니라, 엉망인 셔츠 상태에서 깔끔하게 쌓인 더미 상태에 이르기까지 팔이 가야 할 전체적인 매끄러운 경로를 예측합니다.
  • 해결책: 그들은 **플로우 매칭 트랜스포머(Flow-Matching Transformer)**를 사용합니다. 이것은 로봇이 자신의 팔이 가야 할 부드럽고 연속적인 경로를 예측하며, 진행 과정에서 스스로를 수정하여 중간에 걸리거나 셔츠를 떨어뜨리지 않도록 보장하는 고급 기술입니다.

이것이 왜 중요한가요?

대부분의 로봇 학습 방법은 수천 시간의 데이터나 모든 종류의 셔츠에 대한 개별적인 지침을 요구합니다.

  • 제로샷 전이(Zero-Shot Transfer): 이 논문의 가장 놀라운 점은 로봇을 완전히 컴퓨터 시뮬레이션(비디오 게임 세계) 안에서 훈련시켰다는 것입니다. 그 후, 그 똑같은 로봇을 실제 세상으로 가져와 실제 옷을 입혔습니다. 로봇은 새로운 데이터나 미세 조정(fine-tuning) 없이도 즉시 작동했습니다(Zero-Shot).
  • 영상 하나면 충분합니다: 1,000개의 영상 라이브러리가 필요하지 않습니다. 단 하나의 인간 데몬스트레이션만 있으면 로봇이 나머지를 알아서 파악합니다.

결과

연구팀은 이 기술을 실제 듀얼 암(양팔) 로봇에 테스트했습니다.

  • 연구진은 인간이 셔츠를 접는 영상을 제공했습니다.
  • 그 후 로봇은 한 번도 본 적 없는 8가지의 실제 의류(셔츠, 반바지, 재킷)를 성공적으로 접었습니다.
  • 이 시스템은 특정 프로그래밍이 필요하거나 자주 실패하곤 하는 기존의 다른 방식들보다 뛰어난 성능을 보였습니다.

요 요약

Instant-Fold는 로봇에게 천을 이해하는 "마법의 눈"과 단 하나의 영상으로부터 인간의 폴딩 스타일을 즉시 복제하는 "마법의 두뇌"를 부여하는 것과 같습니다. 이는 컴퓨터 시뮬레이션과 복잡한 현실 세계 사이의 간극을 메워주며, 로봇이 우리를 관찰하는 것만으로도 복잡하고 유연한 작업을 배울 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →