Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
이 논문은 정책의 성공 및 진행도에 대한 자체 예측이 어드밴티지 추정 및 실패 감지를 주도하고, 플로우 매칭(flow-matching), 분산 학습, 견고한 심투리얼(sim-to-real) 전이를 포함한 포괄적인 엔지니어링 최적화 세트로 뒷받침되는 자기 지도 강화 학습 루프로 비전-언어-행동 정책을 향상시킴으로써 LeHome Challenge 2026에서 상위 순위를 달성한 수상 경력의 양손 의류 폴딩 시스템을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 구겨진 티셔츠나 바지를 접으려고 노력하는 모습을 상상해 보세요. 우리에게는 단순해 보이지만, 로봇에게 천 조각은 만질 때마다 모양이 변하는 혼란스럽고 미끄러운 뱀과 같습니다. 이 논문은 저자인 일리아 라르첸코(Ilia Larchenko)가 이 정확한 과제를 수행하여 시뮬레이션 대회에서 1위, 실제 세계 대회에서 2위를 차지한 로봇의 두뇌를 어떻게 구축했는지 설명합니다.
다음은 그가 이를 어떻게 해냈는지에 대한 이야기를 쉬운 개념으로 나누어 정리한 것입니다.
1. 문제: 기계 속의 "유령"
로봇은 두 팔을 사용하여 네 가지 종류의 옷(긴팔/반팔, 긴바지/반바지)을 접어야 했습니다.
- 함정: 로봇은 자신이 무엇을 잡고 있는지 알지 못했습니다. 로봇은 접기 시작하기 전에 옷을 보고 "이것이 티셔츠인가, 아니면 바지인가?"를 먼저 파악해야 했습니다.
- 보상: 로봇은 맨 마지막에 옷이 완벽하게 접혔을 때만 "금메달(보상)"을 받았습니다. 만약 중간에 실수했다면 아무것도 받지 못했습니다. 이는 자전거 타기를 배우는데, 결승선에 도착할 때까지 한 번도 넘어지지 않아야만 쿠키를 주는 것과 같습니다.
2. 해결책: "자기 학습" 루프
단순히 인간의 시연을 모방하는 대신(이는 영상을 보고 수영을 배우려는 것과 같습니다), 저자는 실행하고, 실패하고, 다시 시도함으로써 배우는 시스템을 구축했습니다. 그는 이를 **"플라이휠(Flywheel)"**이라고 부릅니다.
이것은 마치 공장에서 일하는 세 명의 팀원처럼 생각할 수 있습니다:
- 트레이너(Trainer): 데이터를 연구하고 로봇의 두뇌를 업데이트하는 선생님입니다.
- 러너(Runners): 비디오 게임(시뮬레이션) 속에서 하루에 수천 번씩 옷을 접으려고 시도하는 로봇 군단입니다.
- 인간 조력자(Human Helper): 로봇이 막혔을 때만 개입하여 옷을 바로잡고, 로봇이 다시 시도할 수 있게 해주는 사람입니다.
이 세 그룹은 직접 대화하지 않습니다. 대신 공유된 디지털 우체통(HuggingFace Hub)에 메모를 남깁니다. 트레이너는 메모를 읽고 학습한 뒤, 새로운 "두뇌 업데이트"를 다시 우체통에 넣습니다. 러너들은 이를 가져가서 다시 시도합니다.
3. 핵심 비결: 스스로 점수를 매기는 로봇
보통 로 로보틱스에서는 무엇을 할지 결정하는 두뇌와 얼마나 잘하고 있는지 추측하는 별도의 두뇌가 필요합니다. 이 저자는 이 둘을 하나로 합쳤습니다.
- 마법 같은 기술: "소매를 잡아라"라고 결정하는 것과 동시에 "성공할 확률이 80%이다" 그리고 "과정의 40%를 지나왔다"라고 예측하는 동일한 신경망을 사용했습니다.
- 도움이 되는 이유: 로봇이 실시간으로 자신의 점수를 알 수 있기 때문에 더 빠르게 학습할 수 있습니다. 만약 실패할 것이라고 예측한다면, 다른 동작을 시도해야 한다는 것을 알게 됩니다. 이는 학생이 시험을 치를 뿐만 아니라, 즉시 자신의 답안을 채점하여 어디서 틀렸는지 확인하는 것과 같습니다.
4. 실수로부터 배우기 ("리플레이" 전략)
저자는 단순히 연습만 하는 것은 지루하다는 것을 깨달았습니다. 어려운 부분을 연습해야 합니다.
- 하드 마이닝(Hard Mining): 로봇이 실패하면, 시스템은 그 정확한 순간을 저장합니다(비디오 게임의 "세이브 포인트"처럼). 그런 다음 그 실패한 상태를 불러온 뒤, 이번에는 더 어려운 환경(조명이나 천의 질감에 무작위 변화를 줌)을 추가하여 다시 시도합니다.
- 인간의 손길: 로봇이 정말로 막혔을 때, 인간이 단 몇 초 동안 제어권을 가져와 옷을 고친 뒤 다시 제어권을 넘겨줍니다. 로봇은 이 작은 교정으로부터 배웁니다. 이것을 DAgger(인간의 수정을 통해 배우는 방식의 멋진 이름)라고 부릅니다.
5. "마법의 안경" (추론 최적화)
똑똑한 두뇌를 가졌더라도 로봇이 너무 빠르거나 느리게 움직이면 서툴 수 있습니다. 저자는 로봇이 마지막 순간에 "생각"하는 방식을 미세하게 조정함으로써 성능이 급격히 향상된다는 것을 발견했습니다.
- 비유: 객관식 시험을 치르고 있다고 상상해 보세요. 머릿속에 떠오르는 첫 번째 답을 바로 고르는 대신, 세 가지 다른 답을 빠르게 생성해 보고, 자신의 직감(점수)에 따라 어떤 것이 "최선"인지 확인한 뒤 그 답을 선택하는 것입니다.
- 톰슨 샘플링(Thompson Sampling): 저자는 수학적 게임(슬롯머신 같은)을 사용하여 모든 유형의 옷에 맞는 완벽한 설정(예: "반바지에는 느리게 움직이고, 긴 바지에는 꽉 잡기")을 수동 테스트 없이 자동으로 찾아냈습니다.
6. 현실 세계의 도전: 비디오 게임에서 현실로
컴퓨터 시뮬레이션에서 실제 방 안에 있는 실제 로봇으로 옮겨가는 과정이 가장 어려웠습니다.
- 물리학의 "불쾌한 골짜기": 시뮬레이션에서 옷은 완벽해 보였습니다. 하지만 실제로는 조명이 다르고, 카메라가 약간 기울어져 있으며, 로봇 팔에 약간의 유격(백래시)이 있었습니다.
- 해결책: 저자는 로봇을 완벽하게 만들려고 노력하는 대신, 훈련 데이터를 혼란스럽게 만들었습니다. 어두운 곳에서, 밝은 햇빛 아래에서, 카메라가 기울어진 상태에서, 그리고 로봇이 다양한 속도로 움직이는 환경에서 옷을 접도록 가르쳤습니다.
- 결과: 로봇이 혼돈에 익으로 적응하도록 훈련함으로써, 현실 세계를 마주했을 때 당황하지 않게 되었습니다. 이는 폭풍우 치는 바다에서 서퍼를 훈련시켜 평온한 해변을 쉽게 느끼게 만드는 것과 같습니다.
7. 결과
- 시뮬레이션: 로봇은 **79.6%**의 성공률로 옷을 접었으며, 61개의 다른 팀을 제치고 우승했습니다.
- 실제 세계: 최종 대회에서 2위를 차지하며, 실제 로봇으로 실제 옷을 성공적으로 접었습니다.
큰 교훈
저자는 이것이 통제된 변수를 가진 완벽한 과학 실험은 아니었다고 인정합니다. 그것은 "키친 싱크(kitchen sink)" 접근법, 즉 작동할 때까지 모든 유용한 도구(강화 학습, 인간 피드백, 강력한 데이터 증강, 스마트한 추측)를 솥에 집어넣는 방식이었습니다.
핵적인 교훈은 로봇이 옷과 같이 무질서하고 예측 불가능한 것을 다루기 위해서는, 자신의 성공을 예측할 수 있어야 하고, 인간의 수정으로부터 배워야 하며, 현실이 비디오 게임과 다르게 보이더라도 당황하지 않도록 혼란스럽고 다양한 환경에서 훈련되어야 한다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.