← 최신 논문
🤖 AI

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

이 논문은 폐쇄형 가중치 파운데이션 모델(Gemini Robotics On-Device와 같은)을 사용하는 휴머노이드 로봇이 모델 내부 구조에 대한 접근 없이도 배포 시점의 보상 피드백을 API 기반 정책 개선을 위한 지도 학습 데이터로 변환함으로써, 순수 모방 학습의 한계를 극복하고 완벽에 가까운 작업 숙달을 달{%s} 수 있게 하는 비침습적 폐쇄 루프 반복 미세 조정 방법인 CLIFT를 소개한다.

원저자: Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 복잡한 춤을 가르치려 한다고 상상해 보세요. 인공지능의 세계에는 이를 수행하는 두 가지 주요 방법이 있습니다. 첫 번째는 "오픈 소스" 방식으로, 로봇의 전체 뇌, 코드, 그리고 내부 배선까지 모두 얻어서 당신이 직접 모든 나사를 조절할 수 있는 방식입니다. 두 번째는 "클로즈드 소스(폐쇄형 소스)" 방식으로, 로봇은 하나의 블랙박스와 같습니다. 당신은 내부를 볼 수도, 전선을 만질 수도, 코드를 수정할 수도 없습니다. 당신이 할 수 있는 일이라고는 그저 로봇에게 지침 목록(예: "이렇게 춤을 춰라")을 건네주고 그것을 배우라고 요청하는 것뿐입니다. 이것은 오늘날 가장 강력한 로봇 뇌들이 채택하고 있는 표준이 되고 있습니다. 이들은 믿기지 않을 정도로 똑똑하지만, 디지털 문 뒤에 갇혀 있습니다.

과학자들이 던지는 큰 질문은 이것입니다. 만약 로봇의 뇌 내부를 들여다볼 수 없다면, 여전히 로봇이 어렵고 실제적인 과업을 숙달하도록 가르칠 수 있을까요? 보통 내부를 볼 수 없을 때는 그저 눈에 보이는 것을 복사하는 것(모방)에 국한됩니다. 하지만 현실 세계는 무질서합니다. 로봇이 영상 속 인간을 완벽하게 따라 할 수는 있지만, 흔들리는 바닥 위에서 미끄러운 컵을 다루는 상황에 놓이면 미세한 지연이나 고려하지 못한 물리 법칙 때문에 실패할 수 있습니다. 진정으로 잘하기 위해서 로봇은 연습하고, 실패하고, 무엇이 잘못되었는지 깨닫고, 다시 시도하는 과정, 즉 "폐쇄 루프 학습(closed-loop learning)"이 필요합니다. 문제는, 당신이 로봇의 내부 학습 메커니즘을 건질 수 없는 상황에서 어떻게 로봇이 스스로의 실수로부터 배우도록 가르칠 것인가 하는 점입니다.

CLIFT라는 제목의 이 논문은 바로 그 문제를 다룹니다. 연구진은 "Gemini Robotics On-Device"라는 강력하고 폐쇄된 로봇 모델을 접시 쌓기나 상자 포장 같은 까다롭고 접촉이 많은 작업의 달인으로 만들 수 있는지 확인하고 싶었습니다. 이때 모델의 "상자"를 절대 열지 않고 말이죠. 그들은 단순히 인간의 영상을 복사하는 방식(지도 미세 조정, Supervised Fine-Tuning)이 다른 오픈 소스 로봇들보다 훨씬 낫게 만들긴 했지만, 실제 세계의 민첩성을 구현하기에는 여전히 완벽하지 않다는 것을 발견했습니다. 로봇은 종종 물건을 떨어뜨리거나 마지막 단계를 버벅거리곤 했습니다.

이를 해결하기 위해 연구팀은 CLIFT(Closed-Loop Iterative Fine-Tuning)라는 영리한 기술을 발명했습니다. 이것은 게임의 코드를 수정할 수는 없지만 여전히 플레이어를 가르칠 수 있는 비디오 게임 코치와 같습니다. 작동 방식은 다음과 같습니다:

  1. 연습 실행: 로봇이 실제 세계에서 과업을 시도합니다. 성공할 수도 있고, 실패할 수도 있습니다.
  2. 성적표: 단순히 "잘했어" 또는 "못했어"라고 말하는 대신, 특별한 AI 심판(보상 모델)이 영상을 관찰하며 움직임의 아주 작은 조각마다 점수를 매깁니다. 이 심판는 어떤 부분이 매끄럽고 도움이 되었는지, 그리고 어떤 부분이 서툴거나 위험했는지를 정확히 식별합니다.
  3. 마법의 라벨: 연구팀은 이렇게 점수가 매겨진 영상들을 새로운 학습 레슨으로 변환합니다. 좋은 부분에는 특별한 "배지"(예: 금메달)를 추가하고, 나쁜 부분에는 "경고"를 붙입니다.
  4. 수업: 이 새로운 라벨이 붙은 레슨을 API(디지털 메뉴)를 통해 닫혀 있는 로봇의 뇌로 보냅니다. 로봇은 이 새로운 데이터를 통해 스스로를 재학습하며, "금메달"을 쫓고 "경고"를 피하는 법을 배웁니다.

연구진은 이 과정을 마치 더 빠르게 회전하는 플라이휠처럼 두 번 반복했습니다. 결과는 인상적이었습니다. 마지막 단계에 이르렀을 때, 로봇은 더 이상 인간을 단순히 복사하는 데 그치지 않고 자신만의 영리한 동작을 만들어내기 시작했습니다. 예를 들어, 상자를 포장할 때 로봇은 물건을 들어 올리기 전 더 나은 움켜쥐기를 위해 손가락으로 상자를 밀거나 회전시키는 법을 배웠는데, 이는 인간 교사들이 보여준 적이 없는 동작이었습니다. 병을 컵에 넣으려 할 때, 한 번에 실패하더라도 포기하는 대신 다시 시도하는 법을 배웠습니다.

이 논문은 이러한 "비침습적" 방법이 놀라운 효과를 거두었음을 보여줍니다. 로봇의 성공률은 접시 쌓기나 병 끼우기 같은 어려운 과업에서 약 50~70%에서 거의 100%로 급증했습니다. 더욱 놀라운 점은, 연구진이 동일한 기술을 코드를 직접 만질 수 있는 다른 오픈 소스 로봇에 적용했을 때, 오히려 갇혀 있던 로봇이 더 뛰어난 성능을 보였다는 것입니다. 이는 매우 강력한 사전 학습된 "뇌"를 갖는 것이 코드에 대한 완전한 접근 권한을 갖는 것보다 더 중요하다는 것을 시사합니다.

요약하자면, 이 논문은 로봇의 뇌를 부술 필요 없이 가르칠 수 있다는 것을 증명합니다. 실제 연습 세션을 스마트하게 라벨링된 레슨으로 변환함으로써, 여러분은 갇혀 있는 로봇을 전문가로 안내하여 복잡한 물리적 과업을 숙달하게 할 수 있습니다. 저자들은 이 접근 방식이 단 두 번의 사이클만으로 로봇을 완벽한 숙련 단계로 밀어 올릴 수 있음을 발견했으며, 이 모든 과정은 모델의 "상자"를 전혀 열지 않고도 이루어졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →