← 최신 논문
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

이 논문은 모델 기반 제어와 학습된 정책 사이의 간극을 메우는 SUN(Semantically UNified) 프로그램과 Kuafu 시스템을 소개하며, 이는 MPC 검증과 RL 학습을 통합하는 타입 지정 및 언어 기반의 실행 가능한 프로그램을 자동 생성함으로써, 수동적인 조밀한 보상이나 인간의 시연 없이도 견고한 장기 조작을 가능하게 한다.

원저자: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 공장 바닥의 숙련가로서, 오류 없이 동일한 정밀 동작을 수천 번 반복해 왔습니다. 하지만 서랍을 열고, 병을 꺼내어, 테이블 위에 놓는 것과 같이 복잡하고 여러 단계로 이루어진 작업을 어지럽고 예측 불가능한 가정 환경에서 수행하라는 요청을 받으면, 로봇은 종종 비틀거립니다. 그 어려움은 움직임에 대해 생각하는 두 가지 서로 다른 방식 사이의 간극을 메우는 데 있습니다. 한 가지 접근 방식은 모든 관절의 각도와 힘을 계산하여 로봇이 충돌하지 않도록 보장하는 엄격한 수학적 규칙에 의존하지만, 이 방법은 취약하며 세상이 조금만 변해도 실패합니다. 다른 접근 방식은 로봇이 감을 잡을 때까지 연습하는 시행착오 학습을 사용하지만, 이는 종-종 수천 시간의 인간 시연이나 설계하기 까다로운 정교한 보상을 필요로 합니다. 수년 동안 이 두 방법은 경직된 플래너는 적응하지 못하고 학습자는 과업의 깊은 논리를 이해하지 못하는 채로 서로 분리된 영역에서 작동해 왔습니다.

UCLA(캘리포니아 대학교 로스앤젤레스)의 연구진과 동료들은 이 두 가지 접근 방식을 하나로 엮으려는 '쿠아푸(Kuafu)'라는 새로운 시스템을 선보였습니다. 로봇에게 내리는 지침을 일시적인 목표나 경직된 스크립트로 취급하는 대신, 그들은 전체 과정의 단일 진실 공급원 역할을 하는 지속적이고 유형화된 프로그램을 만들었습니다. 그들이 '세만틱 유니파이드(Semantically Unified)' 또는 'SUN 프로그램'이라 부르는 이 프로그램은 컴퓨터가 서랍 손잡이가 어느 방향을 향하는지 또는 병을 얼마나 높이 들어 올려야 하는지와 같은 물체 간의 물리적 관계를 이해할 수 있는 방식으로 작성되었습니다. 결정적으로, 이 동일한 프로그램은 로봇의 행동을 검증하고, 로켓이 어떻게 움직여야 하는지 가르치며, 처음부터 학습하는 데 필요한 데이터를 생성하는 데 사용됩니다. 초기 계획 단계부터 최종 학습 단계에 이르기까지 과업의 핵심 의미를 일정하게 유지함으로써, 이 시스템은 로봇이 원래 수행하기로 되어 있던 작업에서 벗어나는 것을 방지합니다.

시스템은 "서랍을 열고 컵을 안에 넣어라"와 같은 인간의 간단한 언어 지시를 받는 것으로 시작합니다. 인공지능 에이전트는 이 지시를 읽고 물리적 행동과 제약 조건을 설명하는 사전 정의된 빌딩 블록을 선택하여 SUN 프로그램을 구성합니다. 그런 다음, 고도의 제어 방법을 사용하여 이 프로그램이 물리적으로 실행 가능한지 확인하기 위해 고충실도 시뮬레이션에서 테스트합니다. 만약 시뮬레이션 결과 지침에 결함이 있거나 실행 불가능하다는 것이 드러나면, 시스템은 학습이 시작되기 전에 자동으로 프로그램을 수정합니다. 이 스크닝 과정은 매우 중요한데, 이는 로봇이 할 수 없는 작업을 배우도록 요구받아 시간과 컴퓨팅 전력을 낭비하는 일을 방지하기 때문입니다.

프로그램이 검증되면, 시스템은 이를 사용하여 로봇이 과업을 수행하는 수천 개의 성공적인 사례를 생성합니다. 이러한 사례들은 단순히 무작위적인 움직임이 아닙니다. 그리퍼가 손잡이에 닿는 순간부터 서랍이 완전히 열리는 순간까지 모든 단계를 추적하는 지속적인 프로그램에 의해 유도됩니다. 로봇은 먼저 이러한 성공적인 움직임을 모방함으로써 학습하고, 그 후 원래의 프로그램에 의해 엄격하게 제한되는 시행착오 과정을 통해 이를 정교화합니다. 이는 로봇이 유연하고 반응적으로 학습하면서도 궁극적인 목표를 놓치지 않도록 보장합니다. 그 결과, 이전의 방식들이 달성할 수 없었던 수준의 신뢰성로 복잡한 다단계 과업을 수행할 수 있는 정책(policy)이 만들어집니다.

큐브 쌓기부터 병의 방향 바꾸기, 서랍 열기에 이르기까지 9가지의 서로 다른 조작 과업을 포함한 일련의 테스트에서, 이 시스템은 기존 방식들보다 유의미한 개선을 보여주었습니다. 희소 보상(sparse rewards)이나 온라인 플래닝에 의존하는 다른 접근 방식들이 3분의 1 이상의 성공률을 올리는 데 어려움을 겪은 반면, 이 새로운 시스템은 82% 이상의 성공률을 달 Achieved 했습니다. 연구진은 이 시스템이 많은 단계가 필요한 과업을 처리하는 데 특히 효과적이며, 시퀀스의 복잡성이 증가하더라도 성능을 유지한다는 것을 발견했습니다. 또한, 이 시스템이 생성한 데이터는 품질이 매우 높아 시각적 학습 모델이 46%의 시험에서 성공하도록 했는데, 이는 다른 생성 방식의 데이터로 훈련된 모델의 성공률보다 두 배 이상 높은 수치입니다.

어떤 로봇 시스템의 진정한 시험대는 컴퓨터 시뮬레이션의 안전한 환경을 벗어나 실제 세계로 나갈 수 있는지 여부입니다. 이를 검증하기 위해, 연구진은 프랭카(Franka)와 키노바(Kinova)의 물리적 로봇에 훈련된 정책을 배치하였으며, 특정 과업 구조에 대한 사전 지식 없이 카메라를 사용하여 로봇의 행동을 안내했습니다. 추가적인 튜닝이나 실제 세계에서의 연습 없이도, 로봇은 다양한 구성에서 물리적 시험의 34.7%를 성공적으로 완료했습니다. 훈련은 시뮬레이션에서만 이루어졌으나 실제 기계에서 즉시 작동하는 이 '제로샷 전이(zero-shot transfer)'는, 지속적인 프로그램이 과업의 필수적인 논리를 성공적으로 포착하여 학습된 행동이 물리적 세계로 일반화될 수 있게 했음을 시사합니다.

연구진은 이 접근 방식에 한계가 있음을 인정합니다. 현재는 물리적 행동의 사전 정의된 라이브러리에 의존하며 장면 내의 물체들에 대한 명확한 이해를 필요로 하므로, 상당한 새로운 프로그래밍 없이는 천이나 액체와 같은 변형 가능한 물체를 아직 다룰 수 없습니다. 또한, 시스템은 단방향으로 과업을 진행하며 물리적 오류가 발생했을 때 되돌아갈 수 없는데, 이는 특정 유형의 실수로부터 회복하는 능력을 제한합니다. 그러나 이 결과는 로봇 학습을 위한 새로운 원칙을 확립합니다. 즉, 계획, 검증 및 학습 전반에 걸쳐 과업의 세만틱 의미를 일관되게 유지하는 것이 자동화를 위한 견고한 토대를 만든다는 것입니다. 로봇의 과업 이해도가 표류하지 않도록 보장함으로써, 이 시스템은 경직된 제어와 유연한 학습 사이의 간극을 메우며, 실제 세계에서 복잡한 과업을 안정적으로 수행할 수 있는 로봇을 향한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →