← 최신 논문
💻 computer science

SkillWrapper: Generative Predicate Invention for Task-level Robot Planning

이 논문은 파운데이션 모델을 활용하여 가공되지 않은 RGB 관측으로부터 형식적이고 증명 가능하게 건전하며 완전한 심볼릭 술어를 자동으로 발명함으로써, 로봇이 블랙박스 기술을 추상적 표현으로 일반화하여 미지의 장기 과제를 해결할 수 있도록 하는 방법론인 SkillWrapper를 소개한다.

원저자: Ziyi Yang, Benned Hedegaard, Ahmed Jaafar, Yichen Wei, Skye Thompson, Shreyas S. Raman, Haotian Fu, Stefanie Tellex, George Konidaris, David Paulius, Naman Shah

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyi Yang, Benned Hedegaard, Ahmed Jaafar, Yichen Wei, Skye Thompson, Shreyas S. Raman, Haotian Fu, Stefanie Tellex, George Konidaris, David Paulius, Naman Shah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 물리적 수준에서는 믿을 수 없을 정도로 힘이 세고 정교한 로봇이 있다고 상상해 보십시오. 이 로봇은 찻주전자를 집어 들고, 차를 따르고, 그릇 위에 사발을 쌓을 수 있습니다. 하지만 현재 이 로봇은 마치 개별 건반을 누르는 법만 알고 음악 이론은 모르는 천재 피아니스트와 같습니다. 단일 음표는 연주할 수 있지만, 곡을 작곡하거나 전체 콘서트를 계획하는 법은 모릅니다.

이것이 바로 SkillWrapper가 해결하고자 하는 문제입니다.

문제점: "블랙박스" 로봇

현재 많은 로봇은 "블랙박스" 기술을 가지고 있습니다. 이는 미리 프로그래밍된 동작(예: "물체 집기" 또는 "액체 붓기")으로, 그 자체로는 잘 작동합니다. 하지만 당신이 로봇에게 "차 한 잔 만들기"와 같은 복잡하고 다단계적인 과업을 수행하게 하고 싶다면, 로봇은 이러한 기술들을 어떻게 하나로 엮어야 할지 알지 못합니다.

로봇이 복잡한 과업을 계획하게 하려면, 보통 인간이 로봇을 위한 규칙서를 수동으로 작성해야 합니다. 인간은 다음과 같이 설명해야 합니다. "차를 따르려면, 로봇이 먼저 찻주전자를 잡고 있어야 하며, 컵은 비어 있어야 한다." 이는 매우 지루하고 느리며, 모든 새로운 로봇이나 환경에 대해 이 작업을 수행하는 것은 불가능합니다.

해결책: 로봇이 스스로 규칙집을 쓰도록 가르치기

연구진은 SkillWrapper라는 시스템을 만들었습니다. 인간이 규칙집을 쓰는 대신, SkillWrapper는 로봇이 스스로 이것저것 시도해 봄으로써 자신만의 "어휘"와 "규칙"을 발명하도록 가르칩니다.

이것이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다.

1. "시행착오" 단계 (능동적 데이터 수집)

로봇이 주방에 있다고 상상해 보십시오. 아직 규칙을 모르는 상태입니다. SkillWrapper는 로봇에게 명령합니다. "찻주전자를 집어 들어봐. 이제 스펀지를 집어 봐. 이제 사발을 쌓아 봐."

  • 성공: 로봇이 찻주전자를 집어 듭니다.
  • 실패: 로봇이 스펀지를 집으려 하지만, 너무 미끄러워서 떨어뜨립니다.

로봇은 이 순간들을 기록합니다: "찻주전자를 집으려고 시도했고, 성공했다. 스펀지를 집으려고 시도했지만, 실패했다."

2. "아하!" 모먼트 (생성적 술어 발명)

이 부분이 마법 같은 부분입니다. 로봇은 자신의 성공과 실패를 살펴보고 질문합니다: "왜 하나는 성공하고 다른 하나는 실패했을까?"

과거에는 컴퓨터가 인간으로부터 답(예: "스펀지가 너무 미끄럽다")을 전달받아야 했습니다. 하지만 SkillWrapper는 파운데이션 모델(이미지와 언어를 이해하는 매우 똑똑한 AI, 예를 들어 ChatGPT나 DALL-E의 매우 발전된 버전)을 사용합니다.

  • 로봇은 AI에게 두 장의 사진을 보여줍니다: 하나는 성공적으로 집어 올린 모습이고, 다른 하나는 실패한 모습입니다.
  • AI는 이미지를 보고 차이점을 설명할 새로운 단어(술어)를 만들어냅니다.
  • AI가 말합니다: "아! 차이점은 찻주전자에는 손잡이가 있지만, 스펀지는 미끄럽다는 것이구나. 새로운 규칙인 GripperEmpty(그리퍼 비어 있음) 또는 ObjectIsStable(물체가 안정적임)이라는 단어를 만들자."

로봇은 왜 동작이 성공했거나 실패했는지를 설명하는 새로운, 인간이 읽을 수 있는 개념을 만들어냅니다. 이는 마치 로봇이 갑자기 "미끄럽다"라는 단어를 배우고, "아, 지금의 움켜쥐는 방식으로는 미끄러운 물건을 잡을 수 없구나!"라고 깨닫는 것과 같습니다.

3. 규칙집 구축 (연산자 학습)

로봇이 이러한 새로운 단어(술어)들을 발명하고 나면, 논리적인 지도를 만들기 시작합니다.

  • 규칙: "붓기(Pour)를 하려면, 잡고(Holding) 있어야 하며 찻주전자여야 하고, 컵은 비어(Empty) 있어야 한다."
  • 규칙: "쌓기(Stack)를 하려면, 접시가 평평(Flat)해야 한다."

로봇은 이 규칙들을 모아 **심볼릭 모델(Symbolic Model)**을 형성합니다. 이는 (팔의 정확한 각도와 같은) 지저분한 세부 사항은 무시하고 (컵이 비어 있는지와 같은) 논리에 집중하는 고차원적인 세계 지도입니다.

4. 거대한 계획 (과업 수준의 계획)

이제 당신이 로봇에게 "차 만들기"와 같은 복잡한 목표를 주더라도 로봇은 당황하지 않습니다. 로봇은 자신의 새로운 규칙집을 사용하여 표준적인 계획 알고리즘(비디오 게임 AI나 물류 소프트웨어에서 사용하는 것과 같은 종류의 논리)을 사용합니다.

  • 로봇은 목표를 확인합니다: "컵에 차가 있음."
  • 로로봇은 규칙을 확인합니다: "나는 붓기가 필요하다."
  • 로봇은 전제 조건을 확인합니다: "내가 찻주전자를 가지고 있는가? 컵이 비어 있는가?"
  • 로봇은 단계별 계획을 세웁니다: 찻주전자 집기 -> 컵으로 이동하기 -> 차 따르기.

이 논문이 특별한 이유

이 논문은 이전의 시도들과 차별화되는 세 가지 주요 사항을 주장합니다:

  1. 제로 상태에서 시작합니다: 인간이 시작 규칙 목록을 제공해야 하는 다른 방법들과 달리, SkillWrapper는 아무것도 없는 상태에서 시작합니다. 로봇이 움직이는 것을 관찰함으로써 스스로 어휘를 발명합니다.
  2. 수학적으로 정확함이 보장됩니다: 저자들은 단순히 이것이 작동할 것이라고 추측한 것이 아닙니다. 그들은 로봇이 이 과정을 따르면 학습된 규칙이 건전성(Soundness)(불가능한 것을 계획하지 않음)과 완전성(Completeness)(해답이 존재한다면 놓치지 않음)을 갖는다는 것을 수학적으로 증명했습니다. 이는 마치 누군가 그 위를 걷기 전에 다리가 안전한지 수학적으로 증명하는 것과 같습니다.
  3. 실제 세계에서 작동합니다: 그들은 이를 단순한 시뮬레이션이 아닌 실제 로봇에서 테스트했습니다. 로봇은 오직 카메라 이미지만을 입력값으로 사용하여 물체를 쌓거나 액체를 붓는 것과 같은 복잡한 과업을 계획하는 법을 배웠습니다.

핵심 요약

SkillWrapper는 로봇이 자신의 행동에 대한 "문법"을 스스로 가르칠 수 있게 해주는 시스템입니다. 인간이 매뉴얼을 작성하는 대신, 로봇은 시도하고, 실패하고, 똑똑한 AI에게 "왜 실패했나요?"라고 묻고, 문제를 설명할 새로운 단어를 발명하며, 그 단어를 사용하여 다음 움직임을 계획합니다. 이를 통해 로봇은 모든 규칙을 프로그래밍하는 인간 전문가 없이도 실제 세계에서 길고 복잡한 과업을 해결할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →