← 최신 논문
💻 computer science

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

이 논문은 iPhUMI 인터페이스를 통해 수집된 다양한 훈련 데이터셋에 의해 지원되고 새로운 평가 벤치마크를 통해 검증된, 추론 시 단 한 번의 인간 시연만으로 로봇이 새로운 조작 작업을 학습할 수 있게 하는 인컨텍스트 시각-운동 아키텍처인 행동 프롬프팅 정책(Behavior Prompting Policy, BPP)을 소개한다.

원저자: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 새로운 기술을 가르치고 싶다고 상상해 보세요. 예를 들어 특정 종류의 셔츠를 접거나 특정 모양을 그리는 법 같은 것 말이죠. 보통은 강아지에게 새로운 명령어를 가르치는 것과 비슷합니다. 로봇이 제대로 할 수 있을 때까지 처음부터 반복해서 수 시간 동안 훈련시켜야 하죠. 나중에 다른 기술을 가르치고 싶다면, 종종 전체 훈련 과정을 처음부터 다시 시작해야 합니다.

이 논문은 **"행동 프롬프팅(Behavior Prompting)"**이라 불리는 새로운 로봇 교육법을 소개합니다. 이것은 정식 훈련이라기보다, 친구에게 휴대폰으로 짧은 영상을 보여주며 "이렇게 해봐"라고 말하는 것에 더 가깝습니다.

이 기술이 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

1. 핵심 아이디어: "비디오 레시피"

로봇에게 텍스트 명령("셔츠를 접어라")이나 최종 결과물 사진(완성된 셔츠의 모습)을 주는 대신, 사람이 과업을 수행하는 단 한 번의 영상 시연을 제공합니다.

  • 비유: 여러분이 케이크를 굽는다고 상상해 보세요.
    • 기존 방식: 여러분은 글자로 된 레시피(언어)나 완성된 케이크 사진(목표 이미지)을 받습니다. 그러면 여러분은 단계를 추측해야 합니다.
    • 행동 프롬프팅: 여러분은 누군가가 정확히 그 케이크를 굽는 영상을 받게 됩니다. 그 사람은 달걀을 어떻게 깼는지, 얼마나 저었는지, 어떤 속도로 움직였는지를 정확히 볼 수 있습니다. 로봇은 이 "비디오 레시피"(행동 프롬프트)를 보고 결과물이 아닌 '움직임'을 복제하려고 노력합니다.

2. 두뇌: "스마트 번역기" (BPP)

이 논문은 **행동 프롬프팅 정책(Behavior Prompting Policy, BPP)**이라는 새로운 로봇 두뇌를 소개합니다.

  • 작동 방식: 로봇이 과업을 수행하도록 요청받으면, 두 가지를 동시에 살핍니다:
    1. 현재 자신이 보고 있는 것 (현재의 방, 테이블 위의 셔츠).
    2. "비디오 레시피" (사람의 시연).
  • 마법 같은 점: 로봇은 단순히 영상을 암기하는 것이 아닙니다. 로봇은 스마트한 번역기처럼 행동합니다. 영상을 보며 이렇게 판단합니다: "좋아, 영상 속에서 사람은 여기서 셔츠를 잡고 있네. 그런데 지금 내 시야에서는 셔츠가 저기에 있어. 그러니 나는 저 위치에 맞추기 위해 손을 이렇게 움직여야겠어." 로봇은 다음 동작을 결정하기 위해 끊임없이 영상과 현실을 비교합니다.

3. 훈련: 다양성이 핵심

연구진은 이 방식이 제대로 작동하려면 초기 훈련 단계에서 매우 다양한 유형의 과업을 많이 경험해야 하지만, 각 특정 과업에 대한 예시는 많이 필요하지 않다는 것을 발견했습니다.

  • 비유: 요리를 배우는 요리사를 생각해 보세요.
    • 만약 요리사에게 오직 스파게티를 만드는 예시 1,000개를 훈련시킨다면, 그 요리사는 스파게티는 아주 잘 만들겠지만 샐러드는 전혀 못 만들 것입니다.
    • 만약 1,000가지의 서로 다른 요리(수프, 샐러드, 스테이크, 케이크)를 각각 1개씩 보여준다면, 그들은 일반적인 "요리하는 기술"을 배우게 됩니다.
    • 이 논문은 로봇에게 다양한 과업의 "메뉴"를 제공하는 것이(각 과업의 예시가 적더라도) 나중에 새로운 것을 즉석에서 배울 때 훨씬 더 유리하다는 것을 밝혀냈습니다.

4. 도구: "매직 리모컨" (iPhUMI)

이 모든 다양한 예시를 수집하기 위해, 팀은 iPhUMI라는 특별한 핸드헬드 장치를 만들었습니다.

  • 정체: 아이폰이 부착된 그리퍼(집게)입니다.
  • 도움이 되는 방식: 사람은 이 장치를 집어 들고 물리적으로 움직이며 로봇에게 무엇을 할지 보여줄 수 있습니다. 아이폰이 달려 있기 때문에, 로봇은 방 안에서 자신의 위치를 즉각적으로 파악할 수 있습니다 (방을 매핑하는 데 수 시간을 보낼 필요가 없습니다).
  • 장점: 테스트 단계(로보가 실제로 작업할 때)에서 사람은 이 장치를 들고 한 번만 동작을 수행하여 로봇에게 보여주면 됩니다. 그러면 로봇은 즉시 그 일을 할 줄 알게 됩니다. 이는 새로운 기술을 즉석에서 가르치는 "리모컨"과 같습니다.

5. 결과: 무엇을 테스트했나?

팀은 두 가지 테스트를 진행했습니다:

  1. 그리기: 로봇에게 도형을 그리게 했습니다. 로봇이 이전에 본 적 없는 특정 도형이라도, 사람이 태블릿에 한 번 그리면(프롬프트), 로봇은 그 움직임을 복제하여 다른 판 위에 그려낼 수 있었습니다.
  2. 테이블 상의 과업: 그릇을 집어서 옮기는 등의 작업을 테스트했습니다. 연구진은 사람이 그릇을 옮기는 영상을 보여주면, 로봇이 이전에 본 적 없는 조합(다른 종류의 그릇, 다른 위치)이라도 어떻게 움직여야 하는지 파악할 수 있다는 것을 발견했습니다.

요약

이 논문은 행동 프롬프팅이 값비싼 재학습 과정 없이도 단 한 번의 인간 시연을 관찰함으로써 로봇이 새로운 기술을 즉각적으로 배울 수 있게 해준다고 주장합니다.

  • 비결: 로봇이 이전에 광범위하고 다양한 과업을 경험했을 때 가장 잘 작동합니다.
  • 장점: 텍스트 명령이나 최종 목표만을 보여주는 방식보다 더 빠르고 유연합니다. 이는 인간의 실제 움직임을 가이드로 사용함으로써 "무엇을 할 것인가"와 "어떻게 할 것인가" 사이의 간극을 메워줍니다.

중요 참고 사항: 이 논문은 이러한 특정 능력(그리기 및 테이블 조작)에 초점을 맞추고 있습니다. 이 기술이 아직 복잡한 의료 수술이나 산업용 조립 라인에 적용될 준비가 되었다거나, 단 한 번의 관찰로 모든 가능한 과업을 배울 수 있다고 주장하는 것은 아닙니다. 이 기술은 로봇이 광범위하게 훈련받은 유형의 과업 내에서 가장 잘 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →