← 최신 논문
🤖 machine learning

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

본 논문은 명목 환경 데이터만을 사용하여 비행동 기반 모델에 대한 견고한 미니맥스 최적화 프레임워크를 제안하여, 사전 학습 수정 없이 기존 베이스라인을 크게 능가하는 효과적인 오프라인 모방 학습과 보이지 않는 동적 변화에 대한 적응을 가능하게 한다.

원저자: Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 걷기, 뛰기, 점프하기 등을 가르친다고 상상해 보세요. 전통적으로는 전문가가 해당 작업을 수행하는 동영상을 로봇에게 보여주고, 로봇이 이를 모방하도록 훈련시켰습니다. 이를**모방 학습 (Imitation Learning)**이라고 합니다.

하지만 함정이 하나 있습니다. 로봇은 종종 완벽한 마찰이 없는 시뮬레이션 (비디오 게임과 같은) 에서 훈련되지만, 실제 세계로 나가면 상황이 달라집니다. 바닥이 미끄러울 수도 있고, 로봇의 관절이 녹슬어 있을 수도 있으며, 모터의 힘이 약할 수도 있습니다. 로봇이 오직"완벽한"동영상을 모방하도록만 배웠다면, 현실이 엉망이 되는 순간 넘어질 가능성이 매우 높습니다.

이 논문은 로봇을 처음부터 다시 훈련시킬 필요 없이, 이러한 현실 세계의 변화에 훨씬 더 강인하게 만드는 새로운 로봇 교육 방법을 소개합니다.

간단한 비유를 들어 설명해 드리겠습니다:

1. 문제: "완벽한 연습"의 함정

저자들은**행동 기반 모델 (Behavior Foundation Models, BFMs)**이라는 것을 사용합니다. BF M 을 수천 가지 요리를 맛보고 요리의 근본적인"맛의 프로필"을 배운 마스터 셰프로 생각해보세요.

  • 일반적인 작동 방식: 셰프는 완벽한 재료와 완벽한 주방에서 이러한 맛들을 배웁니다. 새로운 요리를 요청받으면, 몇 가지 재료만 보고도 레시피를 빠르게 파악할 수 있습니다.
  • 결함: 셰프가 난로가 고장 나거나, 물이 짜거나, 재료가 상한 주방에서 요리를 하려고 하면"완벽한 주방"레시피는 실패합니다. 셰프는 주방이 여전히 완벽하다고 가정하기 때문에, 요리는 끔찍하게 나옵니다.

로봇공학에서 이는 로봇의 환경이 변할 때 (예: 중력이나 마찰력의 변화) 표준 로봇이"고장 난"주방을 처리하는 법을 배운 적이 없기 때문에 실패한다는 것을 의미합니다.

2. 해결책: "최악의 경우"를 대비한 셰프

저자들은RBFM(강인한 행동 기반 모델, Robust Behavior Foundation Model)이라는 새로운 방법을 제안합니다. 단순히 전문가를 모방하는 대신, 로봇이 작업을 배우는 동안 환경의가장 최악의 버전에 대비하도록 가르칩니다.

셰프가 이제 옆에문제아가 서서 훈련한다고 상상해 보세요.

  • 게임: 셰프는 레시피 (작업) 를 파악하려고 노력합니다. 문제아는 난로를 더 뜨겁게 하거나, 바닥을 미끄럽게 하거나, 재료를 상하게 만들어 주방을 방해하려 합니다 (동역학 변화를 시뮬레이션).
  • 목표: 셰프는 문제아가 최선을 다해 방해할 때도 여전히 맛있는 레시피를 찾아야 합니다.
  • 결과: 셰프는"강인한"레시피를 배웁니다. 실제 세계로 갔을 때 난로가 약간 고장 났거나 바닥이 젖어 있더라도, 요리는 여전히 작동합니다. 왜냐하면 바로 그 시나리오들을 연습했기 때문입니다.

3. 마법 같은 트릭: 새로운 훈련 불필요

일반적으로 로봇에게 고장 난 난로를 처리하는 법을 가르치려면, 고장 난 주방에서 요리하는 동영상을 보여줘야 합니다. 이는 비용이 많이 들고 어렵습니다.

이 논문의 큰 breakthrough 는새로운 동영상이 필요 없다는 점입니다.

  • 그들은 이미"완벽한 주방"데이터로 훈련된 로봇을 가져옵니다.
  • 마지막 단계(작업 추론, Task Inference)만 변경합니다.
  • 로봇이 새로운 작업을 수행하라고 요청받으면, 빠른 정신적 시뮬레이션을 실행합니다:"바닥이 미끄러우면 발을 어떻게 움직여야 할까? 모터가 약하면 얼마나 많은 힘을 써야 할까?"
  • 환경이 약간 고장 났을 수도 있다는 가정하에 최선의 움직임을 계산하면서, 학습에 사용했던 기존 데이터를 그대로 활용합니다.

4. 로봇의 두 가지 버전

이 논문은 속도와 안전성 사이의 트레이드오프를 통해 이러한"최악의 경우"사고를 수행하는 두 가지 방법을 제시합니다:

  • RBFM-Light(빠른 사고가): 이 버전은 빠릅니다. 환경이 얼마나 나쁠지 빠르게 추측하고 계획을 약간 조정합니다. 마치 웅덩이를 보고 혹시나 해서 조금 속도를 줄이는 운전자와 같습니다. 계산 속도가 매우 빠릅니다.
  • RBFM-Heavy(신중한 계획가): 이 버전은 더 느리지만 더 철저합니다. 단순히 추측하는 것이 아니라, 환경이 구체적이고 복잡한 방식으로 변하더라도 계획이 작동할 수 있음을 수학적으로 증명합니다. 마치 한 걸음을 내딛기 전에 지도, 날씨, 도로 상태를 모두 확인하는 운전자와 같습니다. 시간이 조금 더 걸리지만 더 안전합니다.

5. 결과: 현실 세계에서 승리

저자들은 걷고, 뛰고, 점프하는 로봇 (사람, 개, 치타와 유사) 에서 이를 테스트했습니다. 그들은 테스트 중 물리 법칙을 조작했습니다:

  • 중력을 더 강하게 만들었습니다.
  • 바닥을 미끄럽거나 부드럽게 만들었습니다.
  • 로봇의 관절을 뻣뻣하거나 약하게 만들었습니다.

결과:

  • 표준 로봇 (FB-IL): 환경이 변하자마자 완전히 무너졌습니다.
  • 기존"강인한"방법: 잘 작동했지만 매우 느려, 단일 작업을 파악하는 데 몇 시간이 걸렸습니다.
  • 새로운 RBFM 로봇: 표준 로봇보다 변화를 훨씬 잘 처리했으며, 기존 강인한 방법보다수천 배 더 빠릅니다. 그들은 몇 시간이 아닌 몇 분 안에 새로운 고장 난 환경에 적응할 수 있었습니다.

요약

이 논문은 이렇게 말합니다:"단순히 로봇에게 전문가를 모방하도록 가르치지 말고, 세상이 고장 났을 수도 있다는 가정 하에 전문가를 모방하도록 가르치세요."

학습의 마지막 단계에서 이러한"최악의 경우"계획을 수립함으로써, 그들은 새로운 지저분한 데이터를 수집할 필요 없이 초고속(기반 모델과 같이) 이면서도 초강인한(실제 세계의 혼란을 처리할 수 있는 로봇과 같이) 시스템을 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →