← 최신 논문
💻 computer science

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

본 논문은 온라인으로 생성된 실패 궤적을 적응적 부정적 안내로 활용하여 정책이 오류가 발생하기 쉬운 영역에서 벗어나도록 유도하고 작업 성공률을 향상시킴으로써 비전-언어-행동 모델의 견고성을 강화하는 엔드투엔드 프레임워크인 적응적 실패 정보 학습 (AFIL) 을 소개합니다.

원저자: Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 블록을 쌓거나 바나나를 접시에 올리는 것과 같은 작업을 수행하도록 가르치는 상황을 상상해 보세요. 전통적으로 우리는 로봇에게 인간이 해당 작업을 완벽하게 수행하는 영상을 보여줌으로써 가르쳐 왔습니다. 로봇은 이러한"성공 스토리"를 관찰하고 이를 모방하려 합니다.

문제는 무엇일까요? 현실은 완벽하지 않습니다. 로봇이 살짝 미끄러지거나 물체를 이상한 각도로 잡는다면, 어떻게 고쳐야 할지 모릅니다. 오직 완벽한 예시들로부터만 학습했기 때문에, 일이 잘못되었을 때 무엇을 해야 할지 전혀 알지 못합니다. 그저 같은 실수를 반복하다가 결국 작업 전체가 실패할 때까지 멈추지 않습니다. 마치 잔잔하고 고요한 바다에서만 항해하는 법을 배운 선원을 가르치는 것과 같습니다. 폭풍이 몰아치는 순간, 그들은 어떻게 조종해야 할지 전혀 모릅니다.

이 논문은 이러한 문제를 해결하기 위해 AFIL(Adaptive Failure-Informed Learning, 적응형 실패 정보 학습)이라는 새로운 방법을 소개합니다. 간단한 비유를 통해 작동 원리를 설명해 보겠습니다.

1. 성공뿐만 아니라 실수로부터 배우기

완벽한 성공의 영상만 보여주는 대신, AFIL 은 로봇에게 두 가지를 동시에 가르칩니다.

  • "성공"교사: 로봇에게 작업을 완벽하게 수행하는 방법을 보여줍니다.
  • "실패"교사: 일이 잘못되었을 때 발생하는 상황 (예: 물체 떨어뜨리기, 목표물 빗나가기) 을 보여줍니다.

로봇은 이 둘로부터 모두 배웁니다. 올바른 움직임을 배우는 동시에, 피해야 할"잘못된 방법"을 인식하는 법도 배웁니다.

2."이중 머리"뇌

연구자들은 동일한 눈과 귀 (시각 및 언어 이해 능력) 를 공유하는 두 개의"머리"(Dual Action Generator) 를 가진 특수한 로봇 뇌를 개발했습니다.

  • 머리 A는 완벽한 움직임이 어떻게 보이는지 예측합니다.
  • 머리 B는 실패한 움직임이 어떻게 보이는지 예측합니다.

이들은 두 개의 거대한 별도 뇌가 필요하지 않습니다. 이미지와 지시를 이해하는 무거운 작업을 공유하지만, 무엇을 할지 결정하는"근육"은 다릅니다. 이로 인해 시스템이 효율적이 되며 거대한 추가 컴퓨팅 파워가 필요하지 않습니다.

3. 스스로 조정하는"조향 휠"

이것이 가장 영리한 부분입니다. 로봇이 실제로 작업을 수행할 때, 단순히"성공"교사를 맹목적으로 따르지 않습니다. 대신"실패"교사를 지속적으로 점검합니다.

매우 똑똑한 조종사가 있는 자동차를 운전한다고 상상해 보세요.

  • 길이 맑고"성공"교사와"실패"교사가 경로에 동의하면 로봇은 정상적으로 운전합니다.
  • 하지만 로봇이 절벽 (실패) 쪽으로 조금이라도 치우치기 시작하면,"실패"교사가"거기로 가지 마!"라고 외칩니다.
  • 시스템은 그런 다음 조향 휠을 자동으로 조정하여 로봇을 절벽에서 밀어내고 안전한 경로로 되돌립니다.

이 논문은 이를"적응형 부정적 안내 (Adaptive Negative Guidance)"라고 부릅니다. 마치 자기 반발력처럼, 로봇이 실수에 가까워질수록 안전으로 되돌리는 힘이 강해집니다. 중요한 점은 이 힘이 고정되어 있지 않다는 것입니다. 로봇이 실제로 실패할 위험에 처했을 때만 강해지고, 일이 잘 진행될 때는 약하게 유지됩니다.

4."실패"데이터를 얻는 방법

"모든 것을 부수지 않고 로봇이 실패하는 영상을 어떻게 얻나요?"라고 궁금해하실 수 있습니다. 연구자들은 로봇을 부수기 위해 사람을 고용하지 않았습니다. 대신 로봇이 스스로 작업을 시도하도록 했습니다. 로봇이 필연적으로 실수를 할 때, 시스템은 그"오류"순간을 기록합니다. 수학 문제를 연습하는 학생과 같습니다. 정답을 틀렸을 때 그 실수를 기록해 다음에 배울 수 있도록 하는 것이죠. 이는 인간이 특정"실패 시나리오"를 수동으로 설계할 필요 없이 자동으로 발생합니다.

결과

팀원들은 단순한 쌓기 작업부터 복잡한 다단계 가사 작업에 이르기까지 다양한 작업을 수행하는 로봇들을 대상으로 이를 테스트했습니다.

  • 더 나은 복구: 일이 조금 잘못되었을 때, 기존 로봇들은 포기했던 반면 AFIL 로봇은 어떻게 고쳐야 할지 알았습니다.
  • 새로운 상황: AFIL 로봇은 이전에 본 적 없는 새로운 물체나 지저분한 테이블을 처리하는 데 훨씬 능했습니다.
  • 긴 작업: 작은 실수가 종종 전체 실패로 이어지는 길고 복잡한 작업에서 특히 뛰어났습니다.

요약하자면: AFIL 은 실패가 학습의 일부임을 로봇에게 가르칩니다. 무엇을 하지 말아야 하는지 보여주고 실수로부터 벗어나게 하는 똑똑하고 조절 가능한 방법을 제공함으로써, 로봇은 훨씬 더 신뢰할 수 있고 견고해지며 현실 세계의 지저분함에 대비할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →