← 최신 논문
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

본 논문은 시간 역전파(backpropagation through time)나 추가적인 알고리즘 오버헤드 없이도 로봇 제어를 위한 표현력이 풍부한 플로우 매칭(flow-matching) 정책에 조밀한 가치 기반 가이던스(value-based guidance)를 통합하여, 다양한 보행 및 조작 작업에서 강력한 성능을 달성하는 확장 가능한 오프라인 강화 학습 프레임워크인 가치 유도 플로우 매칭(Value-Guided Flow Matching, VGFM)을 제안한다.

원저자: Prajwal Koirala, Mark Campbell

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Prajwal Koirala, Mark Campbell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 반복적이고 예측 가능한 작업의 달인이었지만, 현실 세계의 무질서하고 예측 불가능한 다양성을 다루도록 가르치는 것은 여전히 까다로운 과제로 남아 있습니다. 수년 동안 연구자들은 로봇에게 방대한 과거 움직임 라이브러리를 제공하여, 기계가 실제 세계에서 연습할 필요 없이 인간의 기술을 모방하는 법을 배울 수 있기를 바라며 이 문제를 해결하려 노력해 왔습니다. 오프라인 학습(offline learning)이라고 알려진 이 방식은 훈련을 위한 안전하고 효율적인 경로를 제공하지만, 로봇이 훈련 데이터와 약간이라도 다른 상황에 직면하면 한계에 부딪힙니다. 로봇은 여러 가지 유효한 움직임 방식 중 하나를 선택해야 하는 결정을 내려야 하는데, 이는 마치 복잡한 교차로에서 좌회전을 할지, 직진을 할지, 혹은 차량 사이를 빠져나갈지를 결정해야 하는 운전자와 같습니다. 전통적인 방식은 이러한 풍부한 선택의 다양성을 포착하는 데 어려움을 겪으며, 종종 로봇을 단 하나의 경직된 경로로 몰아넣어 조건이 변할 때 실패하게 만듭니다. 이러한 한계를 넘어서기 위해 과학자들은 단 하나의 행동이 아니라 가능한 행동의 넓은 스펙트럼을 상상할 수 있는 인공지능의 한 유형인 생성 모델(generative models)로 눈을 돌리고 있습니다.

핵심적인 어려움은 이러한 상상력 풍부한 모델이 단순히 창의적일 뿐만 아니라 똑똑하도록 가르치는 데 있습니다. 로봇은 자신이 상상한 많은 행동 중 어떤 것이 실제로 성공으로 이어질지를 알아야 합니다. 과거에는 로봇의 상상을 좋은 결과로 유도하기 위해 컴퓨터가 로봇의 사고 과정의 모든 단계를 역방서로 추적하여 어디서 잘못되었는지 확인해야 하는 계산 집약적인 과정이 필요했습니다. 이는 느리고 불안정했으며, 종-종 훈련 과정을 너무 복잡하게 만들어 규모를 키우는 것을 어렵게 만들었습니다. 코넬 대학교의 연구진은 이제 '가치 유도형 플로우 매칭(Value-Guided Flow Matching)'이라는 새로운 방법을 도입하여 이 병목 현상을 완전히 우회했습니다. 컴퓨터가 시간을 거슬러 올라가 모든 단계를 재추적하도록 강요하는 대신, 이 새로운 접근 방식은 로봇이 의사 결정 과정의 매 순간마다 가이드를 받을 수 있도록 하여, 심지어 중간 단계의 생각조차 성공적인 결과로 향하도록 보장합니다.

프라즈월 코이랄라(Prajwal Koirala)와 마크 캠벨(Mark Campbell)이 이끄는 연구팀은 로봇의 정책, 즉 움직임을 위한 전략이 일련의 끊어진 도약이 아닌 연속적인 흐름처럼 구축되도록 설계했습니다. 근원에서 목적지로 흐르는 강물을 상상해 보십시오. 로봇은 단순하고 무작위적인 움직임의 아이디어에서 시작하여 이를 구체적인 행동으로 점진적으로 형성해 나갑니다. 여기서의 혁신은 시스템이 마지막 단계뿐만 아니라 강의 경로를 따라 있는 모든 지점에서 행동의 품질을 확인한다는 점입니다. 각 중간 단계에서 움직임의 최종 목적지를 예측함으로써, 시스템은 전체 생성 과정을 되감지할 필요 없이 '가치(value)' 신호—해당 행동이 얼마나 좋은지를 나타내는 척도—를 적용할 수 있습니다. 이는 로봇이 시간을 거슬러 올라가는 무거운 계산 비용을 피하면서, 실시간으로 행동의 품질을 평가하는 비평가의 안내를 받으며 움직임을 지속적으로 정교화하는 법을 배울 수 있음을 의미합니다.

이 아이디어를 테스트하기 위해 연구진은 다양한 어려운 과제들을 포함하는 표준 벤치마크인 OGBench를 사용하여 엄격한 일련의 도전 과제를 수행했습니다. 이 과제들은 4족 보행 및 휴머노이드 로봇을 이용한 복잡한 미로 탐색부터 로봇 팔을 이용한 물체 조작까지 다양했습니다. 미로 시나리오에서 로봇은 굽이굽이 휘어진 통로를 통과해야 했고, 조작 과제에서는 큐브를 쌓거나 혼잡한 환경 내의 물체와 상호 작용해야 했습니다. 시스템은 과거 움직임의 정적 데이터셋으로 훈련되었는데, 이는 학습 단계에서 환경을 전혀 보지 못하고 기록된 데이터만을 보았음을 의미합니다. 결과는 놀라웠습니다. 이 새로운 방법은 거의 모든 다양한 과제에서 기존의 최선책들과 대등하거나 그 이상의 성능을 일관되게 보여주었습니다. AntMaze와 HumanoidMaze 환경에서 높은 성공률을 달ert했으며, 큐브 및 장면 조작에 필요한 정밀한 움직임에서도 탁월한 성과를 냈습니다.

이 접근 방식의 핵심적인 특징은 실제 사용 시의 유연성입니다. 시스템이 훈련된 후, 엔지니어들은 모델을 다시 훈련할 필요 없이 단일 행동을 생성하는 데 사용하는 컴퓨팅 파워를 조정할 수 있습니다. 연구진은 컴퓨터가 최종 움직임을 계산하는 단계 수를 늘리기만 하면 로봇이 더 정밀하고 복잡한 작업을 수행할 수 있다는 것을 발견했습니다. 이러한 속도와 정확도 사이의 절충은 로봇이 단순한 상황에서는 빠르게 움직여야 하고, 섬세한 상황에서는 정밀하게 움직이기 위해 속도를 늦춰야 하는 실제 응용 분야에서 매우 중요합니다. 연구는 이러한 확장성이 시간 측면에서 거의 추가 비용 없이 이루어지며, 결정의 순간에 더 많은 처리 능력을 사용함으로써 로봇이 더 표현력이 풍부하고 유능해질 수 있음을 보여주었습니다.

이 방법의 성공은 로봇 제어의 새로운 길을 제시하며, 이는 안전성과 데이터 효율성의 필요성과 복잡하고 적응 가능한 행동에 대한 요구 사이의 균형을 맞춥니다. 모든 단계를 역으로 추적하는 무거운 계산 부담을 제거함으로써, 연구진은 로봇이 이전에는 도달할 수 없었던 수준의 표현력을 가지고 길고 복잡한 일련의 행동을 처리할 수 있도록 만들었습니다. 이 시스템은 마법이나 지름길에 의존하지 않습니다. 단지 가이드가 어떻게 적용되는지를 재사고하여, 로봇이 의사 결정 여정 전체에 걸쳐 밀도 높은 피드백으로부터 배울 수 있도록 할 뿐입니다. 로봇 공학 분야가 구조화되지 않은 인간 환경에서 작동하는 기계로 계속 나아가면서, 이러한 방식은 로봇에게 가능성의 세계로부터 올바른 행동을 선택하는 미묘한 기술을 가르치는 확장 가능하고 효과적인 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →