← 최신 논문
🤖 AI

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

FoMoVLA는 미래 특징 예측(future feature foresight)과 희소 2D 포인트 트래킹(sparse 2D point tracking)을 결합하여 학습함으로써 목표 예측과 연속적 동작 가이드 사이의 간극을 메우고, 여러 로봇 벤치마크에서 최첨단 성능과 강력한 제로샷 일반화 능력을 달성하는 새로운 시각-언어-행동(Vision-Language-Action) 모델 프레임워크입니다.

원저자: Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 샌드위치 만드는 법을 가르치고 있다고 상상해 보세요. 당신은 재료 사진을 보여주며 "터키 클럽 샌드위치를 만들어 줘"라고 말합니다. 일반적인 로봇의 두뇌는 사진을 보고, 다음 동작을 추측하고, 빵을 집어 들며, 운 좋게 잘 되기를 바랄 것입니다. 이것은 마치 지금 일어나는 일에만 반응하는 '뜨거워 혹은 차가워(hot or cold)' 게임을 하는 것과 같습니다. 하지만 실제 삶은 슬라이드 쇼가 아니라 영화입니다. 복잡한 과업을 수행하려면 미래를 상상해야 합니다. "지금 터키를 집으면 빵이 미끄러질 것이고, 나는 그것을 잡아야 한다"라고 말이죠. 이것이 바로 시각-언어-행동(Vision-Language-Action, VLA) 모델의 과제입니다. 이들은 로봇이 보는 것과 듣는 것을 물리적인 움직임으로 바꾸려고 노력하는 똑똑한 두뇌들입니다. 과학자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 로봇이 단순히 반응하는 것을 넘어, 예견하게 만들 수 있을까? 어떻게 하면 로봇이 물체가 어디로 가야 하는지뿐만 아니라, 그곳에 어떻게 도달하는지 이해하게 할 수 있을까?

여기, 로봇의 두뇌를 위한 "수정구슬" 역할을 하는 새로운 프레임워크인 FoMoVLA가 등장했습니다. 연구자들은 기존 방식들이 퍼즐의 중요한 조각을 놓치고 있다고 주장합니다. 어떤 방식들은 전체 미래의 이미지를 픽셀 단위로 예측하려고 하는데, 이는 폭풍 속에서 모든 빗방울을 예측하려는 것과 같습니다. 데이터가 너무 많고 너무 느립니다. 또 다른 방식들은 "샌드위치가 접시 위에 있을 것이다"라고 말하는 것처럼 최종 목적지만을 추측하지만, 그곳에 도달하기까지의 복잡한 여정은 잊어버립니다. FoMoVLA는 로봇에게 두 가지 상호 보완적인 기술을 동시에 가르침으로써 이 문제를 해결합니다: 시각적 예견(Visual Foresight)(장면의 최종 상태를 상상하는 것)과 모션 가이드(Motion Guidance)(물체가 그곳에 도달하기 위해 취하는 구체적인 경로를 추적하는 것)입니다. 이것을 로봇에게 지도상의 목적지를 보는 법(예견)과 동시에 목적지까지 구불구불한 길을 따라 움직이는 GPS 점을 관찰하는 법(모션)을 가르치는 것에 비유할 수 있습니다. 이 둘을 결합함으로써, 로봇은 훨씬 더 명확하고 물리적인 움직임의 이해를 얻게 되며, 블록 쌓기나 물체 집기 같은 까다로운 작업에서 더 나은 성능을 발휘하면서도 실제 작업 시 로봇의 속도를 늦추지 않습니다.

문제점: 미래를 보지 못하는 로봇들

오늘날 대부분의 로봇 두뇌는 매우 반응적입니다. 컵을 보면 잡고, 문을 보면 밉니다. 하지만 그들은 "만약 ~한다면?"이라는 질문에는 어려움을 겪습니다. 만약 로봇이 무거운 상자를 옮기려 한다면, 상자가 실제로 넘어지기 전에 상자가 기울어질 수 있다는 것을 알아야 합니다. 현재의 방식들은 이를 해결하기 위해 두 가지 중 하나를 시도합니다. 전체 미래의 비디오 프레임을 프레임 단위로 예측하거나(이는 계산량이 매우 많고 배경 벽과 같은 쓸모없는 정적 세부 사항들로 가득 차 있습니다), 혹은 단순히 최종 목표 상태만을 예측하는 것입니다(이는 로봇에게 어디로 가야 할지는 알려주지만, 어떻게 가야 하는지는 알려주지 않습니다).

이 논문의 저자들은 이 두 가지 접근 방식이 사실 서로 소개되어야 할 '베스트 프렌드'라고 제안합니다. 당신에게는 "목표"(최종 사진)와 "경로"(움직임)가 모두 필요합니다. 목표만 있다면 로봇은 여정의 물리 법칙을 알지 못합니다. 경로만 있다면, 로봇은 목적지 없이 길을 잃을 수 있습니다.

해결책: FoMoVLA의 두 갈래 접근 방식

FoMoVLA(Foresight and Motion VLA)는 로봇이 이 두 가지를 동시에 수행하도록 가르치는 훈련 프레임워크입니다. 이 방식은 로봇의 두뇌를 영구적으로 바꾸는 것이 아니라, 대신 로봇이 주된 임무인 움직임과 함께 두 가지를 추가로 배우는 특별한 "훈련 모드"를 더합니다.

  1. 수정구슬 (미래 특징 예측): 로봇은 과업을 마친 후 장면이 어떻게 보일지 상상하도록 배웁니다. 전체 미래 이미지를 다시 그리는 대신(이는 어렵습니다), 미래 상태의 "분위기"나 핵심 특징들을 예측하는 법을 배웁니다. 이는 퍼즐을 보고 모든 조각을 다 그리지 않고도 최종 그림이 어떤 모습일지 예측하는 것과 같습니다.
  2. GPS 트래커 (희소 지점 추적): 동시에, 로봇은 물체가 움직임에 따라 특정 점들을 추적하는 법을 배웁니다. 컵 위에 작은 스티커를 붙이고 그것이 테이블 위를 미끄러져 가는 것을 지켜본다고 상상해 보세요. 로봇은 다음 몇 초 동안 그 스티커가 정확히 어디에 있을지 예측하는 법을 배웁니다. 이는 로봇에게 움직임의 "방법", 즉 연속적인 동작의 흐름을 가르쳐 줍니다.

핵심 비결: 점들을 연결하기

진정한 마법은 이 두 기술이 서로 소통하는 방식에서 일어납니다. 많은 이전의 시도에서 로봇들은 이 기술들을 서로 다른 방에서 공부하는 학생들처럼 따로 학습했습니다. FoMoVLA는 FCCA(Future-Conditioned Cross-Attention)라고 불리는 특별한 모듈을 사용하여 이들이 협력하도록 강제합니다.

작동 방식은 다음과 같습니다: "수정구슬"(미래 예측)이 "GPS 트래커"(모션 예측)에게 목적지가 어떤 모습인지 알려줍니다. 그러면 트래커는 그 정보를 사용하여 목적지에 도달하기 위한 최선의 경로를 찾아냅니다. 이는 목적지(예견)를 아는 운전자가 단순히 어디로 꺾어야 할지 추측만 하는 운전자보다 훨씬 더 잘 항해할 수 있는 것과 같습니다. 논문은 이 두 가지가 연결되었을 때 로봇의 예측이 훨씬 더 정확하고 일관되게 된다는 것을 보여줍니다.

결과: 더 똑똑한 로봇, 추가 비용 없음

연구진은 블록 쌓기나 물체 이동과 같은 도전적인 로봇 과업들을 포함하는 LIBERO 제품군(LIBERO suite)과 휴머노이드 로봇이 있는 가정 환경을 시뮬레이션한 RoboCasa 데이터셋에서 FoMoVLA를 테스트했습니다.

  • 성능: FoMoVLA는 최고 수준의 결과를 달이트하며 다른 최상위 로봇 모델들을 능가했습니다. 예를 들어, 여러 단계를 앞서 계획해야 하는 LIBERO의 "Long" 호라이즌 과업에서 FoMoVLA는 **97.6%**의 성공률에 도달하여 이전 방식들을 크게 앞질렀습니다.
  • 제로샷 일반화 (Zero-Shot Generalization): 로봇이 한 번도 본 적 없는 완전히 새로운 상황(예: 다른 조명이나 카메라 각도)에서 테스트되었을 때도, 여전히 매우 뛰어난 성능을 보이며 LIBERO-Plus 벤치마크에서 **80.5%**의 성공률을 달성했습니다.
  • 효율성: 가장 좋은 점은 무엇일까요? 이 모든 추가적인 "사고"는 오직 훈련 중에만 일s어납니다. 로봇이 실제 세계에서 작업할 때는 수정구슬이나 GPS 트래커를 실행할 필요가 없습니다. 그저 흡수한 지식을 사용할 뿐입니다. 이는 로봇이 이전과 똑같이 빠르게 작동하며, 메모리나 시간 비용이 거의 추가되지 않음을 의미합니다(지연 시간을 약 9.4 ms만 추가함).

이 논문이 배제한 것

저자들은 무엇이 효과가 없는지도 신중하게 지적합니다. 그들은 단순히 미래의 픽셀(전체 이미지)을 예측하는 것이 너무 지저분하고 중복된다는 것을 발견했습니다. 또한, 미래를 예측하고 움직임을 추적하는 것을 서로 대화하게 하지 않고 별도로 가르치면, 결과가 아무것도 하지 않는 것보다 약간 더 나은 수준에 그친다는 것도 발견했습니다. 시너지, 즉 "무엇"과 "어떻게" 사이의 대화가 차이를 만드는 핵심입니다.

요점

FoMoVLA는 진정으로 유능한 로봇을 구축하려면 미래를 상상하는 것과 움직임 경로를 이해하는 것을 동시에 가르쳐야 한다는 점을 시사합니다. "목표 지향적" 관점과 "모션 지향적" 관점을 결합함으로써, 로봇은 세상을 훨씬 더 자연스럽고 신뢰성 있게 조작하는 법을 배울 수 있습니다. 현재 시스템은 여전히 2D 추적에 의존하며 3D 기하학을 완전히 이해하지는 못하지만, 이는 로봇이 단순히 반응하는 것을 넘어 진정으로 예측하게 만드는 데 있어 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →