← 최신 논문
🤖 AI

FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence

FluxVLA 엔진은 이질적인 정책 구성 요소로부터 신뢰할 수 있는 실행에 이르기까지 재현 가능한 워크플로우를 가능하게 하기 위해 인터페이스를 표준화하고 데이터 생성, 학습, 시뮬레이션 및 실로봇 배포를 위한 도구들을 통합함으로써, 임바디드 인텔리전스(embodied intelligence)의 엔지니어링 병목 현상을 해결하는 개방형 설정 기반 플랫폼입니다.

원저자: Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhe
게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhen He, Zhen Fu, Yifan Wang, Zexin Zhang, Ang Gao, Haoyu Chen, Chengqi Shi, Hua Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 반복의 달인이었으며, 동일한 정밀 동작을 오류 없이 수천 번 수행할 수 있는 능력을 갖추어 왔습니다. 그러나 지저분한 주방을 탐색하거나, 음성 명령을 이해하거나, 새로운 물체에 적응해야 하는 상황에 직면하면 로봇은 종기에 비틀거리곤 합니다. 로봇이 스크립트를 따르는 수준에서 벗어나 진정으로 세상과 상호작용할 수 있는 단계로 나아가는 간극은 최근 몇 년 사이 새로운 세대의 인공지능 덕분에 좁혀졌습니다. 흔히 시각-언어-행동(vision-language-action) 모델이라 불리는 이 시스템들은 영상을 관찰하고 텍스트를 읽음으로써 학습하며, 자신이 보는 것과 듣는 것을 로봇이 수행해야 할 물리적 움직임과 직접 연결합니다. 이들은 단순히 물체를 인식하는 것이 아니라, 인간의 언어를 바탕으로 물체를 잡고, 들어 올리고, 배치하는 방법을 배웁니다. 하지만 이러한 유망한 컴퓨터 프로그램을 신뢰할 수 있는 작동 기계로 변환하는 것은 여전히 만만치 않은 공학적 과제로 남아 있습니다. 이러한 모델을 훈련시키는 소프트웨어는 로봇을 움직이는 하드웨어와는 다른 언어를 사용하는 경우가 많아, 새로운 실험을 할 때마다 데이터에서 행동으로 가는 전체 가교를 다시 구축해야 하는 파편화된 환경을 만들어냅니다.

연구팀은 이제 이 끊어진 다리를 수리하기 위해 설계된 종합적인 플랫폼을 구축했습니다. 그들은 이를 'FluxVLA 엔진'이라 부르며, 이는 체화된 지능(embodied intelligence)을 위한 보편적인 번역기이자 조립 라선 역할을 합니다. 연구팀은 새로운 유형의 로봇 두뇌를 발명하는 대신, 두뇌를 신체에 연결하는 인프라에 집중했습니다. 그들의 작업은 로봇 공학 연구의 구체적이고 좌절스러운 현실, 즉 모델을 훈련하는 데 사용되는 도구, 컴퓨터 시뮬레이션에서 이를 테스트하는 방법, 그리고 실제 로봇에서 실행하는 데 필요한 코드가 서로 호환되지 않는 문제를 해결합니다. 과학자가 시뮬레이션에서 블록을 분류하는 모델을 성공적으로 훈련시켰더라도, 몇 주간의 코드 재작성 없이는 해당 코드를 물리적 로봇으로 옮길 수 없다는 사실을 깨닫게 되는 상황 말입니다. FluxVLA는 원시 데이터부터 최종 움직임까지 모든 과정을 처리하는 단일화되고 표준화된 워크플로우를 생성함으로써, 시뮬레이션에서 학습된 내용이 실제 세계에서 실행되는 것과 정확히 일치하도록 보장하여 이 문제를 해결합니다.

이 플랫폼은 모든 구성 요소가 설계에 따라 맞물려 돌아가는 매우 조직화된 공장 바닥처럼 작동합니다. 연구자가 로봇을 훈련시키고자 할 때, 매번 새로운 카메라, 센서 또는 로봇 팔을 위해 맞춤형 코드를 작성할 필요가 없습니다. 대신, 작업, 데이터 및 모델을 설명하는 설정 파일을 사용합니다. 그러면 시스템은 필요한 부품들을 자동으로 조립하여, 원시 영상과 센서 판독값을 모델이 이해할 수 있는 형식으로 변转换하고, 모델의 예측을 로봇이 실행할 수 있는 명령으로 번역합니다. 이 과정은 로봇이 가상 환경에서 학습하든 물리적 작업장에서 움직이든 관계없이 일관되게 유지됩니다. 연구진은 한 번에 일련의 행동을 예측하는 방식과 움직임을 단계별로 생성하는 방식 등 기존의 다양한 로봇 학습법을 지원하도록 통합했습니다. 이러한 다양한 방식들이 시스템의 나머지 부분과 소통하는 방식을 표준화함으로써, FluxVLA는 과학자들이 전체 설정을 해체하지 않고도 하나의 학습 알고리즘을 다른 것으로 교체할 수 있게 해줍니다.

이 공학적 접근 방식의 효과를 입증하기 위해, 연구팀은 다양한 로봇 정책(policies)을 사용하여 여러 까다로운 벤치마크에서 플랫폼을 테스트했습니다. 물체를 이동시키거나 도구를 조작하는 일련의 시뮬레이션 작업에서, 시스템은 14가지 유형의 로봇 두뇌를 성공적으로 실행했습니다. 결과에 따르면, 이 모델들은 높은 성공률을 달-성했으며, 일부 모델은 블록 쌓기나 서랍 열기와 같은 작업에서 거의 99%의 정확도에 도달했습니다. 플랫폼은 단순한 시뮬레이션에 국한되지 않았습니다. 수건을 접거나 물체를 집어 올리는 테스트에서, 시스템은 테스트된 모델 중 하나에 대해 60% 이상의 성공률로 로봇을 안내했습니다. 이 수치들이 중요한 이유는 역대 최고 기록이기 때문이 아니라, 일반적인 성능 저하나 신뢰성 손실 없이 훈련에서 실제 실행으로의 전환을 처리하는 단일화된 시스템을 통해 달성되었기 때문입니다.

시스템의 성공에 있어 결정적인 부분은 로봇의 움직임 타이밍을 처리하는 방식에 있습니다. 로봇이 학습할 때, 종종 '액션 청킹(action chunking)'이라 알려진 기술을 사용하여 미래의 일련의 행동을 한꺼번에 예측합니다. 그러나 로봇이 다음 청크를 계산하는 데 너무 오래 걸리면 세상은 변해버리고, 이전의 예측은 쓸모없게 됩니다. FluxVLA 엔진은 로봇이 현재 실제로 무엇을 하고 있는지에 기반하여 다가올 움직임을 지속적으로 조정함으로써, 로봇의 동작을 부드럽고 연속적으로 유지하는 특화된 메커니즘을 포함하고 있습니다. 이를 통해 로봇이 덜컥거리거나 어색하게 멈추지 않고, 섬세한 작업에 필수적인 유연한 움직임을 유지할 수 있습니다. 또한 연구진은 컴퓨터의 사고 과정을 가속화하는 도구를 구축하여, 로봇이 이전보다 훨씬 빠르게 반응할 수 있도록 했으며, 이는 역동적인 환경과 상호작용하는 데 매우 중요합니다.

연구진은 자신들의 시스템이 성취한 것과 그렇지 않은 것을 명확히 구분하고자 주의를 기울였습니다. 그들은 로봇을 이전보다 더 똑똑하게 만드는 새로운 알고리즘을 발견했다고 주장하지 않았습니다. 대신, 로봇 학습의 병목 현상은 종종 모델의 지능이 아니라, 그것을 사용하기 위해 필요한 공학적 복잡성에 있다는 점을 입증했습니다. 데이터에서 배포까지의 안정적이고 재현 가능한 경로를 제공함으로써, 그들은 서로 다른 로봇 학습법이 공정하게 비교되고 신뢰할 수 있게 배포될 수 있음을 보여주었습니다. 이 시스템은 모든 로봇이 모든 작업에 성공할 것을 보장하지는 않지만, 실패가 발생했을 때 그것이 소프트웨어 연결의 결함이 아니라 로봇의 학습 능력 한계 때문임을 확실히 해줍니다. 이러한 명확성은 연구자들이 지원하는 기계 장치가 견고하다는 확신을 가진 상태에서, 실제 로봇의 지능을 개선하는 데 집중할 수 있게 해줍니다.

앞으로 연구팀은 이 플랫폼을 더 큰 생태계의 토대로 바라보고 있습니다. 그들은 향elle 개발이 모듈식으로 유지되어야 하며, 데이터 수집, 시뮬레이션, 평가를 담당하는 별도의 시스템들이 FluxVLA가 구축한 동일한 명확한 인터페이스를 통해 통신해야 한다고 제안합니다. 이러한 접근 방식은 서로 다른 연구 그룹이 호환되지 않는 코드에 막히지 않고, 서로의 진전된 성과를 바탕으로 작업을 더 쉽게 공유할 수 있게 할 것입니다. 궁극적인 목표는 로봇이 실제 세계에서의 실수를 통해 배우고, 그 데이터를 다시 훈련 시스템으로 피드백하여 성능을 점진적으로 향상시키는 순환 구조를 만드는 것입니다. 이 조각들을 어떻게 연결할 것인가라는 공학적 퍼즐을 해결함으로써, FluxVLA 엔진은 차세대 로봇이 실험실을 넘어 인간 삶의 복잡하고 예측 불가능한 현실로 나아가는 데 필요한 인프라를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →