← 최신 논문
💻 computer science

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI는 인지-실행 불일치를 해결하기 위한 예견 정렬 기반의 미래 교정 모듈을 신뢰도 기반 스케줄링 및 반응 시간과 지연 시간을 최소화하기 위한 시스템 수준 최적화와 결합함으로써, Jetson Orin과 같은 저전력 온보드 장치에서 시각-언어-행동 모델을 실시간 제어로 배포할 수 있게 하는 혁신적인 프레임워크이다.

원저자: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 셔츠를 접거나 그릇을 집는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 뇌(초지능형 AI 모델)를 부여합니다. 이 뇌는 사진을 보고 "검은색 그릇을 집어라"와 같은 명령을 이해한 뒤 로봇 팔에 무엇을 할지 알려줍니다. 이것을 시각-언어-행동(Vision-Language-Action, VLA) 모델이라고 부릅니다.

문제는 무엇일까요? 이 뇌들은 거대하고 에너지를 많이 소비한다는 점입니다. 만약 이 모델을 로봇 자체의 온보드 컴퓨터(데스크탑에 비해 강력하지만 아주 작은 Jetson Orin 같은 장치)에서 실행하려고 하면, 로봇은 "생각 모드"에 빠져 멈춰버리게 됩니다. 다음 동작을 계산하는 데 시간이 너무 오래 걸려서, 로봇이 실제로 움직일 때쯤이면 세상은 이미 변해 있습니다. 마치 1초 전의 공 위치를 보여주는 안경을 쓰고 공을 잡으려는 것과 같습니다. 결국 로봇은 놓치고 맙니다.

핵심 아이디어: "선견지명(Foresight)"과 "비동기(Async)"
이 논문의 저자들은 Jetson-PI라는 방법을 통해, 거대하고 전력을 많이 소모하는 슈퍼컴퓨터 없이도 로봇이 더 빠르게 생각하고 더 똑똑하게 움직일 수 있는 영리한 방법을 고안했습니다. 그들은 이를 Jetson-PI라고 부릅니다.

저자들은 다음 두 가지 주요 문제점을 해결했습니다.

1. "시간 여행" 해결법 (정렬 불일치 문제 해결)

문제점: 기존 방식에서는 로봇이 사진을 보고 한참 동안 생각합니다(예: 1.4초). 하지만 그 1.4초 사이에 로봇은 무언가에 부딪혔거나 물체가 움직였을 수도 있습니다. 즉, 로봇은 "과거의 뉴스"를 바탕으로 행동하고 있는 것입니다.

해결책: 단순히 기다리는 대신, Jetson-PI는 "선견지명 정렬(Foresight-Aligned)" 기법을 사용합니다. 로봇이 마치 작고 매우 빠른 수정구슬(경량화된 미래 보정 모듈)을 가진 것처럼 상상해 보세요.

  • 로봇은 동작을 확정합니다 (예: "그릇을 향해 손을 뻗는다").
  • 수정구슬은 그 동작이 끝난 후의 세상이 어떤 모습일지 즉시 예측합니다.
  • 로봇은 이 "미래의 모습"을 사용하여 다음 동작을 계획합니다.

이는 체스 선수가 현재의 판만 보는 것이 아니라, 상대방의 다음 수 이후의 판을 즉시 시각화하여 자신의 다음 수를 완벽하게 계획하는 것과 같습니다. 이를 통해 로봇이 오래된 정보에 기반해 행동하는 것을 방지합니다.

2. "스마트 스킵(Smart Skip)" 해결법 (느린 반응 속도 문제 해결)

문제점: 수정구슬이 있더라도 로봇은 가끔 실제 세상을 확인해야 합니다. 하지만 "큰 뇌"(VLM)를 사용하는 것은 느리기 때문에, 매번 세상을 확인하면 로봇의 움직임이 너무 느려집니다.

해결책: 저자들은 "신뢰도 기반 스케줄러(Confidence-Based Scheduler)"를 도입했습니다.

  • 수정구슬(미래 모듈)에는 "신뢰도 측정기"가 있습니다. 이 측정기는 "나는 다음에 무슨 일이 일어날지 90% 확신해!"라고 말합니다.
  • 신뢰도가 높으면, 로봇은 무거운 뇌의 확인 과정을 건너뛰고(skip) 수정구슬만을 이용해 계속 움직입니다. 이는 익숙한 길을 운전할 때 매 초마다 GPS를 확인할 필요가 없는 것과 같습니다.
  • 만약 신뢰도가 떨어지면(예: 로봇이 까다로운 물체를 집는 중일 때), 스케줄러는 "잠깐 멈춰! 안전을 위해 큰 뇌로 실제 세상을 확인하자"라고 명령합니다.

즉, 로봇은 반드시 필요할 때만 무거운 작업을 수행하므로 훨씬 더 민첩하게 움직일 수 있습니다.

3. "시스템 업그레이드" (엔진 가속화)

저자들은 또한 로봇에서 실행되는 소프트웨어가 비효율적이라는 점을 깨달았습니다. 그들은 로봇의 컴퓨터를 바쁜 주방처럼 다루었습니다.

  • 오븐을 다시 만들지 않기: 요리법(연산 그래프)을 매번 다시 만드는 대신, 한 번 만들어둔 것을 재사용했습니다.
  • 냉장고까지 걸어가지 않기: 모든 재료(데이터)를 조리대 위(GPU 메모리)에 두어, 요리사가 냉장고(CPU 메모리)를 왔다 갔다 할 필요가 없게 했습니다.
  • 단계 펼치기: 여러 개의 작은 단계들을 하나의 크고 매끄러운 동작으로 결합했습니다.

결과: 효과가 있는가?

저자들은 시뮬레이션과 실제 로봇을 통해 이를 테스트했습니다.

  • 속도: Jetson Orin에서, 이들의 방식은 표준 PyTorch를 사용할 때보다 제어 빈도를 8.66배 더 빠르게 만들었으며, vla.cpp라는 도구보다 5.41배 더 빠르게 만들었습니다.
  • 성공률: 로봇 작업 벤치마크인 LIBERO 테스트에서, 이 로봇은 이전의 최고 방법론인 VLASH보다 14.8% 더 자주 성공했습니다.
  • 배터리: 이들은 강력한 데스크탑 그래픽 카드(RTX 4090)를 사용하면 로봇의 배터리가 온보드 Jetson Orin을 사용할 때보다 6.0배 더 빨리 소모된다는 것을 보여주었습니다. Jetson-PI는 로봇이 자체 배터리로 훨씬 더 오래 작동할 수 있게 해줍니다.

저자들이 명시적으로 실패했다고 밝힌 부분
저자들은 몇 가지 아이디어를 테스트하여 제외했습니다.

  • 병렬 처리: 시간을 아끼기 위해 "큰 뇌"와 "행동 전문가"를 동시에 실행하는 것을 시도했습니다. 그 결과, 소형 온보드 컴퓨터에서는 두 프로세스가 제한된 데이터 대역폭을 두고 서로 싸우기 때문에 오히려 모든 것을 느리게 만든다는 것을 발견했습니다. 이는 거대한 데스크탑 컴퓨터에서만 작동합니다.
  • 단순히 로봇 상태만 예측하기: 이전 방식들은 로봇의 팔이 미래에 어디에 있을지를 예측하려고 했습니다. 하지만 저자들은 이것만으로는 부족하다는 것을 발견했습니다. 왜냐로 환경(테이블, 물체 등)이 어떻게 변하는지는 고려하지 못하기 때문입니다. 로봇뿐만 아니라 환경을 예측해야 합니다.

얼마나 확신하는가?
논문은 측정된 수치에 대해 매우 자신감을 보입니다. 그들은 LIBERO 벤치마크에서 광범위한 시뮬레이션을 수행했고, 실험실 환경에서 실제 로봇(X2-W 등)을 테스트했습니다. 지연 시간(ms)과 성공률을 정확하게 측정했습니다. 그들은 자신들의 방법이 이동형 로봇에게는 엄청난 개선이지만, 향후 모델이 더 커질 경우 거대한 슈퍼컴퓨터 클러스터의 원초적인 성능에는 미치지 못할 수 있다는 점을 명확히 밝혔습니다. 하지만 자체 배터리로 움직여야 하는 로봇에게는, 이것이 실용적이고 작동 가능한 솔루션임을 제안합니다.

요약하자면, Jetson-PI는 로봇에게 "앞을 내다보고 생각하는 법"과 "안전할 때는 무거운 작업을 건너뛰는 법"을 가르쳐서, 슈퍼컴퓨터를 등에 업지 않고도 빠르고 똑똑하게 움직일 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →