← 최신 논문
💻 computer science

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

본 논문은 NVIDIA Jetson AGX Orin 기반의 온보드 항공 배포에 최적화된 경량 256M 파라미터 비전 - 언어 - 행동 모델인 LiteVLA-H 를 소개하며, 이는 전문적인 지식 보존 미세 조정 전략을 통해 빠른 반응적 안내 (50.65ms) 를 느린 의미적 내레이션과 분리함으로써 저지연 듀얼 레이트 추론을 달성합니다.

원저자: Justn williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Justn williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

드론을 조종하는 조종사로 상상해 보세요. 이 조종사는 동시에 두 가지 매우 다른 일을 수행해야 합니다:

  1. 즉각적으로 반응하여 나무나 건물에 충돌하지 않도록 피하는 것 (반사 작용과 같습니다).
  2. 주변에서 일어나는 일을 생각하고 설명하는 것, 예를 들어 지상 관제팀에게 "앞쪽에 빨간색 활주로를 보며 왼쪽에 위험 요소가 있습니다"라고 말하는 것 (대화와 같습니다).

오랫동안 단일 "두뇌"(AI 모델) 로 드론이 이 두 가지 일을 모두 하도록 만드는 것은 문제였습니다. AI 는 반응이 너무 느려서 충돌을 일으키거나, 장면을 이해하기에 너무 단순해서 드론이 세부 사항을 보지 못하게 만들었습니다.

이 논문은 이중 모드 조종사처럼 작동하도록 설계된 새로운 시스템인 LiteVLA-H를 소개하며 이를 해결합니다.

핵심 문제: "두뇌" 병목 현상

AI 모델을 주방의 요리사로 생각해 보세요.

  • 옛 방식: 요리사가 주문을 받을 때마다 매번 식료품 저장고로 가서 재료를 찾고, 다지고, 그 다음에 요리를 시작해야 합니다. 빠른 간식 (단일 동작) 이나 푸짐한 만찬 (긴 설명) 을 요청하든 상관없이, 요리사는 먼저 같은 긴 식료품 저장고까지의 길을 가야 합니다. 이 "식료품 저장고까지의 이동"을 논문에서는 pre-fill이라고 부릅니다. 이는 대부분의 시간을 차지합니다.
  • 문제점: 조종사가 나무를 피할 때마다 요리사가 푸짐한 만찬을 요리하려 한다면, 요리사가 양파를 다지는 데 너무 바빠서 조종사는 추락하게 됩니다.

해결책: "이중 속도" 스케줄러

LiteVLA-H 는 규칙을 바꿉니다. 드론에게 "식료품 저장고까지의 이동"(pre-fill) 이 느린 부분이지만, 재료를 꺼낸 후에는 계란 하나를 요리하는 것 (빠른 동작) 은 거의 순간적이라는 것을 인식합니다.

이 시스템은 작업을 두 개의 차선으로 나누는 스케줄러(교통 관리자) 를 사용합니다:

  1. 빠른 차선 (반응형 안내):

    • 하는 일: 드론이 장애물을 감지하면 AI 에게 "왼쪽으로 조종" 또는 "위로 상승" 같은 빠른 명령을 요청합니다.
    • 속도:초당 20 회(50 밀리초마다) 수행합니다.
    • 기법: AI 는 "left"와 같은 단일 단어인 작은 "액션 토큰"만 생성합니다. 완전한 문장을 작성할 때까지 기다리지 않습니다. "식료품 저장고까지의 이동"이 이미 완료되었기 때문에 이는 놀랍도록 빠르게 일어납니다.
  2. 느린 차선 (의미론적 지각):

    • 하는 일: 몇 초마다 AI 는 숨을 고르고 완전한 문장을 생성합니다: "왼쪽에 빨간 불이 있는 활주로를 향해 접근 중입니다."
    • 속도:초당 6 회(150 밀리초마다) 수행합니다.
    • 이점: 이는 빠른 차선을 늦추지 않으면서 인간 운영자나 드론의 로그에 세상의 풍부한 설명을 제공합니다.

실제 작동 중인 "주방" 비유

드론이 붐비는 도시를 비행한다고 상상해 보세요.

  • 빠른 차선은 조종사의 스틱에 있는 손과 같습니다. 새가 앞을 지나가면 조종사의 손은 즉시 움직입니다. AI 는 "위로!"라고 말하고 드론은 반응합니다.
  • 느린 차선은 조종사가 관제탑과 대화하는 것과 같습니다. "관제탑, 공사 구역을 보이며 우회하겠습니다."라고 말하려면 몇 초가 걸리지만, 안전과 인식에 중요합니다.

LiteVLA-H 는 둘 다 가질 수 있음을 증명합니다. 새를 피하기 위해 조종사가 대화를 멈추게 하지도, 이야기를 하기 위해 조종사가 피하기를 멈추게 하지도 않습니다.

AI 를 어떻게 가르쳤는지

AI 가 피하는 것만 배우면서 "멍청해지지" 않도록 하기 위해 연구자들은 특별한 학습 레시피를 사용했습니다.

  • 드론이 추락하고 피하는 영상만 AI 에게 보여준 것이 아닙니다.
  • 또한 일반적인 사진과 설명(예: "매트 위에 있는 고양이"라는 캡션이 달린 고양이 사진) 과 공중 설명(예: "안개가 낀 활주로") 도 보여주었습니다.
  • 이들을 혼합하여 AI 가 동시에 좋은 조종사이자 좋은 이야기꾼이 되도록 가르쳤습니다. 이를 "지식 보존"이라고 하는데, 비행하는 법을 배웠다고 해서 말하는 법을 잊지 않았다는 의미입니다.

결과

팀원들은 드론에 내장된 작은 컴퓨터 (NVIDIA Jetson AGX Orin) 에서 이를 테스트했습니다.

  • 속도: "빠른 차선"은 19.74Hz(거의 초당 20 회) 로 작동합니다. 이는 드론을 안정적이고 안전하게 유지하기에 충분히 빠릅니다.
  • 인식: "느린 차선"은 6.67Hz로 작동하여 일관된 설명 흐름을 제공합니다.
  • 비교: 다른 고급 AI 시스템과 비교했을 때, LiteVLA-H 는 순간적인 결정이 필요할 때마다 완전한 에세이를 쓰려 하지 않기 때문에 "피하기" 명령을 제공하는 속도가 훨씬 빨랐습니다.

결론

이 논문은 드론에게 첫 번째 반응의 속도가 가장 중요하다고 주장합니다. "설정 시간"(pre-fill) 이 가장 큰 지연이라는 점을 인식함으로써, 그들은 "반사 작용"과 "대화"를 분리하는 시스템을 구축했습니다. 이를 통해 작고 컴팩트한 AI 가 인간 운영자에게 세상을 설명할 수 있으면서도 드론을 안전하게 비행할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →