← 최신 논문
💻 computer science

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

본 논문은 명시적 추론 방식에 비해 추론 지연 시간을 최대 90%까지 단축하여 효율적이고 실시간인 신체화된 제어를 달성하기 위해 다중 모달 체인 오브 씽킹 추론을 연속 잠재 표현에 내재화하는 통합 프레임워크인 잠재 추론 VLA(LaRA-VLA)를 제안합니다.

원저자: Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만드는 법을 가르친다고 상상해 보세요.

기존 방식 (명시적 사고 연쇄):
현재 대부분의 첨단 로봇 두뇌는 한 가지 행동을 취하기 전에 일기장에 모든 생각을 하나하나 적어내도록 강요받는 학생처럼 작동합니다.

  • 로봇이 보게 되는 것: "나는 샌드위치가 필요하다."
  • 로봇이 (소리 내어) 생각하는 것: "좋아, 먼저 빵을 찾아야 해. 왼쪽에 빵 한 덩어리가 보이네. 이제 칼을 잡아야 해. 오른쪽에 칼이 있군. 천천히 팔을 움직여야..."
  • 로봇이 행동하는 것: 이 전체 단락을 적어낸 후에야 비로소 팔을 움직입니다.

문제점: 이는 극도로 느립니다. 로봇이 '일기'를 끝까지 적어내는 순간, 샌드위치는 이미 식어버렸거나, 로봇은 빵을 잡을 기회를 놓쳤을 것입니다. 또한, 단어나 토큰과 같은 이산적인 언어로 작성하는 것은 팔을 매끄럽고 연속적인 곡선으로 움직여야 하는 로봇에게는 다소 어색합니다. 마치 1 인치씩만 점프하며 차를 운전하려는 것과 같습니다.

새로운 방식 (LaRA-VLA):
이 논문은 LaRA-VLA(잠재적 추론 VLA) 를 소개합니다. 이는 로봇에게 아무것도 적지 않고 머릿속으로 생각하도록 가르치는 것과 같습니다.

긴 문단 형태의 텍스트를 내뱉는 대신, 로봇은 그 추론을 간결하고 연속적인 '느낌'이나 '분위기'(잠재 표현) 로 내면화합니다.

  • 로봇이 보게 되는 것: "나는 샌드위치가 필요하다."
  • 로봇이 (조용히) 생각하는 것: 빵과 칼의 위치, 그리고 팔이 이동해야 할 경로를 즉시 처리하여 하나의 매끄러운 정신적 스냅샷으로 인식합니다.
  • 로봇이 행동하는 것: 즉시 움직입니다.

3 단계 훈련 캠프 (커리큘럼 학습)

이 논문은 로봇에게 바로 "조용히 생각하라"고 지시할 수 없다고 설명합니다. 로봇은 3 단계로 구성된 훈련 캠프가 필요합니다.

  1. 1 단계: "풀이 과정 보여주기" 단계.
    로봇은 자신의 생각 (텍스트) 을 적어내고 다음 이미지가 어떻게 보일지 (시각) 예측하도록 강요받습니다. "나는 컵을 왼쪽으로 이동시키고 있다"라고 명시적으로 말함으로써 게임의 규칙을 배웁니다.

  2. 2 단계: "속삭임" 단계.
    훈련자들은 로봇의 작성된 문장을 '속삭임'(잠재 토큰) 으로 대체하기 시작합니다. 처음에는 로봇이 문장의 절반은 쓰고 나머지는 속삭입니다. 서서히 적은 양을 쓰고 더 많이 속삭이게 됩니다. 복잡한 생각을 작고 효율적인 정신적 패키지로 압축하는 법을 배우는 것입니다.

  3. 3 단계: "침묵의 마스터" 단계.
    로봇은 더 이상 소리 내어 쓰거나 속삭이지 않습니다. 추론을 완전히 내면화했습니다. 장면을 바라보고 머릿속에서 '속삭임'을 처리한 후 즉시 행동을 실행합니다.

왜 이것이 더 나은가요?

  • 속도: 로봇이 일기장을 적는 시간을 낭비하지 않기 때문에 90% 더 빠르게 반응할 수 있습니다. 논문은 사고 시간이 7 초 이상에서 0.13 초(135 밀리초) 로 단축되었다고 주장합니다. 이는 실시간 제어가 가능할 정도로 빠른 속도입니다.
  • 매끄러움: 로봇이 '이산적인 단어' 대신 '연속적인 느낌'으로 생각하기 때문에 움직임이 더 매끄럽고 실제 물리적 세계가 작동하는 방식과 일치합니다.
  • 견고성: 논문은 흐릿하거나 노이즈가 있는 카메라 피드 (안개 낀 창문을 통해 보는 것과 같은 상황) 로 로봇을 테스트했습니다. '침묵의 사고자'(LaRA-VLA) 는 '일기 작성자'보다 훨씬 잘 대처했으며, 이는 그들의 내부 정신 모델이 더 안정적임을 시사합니다.

결과

테스트에서 이 새로운 방식은 거의 모든 최상위 로봇 모델들을 능가했습니다. 과일 분류나 그릇 쌓기와 같은 길고 복잡한 작업에서 더 뛰어났으며, 훨씬 더 빠르게 수행했습니다.

간단히 말해: LaRA-VLA 는 로봇이 작업을 수행할 때 '말하며' 진행하는 것을 멈추고 '느끼며' 진행하도록 가르쳐, 천재적인 기획자이면서 동시에 번개처럼 빠른 작업자가 되는 로봇을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →