LaST: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
LaST는 이중 시스템 혼합 트랜스포머(Mixture-of-Transformers) 아키텍처 내에서 토큰 효율적인 잠재적 시공간 연쇄 사고(latent Spatio-Temporal Chain-of-Thought)를 채택함으로써 명시적 언어 추론의 지연 및 표현 한계를 극복하고, 이를 통해 다양한 실제 조작 작업 전반에서 상당한 성공률 향상을 달성하는 로봇 비전-언어-행동 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 달걀을 요리하는 법을 가르치고 있다고 상상해 보세요. 당신은 이렇게 말합니다. "팬에서 달걀을 떠서 빵 위에 올려 놓으렴."
과거의 방식 (명시적 추론):
예전에는 이를 수행하기 위해 로봇이 동작을 취하기 전 멈춰 서서, 소리 내어 생각하고, 단계별 에세이를 작성해야 했습니다. 로봇은 아마 이렇게 말했을 것입니다. "먼저, 손을 아래로 내려야 합니다. 그다음, 팬을 기울여야 합니다. 그다음, 달걀을 떠야..."
로봇이 이 에세이를 쓰는 동안 달걀은 식어버리거나, 최악의 경우 팬이 뒤집힐 수도 있습니다. 이러한 "소리 내어 생각하기"는 너무 많은 시간(지연 시간)을 소모하여 로봇을 느리고 서투르게 만듭니다. 또한, 달걀이 미끄러지는 정확한 느낌이나 팬의 3D 형태처럼 말로 설명하기 어려운 것들도 존재합니다.
새로운 방식 (LaST0):
이 논문은 다르게 생각하는 로봇의 두뇌인 LaST0를 소개합니다. 에세이를 쓰는 대신, LaST0는 "조용하고 보이지 않는 사고 과정"(잠재적 시공간 연쇄 사고, Latent Spatio-Temporal Chain-of-Thought)을 사용합니다.
LaST0가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.
1. "무성 영화" vs "대본"
단순히 할 일을 설명하기 위해 단어를 생성하는 대신, LaST0는 미래의 **"내부적인 무성 영화"**를 생성합니다.
- 보는 것: 단순히 사진을 보는 것이 아니라, 달걀의 3D 형태, 팬의 질감, 그리고 로봇 자신의 팔이 느끼는 감각(고유 수용 감각)을 상상합니다.
- "잠재적(Latent)" 부분: 이러한 생각들은 읽을 수 있는 단어가 아니라, 압축된 고속 데이터 패킷입니다. 이는 긴 레시피 북을 읽는 것(느림)과 셰프의 근육 기억(빠르고 직관적임)의 차이와 같습니다. 이를 통해 로봇은 어휘력에 막히지 않고 상황의 물리 법칙을 "느낄" 수 있습니다.
2. "두뇌와 신체" 팀 (이중 시스템)
LaST0는 두뇌를 **"전략적 사령관"**과 **"반사적인 운동선수"**처럼 함께 협력하는 두 명의 전문 가로 나눕니다.
- 사령관 (느린 추론 전문가): 이 부분은 더 느린 속도로 작동합니다. 큰 그림을 보고, 미래의 몇 초를 상상하며, 계획을 세웁니다. "내가 팔을 이렇게 움직이면, 0.5초 후에 달걀은 어디에 있을까?"라고 묻습니다. 이는 몇 초마다 지도를 확인하는 것처럼 가끔씩 수행됩니다.
- 운동선수 (빠른 행동 전문가): 이 부분은 매우 빠릅니다. 큰 계획에 대해 고민하지 않습니다. 그저 사령관의 최신 업데이트를 관찰하며 주변 환경에 즉각적으로 반응합니다. 달걀이 떨어지기 전에 잡는 데 필요한 고속 움직임을 처리합니다.
마법 같은 연결: 이들은 "텔레파시 링크"(공유 주의 집중)를 공유합니다. 사령관은 운동선수에게 새로운 계획을 업데이트하고, 운동선수는 이를 즉시 실행합니다. 즉, 로봇은 현재의 움직임을 늦추지 않으면서도 미래에 대해 깊이 생각할 수 있습니다.
3. 왜 더 나은가?
- 속도: 문장을 쓰는 데 시간을 낭비하지 않기 때문에, LaST0는 "소리 내어 생각하는" 이전 방식보다 14배 더 빠릅니다. 인간처럼 실시간으로 반응할 수 있습니다.
- 물리 법칙의 이해: 단어로 설명할 수 없는 것들을 포착합니다. 텍스트가 아닌 내부 3D 모델을 통해 달걀의 "무게"와 "미끄러움"을 이해합니다.
- 일관성: 미래의 연속적인 "영화"를 상상하기 때문에, 동작이 부드럽고 연결됩니다. 로봇은 덜컥거리며 움직이지 않고 매끄럽게 흐릅로직처럼 움직입니다.
결과
연구진은 테이블 위의 간단한 기술부터 이동 로봇 및 정교한 손(사람의 손과 같은)을 사용하는 복잡한 작업에 이르기까지 10가지 실제 환경 작업에서 이 로봇을 테스트했습니다.
- 성공률: LaST0는 기존의 가장 뛰어난 로봇들보다 13%에서 14% 더 자주 성공했습니다.
- 장기 작업: 특히 달걀을 뜨고, 빵 위에 올리고, 이 과정을 반복하는 것과 같은 길고 복잡한 작업에서 다른 로봇들이 혼란을 느끼거나 실패하는 것과 달리 탁월한 성능을 보였습니다.
요약하자면:
LaST0는 자신에게 "말하기"를 멈추고 미래를 "느끼기" 시작한 로봇입니다. 3D 공간과 시간의 조용한 내부 시뮬레이션을 사용하고, 두뇌를 느린 계획가와 빠른 실행가로 나눔으로써, 이 로봇은 컴퓨터 매뉴얼을 읽으며 머뭇거리는 대신 인간과 같은 속도와 우아함으로 움직입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.