← 최신 논문
💻 computer science

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA는 로봇 조작 작업에서 높은 추론 속도와 강력한 시간적 일관성을 모두 달성하기 위해 자기회귀 블록 생성과 마스크 기반 이산 확산을 결합한 새로운 이산 시각-언어-행동(Vision-Language-Action) 프레임워크입니다.

원저자: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 샌드위치를 만드는 것과 같은 복잡한 식사 준비 과정을 가르치고 있다고 상상해 보세요. 로봇은 재료를 보고(시각), 당신의 음성 명령을 이해하고(언어), 팔을 움직여 빵을 집고, 피넛 버터를 바르고, 젤리를 올리는 동작(행동)을 수행해야 합니다.

이 논문은 로봇에게 이러한 방법을 가르치는 새로운 방식인 TBD-VLA를 소개합니다. 이것이 왜 특별한지 이해하기 위해, 로봇이 보통 어떻게 학습하는지와 이 새로운 방식이 어떻게 작동하는지를 비교해 보겠습니다.

기존 방식: 느리고 한 단계씩 진행하는 로봇

현재 대부분의 로봇은 사람이 문장을 쓸 때 한 글자씩 써 내려가는 것과 같이 생각합니다. 첫 번째 움직임을 결정하고, 그다음 두 번째, 그다음 세 번째를 결정하는 식입니다.

  • 문제점: 이는 매우 느립니다. 만약 로봇이 컵을 집기 위해 100번의 미세한 움직임을 계획해야 한다면, 로봇은 100번을 연속해서 "생각"해야 합니다. 생각을 마칠 때쯤이면 컵은 이미 움직였거나, 로봇이 실시간으로 반응하기에는 너무 느려진 상태일 것입니다.
  • 대안: 일부 연구자들은 속도를 높이기 위해 로봇이 "덩어리(chunks)" 단위로 생각하도록 시도했습니다(마치 단어 하나를 통째로 쓰는 것처럼). 하지만 이는 종종 로봇을 서투르게 만들었습니다. 시간이 흐름에 따라 움직임들이 서로 어떻게 연결되는지 잊어버리기 때문입니다. 이는 마치 문장은 빠르게 쓰지만 문법은 엉망인 문장을 쓰는 것과 같습니다.

새로운 방식: TBD-VLA ("블록 확산" 셰프)

저자들은 이 두 가지의 장점을 결합한 시스템을 만들었습니다. 이를 **Temporal Block Diffusion(시계열 블록 확산)**이라고 부릅니다. 작동 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. "블록" 전략 (레시피 카드)
로봇은 모든 손가락의 미세한 움직임을 개별적으로 생각하는 대신, 작업을 블록(레시피의 페이지와 같은 것) 단위로 나눕니다.

  • 블록 사이: 로봇은 블록을 하나씩(페이지 1, 그다음 페이지 2) 생각합니다. 이를 통해 이야기가 말이 되고 단계가 논리적인 순서를 따르도록 보장합니다.
  • 블록 내부: 일단 "페이지 1"에 대해 작업하기로 결정하면, 그 페이지에 있는 모든 움직임을 동시에 계산합니다.

2. "확산(Diffusion)" 전략 (지우개와 연필)
로봇은 어떻게 블록 내부의 움직임을 그렇게 빠르게 찾아낼까요? 이 모델은 이산 확산(Discrete Diffusion) 기술을 사용합니다.

  • 로봇이 모든 지침이 숨겨진(마스킹된) 빈 종이에서 시작한다고 상상해 보세요.
  • 로봇은 한 번에 모든 움직임에 대해 "추측"을 합니다.
  • 그런 다음, 자신의 추측을 살펴보고 어떤 부분이 틀렸는지 확인한 뒤, 좋은 추측은 남겨두고 잘못된 추측은 "지웁니다".
  • 이 과정을 몇 번 반복하여, 전체 블록의 그림이 명확해질 때까지 전체를 동시에 정교하게 다듬습니다.

결과: 로봇은 모든 단계를 순차적으로 생각할 필요가 없기 때문에 빠르게 움직입니다. 그룹 단위로 생각하며, 전체 그룹을 한꺼번에 정교하게 다듬습니다.

"실시간 청킹(Real-Time Chunkinging)"이라는 초능력

이 논문은 **실시간 청킹(RTC)**이라는 멋진 기능을 강조합니다.

  • 시나리오: 로봇이 현재 우유를 붓고 있는 상황(동작 A)을 가정해 봅시다. 이 과정 중에 로봇은 다음에 무엇을 할지(동작 B) 생각하기 시작해야 합니다.
  • 문제점: 보통 로봇은 동작 A가 100% 완료될 때까지 기다린 후에야 동작 B를 생각할 수 있습니다. 이로 인해 "지연(lag)"이 발생합니다.
  • TBD-VLA의 해결책: 이 모델은 "빈칸 채우기"(인페인팅 과정)를 하도록 훈련되었기 때문에, 현재 수행 중인 동작을 보면서 "나는 지금 무엇을 하고 있는지 알고 있으니, 현재 작업을 하는 동안에도 다음에 올 동작을 추측하기 시작할 수 있다"라고 말할 수 있습니다.
  • 비유: 이는 음악가와 같습니다. 음악가는 곡이 완전히 끝나기를 기다렸다가 다음 음을 생각하는 것이 아니라, 손가락이 현재의 음을 연주하고 있는 동안에도 이미 다음 구절을 흥얼거리고 있습니다. 이 덕분에 로봇은 훨씬 더 빠르고 기민하게 반응할 수 있습니다.

무엇을 증명했는가?

연구진은 이 로봇 두뇌를 두 가지 방식으로 테스트했습니다.

  1. 시뮬레이션 환경: 로봇을 다양한 작업(블록 쌓기나 물체 이동 등)이 있는 가상 세계에 배치했습니다. TBD-VLA는 조명 변화나 카메라 각도 변화로 인해 로봇이 "주의가 산만해진" 상황에서도 이전 방식들보다 더 빠르고 성공적으로 임무를 수행했습니다.
  2. 실제 환경: 실제 로봇 팔(Franka Research 3)을 사용하여 빵을 토스터기에 넣거나 액체를 옮기는 것과 같은 테이블탑 작업을 테스트했습니다.
    • 결과: TBD-VLA는 어렵고 변화가 많은 실제 상황에서 약 **67%**의 성공률을 보인 반면, 이전의 가장 뛰어난 방식은 약 **50%**의 성공률을 보였습니다.
    • 속도: 또한 의사결정 시간이 0.1초 미만이 걸릴 정도로 현저히 빨랐으며, 이는 실시간 제어를 하기에 충분한 속도입니다.

요약

TBD-VLA는 로봇이 움직임을 계획하는 새로운 방식입니다. 한 단계씩 느리게 생각하는 대신, 단계의 묶음(그룹) 단위로 생각하며 이를 한꺼번에 정교하게 다듬습니다. 이를 통해 로봇은 똑똑하게(사건의 순서를 이해함) 작동하면서도 빠르게(실시간으로 반응함) 움직일 수 있으며, 실제 세상에서 복잡한 작업을 훨씬 더 잘 수행할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →