← 최신 논문
🤖 AI

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

이 논문은 언어 명령에 운동학적 속성을 정밀하게 반영하여 로봇 조작의 정밀성과 제어 가능성을 향상시키기 위해, 목표 불변성과 운동학적 변이성을 분리하는 이계 (bi-level) 행동 표현 및 추론 토큰을 도입한 새로운 비전 - 언어 - 행동 모델인 KineVLA 를 제안합니다.

원저자: Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

게시일 2026-03-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 로봇이 인간의 말을 더 정교하게 이해하고, 원하는 대로 정확하게 움직이게 만드는 새로운 기술 'KineVLA'를 소개합니다.

기존의 로봇 기술이 "상자를 치워"라고 하면 대충 상자를 옮기는 데 그쳤다면, 이 기술은 "상자를 잡을 때는 손가락 끝으로, 이동할 때는 왼쪽으로 살짝 비스듬히, 그리고 상자를 내려놓을 때는 라벨이 정면을 보게" 처럼 아주 디테일한 지시까지 완벽하게 수행합니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제점: "대충"만 아는 로봇들

지금까지의 로봇 (기존 VLA 모델) 은 마치 요리 초보와 같습니다.

  • 사용자: "이 와인병을 서랍에 넣어줘."
  • 로봇: "네!" (와인병을 서랍에 넣음)
  • 하지만: 와인병의 라벨이 뒤집혀 있든, 옆으로 누워 있든, 서랍 깊숙이 있든 상관없이 그냥 넣습니다.

사용자가 "라벨이 앞을 보게 넣어줘"라고 해도, 로봇은 "아, 서랍에 넣는 거구나"라고만 생각하고 라벨 방향은 무시합니다. 기존 로봇들은 **'무엇을 할지 (목표)'**는 잘 알지만, **'어떻게 할지 (구체적인 동작)'**는 잘 모릅니다.

2. 해결책: KineVLA (운동 감각을 아는 로봇)

이 논문에서 만든 KineVLA는 마치 숙련된 미술품 운송 전문가나 정교한 요리사처럼 행동합니다.

  • 사용자: "와인병을 서랍에 넣되, 라벨이 오른쪽을 보게, 그리고 병목 부분을 잡아서 천천히 밀어 넣어줘."
  • KineVLA: "네, 알겠습니다. 라벨이 오른쪽을 보게 회전시키고, 병목을 잡고 서랍 깊숙이 밀어 넣겠습니다."

이 로봇은 언어 명령에 숨겨진 방향, 각도, 속도, 접촉 부위 같은 미세한 움직임 (운동학) 까지 모두 이해합니다.

3. 어떻게 그렇게 똑똑해졌을까? (핵심 기술 3 가지)

이 로봇의 두뇌는 세 가지 특별한 장치를 통해 작동합니다.

① '이중 레이어' 지도 (Bi-Level Action Decomposition)

기존 로봇은 하나의 지도만 보고 움직였는데, KineVLA 는 두 개의 지도를 동시에 봅니다.

  • 1 층 지도 (목표): "서랍에 넣어야 해." (큰 그림)
  • 2 층 지도 (세부 동작): "라벨을 오른쪽으로 돌려야 해, 병목을 잡아야 해." (디테일)

이 두 지도를 분리해서 생각하기 때문에, 로봇은 "서랍에 넣는 것"이라는 목표는 유지하면서도, "라벨 방향"이라는 세부 지시사항에 따라 움직임을 자유롭게 바꿀 수 있습니다. 마치 레고 블록을 조립할 때, '완성된 성'이라는 목표는 같지만, '벽돌을 쌓는 순서와 방향'을 사용자의 지시에 따라 정밀하게 조절하는 것과 같습니다.

② '생각하는 과정'을 말로 하는 것 (Bi-Level Reasoning Tokens)

로봇이 바로 손발을 움직이기 전에, 스스로에게 설명하는 시간을 가집니다.

  • 생각 1 (목표): "와인병을 서랍에 넣어야지."
  • 생각 2 (세부): "아, 그런데 라벨이 오른쪽을 봐야 하니까 먼저 병을 돌려야겠네. 그리고 병목을 잡아야 잡기가 편하겠지."

이렇게 생각을 먼저 정리하고 (Chain of Thought) 행동을 하므로, 로봇이 엉뚱한 방향으로 움직이는 실수를 줄일 수 있습니다. 마치 요리사가 "먼저 양파를 다지고, 그다음에 기름을 두르고..."라고 머릿속으로 시나리오를 짜고 요리를 시작하는 것과 같습니다.

③ '생각'과 '행동'의 동기 부여 (Mutual Information)

로봇이 "생각한 내용"과 "실제 행동"이 일치하도록 훈련시킵니다.
만약 로봇이 "라벨을 오른쪽으로 돌려야 해"라고 생각했는데, 실제로는 왼쪽으로 돌렸다면, 이 두 가지가 서로 맞지 않는다는 것을 감지하고 스스로 고쳐 학습합니다. 이는 연극 배우가 대본 (생각) 과 실제 연기 (행동) 가 완벽하게 일치하도록 연습하는 과정과 같습니다.

4. 실제 효과

이 기술을 적용한 로봇은 시뮬레이션과 실제 로봇 팔 (Realman-75) 실험에서 기존 모델보다 훨씬 뛰어난 성과를 보였습니다.

  • 정밀도: 와인병 라벨 방향, 서랍 여는 정도, 접시 이동 경로 등 아주 미세한 지시도 정확히 따릅니다.
  • 유연성: 같은 "상자 옮기기"라는 목표라도, 사용자의 지시에 따라 다양한 방식으로 움직일 수 있습니다.

요약

KineVLA는 로봇에게 "무엇을 할지" 뿐만 아니라 **"어떻게, 어떤 자세로, 어떤 순서로 할지"**까지 세심하게 가르친 기술입니다.

앞으로 이 기술이 상용화되면, 로봇은 단순히 물건을 옮기는 도구를 넘어, **"내 말대로 정교하게 움직여주는 똑똑한 비서"**가 될 것입니다. "화분 왼쪽에 살짝 기울여서 놓아줘" 같은 복잡한 주문도 척척 해내는 날이 머지않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →