← 최신 논문
💻 computer science

From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models

본 논문은 비전-언어-행동 모델을 위한 이미지 기반 및 행동 기반 잠재 행동 감독 전략을 체계적으로 비교하여, 이미지 기반 방법이 장기적 추론을 강화하는 반면 행동 기반 방법은 운동 조정을 개선하며, 직접 토큰 감독이 전반적인 성능을 가장 우수하게 발휘함을 규명합니다.

원저자: Yihan Lin, Haoyang Li, Yang Li, Haitao Shen, Yihan Zhao, Chao Shao, Jing Zhang

게시일 2026-05-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yihan Lin, Haoyang Li, Yang Li, Haitao Shen, Yihan Zhao, Chao Shao, Jing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 집안일을 가르친다고 상상해 보세요. 당신은 사람들이 다양한 일을 하는 모습을 보여주는 방대한 비디오 라이브러리를 가지고 있습니다. 어떤 사람들은 그릇을 쌓고, 다른 사람들은 테이블을 닦으며, 어떤 사람들은 무거운 상자를 옮깁니다. 문제는 사람마다 움직임이 다르다는 점입니다. 한 사람은 손 전체로 컵을 잡고, 다른 사람은 손끝만으로 잡습니다. 한 로봇 팔은 짧고 통통하며, 다른 하나는 길고 가늘습니다.

만약 이 모든 다양한 비디오에서 로봇을 직접 가르치려 한다면, 로봇은 혼란에 빠집니다. 이는 서로 다른 사투리와 억양을 사용하는 화자들이 동시에 말을 할 때 언어를 배우려는 것과 같습니다. 로봇은 어떤 '움직임'이 올바른지 알 수 없습니다.

이 논문은 **잠재 행동 (Latent Actions)**이라는 교묘한 중개자를 소개합니다. 잠재 행동을 **보편적인 '안무 카드'**로 생각하세요. 로봇에게 근육의 정확한 움직임 (이는 극적으로 다양함) 을 가르치는 대신, 먼저 움직임의 '아이디어'를 인식하도록 가르칩니다.

연구자들은 "이러한 안무 카드를 사용하여 로봇을 가르치는 가장 좋은 방법은 무엇인가?"라고 질문했습니다. 그들은 통합된 로봇 두뇌 (시각 - 언어 - 행동 모델) 를 사용하여 네 가지 다른 교수법을 테스트했습니다. 그들이 발견한 바를 간단히 설명하면 다음과 같습니다:

1. 두 가지 유형의 '안무 카드'

이 논문은 이러한 카드를 두 가지 유형, 즉 두 가지 다른 지도 유형으로 나눕니다:

  • '사진 지도' (이미지 기반 잠재 행동):

    • 작동 방식: 이는 작업의 '전'과 '후' 사진을 살펴봅니다. "장면이 어떻게 보였으며, 지금은 어떻게 보이는가?"라고 묻습니다. 이는 특정 로봇 팔을 무시하고 시각적 변화에 집중합니다.
    • 가장 적합한 경우: 길고 복잡한 이야기. 로봇이 다단계 작업 (예: "그릇 세 개를 쌓은 다음 테이블을 닦으세요") 을 계획해야 할 때, 이러한 사진 지도는 놀라울 정도로 효과적입니다. 이는 만화책을 읽어서 이야기를 이해하는 것처럼 로봇이 큰 그림과 사건 순서를 이해하도록 돕습니다.
    • 결과: 로봇은 길고 다단계인 작업과 이전에 보지 못했던 지저분한 새로운 환경을 처리하는 데 훨씬 더 능숙해졌습니다.
  • '동작 지도' (행동 기반 잠재 행동):

    • 작동 방식: 이는 실제 물리적 움직임 (로봇의 관절과 모터) 을 살펴보고 이를 간단한 기호 목록 (토큰) 으로 변환합니다. 마치 복잡한 춤을 간단한 "왼쪽, 오른쪽, 점프" 코드로 변환하는 것과 같습니다.
    • 가장 적합한 경우: 미묘한 물리적 움직임. 정밀하고 조율된 근육 제어가 필요한 작업 (예: 미끄러운 병을 잡기 위해 두 팔을 동시에 움직이는 것) 이 필요할 때, 이러한 동작 지도가 더 우수합니다. 이는 로봇이 움직임의 '느낌'을 배우도록 돕습니다.
    • 결과: 로봇은 복잡하고 조율된 물리적 작업의 대가가 되었습니다.

2. 네 가지 교수법

연구자들은 이러한 카드를 로봇의 두뇌에 보여주는 네 가지 방법을 테스트했습니다:

  1. '속삭임' (암시적 정렬): 교사는 로봇의 두뇌에 힌트를 속삭여, 명시적으로 "이것을 하라"고 말하지 않고도 로봇의 내부 사고를 안무 카드와 정렬시키려 합니다.
    • 판단: 약간 도움이 되었지만 다소 모호했습니다.
  2. '직접 명령' (명시적 직접 디코딩): 교사는 "먼저 안무 카드 (계획) 를 생각한 다음, 그리고 나서 어떻게 움직일지 파악하라"고 말합니다. 로봇은 움직이기 전에 명시적으로 계획을 예측하도록 강요받습니다.
    • 판단: 이는 긴 작업에서 승자였습니다. 로봇이 행동하기 전에 생각하도록 강요했습니다.
  3. '조건부 명령' (명시적 조건부 디코딩): 교사는 "계획을 예측하되, 그동안 움직임도 예측하라"고 말합니다. 이는 동시에 두 가지를 하려고 시도합니다.
    • 판단: 좋았지만 대부분의 작업에서 직접 명령보다 약간 효과가 떨어졌습니다.
  4. '토큰 교체' (행동 - 토큰 매핑): 교사는 물리적 움직임을 직접 간단한 단어 (토큰) 로 변환하고 "단순히 이 단어들을 말하라"고 말합니다.
    • 판단: 이는 복잡한 물리적 작업에서 승자였습니다. 움직임을 너무 단순화하여 로봇이 더 빠르게 학습할 수 있게 했습니다.

3. 큰 발견: '이산 토큰 (Discrete Tokens)'이 왕이다

가장 중요한 발견은 로봇이 정보를 받는 '방식'에 관한 것입니다.

아이에게 그림 그리기를 가르친다고 상상해 보세요.

  • 연속 표현: "4.32 인치 길이의 선을 15.7 도 각도로 그려라"고 말합니다. (숫자가 너무 많고 너무 혼란스럽습니다).
  • 이산 토큰: "'긴 선'을 그려라"고 말합니다. (간단하고 명확하며 기억하기 쉽습니다).

이 논문은 복잡한 움직임을 문장의 단어와 같은 간단한 이산 '토큰'으로 변환하는 것이 로봇에게 정확한 연속 숫자를 가르치려는 것보다 훨씬 더 효과적임을 발견했습니다. 이는 로봇이 '이동'이 수학 방정식이 아닌 단일 단어인 새로운 언어를 배우는 것과 같습니다. 이 방법은 일관되게 가장 똑똑한 로봇을 만들어냈습니다.

4. 이것이 중요한 이유 (실험실에서)

연구자들은 시뮬레이션된 로봇과 실험실의 실제 로봇 팔로 이를 테스트했습니다.

  • 실험실에서: 그들은 다양한 작업을 섞었을 때 (로봇에게 그릇을 쌓는 것과 테이블을 닦는 것을 동시에 가르치는 경우), 로봇은 보통 혼란을 겪고 하나 또는 다른 방법을 잊어버렸습니다 (이를 '부정적 전이'라고 합니다).
  • 해결책: 이러한 잠재 행동 '안무 카드'를 사용하면 혼란이 멈췄습니다. 로봇은 이전 작업을 잊지 않고 모든 작업을 함께 학습할 수 있었습니다. 이는 로봇을 더 견고하게 만들었고 이전보다 지저분한 실제 상황을 더 잘 처리할 수 있게 했습니다.

요약

이 논문은 이것이 곧 질병을 치료하거나 자율 주행 자동차를 만들 것이라고 주장하지 않습니다. 단순히 다음과 같이 말합니다: 여러 다른 비디오에서 로봇에게 여러 가지 다른 일을 가르치고 싶다면, 원시적인 근육 움직임을 가르치지 마십시오. 대신 '계획' (사진 사용) 이나 '간단한 동작 코드' (토큰 사용) 를 인식하도록 가르치십시오.

구체적으로, 로봇이 긴 시퀀스를 계획하게 하려면 이미지 기반 계획을 사용하십시오. 로봇이 까다로운 물리적 움직임을 수행하게 하려면 동작 기반 코드를 사용하십시오. 그리고 두 경우 모두, 이러한 코드를 간단한 **이산 토큰 (단어와 같은)**으로 변환하는 것이 성공을 위한 비결입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →