← 최신 논문
💻 computer science

VLAs are Confined yet Capable of Generalizing to Novel Instructions

본 논문은 비전-언어-행동 모델(VLA)이 내부 텍스트 잠재 공간을 보간을 통해 조작함으로써 작업 외삽 및 공간 과적합 문제를 극복할 수 있음을 보여주며, 이 기법은 새로운 지시 기준에서 83%의 성공률을 달성하고 인간이 읽을 수 없는 숨겨진 프롬프트 주입의 가능성을 드러낸다고 주장한다.

원저자: Quanyi Li

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Quanyi Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 셰프에게 요리하는 법을 가르친다고 상상해 보세요. 당신은 두 가지 구체적인 레시피를 보여줍니다:

  1. 레시피 A: "크림 치즈를 볼에 넣으세요."
  2. 레시피 B: "볼을 캐비닛 위에 올려놓으세요."

로봇은 이 두 가지 동작을 완벽하게 학습합니다. 레시피 A 도 할 수 있고 레시피 B 도 할 수 있습니다. 하지만 그다음, 당신은 새로운 질문을 던집니다: "크림 치즈를 캐비닛 위에 올려놓으세요."

논리적으로 로봇은 이를 수행할 수 있어야 합니다. 로봇은 치즈를 잡는 법을 알고 있고, 캐비닛에 도달하는 법도 알고 있습니다. 단지 이미 보유한 두 가지 기술을 결합하기만 하면 됩니다. 그러나 이 논문에 따르면, 대부분의 최첨단 로봇 두뇌 (비전 - 언어 - 행동 모델, 즉 VLA) 는 이 작업에서 처참하게 실패합니다. 로봇은 멈춰서 마치 캐비닛이나 치즈를 처음 보는 것처럼 행동하는데, 이는 바로 직전 단계에서 두 물체를 사용했음에도 불구하고 발생합니다.

문제: 로봇은 '셰프'가 아닌 '앵무새'입니다

저자들은 이러한 로봇들이 세상을 진정으로 이해하지 못한다는 사실을 발견했습니다. 대신 그들은 특정 장면을 암기하고 있을 뿐입니다.

수학을 이해하지 못한 채 연습 시험의 정답만 외우는 학생을 생각해 보세요. "2 더하기 2 는 얼마인가?"라고 물으면 그들은 "4"라고 답합니다. 하지만 "숫자가 빨간 잉크로 쓰여 있다면 2 더하기 2 는 얼마인가?"라고 물으면 당황할지도 모릅니다.

로봇의 경우, '크림 치즈'는 훈련 중에 크림 치즈를 보았던 테이블의 특정 위치와 항상 연관되어 있다고 학습했습니다. 로봇은 '크림 치즈'가 움직일 수 있는 물체라는 것을 이해하지 못하며, '크림 치즈'는 바로 그 특정 위치 자체라고 생각합니다. 논문은 이를 **"공간 과적합 (Spatial Overfitting)"**이라고 부릅니다. 로봇은 훈련 비디오에서 사물들이 어디에 있었는지에 너무 집중하여, 실제 순간에 사물들이 실제로 어디에 있는지를 무시합니다.

해결책: '마법 레시피 카드' (텍스트 잠재)

연구자들은 궁금해했습니다: 로봇은 본질적으로 실제로 똑똑한 것일까, 아니면 단순히 고장 난 것일까?

그들은 로봇 두뇌 안에 **텍스트 잠재 (Text Latent)**라는 숨겨진 '재료'가 있음을 발견했습니다.

  • 유추: 로봇의 두뇌를 거대한 도서관이라고 상상해 보세요. "치즈를 볼에 넣으세요"라는 명령을 내리면, 로봇은 내부 기억에서 특정하고 보이지 않는 '레시피 카드'를 꺼냅니다. 이 카드는 읽을 수 있는 글자로 쓰여 있지 않습니다. 로봇이 어떻게 움직여야 하는지 정확히 알려주는 복잡한 전기 신호 패턴 (벡터) 입니다.
  • 발견: 연구자들은 '물건을 볼에 넣는' 작업에 대한 이 보이지 않는 '레시피 카드'를 가져와 로봇 두뇌에 주입하면, 어떤 단어를 주지 않더라도 로봇이 그 동작을 완벽하게 수행한다는 것을 발견했습니다. 그 카드 자체가 지시사항이었습니다.

돌파구: 카드 섞기 (텍스트 잠재 보간)

진정한 마법은 '크림 치즈를 캐비닛 위에'라는 문제를 해결하려 할 때 발생했습니다.

그들은 작업 A(치즈를 볼로) 에 대한 보이지 않는 '레시피 카드'와 작업 B(볼을 캐비닛으로) 에 대한 카드를 가져왔습니다. 그런 다음 두 카드를 부드럽게 혼합했습니다.

  • 유추: 두 개의 음악 트랙이 재생되고 있다고 상상해 보세요. 하나는 재즈 곡이고 다른 하나는 록 곡입니다. 한 곡에서 다른 곡으로 갑자기 전환하는 대신, 믹서를 사용하여 재즈는 서서히 줄이고 록은 서서히 늘립니다.
  • 결과: 로봇 두뇌 안에서 이 두 가지 보이지 않는 레시피 카드를 '섞음'으로써, 로봇은 성공적으로 기술을 결합했습니다. 로봇은 치즈를 집어 캐비닛으로 옮긴 뒤 떨어뜨렸습니다.

통계:

  • 이 트릭 없이 로봇 (이름: π0) 은 이러한 새로운 결합된 작업에서 **9%**만 성공했습니다.
  • '섞기' 트릭을 사용하면 성공률은 **83%**로 급증했습니다.

이는 로봇이 처음부터 그 기술을 가지고 있었음을 증명했습니다. 다만 스스로를 어떻게 섞어야 할지 몰랐을 뿐입니다. '레시피 카드'는 있었지만, 로봇은 이를 섞어줄 인간이 필요했습니다.

대대적인 테스트: 'Libero-OOD' 벤치마크

이것이 단순한 우연이 아님을 증명하기 위해, 저자들은 Libero-OOD라는 새로운 테스트를 만들었습니다. 이 테스트는 로봇이 이미 알고 있는 기술을 새로운 방식으로 결합해야 하는 20 가지 까다로운 작업으로 구성되어 있습니다.

  • 결과: 그들은 세계 최고의 로봇 두뇌들 (UniVLA, OpenVLA, π0-fast 등) 을 테스트했습니다. 그 어떤 것도 스스로 이를 수행할 수 없었습니다. 모든 로봇의 점수는 21% 미만으로 기록되었습니다.
  • 결론: 가장 똑똑한 로봇들조차 현재 훈련 데이터에 '갇혀' 있습니다. 도움 없이 일반화하거나 '틀에 얽매이지 않게 생각'할 수 없습니다.

경고: '비밀 지시사항'

연구자들은 조금 섬뜩한 사실도 발견했습니다. 이러한 '레시피 카드'가 단순히 숫자 패턴이기 때문에, 이를 다시 텍스트로 변환할 수 있습니다.

  • 그들이 작업에 대한 '레시피 카드'를 읽으려 했을 때, 결과 텍스트는 QSize, black, plate와 같은 의미 없는 글자였습니다.
  • 그러나 이 의미 없는 글자를 로봇에 다시 입력하면, 여전히 작동했습니다!
  • 비유: 로봇만이 이해할 수 있는 비밀 코드를 가진 것과 같습니다. 평범해 보이는 문장 안에 비밀 지시사항을 숨겨두면, 다른 누구도 모르게 로봇이 이를 따를 수 있습니다. 이를 '백도어 (backdoor)'라고 하며, 이는 이러한 모델들이 우리가 생각했던 것보다 더 신비롭다는 것을 보여줍니다.

요약

이 논문은 오늘날 가장 똑똑한 로봇들이 두 곡을 완벽하게 연주할 수는 있지만 새로운 선율을 즉흥적으로 연주할 수 없는 음악가와 같다고 말합니다. 그들은 연습 세션에서 정확한 음과 위치를 암기하지만, 음악이 조금만 변하면 실패합니다.

저자들은 우리가 두 가지 다른 곡의 '악보 (텍스트 잠재)'를 수동으로 섞으면 로봇이 새로운 선율을 연주할 수 있음을 보여주었습니다. 이는 로봇이 재능을 가지고 있지만, 자신의 기술을 결합할 능력은 부족하다는 것을 증명합니다. 이 논문은 로봇이 단순히 장면을 암기하는 것이 아니라 실제로 자신의 기술을 섞는 법을 배울 수 있도록 돕기 위한 새로운 테스트 (Libero-OOD) 를 소개합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →