← 최신 논문
💻 computer science

Rethinking VLM Representation for VLA Initialization

본 논문은 사전 학습된 비전 - 언어 모델 (VLM) 로부터 비전 - 언어 - 행동 (VLA) 모델을 초기화하는 최적의 전략을 조사하여, 원래 VLM 표현을 유지하면서 로봇 데이터 사전 학습을 포함한 단계별 LoRA 기반 훈련을 적용하는 것이 가장 효과적인 행동 학습 성능을 산출함을 밝힙니다.

원저자: Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 컵을 들거나 빨래를 접는 것과 같은 집안일을 수행하도록 가르친다고 상상해 보세요. 이를 위해 로봇에게 세상에 대해 이미 많은 것을 알고 있는 '두뇌'를 부여합니다. 예를 들어 고양이를 인식하거나, 문장을 이해하거나, 부엌의 모습이 어떤지 아는 능력 말입니다. 이 두뇌는 **시각 - 언어 모델 (VLM)**이라고 불립니다.

이 논문은 간단하지만 까다로운 질문을 던집니다: 이미 훈련된 이 두뇌를 어떻게 조정해야 기존에 알고 있던 좋은 지식을 망치지 않으면서 훌륭한 '로봇 두뇌'(VLA 모델) 로 만들 수 있을까요?

저자들은 이를 부엌에서의 통제된 실험처럼 다루며, 완벽한 로봇 레시피를 만들기 위해 세 가지 주요 재료를 테스트합니다.

1. "전문 훈련" 재료 (Embodied VQA)

로봇 두뇌가 무엇이든 요리할 줄 아는 만능 셰프라고 상상해 보세요. 이제 이 셰프를 로봇 셰프로 가르치고 싶다면, "숟가락을 어떻게 잡는지"나 "비누가 어디 있는지"와 같은 구체적인 기술에 대한 특강을 시킬 수 있습니다.

  • 실험: 연구자들은 로봇 두뇌에 공간 이해, 물체 위치 파악, 카메라 각도 예측 등 일곱 가지 다른 기술에 기반한 다양한 유형의 "숙제"(시각 질문 답변, VQA) 를 주었습니다.
  • 놀라운 사실: 로봇에게 단순히 더 많은 숙제를 주는 것이 항상 도움이 되는 것은 아니었습니다.
    • 로봇이 이미 어떤 작업에 능숙했다면, 추가 숙제가 도움이 되었습니다.
    • 반면, 로봇이 다른 유형의 작업에 어려움을 겪고 있을 때, 같은 숙제는 오히려 성능을 저하시켰습니다.
    • 최적의 지점: 가장 좋은 결과는 특정한 조합에서 나왔습니다. 즉, 로봇에게 **물체의 위치 (Grounding)**와 **로봇 자신의 행동 (Egocentric Understanding)**을 가르치는 것이었습니다. 카메라 각도 예측이나 복잡한 단계 계획과 같은 다른 기술들을 너무 많이 추가하면, 마치 한 번에 다섯 가지 새로운 언어를 배우려는 것처럼 로봇이 혼란에 빠졌습니다.

2. "얼마나 열심히 공부할지" 재료 (Update Strategy)

로봇이 숙제를 시작하면, 우리는 두뇌를 얼마나 변경해야 할까요?

  • "완전 재작성" (Full Fine-tune): 이는 로봇에게 "이전 지식을 모두 잊어라. 오직 이 새로운 로봇 작업에만 집중하도록 두뇌 전체를 다시 써라"라고 말하는 것과 같습니다.
    • 결과: 이는 종종 역효과를 냈습니다. 로봇은 새로운 작업을 배우기는 했지만, 처음에 세상을 이해하는 데 도움이 되었던 일반적인 지식을 잊어버렸습니다. 결과적으로 틀 밖에서 생각하지 못하는 전문가가 되어버린 것입니다.
  • "부드러운 밀기" (LoRA): 이는 로봇에게 두뇌에 붙일 작은 스티커 메모 (어댑터) 세트를 주는 것과 같습니다. 로봇은 기존 지식을 지우지 않고 새로운 로봇 작업만 학습합니다.
    • 결과: 이는 훨씬 더 잘 작동했습니다. 로봇은 일반적인 지능을 유지하면서도 구체적인 로봇 기술을 습득했습니다. 논문은 원래 두뇌를 보존하는 것이 두뇌를 완전히 재구성하는 것보다 더 중요하다는 것을 발견했습니다.

3. "실제 세계 연습" 재료 (Robot Data Pretraining)

마지막으로, 연구자들은 다음과 같은 질문을 던졌습니다: 로봇에게 단순히 사진과 질문만 보여줘야 할까요, 아니면 실제 로봇이 움직이는 영상도 보여줘야 할까요?

  • 발견: 실제 움직임 (로봇 데이터) 을 보여주는 영상은 도움이 되었지만, 신중하게 수행했을 때만 해당되었습니다.
  • 최고의 레시피: 승리를 거둔 전략은 이단계 과정이었습니다:
    1. 먼저, "물체의 위치"와 "내가 무엇을 하고 있는지"라는 숙제로 두뇌를 부드럽게 밀어줍니다 (부드러운 LoRA 방법 사용).
    2. 그다음, 로봇이 실제 움직임 데이터로 연습하게 합니다. 이때도 역시 부드러운 밀기 방법을 사용합니다.
    • 모든 숙제와 실제 연습을 한 번에 섞어서 수행하는 것은 단계를 나누어 진행하는 것보다 효과가 떨어졌습니다.

핵심 교훈

이 논문은 훌륭한 로봇 두뇌를 만드는 것이 모든 것을 무작정 던져주는 것이 아니라고 결론 내립니다. 그것은 균형에 관한 것입니다:

  1. 과거를 지우지 마세요: 로봇이 처음에 가지고 있던 '일반 지식'은 새로운 로봇 작업을 배우는 데 실제로 매우 유용합니다. 이를 지워버리지 마세요.
  2. 올바른 숙제를 선택하세요: 로봇이 수행해야 할 작업에 맞는 구체적인 기술만 가르치세요. 모든 것을 한 번에 가르치면 혼란만 초래합니다.
  3. 천천히 진행하세요: 두뇌를 완전히 다시 쓰는 대신 부드러운 업데이트 (스티커 메모와 같은) 를 사용하고, 새로운 기술을 단계별로 도입하세요.

간단히 말해, 똑똑한 일반 AI 를 똑똑한 로봇으로 바꾸는 최선의 방법은 기존 지식을 삭제하지 않으면서 새로운 기술을 신중하게 추가하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →