← 최신 논문
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

이 논문은 고도화된 추론과 행동을 하나의 통합된 모델로 결합하고, 적응적 모드 전환과 확장 가능한 데이터 생성 파이프라인을 통해 장거리 작업 계획, 오류 복구, 자연스러운 인간 - 로봇 상호작용 및 일반화된 시각적 기반을 가능하게 하는 'OneTwoVLA'를 제안합니다.

원저자: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

게시일 2026-03-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 비유: "생각하는 요리사" vs "기계적인 요리사"

기존의 로봇들은 크게 두 가지 방식으로 작동했습니다.

  1. 이중 시스템 (Dual-System):
    • 비유: 한 사람은 **두뇌 (System 2)**만 있고, 다른 사람은 **손 (System 1)**만 있습니다.
    • 문제: 두뇌가 "소스를 넣으세요"라고 말하면, 손이 그 말을 듣고 움직입니다. 하지만 두뇌가 말을 하는 데 시간이 걸리거나 (지연), 손이 못 하는 일을 지시하면 (예: "공중에 있는 소스를 잡으세요") 로봇은 당황합니다. 서로가 서로의 능력을 잘 모릅니다.
  2. 단순 행동 모델 (Flat VLA):
    • 비유: 반사 신경만 있는 로봇입니다.
    • 문제: "소스를 넣으세요"라고 하면 바로 넣습니다. 하지만 "소스가 떨어졌어!"라고 하면, "아, 내가 떨어뜨렸구나? 다시 잡아야지"라고 생각할 수 없습니다. 그냥 계속 떨어뜨린 소스를 집으려다 실패합니다.

✨ OneTwoVLA 의 등장: "생각과 행동이 하나 된 요리사"

OneTwoVLA 는 한 명의 요리사가 **생각 (Reasoning)**과 **행동 (Acting)**을 동시에 할 수 있게 만든 모델입니다.

  • 적응형 모드 (Adaptive Reasoning):
    • 평소에는: "손"이 빠르게 움직입니다. (소스를 부어라, 그릇을 가져와라)
    • 중요한 순간에는: "두뇌"가 갑자기 깨어납니다.
      • 예시: 소스를 부으려는데 손이 미끄러졌을 때? → 생각 모드 전환 → "아, 소스병이 미끄러졌네. 다시 꽉 잡고 잡아야겠다." → 행동 모드 전환 → 다시 잡아서 부음.
    • 이 방식 덕분에 로봇은 빠르면서도, 문제가 생길 때 스스로 해결할 수 있습니다.

🧠 핵심 기술 3 가지 (요리사의 능력)

이 로봇은 네 가지 놀라운 능력을 보여줍니다.

  1. 긴 계획 세우기 (Long-horizon Planning):
    • 상황: "난초 주스를 만들어줘."
    • 기존 로봇: "난초? 뭐야?" 하고 멈춤.
    • OneTwoVLA: "난초 주스? 아, 건강을 원하시는 거구나. 얼음, 난초 잎, 주스기를 준비해야지." → 단계별 계획을 세우고 실행합니다.
  2. 실수 감지 및 복구 (Error Detection & Recovery):
    • 상황: 고기를 잡으려는데 미끄러져서 떨어뜨림.
    • OneTwoVLA: "앗, 떨어졌어! 다시 꽉 잡아야지." → 스스로 상황을 파악하고 다시 시도합니다.
  3. 자연스러운 대화 (Human-Robot Interaction):
    • 상황: 사람이 "오렌지 보드카 말고 레몬으로 바꿔줘."
    • OneTwoVLA: "네, 알겠습니다. 오렌지는 내려놓고 레몬을 가져오겠습니다." → 사람의 말을 듣고 즉시 계획을 수정합니다.
  4. 눈으로 이해하기 (Visual Grounding):
    • 상황: "책상 위에 있는 검은색이고 둥근 물건을 줘."
    • OneTwoVLA: "아, 저기 시계가 있네. 검은색이고 둥글지." → 특징을 보고 정확한 물건을 찾아냅니다.

🎨 더 똑똑하게 만들기: "가상 요리 교실"

이 로봇을 훈련시키기 위해 연구자들은 실제 로봇 데이터만으로는 부족하다고 생각했습니다. 그래서 AI 가 만든 가상의 데이터를 함께 학습시켰습니다.

  • 비유: 실제 요리 실습 (로봇 데이터) 만으로는 다양한 요리를 배울 수 없으니, 가상 현실 (VR) 요리 교실에서 수천 가지의 다양한 상황 (가상의 식탁, 다양한 재료) 을 경험하게 한 것입니다.
  • 이 덕분에 로봇은 본 적 없는 물건이나 본 적 없는 상황에서도 "아, 이건 이런 원리로 움직이는 거겠구나"라고 **상상력 (일반화 능력)**을 발휘할 수 있게 되었습니다.

🏆 결론: 왜 이 연구가 중요한가요?

이 논문은 로봇이 단순한 기계를 넘어, 상황을 파악하고 생각하며 행동하는 진정한 파트너가 될 수 있음을 증명했습니다.

  • 기존 방식: 생각과 행동이 분리되어 느리고, 실수하면 멈춤.
  • OneTwoVLA: 생각과 행동이 하나로 통합되어 빠르고, 유연하며, 실수를 스스로 고칠 수 있음.

이 기술이 발전하면, 우리 집에서는 로봇이 "오늘 저녁 뭐 먹을까?"라고 물어보며 스스로 요리를 준비하거나, 실수를 하면 스스로 해결하는 모습을 볼 수 있게 될 것입니다. 마치 영화 속의 똑똑한 로봇 친구처럼 말이죠! 🤖✨

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →