← 최신 논문
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

이 논문은 자유 형식의 사고 사슬(chain-of-thought) 생성을 구조화된 지각적 증거 및 에이전트 도구 사용에 대한 인컨텍스트 사후 학습(in-context post-training)으로 대체함으로써, 시뮬레이션 및 실세계 조작 작업 전반에서 우수한 저수준 제어와 최첨단 성능을 가능하게 하는 근거 있는 언어 소비를 구현하는 In-Context VLA 프레임워크를 소개한다.

원저자: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

게시일 2026-08-07
📖 2 분 읽기☕ 가벼운 읽기

원저자: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 샌드위치를 만들거나 어질러진 방을 정리하는 것과 같은 집안일을 가르치고 있다고 상상해 보세요. 오랫동안 과학자들은 인간이 일을 하는 영상을 로봇에게 보여주며, "네가 본 것을 똑같이 따라 해"라고 말하며 기계를 가르치려 노력해 왔습니다. 이는 단순한 작업에는 효과적일 수 있지만, 마치 단 하나의 경직된 문장만을 암기함으로써 새로운 언어를 배우려는 것과 같습니다. 만약 당신이 로봇에게 "빨간 머그컵을 집어 들어"라고 했다가, "그 진홍색 컵을 잡아"라고 말한다면, 로봇은 혼란에 빠질 수 있습니다. 왜냐하면 로봇은 들었던 특정 소리를 맞추는 법만 배웠을 뿐, 그 단어 뒤에 숨겨진 '의미'를 이해하는 법을 배우지 못했기 때문입니다.

이를 해결하기 위해, 연구자들은 최근 로봇에게 인간이 행동하기 전에 스스로에게 말을 거는 것과 유사한 '생각하는' 단계를 부여하는 실험을 했습니다. 그들은 로봇이 먼저 "좋아, 컵은 테이블 위에 있고, 나는 내 손을 왼쪽으로 움직여야 해"와 같은 계획을 글로 써낸 뒤에 행동하기를 바랐습니다. 이것을 '사고의 사슬(Chain-of-Thought)'이라고 부릅니다. 하지만 반전이 있습니다. 로봇의 경우, 움직이기 전에 말을 너무 많이 하는 것은 오히려 일을 더 못하게 만듭니다. 이는 도로에 대해 소설을 쓰면서 자동차를 운전하려는 것과 같습니다. 문장을 다 마칠 때쯤이면 이미 길을 지나쳐 버리기 때문입니다. 로봇은 실제로 물체를 잡는 대신 자신의 생각을 서술하는 루프에 빠지게 되며, 실제로 보는 것이 아니라 추측하는 것이기 때문에 물건이 어디에 있는지에 대해 사실을 지어내기도 합니다.

이 논문은 VLA-Talker라고 불리는 새로운 로봇 교육법을 소개합니다. 연구자들은 로봇에게 스스로 생각을 쓰도록 강요하는 대신, 로봇이 보고할 수 있도록 돕는 '스마트 어시스턴트'를 제공했습니다. 이것은 마치 초강력 안경과 유능한 부조종사를 가진 로봇을 생각하면 쉽습니다. 로봇이 숟가락이 어디에 있는지 알아야 할 때, 로봇은 스스로 추측하거나 문단을 작성하지 않습니다. 대신, 특수 도구(깊이 카메라 및 객체 탐지기 등)를 사용하는 부조종사에게 즉시 요청하여 "숟가락은 당신의 손에서 오른쪽으로 42픽셀 떨어져 있고 약간 더 낮게 있습니다"라는 명확하고 사실적인 보고를 받습니다. 그러면 로봇은 이 명확하고 사실에 기반한 보고를 읽고 즉시 행동합니다.

연구자들은 이 방법이 게임 체인저라는 것을 발견했습니다. 로봇이 스스로 혼란스러운 수다를 생성하는 대신, 도구로부터 명확하고 근거 있는 언어를 '소비'하게 함으로써, 로봇은 훨씬 더 빠르고 정확해졌습니다. 테스트 결과, 이 접근 방식은 단순히 더 잘 작동할 뿐만 아니라, 기존의 '생각하는' 방식보다 거의 4.6배 더 빨랐습니다. 로봇이 움직이기 전에 에세이를 쓰는 데 시간을 낭비하지 않았기 때문입니다. 연구진은 복잡한 컴퓨터 시뮬레이션과 실제 인간형 로봇을 대상으로 테스트를 진행했으며, 이 방식이 다른 로봇들이 어려워했던 과제들을 일관되게 해결해 냈음을 입증하며, 때로는 가장 좋은 생각법은 사실을 알고 있는 다른 이의 말을 듣는 것임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →