← 최신 논문
🤖 machine learning

Patch Policy: Efficient Embodied Control via Dense Visual Representations

Patch Policy는 블록 인과적 어텐션 메커니즘을 통해 Vision Transformer로부터 얻은 조밀한 사전 학습된 시각적 특징을 활용하는 경량화되고 효율적인 트랜스포머 기반 아키텍처를 도입하며, 이를 통해 기존의 글로벌 풀링 방식이나 무거운 VLM 기반 방식에 비해 현저히 적은 파라미터와 낮은 계산 오버헤드로 임바디드 제어(embodied control)에서 우수한 성능을 달성합니다.

원저자: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 신발 끈을 묶거나 충전기를 꽂는 법을 가르친다고 상상해 보세요. 이를 위해 로봇은 세상을 "보아야" 합니다. 하지만 단순히 인간이 방 안을 훑어보는 것처럼 보는 것이 아닙니다. 로봇은 신발 끈이 신발과 비교했을 때 정확히 어디에 있는지, 혹은 플러그가 소켓과 어떻게 정렬되는지를 정확히 이해해야 합니다. 오랫동안 로보트의 뇌에는 기묘한 사각지대가 있었습니다. 로봇은 어떤 물체가 무엇인지(예: "컵") 인식하는 데는 뛰어났지만, 공간 속에서 그것이 정확히 '어디'에 있는지는 기억하는 데 서툴렀습니다.

이를 해결하기 위해 과학자들은 **비전 트랜스포머(Vision Transformers, ViTs)**라고 불리는 것을 사용합니다. ViT를 아주 똑똑한 형사라고 생각해보세요. 이 형사는 범죄 현장 사진을 보고 단순히 "지저한 방이네"라고 말하는 데 그치지 않습니다. 대신, 사진을 수백 개의 작은 퍼즐 조각(패치)으로 나누고, 세부 사항을 이해하기 위해 각 조각을 하나하나 정밀하게 연구합니다. 이것을 **조밀한 표현(dense representation)**이라고 합니다. 반면, 기존의 로봇 방식은 전체 사진을 흐릿하게 뭉쳐서 하나의 점으로 만든 뒤, "지저운 방이네"라고 말하는 형사와 같았습니다. 이것을 **글로벌 풀링(global pooling)**이라고 부릅니다. "점" 방식은 빠르긴 하지만, 섬세한 작업을 수행하는 데 필요한 아주 작은 디테일들을 놓치게 됩니다. 현재 로봇 공학계의 큰 질문은 이것입니다. "로봇의 뇌를 실시간으로 움직일 수 없을 만큼 거대하고 느리게 만들지 않으면서도, 이 초정밀 '퍼즐 조각' 시각을 줄 수 있을까?"

이 문제를 해결하기 위해 등장한 것이 바로 **패치 폴리시(Patch Policy)**라는 새로운 접근법이며, 이는 "그렇다, 가능하다!"라고 답합니다. 뉴욕 대학교와 메타(Meta)의 연구진은 로봇이 고화질로 보기 위해 거대한 10억 달러짜리 슈퍼컴퓨터가 될 필요는 없다는 것을 발견했습니다. 그들은 거대한 AI 모델의 무거운 과정을 건너뛰고, 이 작은 퍼즐 조각들을 직접 섭취할 수 있는 가벼운 로봇 뇌를 구축했습니다.

그들이 어떻게 이 일을 해냈고 무엇을 발견했는지에 대한 이야기입니다.

문제점: "흐릿한 점" vs "무거운 거인"

수년간 로봇 컨트롤러에는 두 가지 나쁜 선택지가 있었습니다.

  1. 흐릿한 점: 카메라 이미지를 가져와서 하나의 작고 작은 요약본(하나의 "글로벌 토큰")으로 압축했습니다. 빠르긴 했지만, 마치 안개 낀 안경을 쓰고 바늘귀를 꿰려는 것과 같았습니다. 바늘이 있다는 것은 알지만, 바늘귀는 볼 수 없는 상태였습니다.
  2. 무거운 거인: 더 나은 시각 능력을 갖추기 위해 일부 팀은 거대한 "비전-언어-행동(VLA)" 모델을 사용하기 시작했습니다. 이 모델들은 사전의 모든 단어를 알고 있고 모든 픽셀을 볼 수 있는 천재 교수님과 같습니다. 하지만 이 교수님들은 너무 무거워서(수십억 개의 파라미터) 슬로 모션처럼 움직입니다. 생각하는 데 시간이 너무 오래 걸려, 컵이 떨어지는 상황처럼 빠르게 반응해야 할 때 대처하기 어렵습니다.

연구팀은 질문했습니다: "거인의 초정밀 시각을 가지면서도 무게는 줄일 수 있을까?"

해결책: "패치 폴리시"

그 답은 패치 폴리시입니다. 여러분이 비디오 게임을 하고 있다고 상상해 보세요. 보통 게임은 "당신은 숲에 있습니다"라고 알려줍니다. 이것이 "글로벌" 뷰입니다. 패치 폴리시는 "당신은 숲에 있으며, 구체적으로 왼쪽 2인치 지점에 솔방울이 있고, 오른쪽 4인치 지점에 바위가 있으며, 위쪽 10인치 지점에 다람쥐가 있습니다"라고 알려줍니다. 패치 폴리시는 이 모든 구체적인 디테일(패치)을 로봇의 뇌에 직접 전달합니다.

하지만 문제가 하나 있었습니다. 로봇의 뇌에 너무 많은 디테일을 한꺼번에 입력하면, 사건이 언제 일어났는지 혼동할 수 있습니다. 다람쥐가 바위가 떨어지기 전인가요, 후인가요? 이를 해결하기 위해 연구진은 **블록-인과적 어텐션 마스크(block-causal attention mask)**라는 특별한 "신호등" 시스템을 발명했습니다.

  • 작동 원原理: 단일 카메라 프레임(한 장의 스냅샷) 내부에서, 로봇은 장면을 이해하기 위해 모든 퍼즐 조각을 동시에 볼 수 있습니다. 하지만 현재의 결정을 내리기 위해 미래의 퍼즐 조각을 보는 것은 엄격히 금지됩니다. 이는 실제 로봇이 그래야 하는 것처럼 타임라인을 올바르게 유지해 줍니다.

이를 통해 로봇은 세상을 완벽하게 보는 법을 이미 알고 있는 "기성" 비전 모델(WebSSL 또는 DINOv2 등)을 로봇에게 처음부터 다시 가르칠 필요 없이 그대로 사용할 수 있습니다.

발견한 사실: 작고 빠른 것이 승리한다

연구팀은 이 새로운 로봇 뇌를 네 가지 비디오 게임 시뮬레이션과 세 가지 실제 로봇 작업(케이블 꽂기, 도구 걸기, 펜 수집하기 등)에서 테스트했습니다. 결과는 다음과 같았습니다:

  • "흐릿한 점"보다 우수함: 시뮬레이션에서 패치 폴리시를 사용하는 로봇은 기존의 "글로와 점" 방식을 사용하는 로봇보다 업무 수행 능력이 40% 더 높았습니다. 블록을 쌓거나 물체를 특정 위치로 밀어야 하는 정밀한 작업이 요구될 때, 상세한 시각 정보가 엄청난 차이를 만들었습니다.
  • "무거운 거인"을 이기다: 가장 놀랍게도, 패치 폴리시는 거대한 미세 조정 VLA 모델인 OpenVLA-OFT보다 성공률에서 18% 앞섰습니다. 하지만 핵심은 이것입니다: 패치 폴리시는 거대 모델의 약 **0.7%**에 불색한 파라미터(뇌 크기)만을 사용했습니다.
  • 실제 세계의 정밀도: 실제 로봇에서도 차이는 명확했습니다. 플러그를 소켓에 넣어야 하는데 여유 공간이 단 2mm뿐인 "케이블 삽입" 작업에서, 기존 방식들은 자주 막혔습니다. 패치 폴리시는 **70%**의 성공률을 보인 반면, 거대 모델인 OpenVLA-OFT는 단 **30%**만 성공했습니다. 거대 모델은 케이블을 꽂는다는 '개념'은 이해했지만, 실제로 수행하는 데 필요한 아주 미세하고 정밀한 움직임에서는 실패한 것입니다.
  • 속도: 이 새로운 방식은 믿을 수 없을 정도로 빠릅니다. 약 11밀리초(0.011초) 만에 결정을 내릴 수 있습니다. 이는 로봇이 실시간으로 반응하기에 충분한 속도이며, 무거운 거인 모델들은 훨씬 더 오래 걸립니다.

"압축하지 마라"는 규칙

연구진은 또한 흔한 아이디어인 "더 빠르게 만들기 위해 퍼즐 조각들을 뭉칠 수 있을까?"를 테스트했습니다. 그들은 패치의 수를 256개에서 단 1개로 줄여(다시 "흐릿한 점"으로 되돌림) 실험했습니다. 결과는 어땠을까요? 로봇은 업무 수행 능력이 형편없어졌습니다. 성공률이 급격히 떨어졌습니다. 이는 정밀한 로봇 손을 위해서는 정말로 그 모든 작은 디테일을 유지해야 하며, 이를 요약해서 없애버려서는 안 된다는 것을 증명했습니다.

결론

이 논문은 로봇을 더 똑똑하게 만들기 위해 더 크고 무거운 로봇을 만들 필요는 없다고 제안합니다. 대신, 우리는 그들이 세상을 고화질로 보게 하기만 하면 됩니다. 정교한 "패치" 이미지를 가벼운 뇌에 직접 입력하는 영리한 트릭을 사용함으로써, 패치 폴리시는 로봇이 이전보다 훨씬 빠르고 정확하게 복잡하고 정밀한 작업을 학습할 수 있게 해줍니다. 이는 때때로 앞으로 나아가는 가장 좋은 방법은 더 큰 엔진을 만드는 것이 아니라, 길을 조금 더 자세히 들여다보는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →