지금까지의 로봇들은 주로 여러 개의 고정된 카메라로 주변을 찍어서 명령을 수행했습니다. 마치 우리가 여러 개의 정지된 사진을 보고 3D 공간을 이해하려는 것과 비슷합니다.
하지만 이 방식에는 두 가지 큰 문제가 있었습니다.
공간 감각 부족: 사진만 보고는 물체의 정확한 깊이 (3D) 를 이해하기 어려워, 물건을 놓을 위치를 잘못 계산합니다. (예: 병 두 개 사이에 컵을 넣으려는데, 병 사이가 아니라 병 위에 올려버림)
움직임에 둔감: 로봇이 물건을 잡으러 가는데, 그 물체가 갑자기 움직이면 로봇은 원래 계획대로 계속 가다가 실패합니다. 마치 고정된 지도만 보고 길을 찾다가, 길이 막혔는데도 계속 그 방향으로 달려가는 것과 같습니다.
💡 해결책: 인간의 뇌를 모방하다
저자들은 인간의 뇌가 세상을 어떻게 처리하는지 영감을 받았습니다. 인간의 뇌에는 시각 정보를 처리하는 **두 가지 주요 경로 (통로)**가 있습니다.
배쪽 경로 (Ventral Pathway): "무엇인가?"를 봅니다. 사물의 모양, 색상, 위치를 기억하며 정적인 공간 이해를 담당합니다. (예: "저건 컵이야, 책상 위에 있어")
등쪽 경로 (Dorsal Pathway): "어떻게 움직일까?"를 봅니다. 실시간으로 움직이는 물체를 추적하고 행동을 조정합니다. (예: "커피가 넘어지니까 손으로 막아야지!")
이 논문은 이 두 가지 방식을 로봇에게 적용한 이중 스트림 (Dual-Stream) 모델을 제안합니다.
🧠 코르티컬 폴리시: 로봇의 두 눈
이 모델은 로봇의 머릿속에 두 개의 전문가를 배치한 것과 같습니다.
1. 정적 스트림 (Static-Stream): "지식 있는 지도 작성자"
역할: 주변의 고정된 카메라 사진들을 분석하여 3D 공간 지도를 만듭니다.
비유: 이 로봇은 마치 고도의 3D 지도 제작자처럼 작동합니다. 여러 각도에서 찍은 사진을 합쳐서, "이 물체는 저기 있고, 저 물체는 그 옆에 있다"는 기하학적인 관계를 정확히 이해합니다.
특징: 기존 모델보다 3D 공간 이해도가 훨씬 뛰어나서, 물체 사이의 정확한 간격을 계산할 수 있습니다.
2. 동적 스트림 (Dynamic-Stream): "민첩한 운전사"
역할: 로봇의 손목에 달린 카메라 (1 인칭 시점) 를 통해 실시간 움직임을 추적합니다.
비유: 이 로봇은 마치 운전 중 갑자기 차가 튀어 나오면 즉시 핸들을 꺾는 운전사와 같습니다. 물체가 움직이거나 장애물이 생기면, 미리 정해진 길 (경로) 에 집착하지 않고 순간적으로 경로를 수정합니다.
특징: 인간의 눈이 움직이는 물체를 따라가는 것처럼, 로봇도 손끝의 위치를 실시간으로 파악하며 행동을 수정합니다.
🚀 결과는 어떨까요?
이 두 전문가가 협력하면 로봇은 다음과 같은 능력을 얻게 됩니다.
정교한 공간 작업: 병 두 개 사이에 컵을 정확히 넣는 것처럼, 복잡한 공간 관계가 필요한 작업에서도 실수가 줄어듭니다.
예측 불가능한 상황 대처: 로봇이 물건을 잡으러 가는데 물체가 움직여도, 로봇은 "아, 움직였네?" 하고 즉시 경로를 바꿔서 성공합니다.
실제 실험 결과: 시뮬레이션과 실제 로봇 실험에서 기존 최첨단 모델들보다 훨씬 높은 성공률을 보였습니다. 특히 환경이 변하거나 방해물이 있을 때 강인함을 입증했습니다.
📝 한 줄 요약
"이 새로운 로봇은 고정된 지도 (정적 스트림) 만 보는 게 아니라, 실시간으로 움직이는 상황을 눈으로 쫓아 (동적 스트림) 즉흥적으로 대응하는 인간 같은 뇌를 갖게 되었습니다."
이 기술은 앞으로 로봇이 공장뿐만 아니라 우리 집이나 복잡한 일상 환경에서도 더 자연스럽게 일할 수 있는 기반이 될 것입니다.
Cortical Policy: 로봇 조작을 위한 이중 스트림 뷰 트랜스포머 기술 요약
이 논문은 ICLR 2026에 발표된 **"CORTICAL POLICY: A DUAL-STREAM VIEW TRANSFORMER FOR ROBOTIC MANIPULATION"**으로, 로봇 조작 (Robotic Manipulation) 분야에서 기존 방법론의 한계를 극복하고 인간의 뇌 구조에서 영감을 받은 새로운 아키텍처를 제안합니다.
1. 문제 정의 (Problem)
기존의 로봇 조작을 위한 뷰 트랜스포머 (View Transformers) 는 주로 정적인 (Static) 다중 카메라 뷰를 활용하여 행동을 예측합니다. 그러나 이러한 접근 방식은 다음과 같은 두 가지 주요 한계를 가집니다.
부족한 3D 공간 추론 능력: 정적인 2D 이미지를 단순히 융합하는 방식은 교차 뷰 (Cross-view) 관계를 모델링하지 못해, 3D 공간에서의 기하학적 이해도가 낮습니다. 이로 인해 물체 간의 공간적 관계 (예: 병 사이로 물체 넣기) 를 파악하는 데 실패하거나 환경 변화 (조명, 질감 등) 에 민감하게 반응합니다.
동적 적응 실패: 고정된 카메라 설정은 예측 불가능한 물체 이동이나 동적인 환경 변화에 실시간으로 대응하는 능력이 부족합니다. 로봇이 접근하는 동안 목표 물체가 움직이면, 기존 방법들은 원래 계획된 궤적을 고수하여 작업 실패로 이어집니다.
2. 제안 방법 (Methodology)
저자들은 인간의 시각 처리 시스템, 특히 **배측 경로 (Dorsal Stream)**와 **복측 경로 (Ventral Stream)**의 이중 구조에서 영감을 받아 Cortical Policy를 제안합니다. 이 모델은 두 개의 상호 보완적인 스트림을 병렬로 처리합니다.
A. 정적 뷰 스트림 (Static-View Stream) - "복측 경로" 모방
목적: 장면의 3D 구조 이해 및 영구적인 공간 표현 학습.
핵심 기술:
기하학적 일관성 학습: 사전 훈련된 3D 기초 모델인 **VGGT (Visual Geometry Grounded Transformer)**를 활용하여, 서로 다른 뷰에서 추출된 기하학적으로 일관된 키포인트 (Keypoints) 를 정렬합니다.
3D 지도 생성: VGGT 를 통해 깊이 맵, 카메라 파라미터 등을 예측하고, 이를 3D 공간으로 역투영 (Unprojection) 하여 교차 뷰 간의 기하학적 일관성을 강제합니다.
손실 함수: **Cyclic Geometric Consistency Loss (Lcgc)**를 도입하여 뷰 간의 특징 매칭 오류를 누적되지 않도록 순환 구조로 최적화합니다. 이를 통해 뷰에 무관한 (Viewpoint-invariant) 3D 표현을 학습합니다.
B. 동적 뷰 스트림 (Dynamic-View Stream) - "배측 경로" 모방
목적: 실시간 시각 피드백을 통한 적응형 행동 추론 및 궤적 재계획.
핵심 기술:
자아 중심 시선 추정 (Egocentric Gaze Estimation): 로봇의 손목 카메라 (Dynamic View) 에서의 움직임을 기반으로 엔드 이펙터 (End-effector) 의 위치를 추정합니다.
위치 인식 사전 훈련 (Position-aware Pretraining): 인간 시선 추정 모델 (GLC) 을 로봇의 손목 카메라 데이터로 사전 훈련하여, 동적 프레임에서 행동 중심의 특징 맵과 히트맵 (Saliency Maps) 을 추출합니다.
적응형 행동: 이 스트림은 정적 환경이 아닌, 움직이는 물체나 예상치 못한 장애물에 대해 실시간으로 궤적을 조정하는 능력을 제공합니다.
C. 통합 및 행동 예측
두 스트림에서 추출된 특징 (정적 스트림의 3D 공간 지식 + 동적 스트림의 적응형 행동 단서) 을 **액션 헤드 (Action Head)**에서 융합합니다.
최종적으로 그리퍼의 6-DoF 위치, 회전, 상태 (열림/닫힘), 충돌 지표 등을 예측하여 로봇을 제어합니다.
3. 주요 기여 (Key Contributions)
이중 스트림 아키텍처: 정적 뷰와 동적 뷰를 통합하여 인간 뇌의 시각 - 운동 제어 원리를 모방한 최초의 뷰 트랜스포머 기반 로봇 조작 프레임워크를 제안했습니다.
교차 뷰 기하학적 일관성 학습: VGGT 를 활용한 3D 기초 모델의 지식을 정적 스트림에 주입하여, 2D 이미지를 넘어선 강력한 3D 공간 추론 능력을 확보했습니다.
동적 뷰 스트림 설계: 기존 연구에 없던 동적 뷰 처리 스트림을 도입하여, 위치 인식 사전 훈련을 통해 실시간 궤적 조정 및 동적 환경 적응 능력을 구현했습니다.
4. 실험 결과 (Results)
RLBench, COLOSSEUM 벤치마크 및 실제 로봇 실험을 통해 기존 SOTA 방법론 (RVT-2, PerAct, 3D-MVP 등) 과 비교 평가되었습니다.
RLBench 성능: 18 가지 작업에서 **평균 성공률 81.0%**를 기록하여, 기존 최상위 모델인 RVT-2(77.5%) 보다 3.5%p 높은 성능을 달성했습니다. 특히 "병 사이로 블록 쌓기"와 같은 복잡한 공간 추론 작업에서 뛰어난 성능을 보였습니다.
COLOSSEUM (강건성 평가): 객체 색상/크기/질감 변화, 조명, 카메라 각도 변화 등 다양한 환경 교란 (Perturbations) 하에서 **평균 성공률 69.9%**를 기록하여 RVT-2(60.5%) 보다 9.4%p 우위를 보였습니다. 이는 동적 뷰 스트림이 환경 변화에 대한 강건성을 크게 향상시켰음을 의미합니다.
실제 로봇 실험: 실제 물리적 환경에서 "병 사이 블록 쌓기" 및 "이동하는 물체 추적" 작업에서 기존 방법들이 실패한 경우 (0% 성공) 에도 80% 이상의 성공률을 기록하며, 동적 환경에서의 궤적 재계획 능력을 입증했습니다.
5. 의의 및 결론 (Significance)
이 논문은 로봇 조작 분야에서 시각적 인식 (Vision) 과 운동 제어 (Motor Control) 의 통합을 위한 새로운 패러다임을 제시합니다.
3D 공간 이해의 심화: 단순한 2D 특징 융합을 넘어, 3D 기초 모델을 활용한 기하학적 일관성 학습을 통해 로봇의 공간 추론 능력을 획기적으로 개선했습니다.
동적 환경 적응: 고정된 카메라 뷰에 의존하던 기존 접근법의 한계를 넘어, 인간처럼 움직이는 시각 정보 (Dynamic View) 를 활용하여 예측 불가능한 환경에서도 적응적으로 행동할 수 있는 능력을 부여했습니다.
미래 전망: 이 연구는 복잡한 비정형 환경에서 작동해야 하는 자율 로봇의 개발에 중요한 기초를 제공하며, 비전 기반 로봇 제어의 범위를 확장할 잠재력을 가지고 있습니다.
요약하자면, Cortical Policy는 인간의 뇌 구조를 모방한 이중 스트림 설계를 통해 로봇이 정적인 공간 이해와 동적인 상황 적응을 동시에 수행할 수 있게 하여, 로봇 조작의 신뢰성과 범용성을 크게 향상시킨 획기적인 연구입니다.