← 최신 논문
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

본 논문은 RGB 이미지와 고유 수용 감각만을 사용하여 카메라 시점 변화에 대한 강건함을 달성하기 위해 플로우 기반 시각-언어-행동 정책을 정규화하는 교차 뷰 행동 일관성 방법을 제안하며, 이는 카메라 레이블이나 깊이 입력을 요구하지 않고도 시뮬레이션 및 실제 로봇 작업 모두에서 성능을 크게 향상시킨다.

원저자: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

게시일 2026-09-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 시연으로부터 학습하는 로봇들은 점점 더 유능해지고 있지만, 종종 독특한 취약성을 겪곤 합니다. 바로 자신이 학습되었던 특정 관점에 묶여 있다는 점입니다. 상단 선반에 카메라가 놓인 상태에서 로봇이 컵을 집는 법을 배웠다고 가정해 봅시다. 만약 이 카메라가 부딪히거나, 옆으로 이동하거나, 더 높이 올려진다면, 컵과 탁자, 그리고 로봇 자신의 몸은 전혀 움직이지 않았음에도 불구하고 로봇은 갑자기 실패할 수 있습니다. 이는 로봇의 '두뇌', 즉 무엇을 보는지와 무엇을 해야 하는지를 연결하는 일종의 인공지능이 원래 카메라의 정확한 각도를 기준으로 작업을 인식하도록 학습되었기 때문입니다. 현실 세계에서는 카메라가 부딪히기도 하고, 로봇이 움직이기도 하며, 조명이 변하기도 하므로, 시점이 바뀐 것에 적응하지 못하는 시스템은 진정으로 유용하다고 할 수 없습니다. 연구자들은 로봇에게 3D로 보는 깊이 카메라와 같은 더 복잡한 센서를 부여하거나, 공간의 기하학적 구조를 이해하도록 가르치는 방식으로 이를 해결하려 노력해 왔지만, 이러한 솔루션들은 종-종 값비싼 하드웨어나 유지 관리가 어려운 복잡한 보정 과정을 필요로 합니다.

칭화 대학교와 암스테르담 대학교의 연구팀은 새로운 센서를 추가하거나 실제 세계에서 로봇의 작동 방식을 변경하지 않고도 카메라 움직임에 강한 로봇 정책을 만드는 방법을 찾아냈습니다. 그들은 단순히 다음 동작을 추측하는 것이 아니라, 마치 물이 목적지를 향해 흐르는 것처럼 동작의 '흐름(flow)'을 예측하며 학습하는 특정 종류의 로лот 컨트롤러에 집중했습니다. 그들 발견의 핵심은 로봇이 스스로와 일치하도록 강제하는 학습 방법입니다. 연구진은 동일한 물리적 장면을 두 가지 다른 각도에서 보여주는 한 쌍의 훈련 이미지를 만들었습니다. 하나는 원래의 카메라 위치에서 본 것이고, 다른 하나는 약간 이동된 위치에서 본 것입니다. 결정적으로, 그들은 두 이미지에 대해 로봇이 정확히 동일한 동작을 수행하도록 지시했습니다. 두 가지 뷰에 대해 동일한 움직임의 흐름을 예측하도록 로봇을 훈련함으로써, 카메라 위치의 변화를 무시하고 오직 과업 자체에만 집중하도록 가르친 것입니다.

연구진은 이 아이디어를 카메라 시점 변화를 처리하는 능력을 전문적으로 테스트하기 위해 설계된 벤치마크인 LIBERO-Plus를 사용하여 시뮬레이션 환경에서 테스트했습니다. 그들은 이 새로운 방법을 표준 훈련 기법들과 비교했습니다. 카메라가 이동했을 때, 표준 방식으로 훈련된 로봇은 약 17%의 시도에서만 성공했습니다. 다양한 카메라 각도로 훈련받되 이들의 특별한 일관성 규칙을 적용하지 않은 로봇은 약 75%의 성공률로 개선되었습니다. 그러나 이들의 교차 뷰 일관성(cross-view consistency) 규칙으로 훈련된 로봇은 87.2%의 성공률에 도달했습니다. 이 향상은 다양한 무작위 훈련 시작 지점에서도 일관되게 나타났습니다. 또한 연구진은 이 성공이 두 이미지가 동일한 물리적 상태를 보여준다는 사실에 전적으로 의존한다는 것을 증명했습니다. 그들이 훈련 데이터를 뒤섞어 로봇이 특정 상태를 위한 동작을 다른 뷰와 매칭하도록 했을 때, 성능은 25.8%로 급락했습니다. 이는 로봇이 단순히 답변을 매끄럽게 만든 것이 아니라, 서로 다른 뷰를 동일한 동작에 연결하는 법을 진정으로 학습했다는 것을 보여줍니다.

이것이 단지 컴퓨터 시뮬레이션의 결과가 아님을 확인하기 위해, 연구팀은 이 방법을 실험실의 실제 로봇 팔에 적용했습니다. 그들은 동일한 탁자를 관찰하는 세 개의 동기화된 카메라를 사용하여 훈련 데이터를 수집함으로써, 실제 세계로부터 필요한 뷰의 쌍을 만들 수 있었습니다. 그 후, 훈련 과정에서 한 번도 본 적 없는 위치에 배치된 단일 카메라를 사용하여 로봇을 테스트했습니다. 새로운 방법으로 훈련된 로로봇은 이러한 미학습 카메라 테스트에서 74.4%의 성공률을 보인 반면, 표준 방식은 53.3%에 그쳤습니다. 개선 효과는 헤드폰을 스탠드에서 제거하는 것과 같은 어려운 과업에서 가장 극적으로 나타났는데, 표준 방식은 새로운 카메라 위치에서 완전히 실패했지만, 새로운 방식은 시도의 거의 절반 가까이 성공했습니다. 이 연구는 로봇에게 서로 다른 각도에서 자신의 동작에 대한 일관성을 가르침으로써, 추가적인 카메라, 깊이 센서, 또는 복잡한 기하학적 지도 없이도 로봇이 실제 세계에서 훨씬 더 신뢰할 수 있게 될 수 있음을 확인시켜 줍니다. 로봇은 단순히 그림이 바뀌더라도 과업은 동일하다는 것을 학습하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →