← 최신 논문
💻 computer science

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP는 훈련이 필요 없는 물리 기반 탐색 계층을 코드 기반 정책(code-as-policy) 프레임워크에 통합하여, 질량 및 강성과 같은 잠재적 객체 속성을 추론하기 위한 효율적이고 표적화된 정보 탐색을 가능하게 하는 이중 에이전트 계획 및 우선순위 지정 시스템을 통해 로봇 조작 능력을 향상시키는 새로운 에이전트입니다.

원저자: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 가시적인 세계의 숙련가였습니다. 만약 컵을 탁자에서 싱크대로 옮기는 작업이 포함된다면, 현대의 로봇은 종종 컵을 보고, 경로를 계획하며, 인상적인 우아함으로 그 움직임을 실행할 수 있습니다. 이러한 성공은 시각-언어-행동 정책(vision-language-action policies), 즉 인간이 과업을 수행하는 것을 관찰하고 그 움직임을 모방함으로써 학습하는 시스템에 의존합니다. 하지만 이러한 시스템은 근본적인 한계에 직면해 있습니다. 바로 표면 위에 있는 것만을 본다는 점입니다. 이들은 캔이 비었는지 알기 위해 무게를 느낄 수도 없고, 과일이 익었는지 알기 위해 단단함을 감지할 수도 없습니다. 현실 세계에서 많은 과업은 이러한 숨겨진 물리적 특성에 달려 있습니다. 주방을 청소하는 인간은 탄산음료 캔을 흔들어 비었는지 소리를 듣거나, 아보카도를 눌러보며 익었는지 확인하는 등, 시각이 남긴 빈틈을 채우기 위해 촉각과 청각을 사용합니다. 이러한 숨겨진 정보를 능동적으로 찾아내는 능력이 없다면, 로봇은 과업의 성공과 실패를 결정짓는 바로 그 세부 사항들에 대해 눈이 먼 상태로 남게 됩니다.

국립 타이완 대학교와 NVIDIA의 연구진은 이 간극을 메우기 위한 새로운 접근 방식을 개발하여, PhysCaP라고 불리는 시스템을 만들어냈습니다. 이 시스템은 로봇이 스스로 지침을 작성하는 능력과 새로운 물리적 탐색 능력을 결합하여, 호기심 많은 인간처럼 행동하도록 가르칩니다. 단순히 관찰하고 복제하는 대신, 로봇은 물리적 세계에 질문을 던부도록 설계되었습니다. 답이 숨겨져 있는 물체들이 놓인 탁자에 직면했을 때, 로봇은 추측하지 않습니다. 대신 아이템을 들어 올리거나 누르는 등의 상호작 작용을 통해 필요한 특정 데이터를 수집하기로 결정합니다. 이 시스템은 '코드-애즈-폴리시(code-as-policy)' 프레임워크를 기반으로 구축되었는데, 이는 로봇이 자신의 움직임을 제어하기 위해 실행 가능한 컴퓨터 코드를 생성함을 의미하며, 이를 통해 인간이 일련의 행동 순서를 계획하는 것과 매우 유사하게 복잡한 단계들을 추론할 수 있게 합니다. PhysCaP를 독특하게 만드는 것은 '물리 정보 기반 탐색 계층(physics-informed exploration layer)'의 추가입니다. 이 계층을 통해 로봇은 촉각 센서나 저울 같은 특수 센서 없이도, 오직 자신의 모터와 관절으로부터 오는 피드백만을 사용하여 질량이나 강성 같은 속성을 추정할 수 있습니다.

이 새로운 시스템의 핵심은 너무 빨리 행동하거나 시간을 낭비하는 것 사이의 미묘한 균형을 관리하는 이중 에이전트 설계입니다. 한 에이전트인 '플래너(Planner)'는 장면을 살펴보고 로봇이 과업을 완수하기에 충분한 정보를 가지고 있는지 결정합니다. 만약 정보가 부족하다면, 플래너는 이를 찾기 위한 잠재적 행동 목록을 생성합니다. 그다음 두 번째 에이전트인 '프라이오리타이저(Prioritizer)'가 이 목록을 검토하고 시각적 단서에 따라 행동의 우선순위를 매깁니다. 예를 들어, 네 개의 캔 중 빈 탄산음료 캔을 찾는 과업이라면, 프라이오리타이저는 두 개는 밀봉되어 있고 두 개는 빨대가 꽂혀 있다는 점을 알아차립니다. 이 에이전트는 밀봉된 캔은 가득 차 있을 가능성이 높다고 논리적으로 추론하여, 먼저 열려 있는 캔들을 확인하도록 우선순위를 정합니다. 이는 로봇이 정답을 담고 있지 않을 가능성이 높은 물체에 에너지를 낭비하는 것을 방지합니다. 로봇이 충분한 증거를 수집하면, 시스템은 탐색을 멈추고 최종 과업을 실행합니다.

이 아이디어를 테스트하기 위해 연구진은 실제 탁자 위에 세 가지 뚜렷한 도전 과제를 설정했습니다. 한 과업에서는 파란색 큐브가 세 개의 컵 중 하나 아래에 숨겨져 있었는데, 한 컵은 큐브를 담기에 너무 작았습니다. 시각에만 의존하는 로봇은 모든 컵을 들어 올리겠지만, PhysCaP는 추론 능력을 사용하여 크기 차이를 포착하고 불가능한 컵은 건너뛰어 실행 가능한 후보들만 들어 올렸습니다. 또 다른 과업에서 로봇은 네 개의 캔 중 단 하나의 빈 탄산음료 캔을 찾아야 했습니다. 모터 피드백을 통해 무게를 측정하는 능력을 사용하여, 로봇은 빈 캔을 성공적으로 식별했습니다. 세 번째 과업에서 로봇은 초록색과 검은색 아보카도 무리 중에서 잘 익은 아보카도를 골라야 했습니다. 검은색 아보카도를 눌러 단단함을 측정함으로써, 로듐은 익은 것을 선택하고 딱딱하고 덜 익은 과일은 무시했습니다. 이 모든 시나리오에서 이 시스템은 다른 방식들이 실패한 지점에서 성공했습니다. 시각에만 의존하는 로봇은 숨겨진 속성을 볼 수 없었기 때문에 과업을 해결할 수 없었습니다. 속성을 측정할 수는 있지만 이를 우선순위화하는 추론 능력이 부족한 로봇은 모든 물체를 확인하느라 훨씬 더 많은 시간과 에너지를 소모했습니다.

결과에 따르면 PhysCaP는 경쟁 모델들보다 훨씬 적은 수의 물체와 상호 작용하면서도 높은 성공률로 과업을 완료할 수 있었습니다. 실제 테스트에서 이 시스템은 무분별하게 모든 것을 확인하는 시스템보다 현저히 적은 물리적 접촉과 짧은 시간 안에 숨겨진 큐브, 빈 캔, 그리고 잘 익은 아보카도를 찾아냈습니다. 연구진은 디지털 환경에서도 시스템이 어떻게 작동하는지 확인하기 위해 시뮬레이션을 실행했으며, 결과는 동일했습니다. 무엇을 측정할지, 언제 멈출지를 추론할 수 있는 시스템이 단순히 추측하거나 모든 것을 확인하려는 모델보다 뛰어난 성능을 보였습니다. 이 연구는 로봇이 진정으로 무질서하고 예측 불가능한 현실 세계에서 작동하기 위해서는, 시각만으로는 드러낼 수 없는 물리적 진실을 능동적으로 찾아내야 함을 확인시켜 줍니다. 로봇에게 올바른 질문을 던지고 물리적 세계가 제공하는 답변에 귀를 기울이는 능력을 부여함으로써, 이 연구는 인간 삶의 미묘하고 촉각적인 복잡성을 다룰 수 있는 기계에 한 걸음 더 다가서고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →