Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
이 논문은 기하학적 구조를 복구하고, 물리적 파라미터를 추론하며, 장면 구성 요소를 조립함으로써 노동 집약적인 실제 세계의 로봇 상호작용을 실행 가능한 물리 시뮬레이션으로 변환하는 과정을 자동화하여 다양한 조작 및 동작 도메인 전반에 걸친 확장 가능한 정책 학습과 평가를 가능하게 하는 비전-언어 에이전트 프레임워크인 Agentic Real2Sim을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 컵 쌓기나 빨래 접기 같은 새로운 기술을 가르치는 모습을 상상해 보세요. 실제 사람이 하는 모습을 촬영하는 데 몇 달을 보낼 수도 있겠지만, 그 후에는 로봇이 연습할 수 있도록 컴퓨터 프로그램 안에 모든 컵, 테이블, 손의 움직임을 일일이 다시 만들어야 합니다. 이는 마치 비디오 게임 캐릭터를 가르치기 위해 그들이 사는 세상의 모든 픽셀을 손으로 직접 색칠하는 것과 같습니다. 이것이 바로 "Real-to-Sim" 문제입니다. 즉, 지저받은 실제 영상을 깔끔하고 플레이 가능한 디지털 트윈으로 바꾸는 작업입니다. 과학자들은 이를 자동화하려고 노력해 왔지만, 테이블의 높이나 컵의 무게를 측정할 때 발생하는 아주 작은 실수 하나가 전체 시뮬레이션을 망가뜨리는 취약한 과정인 경우가 많았습니다.
"에이전틱(Agentic)" AI의 세계로 들어와 봅시다. AI 에이전트를 단순한 계산기가 아니라, 작고 매우 똑똑한 프로젝트 매니저라고 생각해 보세요. 에이전트는 단순히 고정된 지침 목록을 따르는 대신, 엉망인 상황을 살펴보고, 어떤 도구를 사용할지 결정하며, 자신의 작업을 확인하고, 실시간으로 실수를 바로잡을 수 있습니다. "Agentic Real2Sim"이라는 제목의 이 논문은 중요한 질문을 던집니다. 이 똑똑한 AI 프로젝트 매니저들을 사용하여 로봇이 과업을 수행하는 영상을 어떻게 하면 그 순간과 똑같은 고품질의 플레이 가능한 디지털 버전으로 자동 변환할 수 있을까? 목표는 단순히 예쁜 3D 그림을 만드는 것이 아닙니다. 로봇이 해당 과업을 다시 시도하고, 실수로부터 배우고, 인간이 일일이 숫자를 조정하지 않아도 스스로 더 나아질 수 있는 물리적으로 정확한 세계를 만드는 것입니다.
저자들은 이 퍼즐을 풀기 위해 디지털 탐정과 엔지니어가 함께 협력하는 것처럼 작동하는 Agentic Real2Sim이라는 새로운 프레임워크를 소개합니다. 이 시스템은 사람이 수동으로 3D 모델을 정리하거나 물체의 무게를 추측하는 대신, "시각-언어 에이전트"(이미지를 보고 언어를 이해하는 AI)를 사용하여 전체 과정을 조율합니다. 이 시스템은 실제 로봇이 물체와 상호작용하는 영상(예: DROID 로봇이 도구를 집어 올리는 모습)을 받아들여, 작업을 처리하는 네 가지 전문화된 단계로 나누며, 각 단계는 팀 내의 서로 다른 "에이전트"에 의해 처리됩니다.
첫째, **시각 처리 에이전트(Visual Processing Agent)**가 영상을 관찰합니다. 이는 마치 현장 감식 전문가가 최적의 프레임을 선택하기 위해 동작을 일시 정지하고, 로봇이 만지는 물체를 잘라내며, 3D 모델을 구축하는 것과 같습니다. 이 에이전트는 로봇의 위치, 카메라의 위치, 그리고 바닥의 상태를 파악합니다. 만약 AI가 그림자나 반사 때문에 혼란을 겪는다면, 다른 프레임을 사용하여 다시 시도하라고 스스로에게 요청할 수 있습니다.
다음으로, **물리적 사전 지식 추론 에이전트(Physical-Prior Inference Agent)**가 투입됩니다. 이들은 그룹 내의 "물리 선생님"입니다. 이 에이전트는 3D 모델을 보고 컴퓨터가 시뮬레이션을 실제처럼 느끼게 만드는 데 필요한 보이지 않는 속성들을 추측합니다. "이 물체는 금속인가 고무인가? 얼마나 무거운가? 얼마나 튀어 오르는가?"와 같은 질문을 던집니다. 이들은 디지털 모델에 이러한 물리적 규칙을 부착하여, 시뮬레이션이 실행될 때 무거운 상자가 가벼운 상자와 다르게 떨어지도록 만듭니다.
그다음, **장면 준비 에이전트(Scene Preparation Agent)**는 무대 감독 역할을 합니다. 이 에이전트는 모든 3D 모델, 로봇의 시작 위치, 카메라 각도를 가져와서 MuJoCo라는 물리 엔진 안에 전체 디지털 세계를 설정합니다. 로봇의 발이 지면에 닿아 있는지, 물체들이 올바른 위치에 있는지 확인합니다.
마지막으로, **시뮬레이터 루프 내 에이전트(Simulator-in-the-Loop Agent)**는 품질 관리 검사관입니다. 이 에이전트는 시뮬레이션을 실행하여 로봇이 실제로 물체를 잡을 수 있는지 확인합니다. 만약 디지털 컵의 위치가 실제보다 아주 약간 멀리 놓여 있어서 로봇이 컵을 놓친다면, 이 에이전트는 실패를 감지하고 위치를 미세하게 조정한 뒤, 성공할 때까지 "시도, 확인, 수정, 재시도"의 과정을 자동으로 반복합니다.
연구진은 이 시스템을 물건을 집거나 놓는 등의 과업이 포함된 100개의 서로 다른 로봇 영상(DROID-100 데이터셋)으로 테스트했습니다. 그 결과, 시스템은 약 100개 중 48개의 에피소드를 로봇이 과업을 재현할 수 있는 플레이 가능한 현실적인 시뮬레이션으로 성공적으로 변환할 수 있었습니다. 이는 거의 절반의 시도가 여전히 어려움에 직면했거나 추가적인 개선이 필요함을 의미하지만, 결과는 유망했습니다. 또한 이 시스템은 다양한 유형의 도전 과제를 처리할 수 있을 만큼 유연했습니다. 천이나 로프와 같은 부드럽고 말랑말랑한 물체(변형 가능한 물체)를 시뮬레이션할 수 있었으며, 휴머노이드 로봇이 걸어 다니는 움직임까지도 구현할 수 있었습니다.
가장 흥oli로운 발견 중 하나는 비용에 관한 것이었습니다. 팀은 에이전트를 구동하기 위해 다양한 "두뇌"(AI 모델)를 사용하여 시스템을 테스트했습니다. 그들은 더 작고 오픈 소스인 AI 모델(310억 개의 파라미터를 가진 Gemma 4)이 대형 기술 기업의 훨씬 더 비싼 독점 모델만큼 잘 수행한다는 것을 발견했습니다. 실제로, 더 저렴한 모델을 사용하는 것이 동일한 횟수의 변환을 수행하는 데 비용이 약 31배 적게 들었습니다. 이는 디지털 트윈을 구축하기 위해 반드시 가장 비싸고 강력한 AI가 필요한 것은 아니며, 똑똑하고 효율적인 에이전트가 훨씬 적은 비용으로 핵심적인 역할을 수행할 수 있음을 시사합니다.
결론적으로, 이 시스템은 아직 완벽하지 않지만(여전히 복잡한 시각적 오류나 까다로운 물리 법칙에 어려움을 겪습니다), 큰 진전을 의미합니다. 인간이 수동으로 시뮬레이션을 구축하는 대신, 우리는 AI 에이전트가 로봇의 작업을 관찰하고, 그 순간의 디지털 트윈을 구축하며, 다른 로봇이 그로부터 배울 수 있게 하는 미래를 향해 나아가고 있습니다. 저자들은 향-후 이 디지털 트윈들이 로봇이 새로운 기술을 더 빠르고 안전하게 배울 수 있도록 훈련하는 데 사용되기를 희망하며, 물리적 세계의 무질서한 현실을 학습을 위한 놀이터로 바꾸기를 기대하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.