← 최신 논문
🤖 AI

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys는 단일 뷰 1인칭 시점 RGB 비디오로부터 제어 가능한 변형 가능한 디지털 트윈을 생성하기 위해 일반화 가능한 물리 모델을 학습하며, 객체별 최적화 없이도 복잡한 역학의 제로샷 예측을 가능하게 하고 실세계 로봇 계획을 용이하게 하는 프레임워크이다.

원저자: Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 하는 모든 것을 기록하는 스마트 글래스를 착용하고 있다고 상상해 보세요. 당신은 수건을 집어 들어 흔들고, 접고, 침대 위로 던집니다. 이제, 로봇이 그 영상을 보고 그 수건이 어떻게 작동하는지, 즉 무게는 얼마인지, 얼마나 잘 늘어나는지, 그리고 다른 각도에서 잡아당기면 어떻게 출렁거릴지를 즉각적으로 이해한다고 상상해 보세요.

이것이 바로 UC 샌디에이고 연구진이 개발한 새로운 시스템인 EgoPhys의 핵심 아이디어입니다. 일상적인 비유를 사용하여 이 시스템이 어떻게 작동하는지 쉽게 설명해 드리겠습니다.

문제점: 로봇은 '부드러운 것'을 이해하지 못한다

로봇은 상자나 컵 같은 딱딱한 물체를 움직이는 데는 뛰어나지만, 담요, 반죽, 옷과 같이 부드럽고 말랑말랑한 물체는 로봇에게 악몽과 같습니다. 컴퓨터에서 이러한 물체를 시뮬레이션하려면 보통 값비싼 3D 스캐너, 완벽한 조명, 그리고 모든 미세한 세부 사항을 측정하는 데 많은 시간이 필요합니다.

기존 방식은 마치 스튜디오에서 전문가가 보여주는 슬로 모션 영상을 보며 저글링을 배우는 것과 같습니다. 정확하긴 하지만, 지저도 못한 주방에서 초보자가 찍은 흔들리는 영상을 보고 배울 때는 제대로 작동하지 않습니다.

해결책: '인간의 놀이'로부터 배우기

EgoPhys는 에고센트릭 비디오(egocentric video), 즉 사람의 시점에서 촬영된 영상(예: 머리에 쓴 고프로 영상)을 통해 학습 방식을 바꿉니다.

  1. "마법의 안경" (에고센트릭 비디오): 이 시스템은 사람이 부드러운 물체(수건을 잡아당기거나 인형을 꾹꾹 누르는 등)와 상호작용하는 단순한 영상을 사용합니다. 깊이 센서나 특수 카메라가 필요하지 않습니다. 일반적인 영상 피드만 있으면 됩니다.
  2. "거친 스케치" (Coarse Initialization): 먼저, 시스템은 물체의 기본적인 3D 모델을 구축하고 일반적인 물리적 특성을 추측합니다. 이것은 마치 아이가 강아지를 대략적으로 그리는 것과 같습니다. 강아지처럼 보이지만 다리 부분이 약간 흔들릴 수 있는 상태입니다.
  3. "치트 시트" (The Codebook): 이것이 이 논문의 핵심 혁신입니다. 매번 새로운 물체마다 물리 법칙을 처음부터 계산하려고 하면 너무 느리고 어렵기 때문에, EgoPhys는 압축된 "치트 시트" 또는 **"물리 규칙 라이브러리"**를 만듭니다.
    • 예를 들어, 당신에게 "잘 늘어나는 규칙"과 "말랑말랑한 규칙"이 담긴 도서관이 있다고 상상해 보세요.
    • 로봇이 한 번도 본 적 없는 새로운 수건을 보게 되면, 처음부터 물리학을 다시 배울 필요가 없습니다. 그저 수건을 보고 자신의 "치트 시트"를 확인한 뒤 즉시 알게 됩니다. "아, 이건 내 라이브러리에 있는 '폭신한 수건' 항목이구나. 어떻게 굽혀질지 정확히 알겠어."

실제 적용 사례

연구진은 다양한 부드러운 물체(수건, 봉제 인형, 가방)와 상호작용하는 사람들의 데이터셋을 통해 이 시스템을 훈련시켰습니다. 그들은 AI가 이러한 상호작용의 복잡한 물리학을 작고 재사용 가능한 코드북으로 응축하도록 가르쳤습니다.

  • "개별 스프링" 숙제가 없다: 보통 컴퓨터가 부드러운 물체를 시뮬레이션하려면, 새로운 물체를 볼 때마다 물체 내부의 아주 작은 스프링 하나하나에 대해 수학 문제를 풀어야 합니다. EgoPhys는 이 과정을 건너뜁니다. "치트 시트"를 사용하여 무거운 수학 계산 없이도 동작을 즉각적으로 예측합니다.
  • 제로샷 일반화 (Zero-Shot Generalization): 이는 만약 EgoPhys에게 한 번도 본 적 없는 새로운 종류의 천을 가지고 노는 영상을 보여주더라도, 그 천이 어떻게 움직일지 여전히 예측할 수 있음을 의미합니다. 이는 마치 새로운 종류의 젤리를 처음 봤을 때, '젤리다움'의 일반적인 규칙을 이해하고 있기 때문에 그것이 어떻게 출렁거릴지 즉시 아는 것과 같습니다.

로봇 테스트

팀은 이 시스템이 실제 세계에서 작동하는지 증명하기 위해 Ego-Phys를 실제 로봇 팔(xArm6)에 연결했습니다.

  1. 그들은 로봇에게 사람이 수건을 가지고 노는 영상을 보여주었습니다.
  2. EgoPhys는 컴퓨터 안에 그 수건의 "디지털 트윈"(가상 복제본)을 구축했습니다.
  3. 로봇은 이 디지털 트윈을 사용하여 실제 수건을 어떻게 움직일지 계획했습니다.
  4. 결과: 로봇은 시뮬레이션에서 만든 계획에 따라 실제 수건을 성공적으로 움직였습니다. 실제 결과가 컴퓨터의 예측과 일치했으며, 이는 로 로봇이 인간의 영상을 통해 물리학을 "학습"하고 이를 자신의 몸에 적용할 수 있음을 입증했습니다.

이것이 중요한 이유

이 논문은 이것이 단 하나의 보정되지 않은 웨어러블 비디오만으로 부드러운 물체의 완전하게 상호작용 가능하고 물리적으로 정확한 모델을 구축하는 첫 번째 시스템이라고 주장합니다.

  • 이전에는: 부드러운 물체를 시뮬레이션하기 위해 실험실, 3D 스캐너, 그리고 몇 시간의 계산 시간이 필요했습니다.
  • 이제는: 스마트 카메라로 영상을 찍기만 하면, AI가 로봇이 행동을 계획하는 데 사용할 수 있는 물리 모델을 즉시 구축합니다.

요약하자면, EgoPhys는 인간이 물건을 가지고 노는 모습을 관찰함으로써 로봇에게 세상의 "말랑말랑함"을 이해하도록 가르치며, 단순한 영상을 로봇 계획을 위한 강력한 도구로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →