← 최신 논문
💻 computer science

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen은 대규모의 고충실도 로봇 조작 데이터 합성 및 제로샷 실세계 정책 전이를 가능하게 하기 위해, 텍스트 또는 단일 이미지로부터 물리적으로 타당하고 상호작용 가능한 테이블탑 장면을 생성하는 학습이 필요 없는 자동화된 엔진입니다.

원저자: Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 지저난 주방 조리대를 정리하는 법을 가르치고 싶다고 상상해 보세요. 이를 안전하고 저렴하게 수행하기 위해, 실제 접시를 깨뜨릴 위험을 감수하는 대신 비디오 게임(시뮬레이션)에서 연습하는 것이 좋습니다. 하지만 여기 문제가 있습니다. 대부분의 비디오 게임 세계는 너무 단순하거나(예: 떠 있는 물체가 있는 평평한 테이블), 혹은 너무 엉망이라서(예: 물체들이 서로 겹치거나 중력을 무시함) 현실성이 떨어집니다. 만약 로봇이 망가진 세계에서 연습한다면, 나쁜 습관을 배우게 되어 실제 현장에서 일을 할 때 실패하게 됩니다.

TabletopGen은 로봇 훈련용 세계를 위한 "마법의 건축가" 역할을 하는 새로운 도구입니다. 이 도구는 텍스트 설명이나 단 한 장의 사진을 읽는 것만으로도, 물리 법칙을 준수하며 현실적인 테이블 위 장면을 처음부터 구축합니다.

작동 방식은 다음과 같이 세 가지 간단한 단계로 나뉩니다.

1. "찰흙 조각가" (생성형 인스턴스 추출)

어질러진 책상 사진이 있다고 가정해 봅시다. 당신은 사진 속의 모든 물건(커피 머그잔, 노트북, 스테이플러 등)을 집어 올릴 수 있는 3D 객체로 만들고 싶습니다.

  • 문제점: 단순히 사진을 복사하기만 하면, 뒷면을 볼 수 없기 때문에 물체들이 평면적으로 보이거나 구멍이 뚫린 것처럼 보일 수 있습니다.
  • TabletopGen의 해결책: 이 도구는 숙련된 조각가처럼 행동합니다. 사진을 보고 각 아이템을 식별한 뒤, 빈 공간을 "채워 넣어" 각 물체의 완전하고 견고한 3D 모델을 만듭니다. 그런 다음, 마치 도공이 물레 위에 점토 그릇을 정렬하듯, 이 물체들을 테이블 위에 놓일 준비가 되도록 똑바로 세웁니다.

2. "풍수지리 마스터" (포즈 및 스케일 정렬)

이제 테이블 위에 놓일 3D 객체 더미가 준비되었습니다. 이제 이 물체들을 사진과 똑같이 보이게 하면서도, 공중에 떠 있거나 나무 테이블 아래로 가라앉지 않도록 배치해야 합니다.

  • 문제점: 그냥 위치를 짐작해서 배치하면, 책이 뒤집혀 있거나 컵이 테이블 위 공중에 두 피트 정도 떠 있는 상황이 발생할 수 있습니다.
  • TabletopGen의 해결책: 완벽한 배치를 위해 두 가지 특수 도구를 사용합니다.
    • 회전 조정기 (DRO): 각 물체를 미세하게 회전시켜 형태와 그림자가 원래 사진과 완벽하게 일치하도록 만듭니다.
    • 탑 뷰 플래너 (TSA): 테이블을 바로 위에서 내려다보는 모습(드론처럼)을 상상합니다. 이 도구는 "상식적인" 물리 법칙(예: "컵은 테이블 안에 있는 것이 아니라 테이블 '위에' 놓인다")을 사용하여, 물체들이 서로 충돌하지 않도록 크기를 결정하고 정확한 위치를 잡습니다. 또한, 모든 물체의 크기가 적절한지 확인하기 위해 하나의 신뢰할 수 있는 물체를 "자(ruler)"로 선택합니다.

3. "게임 빌더" (대화형 시뮬레이션)

물체 배치가 완료되면, 이 도구는 물체들을 물리 엔진(비디오 게임 엔진)에 떨어뜨립니다.

  • 결과: 이 과정은 장면을 플레이 가능한 레벨로 변환합니다. 이제 로봇은 컵을 "집어 올리거나" 책을 "움직이는" 연습을 할 수 있습니다. 만약 로봇이 책을 테이블 아래로 밀려고 하면 책은 떨어집니다. 만약 책을 벽 쪽으로 밀면, 책은 벽에 부딪혀 튕겨 나옵니다.
  • 보너스: 각 물체가 독립적이고 분리되어 있기 때문에, 커피 머그잔을 티팟으로 바꾸거나 노트북을 다른 곳으로 옮기는 등의 작업을 아주 쉽게 할 수 있습니다. 즉, 전체 세계를 다시 만들 필요 없이 수천 개의 새로운 연습 시나리오를 즉석에서 만들어낼 수 있습니다.

이것이 왜 중요한가요?

이 논문은 이러한 "마법의 건축가"가 만든 세계에서 훈련받은 로봇이 실제로도 임무를 수행할 수 있음을 증명합니다.

  • 테스트: 연구진은 실제 테이블 사진을 찍고, 이를 바탕으로 시뮬레이션을 구축한 뒤, 로봇 팔이 과일과 블록을 움직이도록 시뮬레이션에서 훈련시켰습니다. 그 후 로봇에게 실제 테이블에서 똑같은 작업을 수행하도록 했습니다.
  • 결과: 로봇은 성공했습니다! 로봇은 실제 테이블에서 추가적인 연습을 할 필요가 없었습니다. 이는 "마법의 건축가"가 구축한 세계가 로봇에게 실제 기술을 가르칠 수 있을 만큼 충분히 정확하다는 것을 보여줍니다.

요약하자면: TabletopGen은 단 한 장의 사진이나 문장을 완벽하고 물리적으로 정확한 로봇 훈련장으로 바꿔주는 도구입니다. 이를 통해 로봇은 값비싼 실물 데이터를 수집할 필요 없이, 복잡한 과업을 빠르고 안전하게 학습할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →