← 최신 논문
💻 computer science

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

Scene2Demo는 객체-동작 그래프와 피드백 기반 정교화 기술을 활용하여 단일 이미지로부터 고품질의 실행 가능한 임바디드(embodied) 데이터를 자동으로 생성함으로써, 작업 계획 성공률을 크게 향상시키고 효과적인 다운스트림 로봇 정책 학습을 가능하게 하는 자기 진화형 프레임워크입니다.

원저자: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

집 안을 돌아다니며 일상적인 가사 노동을 돕는 로봇은 오랫동안 공상 과학 소설의 꿈이었지만, 이를 실제로 구현하는 것은 완고할 정도로 어려운 현실임이 드러났습니다. 핵심적인 문제는 단순히 기계에게 팔을 움직이는 법을 가르치는 것이 아니라, 무질서하고 예측 불가능한 세상을 이해하고 다음에 무엇을 할지 결정하는 법을 가르치는 것입니다. 이러한 기술을 배우기 위해 로봇은 전통적으로 방대한 양의 데이터를 필요로 합니다. 인간이 과업을 수행하는 모습을 담은 수천 시간의 영상이나, 컴퓨터 시뮬레이션 속에서의 수백만 번의 시행착오가 필요합니다. 이러한 데이터를 수동으로 수집하는 것은 느리고 비용이 많이 들며, 드물거나 위험한 시나리오의 경우 아예 불가능할 때도 많습니다. 연구자들은 이 데이터를 자동으로 생성하기 위해 인공지능을 활용해 왔으나, 초기 시도들은 실제처럼 보이지만 물리 법칙을 위반하거나 로봇이 실제로 따를 수 없는 지침을 생성하는 경우가 많았습니다. 과제는 로봇이 과업을 성공적으로 연습할 수 있도록, 단 한 장의 방 사진과 간단한 요청을 받아 물리 법칙에 기반한 작동 가능한 시뮬레이션을 구축하는 시스템을 만드는 것이었습니다.

한 연구팀은 스스로 진화하는 데이터 공장 역할을 하는 SCENE2DEMO라는 새로운 시스템을 도입하여 이 문제를 해결했습니다. 과정은 실제 주방과 같은 실제 방의 사진 한 장과 "컵을 집어라"와 같은 사용자의 간단한 텍text 명령으로 시작됩니다. 시스템은 먼저 고급 컴퓨터 비전을 사용하여 그 사진을 완전히 상호작용 가능한 3D 시뮬레이션으로 재구성합니다. 시스템은 물체의 형태와 위치를 식별하여 중력이나 충돌과 같은 물리 법칙을 준수하는 디지털 트윈(digital twin)을 생성합니다. 일단 이 가상 공간이 구축되면, 시스템은 단순히 로봇이 어떻게 움직여야 할지 추측하는 데 그치지 않고, 사용자의 요청을 작고 관리 가능한 단계들의 논리적인 순서로 분해합니다. 시스템은 과업을 하나의 지도처럼 취급하며, 각 정거장을 문을 열거나 물체를 들어 올리는 것과 같은 구체적인 동작으로 설정하고, 한 단계의 끝이 다음 단계의 시작을 완벽하게 준비하도록 보장합니다.

그다음 시스템은 시뮬레이션에서 이 계획을 실행하려고 시도합니다. 만약 로봇이 성공하면, 시스템은 향후 학습을 위한 완벽한 예시로서 전체 움직임과 카메라 뷰를 기록합니다. 하지만 SCENE2DEMO의 진정한 힘은 로봇이 실패했을 때 나타납니다. 기존의 많은 시스템에서는 실패가 단순히 폐기되었습니다. 그러나 여기서는 자기 진화 메커니즘을 채택하고 있습니다. 로봇이 문에 부딪히거나 물체를 떨어뜨리는 등 단계가 잘못되면, 두 개의 특화된 디지털 에이전트가 개입하여 조사합니다. 한 에이전트는 안전 검사관 역할을 하며, 여러 카메라 각도에서 실패 영상을 관찰하여 정확히 무엇이 잘못되었는지 찾아냅니다. 다른 에이전트는 감독관 역할을 하며, 그 시각적 증거를 사용하여 계획을 다시 작성합니다. 예를 들어, 과업을 다시 시도하기 전에 로봇의 베이스를 약간 왼쪽으로 옮기거나 팔을 조금 더 뻗도록 제안할 수 있습니다. 시도하고, 실패하고, 분석하고, 수정하는 이 루프는 로봇이 과업을 성공적으로 완료할 때까지 자동으로 반복됩니다.

연구진은 컵을 집는 것과 같은 단순한 작업부터 냉장고에 컵을 넣는 것과 같은 복잡한 다단계 가사 노동에 이르기까지 100개 이상의 다양한 시나리오에서 이 접근 방কে 테스트했습니다. 자기 수정 기능이 없었을 때, 시스템은 단순한 과업에서 약 72%의 성공률을 보였습니다. 하지만 더 복잡하고 긴 호흡의 과업을 위해 자기 진화 루프를 추가했을 때, 성공률이 크게 향 만큼 향상되었으며 개별 단계의 품질 또한 훨씬 더 신뢰할 수 있게 되었습니다. 시스템은 자동으로 생성된 이러한 예시들을 통해 학습할 수 있는 고품질의 훈련 데이터를 생성할 수 있었습니다. 로봇이 이 데이터로부터 학습했을 때, 냉장고 문 열기에서 96%, 컵 집기에서 92%의 성공률을 달rat 달성하며, 기계가 생성한 데이터가 실제 세계에서 과업을 수행하도록 로봇을 가르칠 만큼 견고하다는 것을 입증했습니다.

이 연구는 우리가 로봇이 세상과 상호작용하는 모든 가능한 방식을 수동으로 기록할 필요가 없다는 점을 시사합니다. 대신, 현실적인 시뮬레이션과 자신의 실수를 통해 배울 수 있는 피드백 루프를 결합함으로써, 우리는 방대한 양의 신뢰할 수 있는 훈련 데이터를 생성할 수 있습니다. 이 시스템은 마법이나 완벽한 시각에 의존하는 것이 아니라, 문제를 분해하고, 테스트하고, 시각적 증거를 바탕으로 해결책을 개선하는 구조화된 프로세스에 의존합니다. 현재의 시스템은 특정 유형의 움직임과 물체로 제한되어 있고 가장 복잡한 물리적 제약 조건에는 여전히 어려움을 겪고 있지만, 명확한 발전 방향을 보여줍니다. 훈련 데이터 생성을 자동화함으로써, 이 접근 방식은 궁극적으로 로봇이 방 사진을 보고 명령을 받는 것만으로도 새로운 기술을 빠르고 안전하게 배울 수 있게 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →