← 최신 논문
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

이 논문은 세 가지 시계열 분리 루프를 통해 코드 기반 비평가(critics)와 회복 기술을 온라인으로 동적으로 업데이트함으로써 자가 진화하는 물리적 지능을 가능하게 하는 폐쇄 루프 체화형 하네스인 Zetta를 제시하며, 벤치마크 작업에서 최첨단 성능과 상당한 추론 속도 향상을 달달성하는 동시에 제로샷 전이와 창발적 "아하 모먼트(Aha Moments)"를 입증한다.

원저자: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 공장에서 단순하고 반복적인 작업을 수행할 수 있었지만, 실제 가정이나 작업장의 무질서하고 예측 불가능한 특성을 다룰 수 있는 유연성을 부여하는 것은 인공지능 분야에서 가장 어려운 과제 중 하나로 남아 있었습니다. 수년 동안 연구자들은 로봇에게 방대한 양의 비디오 데이터를 입력하여, 기계가 모든 가능한 상황에 대응할 수 있는 단 하나의 완벽한 지침 세트를 학습하기를 기대하며 노력해 왔습니다. 이러한 접근 방식은 강력하지만, 현실 세계가 훈련 영상에서 조금이라도 벗어날 때 종종 실패하곤 합니다. 그리퍼의 미세한 미끄러짐이나 조명의 변화만으로도 로봇이 멈추거나 충돌할 수 있기 때문입니다. 대안적인 경로가 등장했는데, 로봇을 정적인 프로그램이 아니라 생각하고 계획하며 도구를 사용할 수 있는 에이전트로 취급하는 것입니다. 그러나 이러한 더 똑똑한 에이전트들조차 실시간으로 자신의 실수를 통해 배우는 데 어려움을 겪었습니다. 대부분의 시스템은 작업을 시도하고, 실패한 후, 전체 시도가 모두 끝난 후에야 무엇이 잘못되었는지 반성하는 루프 내에서 작동합니다. 오류를 분석할 때쯤이면 수정할 순간은 이미 지나가 버리고, 물리적 상호작용은 이미 깨진 상태가 됩니다.

칭화 대학교와 Z-Trans AI의 연구팀은 로봇이 학습하는 방식을 바꾸는 '제타(Zetta)'라는 새로운 시스템을 선보였는데, 이는 사고(thinking)와 행동(acting) 사이의 간극을 메우는 방식입니다. 제타는 작업이 끝날 때까지 기다리는 대신, 로봇이 움직이는 동안 자신의 물리적 상태를 지속적으로 모니터링하여 오류가 발생하는 즉시 이를 포착하고 즉각적으로 수정할 수 있게 합니다. 이 시스템은 로봇의 핵심 두뇌를 다시 훈련시키려 하지 않으며, 핵심 두뇌는 고정되고 안정된 상태로 유지됩니다. 대신, 로봇의 손과 만지는 물체를 감시하는 작고 특화된 모니터인 '런타임 크리틱(runtime critics, 실행 시점 비판자)' 계층을 구축합니다. 만약 크리틱이 움켜쥔 것이 미끄러지거나 물체가 떨어지기 직전임을 감지하면, 로봇이 통제력을 잃기 전에 상황을 구제하기 위해 미리 프로그래밍된 복구 기술을 실행합니다. 이는 로봇이 근본적인 세계관을 바꾸는 것이 아니라, 물리적 실패를 처리하는 검증된 방법들의 라이브러리를 축적함으로써 특정 작업에 대해 더 나아지는 자기 진화적 루프를 생성합니다.

연구진은 이 접근 방식을 두 가지 주요 로봇 조작 벤치마크, 즉 물체를 서로 다른 위치로 이동시키는 작업들과 서랍을 열거나 가전제품을 켜는 것과 같은 더 복잡한 가사 노동 세트에 테스트했습니다. 시뮬레이션에서 이 시스템은 어려운 작업에 대해 약 35%의 성공률을 가진 기본 로봇 정책에서 시작했습니다. 시스템이 수천 번의 시행착차를 거치면서, 시스템은 무엇이 잘못되었는지 구체적인 순간들을 식별하기 시작했습니다. 시스템은 이러한 실패들을 그룹화하고, 근본 원인을 파악하며, 이를 해결하기 위한 새로운 코드를 작성했습니다. 단 몇 차례의 자기 수정 과정만으로, 어려운 작업에 대한 성공률은 90% 이상으로 급등했습니다. 시스템은 단순히 운이 좋았던 것이 아니라, 한동안 고전하다가 갑자기 물리적 원칙(예: 들어 올리기 전에 움켜쥐기를 안정시켜야 한다는 점)을 발견하여 성능이 비약적으로 향ขึ้น하는 명확한 개선 패턴을 보여주었습니다. 연구진은 이러한 갑작스러운 돌파구를 로봇이 놓치고 있던 물리적 제약 조건을 마침내 이해하게 되는 '아하 모먼트(aha moments)'라고 부릅니다.

이 발견이 특히 중요한 이유는 로봇이 학습한 기술이 단일한 특정 물체나 특정 방에 국한되지 않았기 때문입니다. 연구진이 한 작업에서 와인병을 다루기 위해 로봇이 학습한 기술을 크림치즈 용체를 다루는 완전히 다른 작업에 적용했을 때, 로봇은 추가 훈련 없이도 성공했습니다. 시스템은 단순히 목표를 향한 경로를 암기한 것이 아니라, 다양한 시나리오에서 작동하는 물체를 잡고, 옮기고, 배치하는 방법에 대한 더 깊은 이해를 학습했다는 것을 시사합니다. 또한 이 시스템은 컴퓨터 클러스터에서 시뮬레이션을 실행하여 학습에 필요한 경험을 생성함으로써 매우 빠르게 작동함을 입증했습니다. 로봇의 논리를 시뮬레이션을 실행하는 하드웨어와 분리함으로써, 연구진은 이전 방식보다 20배 이상 빠르게 학습 과정을 실행할 수 있었고, 이를 통해 로봇이 며 days가 아닌 단 몇 시간 만에 기술을 진화시킬 수 있었습니다.

연구진은 이 접근 방식이 로봇 공학의 근본적인 문제, 즉 물리적 세계의 급격한 변화에 반응하지 못하는 현재 모델들의 한계를 해결한다고 주장합니다. 거대 인공지능 모델은 떨어지는 물체를 잡거나 미끄러지는 움켜쥐기를 조절하는 데 필요한 속도로 결정을 내리기에는 너무 느립니다. 핵심 두뇌를 고정된 상태로 두고 빠르고 반응적인 크리틱과 복구 기술 계층을 추가함으로써, 제타는 고차원적 계획과 저차원적 물리 제어 사이의 간극을 메웁니다. 이 시스템은 주방을 탐색하고, 캐비닛을 열고, 물건을 안에 넣는 것과 같은 복잡하고 긴 일련의 동작들을, 작업을 관리 가능한 단계로 나누고 각 잠재적 실패에 대한 안전망을 갖춤으로써 처리할 수 있음을 보여주었습니다. 한 사례 연구에서, 병을 그릇으로 옮기려던 로봇은 운반 중에 병을 떨어뜨려 반복적으로 실패했습니다. 몇 차 번의 자기 수정 후, 시스템은 이동하기 전에 움켜쥐기가 확실한지 확인하는 특정 체크 과정을 추가했고, 해당 작업의 성공률은 15%에서 95%로 치솟았습니다.

이 연구는 또한 이러한 학습을 가능하게 하는 인프라의 중요성을 강조합니다. 로봇의 기술을 진화시키려면 시스템이 수천 번의 시행착차를 실행하여 실패가 발생하는 드문 순간들을 찾아내고 그 실패를 분석해야 합니다. 연구진은 이 작업량을 관리할 수 있는 특화된 시스템을 구축하여, 속도를 늦추지 않고 동시에 많은 시뮬레이션을 실행할 수 있게 했습니다. 이 인프라는 프로젝트의 속도에 결정적이었으며, 팀이 크리틱과 복구 기술을 훈련하는 데 필요한 데이터를 효율적으로 수집할 수 있게 해주었습니다. 이러한 규모의 학습 과정을 확장할 능력이 없었다면, 자기 진화 루프는 실용적일 만큼 빠르지 않았을 것입니다. 결과는 물리적 지능을 향한 새로운 길을 제시하며, 로봇이 처음부터 완벽할 필요는 없지만 경험을 통해 신뢰성을 학습하고 예상치 못한 상황을 처리하는 능력을 끊임없이 연마할 수 있음을 보여줍니다.

이 연구의 함의는 단순히 로봇이 물체를 더 잘 움직이게 만드는 것을 넘어섭니다. 이는 인공지능이 견고하고 적응 가능한 방식으로 물리적 세계와 상호작용할 수 있는 청사진을 제공합니다. 실시간으로 오류를 감지하고 복구하는 능력에 집중함으로써, 시스템은 기존 방식들을 괴롭혀온 취약성을 피합니다. 연구진은 현재의 작업이 시뮬레이션 내에서 수행되었지만, 개발된 원칙들은 실제 로봇으로 전이되도록 설계되었다고 언급합니다. 연구팀의 다음 단계는 이 자기 진화형 하네스를 가져와 실제 기계에 테스트하여 디지털 시뮬레이션과 현실 세계 사이의 간극을 메우는 것입니다. 만약 성공한다면, 이는 단순히 작업을 수행하도록 프로그래밍된 로봇이 아니라, 시도할 때마다 성능을 학습하고 개선할 수 있는 로봇으로 이어져, 인간의 환경에서 더욱 유용하고 신뢰할 수 있는 파트너가 될 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →