← 최신 논문
🤖 AI

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II는 시뮬레이션과 실로봇 실험 전반에 걸쳐 내비게이션, 조작 및 전신 제어 성능을 정량화함으로써 전신행동 AI 계층으로 이전 모델의 통합 평가 프레임워크를 확장하며, 이를 통해 공유된 트레이스 아이덴티티(trace identities)를 통해 심투리얼(sim-to-real) 간극을 메우는 연속적인 수리 지향적 진단 파이프라인을 구축한다.

원저자: Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

물리적 인공지능(physical AI) 분야는 단순히 컴퓨터 내부에서 생각하는 것을 넘어, 실제 세계를 움직일 수 있는 기계를 만드는 것을 목표로 합니다. 이를 위해 엔지니어들은 서로 다른 지능의 층을 하나 위에 다른 하나를 쌓아 올립니다. 가장 상단에는 언어를 이해하고 복잡한 과업을 계획하는 뇌와 같은 '추론 계층(reasoning layer)'이 있습니다. 그 아래에는 문으로 걸어가거나 컵을 집어 올리는 것과 같은 특정 동작을 처리하는 '기술 계층(skill layers)'이 있습니다. 그리고 가장 하단에는 로봇의 근육과 관절을 관리하여 균형을 유지하게 하는 '제어 계층(control layer)'이 있습니다. 수년 동안 과학자들은 표준 테스트와 공유된 데이터를 사용하여 상단의 추론 계층을 매우 정밀하게 테스트할 수 있었습니다. 그러나 물리적 세계와 직접 맞닿는 하위 계층들을 테스트하는 것은 훨씬 더 어려웠습니다. 각 연구실은 저마다 고유한 테스트 환경을 구축하고, 서로 다른 로봇과 서로 다른 규칙을 사용했기 때문에, 결과를 비교하거나 로봇이 실험실을 떠났을 때 실제로 제대로 작동할지 알기가 어려웠습니다.

XPENG 로보틱스의 한 팀은 이러한 파편화 문제를 해결하기 위해, 컴퓨터 시뮬레이션과 실제 하드웨어 사이의 간극을 메우는 통합된 테스트 방식을 만들어냈습니다. 이들의 새로운 보고서인 'DeepInsight II'는 연구자들이 가상 로봇과 물리적 로봇에 대해 정확히 동일한 테스트를 수행하여, 두 존재를 하나의 연속적인 실험의 일부로 취급할 수 있게 하는 시스템을 소개합니다. 이들은 새로운 유형의 로봇이나 새로운 알고리즘을 만드는 대신, 더 나은 '측정 자(measuring stick)'를 만들었습니다. 이 시스템은 추론하는 뇌, 기술 계층, 그리고 물리적 제어기를 하나의 응집된 단위로 연결하여, 로봇이 바닥에서 발을 헛디디는 순간부터 그 비틀거림을 유발한 구체적인 결정에 이르기까지 실패의 과정을 추적할 수 있게 해줍니다.

연구진은 먼저 자신들의 시스템이 기존의 내비게이션 및 조작 벤치마크를 얼마나 잘 재현하는지 테스트하는 것으로 시작했습니다. 그들은 공개된 버전의 로봇 뇌를 가져와 집 안을 걸어서 통과하거나 가상의 주방에서 물건을 집는 것과 같은 표준 과업들을 대상으로 테스트했습니다. 결과에 따르면, 이 통합 시스템은 표준 테스트의 점수들을 높은 정확도로 재복제할 수 있었으며, 이는 새로운 측정 자가 데이터를 왜곡하지 않았음을 입증했습니다. 이는 새로운 인프라가 원래 테스트의 규칙을 깨뜨리지 않으면서도, 서로 다른 로봇 설계와 소프트웨어 버전이 가진 복잡하고 무질서한 현실을 처리할 수 있음을 확인해 준 중요한 첫 단계였습니다.

다음으로, 연구팀은 기계가 똑바로 서 있고 부드럽게 움직이도록 유지하는 역할을 하는 로봇의 '전신 제어(whole-body control)'에 주목했습니다. 그들은 다양한 연구 그룹으로부터 네 가지 서로 다른 제어 시스템을 수집하여 고충실도(high-fidelity) 시뮬레이션 내에서 표준화된 동작 과업들을 수행하게 했습니다. 그 결과, 모든 시스템이 과업을 수행할 수는 있었지만, 어떤 시스템은 넘어짐을 방지하고 정밀한 움직임을 유지하는 데 있어 다른 시스템보다 현저히 뛰어남을 발견했습니다. 특히 한 시스템은 거의 모든 동작을 높은 정밀도로 성공적으로 완수하며 가장 신뢰할 만한 성능을 보였습니다. 이 시뮬레이션 단계는 물리적인 기계를 위험에 빠뜨리기 전에 약한 후보들을 빠르고 안전하게 걸러내는 역할을 했습니다.

가장 큰 도약은 이 검증된 시스템들을 컴퓨터 화면에서 실제 로봇으로 옮겼을 때 일어났습니다. 연구진은 동일한 제어 시스템의 두 가지 버전을 선택하여, 가상 로봇과 물리적 로봇이 동시에 정확히 같은 동작을 시도하는 매칭된 실험을 진행했습니다. 이 두 실행을 하나의 정체성(identity) 아래로 연결함으로써, 그들은 결과를 직접 비교할 수 있었습니다. 그 결과 물리적 로봇이 가상 로봇보다 약간 더 많은 오류를 범하기는 했지만, 시스템 간의 순위는 동일하게 유지되었습니다. 시뮬레이션에서 가장 우수한 성능을 보였던 시스템이 실제 바닥에서도 가장 우수한 성능을 보였습니다. 이는 테스트 조건이 엄격하게 통제된다면, 시뮬레이션이 실제 세계의 성능을 예측하는 신뢰할 수 있는 지표가 될 수 있음을 확인시켜 주었습니다.

단순히 성공 여부를 측정하는 것을 넘어, 연구진은 로봇이 왜 실패하는지를 정확히 진단하는 방법을 개발했습니다. 로봇이 비틀거리거나 물건을 떨어뜨릴 때, 그것이 잘못된 계획 때문인지, 서툰 움직임 때문인지, 아니면 환경에 대한 오해 때문인지 명확하지 않은 경우가 많습니다. 연구팀은 실패를 구체적인 카테고리로 분류하는 진단 도구를 만들었습니다. 그들은 일부 실패가 로봇의 서로 다른 계층들이 같은 언어로 대화하지 못하기 때문에 발생한다는 것을 발견했습니다. 예를 들어, 내비게이션 계층은 특정 지점에 도착했을 때 멈추도록 되어 있지만, 인사(greeting) 계층은 로봇이 특정 방향을 향하고 있을 것을 요구했는데, 첫 번째 계층이 이 세부 사항을 무시했던 것입니다. 또 다른 실패는 계획이 아무리 완벽하더라도 로봇이 물리적으로 해당 위치에 도 move 할 수 없는 경우에 발생했습니다.

이 진단 도구를 시뮬레이션과 실제 실행 모두에 적용함으로써, 연구팀은 실패의 정확한 원인을 짚어낼 수 있음을 보여주었습니다. 한 실제 사례에서, 로봇은 내부 지도가 미세하게 어긋나서 손이 닿지 않는 곳에 멈춰 서는 바람에 사람에게 인사를 하는 데 실패했습니다. 진단 시스템은 이를 '경계 오류(boundary error)'로 식별했는데, 즉 로봇이 정의한 '도착'의 개념이 실제 상황의 물리적 현실과 일치하지 않았던 것입니다. 이러한 수준의 상세함은 엔지니어가 로봇의 어느 부분을 다시 만들어야 할지 추측하는 대신, 깨진 특정 인터페이스나 규칙을 수정할 수 있게 해줍니다.

이 연구는 시뮬레이션을 더 좋게 만드는 것이 아니라, 평가를 위한 공유된 언어를 만듦으로써 시뮬레이션과 현실 사이의 간극을 좁힐 수 있음을 보여줍니다. 가상 세계와 물리적 세계를 동일한 실험의 두 갈래로 취급함으로써, 연구진은 컴퓨터에서 실제 로봇으로 동일한 테스트를 결과의 비교 능력 손실 없이 전달할 수 있음을 증명했습니다. 이 접근 방식이 로보틱스의 모든 문제를 해결하지는 못하더라도, 진행 상황을 측정하고 로봇이 왜, 그리고 어디에서 실패하는지를 정확히 이해할 수 있는 명확하고 신뢰할 수 있는 방법을 제공합니다. 이는 복잡하고 불투명한 로봇 테스트 과정을 투명하고 추적 가능한 여정으로 바꾸어 놓으며, 엔지니어들이 자신들의 창조물을 실험실에서 실제 세상으로 내보낼 수 있는 확신을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →