Technical Report: One-Step Drifting Action Heads for GR00T N1.7
본 기술 보고서는 추론 지연 시간을 70.0ms에서 30.6ms로 크게 단축하지만 LIBERO 벤치마크 전반에서 작업 성공률이 감소하는 체계적인 트레이드오프를 초래하는 원스텝 드리프팅 액션 헤드를 갖춘 GR00T N1.7 변형 모델을 평가하며, 이는 폐루프 제어에서 결정론적 원스텝 생성의 한계를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보고, 이해하고, 손을 움직일 수 있는 로봇은 더 이상 공상 과학의 꿈이 아닙니다. 이들은 카메라의 눈과 언어 학습된 뇌를 결합한 시스템을 사용하여 오늘날 실제로 제작되고 있습니다. 시각-언어-행동 모델(vision-language-action models)이라고 불리는 이 시스템은 기계가 장면을 보고, "빨간 컵을 집어라"와 같은 명령을 읽은 다음, 이를 수행하기 위한 정밀한 움직임의 순서를 파악할 수 있게 해줍니다. 그러나 이러한 로봇이 현실 세계에서 유용하게 쓰이려면, 비틀거리지 않고 변화하는 환경에 빠르게 반응할 수 있을 만큼 충분히 빠르게 생각해야 합니다. 컴퓨터가 다음 동작을 결정하는 데 너무 오래 걸리면, 로봇은 목표물을 놓치거나 물건을 넘어뜨릴 수 있습니다. 엔지니어들의 핵심 과제는 작업을 완료하는 데 필요한 정확도를 희생하지 않으면서도 이러한 결정을 빠르게 내리는 방법을 찾는 것입니다.
절강대학교와 LimX Dynamics의 연구진이 발표한 새로운 기술 보고서는 이러한 로봇의 의사결정 속도를 높이기 위한 특정 지름길을 조사합니다. 이 연구는 GR00T N1.7이라는 강력한 로봇 뇌에 초점을 맞추고 있습니다. 표준 형태에서 이 시스템은 신중한 계획가처럼 작동합니다. 향후 40번의 움직임에 대한 순서를 결정하기 위해, 내부 계산 엔진을 여러 번 실행하며 확신이 생길 때까지 각 단계를 거쳐 계획을 정교화합니다. 이 반복적인 과정은 정확하지만 느려서, 동작 목록을 생성하는 데만 약 45밀리초가 소요됩니다. 연구진은 간단한 질문을 던졌습니다. 이 신중한 다단계 계획을 단 한 번의 즉각적인 추측으로 대체할 수 있을까? 그들은 정교화 단계를 건너뛰고 40개의 움직임 전체를 단 한 번의 시도로 예측하도록 하는 버전의 로봇을 구축했습니다.
이 실험 결과는 속도와 성공 사이의 극명한 트레이드오프(trade-off)를 보여줍니다. 이 '원스텝(one-step)' 방식으로 전환함으로써, 연구진은 사고 시간을 획기적으로 줄였습니다. 동작 목록을 생성하는 데 필요한 시간은 약 45밀리초에서 단 5밀리초로 줄어들어 9배의 속도 향상을 이루었습니다. 컴퓨터가 시각 및 언어 정보를 처리하여 계획을 생성하는 데 든 총 시간을 측정했을 때, 시간은 약 70밀리초에서 30밀리초 직후로 떨어졌습니다. 이는 중요한 공학적 성과로, 만약 이 방법이 완벽하다면 로봇이 훨씬 더 빠르게 반응할 수 있음을 시사합니다.
그러나 보고서는 이러한 속도가 가혹한 대가를 치른다는 점을 분명히 합니다. 로봇은 생각하는 데는 훨씬 빨라졌지만, 일을 수행하는 데는 현저히 나빠졌습니다. 연구진은 물체를 다른 위치로 이동시키고, 목표물을 향해 손을 뻗고, 긴 일련의 동작을 완료하는 표준 과제 세트를 통해 새 시스템을 테스트했습니다. 공간 추론이 필요한 작업에서 새 시스템은 기존의 느린 시스템보다 훨씬 높은 성공률을 보인 것에 비해 64%의 성공률만을 기록했습니다. 특정 목표에 도달해야 하는 작업에서는 성공률이 52%로 떨어졌습니다. 이 격차는 길고 복잡한 작업에서 더욱 벌어져, 새 시스템은 단 26%의 성공률만을 보였습니다.
연구진은 이러한 실패가 단순히 운이 나빴던 것이 아님을 확인하기 위해 주의를 기울였습니다. 그들은 서로 다른 무작위 시작점에서 실험을 세 번 실시했으며, 결과는 모든 경우에서 일관되게 좋지 않았습니다. 이러한 일관성은 문제가 우연한 불운이 아니라 현재 설정된 방식 하에서의 원스텝 접근법이 가진 근본적인 한계임을 말해줍니다. 시스템은 여러 차례의 과정을 통해 아이디어를 정교화할 여유를 갖는 대신, 즉시 단 하나의 예측에 전념해야 하기 때문에 어려움을 겪는 것으로 보입니다. 작업이 복잡하거나 길어질 때, 이러한 정교화의 부재는 오류를 누적시켜 로봇을 실패하게 만듭니다.
또한 보고서는 비동기적 동작(asynchronous action)이라는 실제 세계의 문제를 다루기 위한 "DrifOv"라는 더 발전된 개념을 탐구합니다. 실제 로봇에서는 이전 계획을 실행하는 동안 새로운 계획이 도착하곤 합니다. 연구진은 이미 확정된 부분을 다시 작성하지 않고도, 부분적으로 완성된 계획을 받아 부족한 미래 단계를 채울 수 있는 시스템을 구축했습니다. 이 기능은 훈련 과정에서 성공적으로 구현되어 테스트되었으나, 표준 실험에는 사용되지 않았습니다. 즉, 보고된 속도 향상과 실패율은 더 단순한 동기적(synchronous) 버전에만 적용됩니다. 연구진은 현재의 설정이 이 고급 방식이 성공 문제를 해결할 수 있다는 것을 아직 증명하지는 못했다고 언급하면서도, 이것이 미래 연구를 위한 유망한 방향임을 밝혔습니다.
궁극적으로 이 연구는 복잡성을 제거함으로써 로봇을 단순히 더 빠르게 만들 수 있다는 생각에 대해 현실적인 점검을 제공합니다. 연구진은 로봇의 '뇌'가 동작 목록을 생성하는 속도를 9배 빠르게 만들 수는 있었지만, 로봇이 그 속도를 이용해 작업을 안정적으로 완수할 수는 없다는 것을 발견했습니다. 정확도가 너무 많이 떨어져 쓸모가 없어졌기 때문에, 속도 향상이 전체적인 시스템의 개선으로 이어지지는 않았습니다. 보고서는 결론적으로, 단순히 느리고 신중한 계획을 버리는 것이 아니라, 속도를 얻으면서도 정확도를 유지할 방법을 찾는 것이 앞으로 나아갈 길이라고 명시했습니다. 연구진은 향-후 연구가 로봇의 계획을 긴 덩어리로 실행하는 대신 더 빈번하게 실행하는 것이 새 시스템의 속도와 기존 시스템의 신뢰성 사이의 간극을 메우는 데 도움이 될 수 있는지 테스트하는 데 집중해야 한다고 제안합니다. 현재로서는 교훈이 명확합니다. 로봇 조작의 세계에서 더 빨리 생각하는 것이 반드시 더 잘하는 것을 의미하지는 않습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.