Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution
Hydra는 시각적 상태와 행동을 효율적인 계획을 위한 이산 잠재 공간으로 통합하는 동시에, 연속적인 플로우 매칭(flow-matching)을 사용하여 이러한 이산적 계획을 매끄러운 물리적 명령으로 변환함으로써 월드 모델과 실시간 실행 사이의 간극을 메우는 새로운 로봇 제어 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 생명체와 같은 선견지명을 가지고 세상을 움직이는 데 어려움을 겪어 왔습니다. 현대의 기계들은 눈에 보이는 것에 즉각적으로 반응할 수는 있지만, 다음에 어떤 일이 일어날지 상상하는 능력은 부족한 경우가 많습니다. 전통적인 내비게이션 시스템은 자동차 바로 앞의 도로만을 바라보며, 장애물이 나타날 때마다 반응하지만 막다른 길을 만난 후에야 경로를 우회하려 하는 운전자처럼 작동합니다. 로봇에게 이러한 종류의 선견지명을 부여하기 위해, 과학자들은 '월드 모델(world models)'을 개발했습니다. 이는 기계가 실제로 움직이기 전에 다양한 미래를 상상할 수 있게 해주는 일종의 내부 시뮬레이터입니다. 그러나 주요한 장애물은 이러한 시뮬레이터를 물리적 로봇에서 실시간으로 사용하는 것을 가로막아 왔는데, 바로 이러한 상상된 미래를 검증하는 과정이 너무 느리다는 점입니다. 현재의 방식들은 로봇이 수천 개의 잠재적 경로를 생성하고, 각 경로를 상세한 이미지로 변환하여 안전성을 확인한 뒤, 나쁜 경로들을 버리는 과정을 거쳐야 합니다. 이미지를 생성하고 확인하는 이 순환 과정은 계산량이 너무 많아서 로봇을 멈추게 만들며, 실시간 내비게이션을 불가능하게 만듭니다.
여러 대학의 연구진이 개발한 '히드라(Hydra)'라는 새로운 접근 방식은 로봇이 움직임을 생각하는 방식을 바꿈으로써 이 문제를 해결합니다. 히드라는 모든 가능한 미래를 고해상도 디테일로 상상하려고 노력하는 대신, 인간이 바퀴의 정확한 회전 각도를 계산하기보다 "좌회전"이나 "직진 경로"와 같이 넓고 이산적인(discrete) 움직임의 개념으로 생각하는 것과 유사하게, 움직임을 넓고 이산적인 개념으로 생각하는 법을 배웁니다. 연구진은 로봇의 플래너(planner)가 픽셀로 이루어진 광활하고 열린 공간이 아니라, 압축되고 추상적인 가능성의 지도 안에서 최적의 경로를 찾는 방식으로 시뮬레이터 내부에 존재하도록 구축했습니다. 이를 통해 로봇은 수천 개의 잠재적 미래를 순식간에 평가할 수 있으며, 경로가 완전히 그려지기도 전에 위험한 경로들을 폐기할 수 있습니다. 일단 안전한 경로가 선택되면, 시스템은 그 추상적인 개념을 로봇의 모터가 실행할 수 있는 부드럽고 연속적인 움직임으로 다시 변환합니다.
핵심 혁신은 저자들이 '이산 잠재 계획(discrete latent planning)'이라고 부르는 기술에 있습니다. 기존 시스템에서 복도를 지나가려는 로봇은 연속적인 궤적의 흐름을 생성하며, 이 중 상당수는 벽으로 직접 돌진하게 됩니다. 그러면 시스템은 충돌이 발생하는지 확인하기 위해 각 궤적을 시각적 이미지로 렌더링해야 하는데, 이는 움직이는 로봇에게는 너무 오래 걸리는 작업입니다. 히드라는 예측을 특화된 필터를 통해 그룹화하여 작은 고정 어휘 세트로 강제함으로써 이 병목 현상을 피합니다. 로봇이 미래를 고려할 때, 단순히 충돌의 흐릿한 이미지를 생성하는 것이 아니라, "안전한 회전"이나 "충돌"을 나타내는 학습된 어휘 속의 토큰(token)을 선택합니다. 이 토k들은 물리적으로 가능한 행동들의 유한한 목록에서 추출되기 때문에, 로봇은 충돌 장면을 시각화할 필요 없이 해당 경로가 벽으로 향하는 무효한 경로임을 즉각적으로 인식할 수 있습니다. 이러한 '연속적인 추측'에서 '이산적인 선택'으로의 전환은 시스템이 위험한 옵션들을 거의 즉시 제거하게 하여, 이미 타당하다고 알려진 경로에만 계산 능력을 집중할 수 있게 합니다.
이러한 추상적인 선택이 실제의 부드러운 움직임으로 이어지도록 하기 위해, 히드라는 이 이산적 계획을 연속적 실행 방법과 결합합니다. 로봇이 최적의 추상적 경로를 선택하면, 보조 시스템이 그 선택을 바퀴를 구동하는 데 필요한 정밀하고 유동적인 명령으로 변환합니다. 이 두 단계의 과정, 즉 단순화된 추상 공간에서의 계획과 실제 세계에서의 실행은 로봇이 반응형 운전자의 속도로 시뮬레이터의 안전성을 유지할 수 있게 해줍니다. 연구진은 이 시스템을 바퀴형 차량과 4족 보행 로봇이라는 두 가지 서로 다른 물리적 로봇에 대해 좁은 복도와 숨겨진 장애물이 있는 환경을 포함하여 테스트했습니다. 이 실험에서 시스템은 약 8미터 떨어진 목표 지점까지 1초도 안 되어 충돌 없는 경로를 성공적으로 계획해 냈는데, 이는 전체 이미지를 생성하고 확인하는 데 의존했던 이전 방식보다 약 500배 빠른 속도입니다.
이러한 물리적 테스트 결과는 과거의 사고방식과 새로운 방식 사이의 상당한 격차를 보여줍니다. 연구진이 연속 샘플링을 사용하는 기존 시스템과 히드라를 비교했을 때, 기존 방식들은 불가능한 경로를 계산하는 데 너무 많은 시간을 소비하여 종종 장애물을 피하지 못하고 충돌했습니다. 반면 히드라는 장애물이 없는 환경에서 완벽한 성공률을 달ert했으며, 숨겨진 코너와 장애물도 대부분의 실험에서 성공적으로 통과했습니다. 또한 시스템은 제안된 경로가 학습된 안전한 움직임의 어휘에 부합하지 않는다는 것을 감지함으로써, 로봇이 물리적으로 충돌하기 훨씬 전부터 충돌이 임박했음을 알아낼 수 있었습니다. 시각적 외형이 아닌 추상적 구조를 바탕으로 불안전한 경로를 거부하는 이 능력은 의사 결정 과정을 늦추지 않으면서도 안전을 확보하는 견고한 방법임이 입증되었습니다.
이러한 성공에도 불구하고, 연구진은 이 시스템에 한계가 있음을 인정합니다. 움직임을 고정된 어휘로 그룹화하는 방식 때문에, 로봇은 때때로 실제 장애물과 밀집한 덤불 같은 시각적으로 복잡하지만 안전한 영역을 구분하는 데 어려움을 겪습니다. 시스템이 추상적 코드로부터 장면을 재구성하는 난이도에 의존하기 때문에, 질감이 매우 복잡한 환경은 때때로 오작동을 일으켜 로봇이 안전하게 지나갈 수 있는 곳에서도 주춤하게 만들 수 있습니다. 또한, 현재 시스템은 사람과 같은 동적인 객체를 표현하는 데 어려움이 있어, 이들을 피해야 할 별개의 개체로 다루기보다는 배경으로 매끄럽게 처리해 버리는 경향이 있습니다. 이러한 과제들은 이 이산적 접근 방식이 강력한 진전이긴 하지만, 향질 버전에서는 인간 환경의 완전한 복잡성을 다룰 수 있도록 세계를 표현하는 방식을 정교화해야 함을 시사합니다.
궁극적으로, 이 연구는 로봇이 픽셀이 아닌 개념을 통해 사고함으로써 실시간 목표 지향적 계획을 달 수 있음을 보여줍니다. 월드 모델을 물리적 로봇에 적용하는 핵심은 모델을 더 상세하게 만드는 것이 아니라, 더 구조화하여 계산 효율적이고 물리적으로 근거 있는 방식으로 미래를 상상하게 만드는 것임을 이 연구는 시사합니다. 이 접근 방식은 로봇이 인간이 매일 사용하는 것과 같은 직관적인 선견지명을 가지고 현실 세계를 항해할 수 있는 유망한 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.