Memory as Plans: World-Action Modeling with Memory-Grounded Planning
이 논문은 복잡한 로봇 작업의 비마르코프적(non-Markovian) 특성을 해결하기 위해 메모리 의존적 모델링을 메모리 기반 계획(memory-grounded planning)과 계획 조건부 실행(plan-conditioned execution)으로 분해하고, 압축된 에피소드 메모리 표현을 활용하여 일정한 추론 지연 시간을 유지하면서 벤치마크와 실제 로봇 작업 모두에서 최첨단 성능을 달이는 MaP-WAM(Memory-as-Plans) 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 즉각적인 순간의 달인이었습니다. 로봇 팔 앞에 컵을 놓으면, 로봇은 그것을 향해 손을 뻗어 잡고 놀라운 정밀도로 들어 올릴 수 있습니다. 이러한 능력은 단순한 규칙에 의존합니다. 로봇은 전적으로 지금 보고 있는 것에 기반하여 다음 동작을 결정합니다. 하지만 현실 세계는 그렇게 단순하지 않습니다. 많은 작업은 더 이상 보이지 않는 것들을 기억할 것을 요구합니다. 몇 분 전에 가려졌던 특정 버튼을 로봇에게 찾으라고 요청하거나, 하루 중 서로 다른 위치에서 보았던 두 물체를 서로 바꾸라고 요청하는 상황을 상상해 보십시오. 성공하기 위해서, 기계는 단순히 현재뿐만 아니라 과거의 정신적 이미지를 보유해야 합니다. 이것이 바로 기억 의존적 조작(memory-dependent manipulation)의 과제이며, 로봇이 우리 가정과 일터에서 복잡하고 다단계적인 집안일을 수행하는 데 있어 걸림돌이 되어온 문제입니다.
수년 동안 연구자들은 로봇에게 점점 더 많은 비디오 이력을 입력함으로써 이 문제를 해결하려 노력했습니다. 그들은 기계가 본 모든 프레임의 점점 커지는 창(window)을 제공하며, 충분히 많이 보면 필요한 것을 기억할 수 있기를 바랐습니다. 하지만 이 방식은 한계에 부딪힙니다. 이력이 길어질수록 로봇을 구동하는 컴퓨터는 느려지며, 결국 메모리가 부족해져서 작동이 멈추게 됩니다. 다른 팀들은 과거를 짧은 단어 목록으로 요약하는 방법을 시도했지만, 그 과정에서 물체의 정확한 색상이나 정밀한 위치와 같이 성공에 필수적인 미세한 세부 사항들을 자주 놓치곤 했습니다. 그 결과는 트레이드오프였습니다. 로봇이 빠르지만 잘 잊어버리거나, 상세하지만 너무 느려서 쓸모가 없거나 둘 중 하나였습니다.
연구팀이 개발한 새로운 접근 방식은 전략을 완전히 바꿉니다. 로봇이 움직이는 동안 끊임없이 전체 이력을 다시 읽도록 강요하는 대신, 먼저 계획을 세우도록 가르치는 것입니다. 이는 운전 중에 지도를 계속 읽는 것과, 내비게이터가 다음 구간을 위한 명확한 지침 하나를 주는 것의 차이와 같습니다. 연구진은 이 시스템을 MaP-WAM이라고 부릅니다. 이 시스템은 긴 작업을 작은 세그먼트로 나누어 작동합니다. 로봇이 움직이기 전에, 로봇은 장기 기억(과거의 희소하게 선택된 신중한 스냅샷들)을 살펴보고 다음 단계를 위한 구체적인 계획을 작성합니다. 이 계획에는 무엇을 할 것인지에 대한 설명과 로봇이 작업하는 동안 장면이 어떻게 보여야 하는지에 대한 시각적 가이드가 모두 포함됩니다.
일단 이 계획이 작성되면, 로봇은 전체 이력을 다시 볼 필요 없이 이를 실행합니다. 로봇은 오직 현재의 뷰와 방금 만든 계획만을 보면 됩니다. 이는 로봇의 "작업 기억(working memory)"을 작고 빠르게 유지하여, 작업이 길어지더라도 매끄럽게 실행될 수 있도록 합니다. 로봇이 경로를 잃거나 경로에서 벗어나지 않도록 하기 위해, 시스템은 또한 진행 상황을 추적합니다. 시스템은 현재 위치를 계획에 있는 시각적 가이드와 끊임없이 대조합니다. 만약 로봇이 계획보다 약간 뒤처지거나 앞서 있다고 판단하면, 오류가 쌓이기 전에 오류를 수정하기 위해 내부 시계를 조정합니다. 이는 로봇이 계획하고, 행동하고, 진행 상황을 확인하고, 다음 단계를 위해 기억을 업데이트하는 폐쇄 루프(closed loop)를 생성하며, 이 모든 과정 동안 계산 부하를 일정하게 유지합니다.
연구팀은 컴퓨터 시뮬레이션과 실제 로봇 팔 모두에서 이 방법을 테스트했습니다. 블록을 바꾸거나 숨겨진 버튼을 찾는 등의 작업이 포함된 시뮬레이션에서, 이 새로운 시스템은 기억 문제로 어려움을 겪었던 기존 방식들을 능가하며 83.3%의 성공률을 기록했습니다. 실제 로봇에서는 특정 버튼을 찾아야 하는 작업에서 88%의 성공률을, 버튼을 특정 순서대로 눌러야 하는 작업에서 68%의 성공률을 달성했습니다. 결정적으로, 작업이 길어지고 과거 행동의 이력이 증가함에 따라 로봇이 다음 동작을 결정하는 데 걸리는 시간은 약 827밀리초 근처에서 머물며 거의 일정하게 유지되었습니다. 반면, 전체 프레임의 이력을 처리하려고 했던 기존 방식들은 약 1,700프레임 이후에 너무 느려지고 메모리를 많이 사용하여 멈춰버렸습니다.
연구진은 이 성공의 핵심이 단순히 기억을 갖는 것이 아니라, 그것을 어떻게 사용하는가에 있다는 것을 발견했습니다. 복잡하고 긴 이력을 압축되고 기억에 근거한 계획으로 변환함으로써, 실시간으로 처리하는 비용 없이도 미세한 시각적 증거를 유지할 수 있게 해주었습니다. 또한 그들은 진행 상황을 명시적으로 추적하는 것이 필수적이라는 것을 발견했습니다. 이것 없이는 로봇이 버튼을 누르는 것과 떼는 것과 같이 시각적으로 유사한 순간들을 혼동하여 반복적인 실수를 저지르게 됩니다. 이 시스템은 로봇이 현명하게 행동하기 위해 자신의 모든 과거를 머릿속에 담고 있을 필요는 없으며, 단지 그 과거를 현재를 위한 명확하고 실행 가능한 계획으로 바꾸는 법을 알면 된다는 것을 입증했습니다. 반응형 기억에서 주도적 계획으로의 이러한 전환은 인간 삶의 복잡하고 다단계적인 현실을 다룰 수 있는 로봇을 향한 유망한 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.