← 최신 논문
💻 computer science

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

이 논문은 장기 과업을 위한 시각 운동 정책(visuomotor policies)에서 단기 기억을 효과적으로 확장하는 게이트 어텐션(gated attention)과 계층적 압축(hierarchical compression)을 갖춘 트랜스포머 기반 아키텍처인 PRISM을 소개하며, 체계적인 평가를 위한 ReMemBench 벤치마크와 함께 대규모 사전 학습에 의존하지 않고도 기존 베이스라인 대비 유의미한 성능 향상을 달성하였습니다.

원저자: Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 요리를 하려고 하는데, 양념을 집으려고 고개를 돌릴 때마다 방금 무엇을 하려 했는지 즉시 까먹는 상황을 상상해 보세요. 가스레인지를 켰지만, 팬을 가져오기 위해 자리를 비운 사이 끄는 것을 잊어버리거나, 심지어 소금을 이미 넣었다는 사실조차 잊어버릴 수도 있습니다. 이것이 바로 현재 많은 로봇이 직면한 문제입니다. 그들은 눈앞에 있는 것을 보는 데는 매우 똑똑하지만, 몇 초 또는 몇 분 전에 일어난 일을 기억하는 '단기 기억력'은 거의 없습니다.

이 논문은 이 문제를 해결하기 위해 새로운 로봇의 뇌인 PRISM과 새로운 테스트인 REMEMBENCH를 소개합니다. 작동 방식은 다음과 같이 쉽게 설명할 수 있습니다.

문제점: "금붕어 기억력"을 가진 로봇들

대부분의 현대적 로봇은 인간이 하는 행동을 관찰하며 배웁니다(마치 학생이 선생님을 따라 하는 것과 같습니다). 하지만 이들은 보통 현재의 비디오 프레임 하나만을 봅니다. 만약 작업이 "가스레인지를 켰으니, 끄기 전에 2분을 기다려야 한다"와 같이 30초 전의 일을 기억해야 하는 것이라면, 로봇은 과거의 행동을 기억하지 못하기 때문에 실패하게 됩니다.

이를 해결하기 위해 단순히 로봇에게 더 긴 비디오 기록을 보여주도록 만들면, 두 가지 나쁜 결과가 발생합니다.

  1. 노이즈 문제 (The Noise Problem): 로봇은 너무 많은 정보에 압도당합니다. 로봇은 배경에 있는 무관한 물체 같은 쓸모없는 세부 사항을 자신의 결정과 연결하기 시작하여 실수를 유발할 수 있습니다.
  2. 과도한 연산 문제 (The Heavy Lifting Problem): 긴 비디오 기록을 처리하는 것은 엄청난 컴퓨터 성능과 메모리를 요구하며, 이는 로봇을 느리고 비싸게 만듭니다.

해결책: PRISM (스마트한 사서)

저자들은 단순한 수집가가 아닌 스마트한 사서처럼 행동하는 로봇 정책인 PRISM을 구축했습니다. 모든 페이지를 머릿속에 다 담아두는 대신, PRISM은 두 가지 영리한 기술을 사용합니다.

  1. "게이트 어텐션" 필터 (경비원):
    로봇의 기억을 붐비는 방이라고 상상해 보세요. PRISM에는 누가 들어오고 누가 나갈지를 결정하는 경비원이 있습니다. 만약 로봇이 "빨간 사과를 집었다"는 것을 기억하고 있지만, 현재 작업이 파란 그릇에 관한 것이라면, 경비원은 빨간 사과의 기억이 로봇을 산만하게 하지 못하도록 차단합니다. 이를 통해 로사적인 과거 사건과 현재 행동 사이의 어처구니없는 연결을 막아줍니다.

  2. "계층적" 요약기 (뉴스 앵커):
    긴 이야기의 모든 단어를 하나하나 읽는 대신, PRISM은 먼저 작은 덩어리들을 읽고 각 덩어리에 대한 짧은 요약을 작성합니다. 그런 다음, 전체적인 줄거리를 이해하기 위해 그 요약본들을 읽습니다. 이는 뉴스 앵커가 모든 원본 경찰 보고서를 읽는 대신 그날의 사건을 요약하는 것과 같습니다. 이 방식 덕분에 로봇은 훨씬 빨라지고 컴퓨터 메모리도 적게 사용하며, 최대 2분의 기록을 기억할 수 있습니다.

테스트: REMEMBENCH (로봇 기억력 시험)

저자들은 로봇이 실제로 기억력을 가지고 있는지 증명하기 위해 REMEMBENCH를 만들었습니다. 이것은 로봇의 기억력을 측정하는 표준화된 "운전면허 시험"이라고 생각하면 됩니다. 단순히 팔을 움직일 수 있는지를 테스트하는 것이 아니라, 네 가지 특정 유형의 단기 기억력을 테스트합니다.

  • 공간 기억 (Spatial Memory): "내가 과일을 어디에 두었지?" (로봇은 현재 보이지 않는 물체를 찾아내야 합니다).
  • 미래 계획 기억 (Prospective Memory): "2분 후에 가스레인지를 꺼야 한다." (로봇은 과거의 트리거를 바탕으로 미래의 행동을 기억해야 합니다).
  • 대상 연관 기억 (Object-Associative Memory): "이 사과를 씻었으니, 반드시 이 특정 그릇에 다시 담아야 한다." (로봇은 어떤 물체가 어떤 용기와 짝인지 기억합니다).
  • 대상 집합 기억 (Object-Set Memory): "빵스틱을 모두 옮겨야 하지만, 옮기는 동안 개수를 세어야 한다." (로봇은 물체 그룹의 합계를 계속 추적합니다).

결과: 명확한 승자

저자들이 PRISM을 다른 로봇들(표준적인 "긴 기억"을 가진 로봇이나 다른 유형의 AI 뇌를 가진 로봇 포함)과 비교 테스트했을 때의 결과입니다.

  • 기억력 테스트에서: PRISM은 압도적인 승자였으며, 그다음으로 뛰어난 로봇보다 상당한 차이(5%~12%)로 앞섰습니다.
  • 표준 작업에서: 기억력을 명시적으로 테스트하지 않는 작업에서도 PRISM은 더 나은 성과를 보였습니다. 왜냐하면 기억을 갖는 것은 로봇이 맥락을 이해하는 데 도움을 주기 때문입니다. 예를 들어, 컵을 "방금 집어 들었는지" 아니면 "놓으려는 중인지" 아는 것은 혼란을 피하는 데 도움이 됩니다.
  • 실제 환경: 실제 물리적 로봇에 적용했을 때, 기억이 없는 로봇은 완전히 실패(성공률 0%)한 반면, PRISM은 30%의 성공률을 보였습니다.

핵심 요약

이 논문은 "경비원"을 통해 노이즈를 걸러내고 "요약기"를 통해 공간을 절약함으로써, 로봇이 몇 분 전의 일을 마침내 기억할 수 있다고 주장합니다. 이를 통해 로봇은 단순히 현재 순간에 반응하는 것을 넘어, 일련의 단계가 필요한 길고 복잡한 가사 노동을 수행할 수 있습니다. 저자들은 더 나은 기억 능력을 갖춘 로봇을 만들 수 있도록 로봇의 뇌(PRISM)와 테스트(REMEMBENCH)를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →