← 최신 논문
💻 computer science

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

이 논문은 부분적으로 관찰 가능한 환경에서 가짜 상관관계와 오차 누적을 완화함으로써 신뢰할 수 있는 장기 로봇 제어를 가능하게 하기 위해, 시각-언어 모델의 사전 지식으로부터 증류된 어텐션 기반 메모리 검색과 희소 어텐션 메커니즘을 활용하는 시각-운동 정책인 HALO를 소개한다.

원저자: Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 로봇에게 복잡한 요리를 하는 법을 가르치려 한다고 상상해 보세요. 문제는 주방이 매우 넓고, 로봇은 지금 바로 눈앞에 보이는 것만 볼 수 있다는 점입니다. 로봇은 방 전체를 볼 수 없으며, 당신이 특별한 "기억"을 제공해주지 않는 한 5분 전에 무슨 일이 있었는지 기억하지 못합니다.

이 논문은 로봇에게 그러한 기억을 부여하는 새로운 방법인 HALO를 소개합니다. HALO를 로봇의 두뇌를 위한 똑똑하고 매우 체계적인 사서라고 생각해보세요. 이 기술이 어떻게 작동하는지 쉬운 개념으로 나누어 설명하겠습니다.

문제점: 기억상실증에 걸린 로봇

오늘날 대부분의 로봇은 단기 기억 상실증이 있는 사람과 같습니다. 만약 당신이 로봇에게 "빵을 전자레인지에 넣고 나서 문을 닫아줘"라고 말한다면, 로봇은 첫 번째 부분은 수행할지 모르지만, 불이 꺼지거나 빵이 시야에서 사라지면 자신이 무엇을 하고 있었는지 잊어버립니다.

이를 해결하기 위해 과학자들은 로봇에게 자신이 본 모든 것을 기록하는 "노트"를 주는 방법을 시도했습니다. 하지만 이 방식에는 두 가지 큰 문제가 있습니다.

  1. "잘못된 단서" 문제: 만약 로봇이 자신의 노트 전체를 읽는다면, 쓸모없는 세부 사항 때문에 주의가 산만해질 수 있습니다. 예를 들어, 로봇이 과거에 주방에 있는 고양이를 보았다면, "오, 고양이가 여기 있네, 그러니 요리를 멈춰야겠다!"라고 생각할 수도 있습니다. 이는 빵과는 아무런 상관이 없는 일임에도 불구하고 말이죠. 이를 "가짜 상관관계(spurious correlation)"라고 부릅니다. 즉, 로봇이 실제로는 관련이 없는 두 가지를 연결 짓는 현상입니다.
  2. "스노볼 효과(눈덩이 효과)": 만약 로봇이 작은 실수(예: 빵을 약간 너무 세게 잡는 것)를 저지르면, 그 실수는 다음에 보게 될 장면을 변화시킵니다. 만약 로봇이 실수를 저지르는 와중에 자신의 노트 전체를 계속 읽는다면, 그 오류들은 언덕 아래로 굴러 내려가는 눈덩이처럼 쌓여가 결국 로봇을 완전히 길을 잃게 만들고 임무를 실패하게 만듭니다.

해결책: HALO (똑똑한 사서)

연구진은 이 두 가지 문제를 해결하기 위해 HALO를 만들었습니다. HALO는 두 가지 주요 기술을 사용합니다.

기술 1: "퀴즈 마스터" (AI를 이용한 기억 학습)

당신이 새로운 언어를 배우고 있다고 상상해 보세요. 단순히 사전만 읽을 수도 있지만, 필요한 특정 단어들에 대해 누군가가 퀴즈를 내준다면 더 빨리 배울 수 있습니다.

HALO는 다음과 같이 "퀴즈 마스터"(VLM이라는 강력한 시각-언어 모델)를 사용하여 이 과정을 수행합니다. 로봇이 요리를 시작하기 전에, 퀴즈 마스터는 로봇의 과거 경험을 살펴보고 다음과 같은 질문을 던집니다.

  • "카운터 위에 빵 슬라이스가 몇 개 있었나요?"
  • "언제 가스레인지가 켜졌나요?"
  • "올리브 오일은 어디에 놓였나요?"

로봇은 이 질문들에 올바르게 답해야 "시험을 통과"할 수 있습니다. 답을 하기 위해서 로봇은 반드시 자신의 기억 속을 뒤져서 구체적이고 유용한 사실들을 찾아내야 합니다. 이 과정은 로봇의 기억 시스템이 쓸데없는 것들(예: 고양이)은 무시하고, 실제로 요리에 도움이 되는 단서들에만 집중하도록 훈련시킵니다.

기술 2: "스포트라이트" (소음 무시하기)

퀴즈 마스터가 있더라도, 로봇의 과거 8분 분량의 영상을 통째로 읽는 것은 압도적이고 혼란스러울 수 있습니다. 이는 500페이지짜리 책에서 특정 문장을 찾기 위해 모든 단어를 하나하나 다 읽어야 하는 것과 같습니다.

HALO는 "스포트라이트" 기술을 사용합니다. 로봇은 책 전체를 읽는 대신, 특수한 검색 도구를 사용하여 과거의 가장 중요한 상위 5개 또는 10개의 문장만을 찾아냅니다. 그 외의 모든 것은 무시합니다. 이는 "스노볼 효과"를 방지합니다. 왜냐하면 로봇이 낡거나, 소음이 섞였거나, 혹은 현재 작업과 무관한 정보 때문에 혼란에 빠지는 것을 막아주기 때문입니다. 로봇은 오직 현재 수행 중인 작업에 꼭 필요한 특정 순간만을 바라보게 됩니다.

결과: 얼마나 잘 작동했는가?

연구진은 컴퓨터 시뮬레이션과 실제 실험실의 로봇을 통해 HALO를 테스트했습니다. 그들은 로봇에게 다음과 같이 최대 8분 전의 일을 기억해야 하는 과제들을 주었습니다.

  • 이전에 보았지만 지금은 보이지 않는 물건 찾기.
  • 서랍에 몇 개의 아이템이 들어갔는지 세기.
  • 가스레인지가 데워질 때까지 특정 시간 동안 기다리기.

연구 결과는 다음과 같았습니다:

  • HALO는 이전 방식들보다 훨씬 뛰어난 성능을 보였습니다. 텍나 텍 요약본을 읽는 로봇이나 수동으로 작성된 규칙을 따르는 로봇들이 약 18%~29%의 성공률을 보인 반면, HALO는 약 41%의 성공률을 기록했습니다.
  • "퀴즈 마스터"(VQA)는 로봇이 올바른 단서를 찾도록 도와 성공률을 10% 향상시켰습니다.
  • "스포트라이트"(Top-k attention)는 로봇이 자신의 실수로 인해 혼란에 빠지는 것을 막아 성공률을 9% 더 높였습니다.

핵심 요약

HALO는 다음 두 가지를 결합하여 로봇이 더 잘 기억하도록 가르칩니다.

  1. 올바른 질문을 던짐으로써 어떤 정보가 실제로 중요한지 학습합니다.
  2. 가장 중요한 기억만을 살펴봄으로써 소음에 압도되는 것을 방지합니다.

이를 통해 로봇은 복잡하고 지저온 실제 환경에서도 자신의 과거 기록 때문에 길을 잃거나 혼란에 빠지지 않고, 길고 복잡한 작업을 수행할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →