← 최신 논문
🤖 AI

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM 은 마인크래프트의 신체화된 에이전트를 위한 새로운 프레임워크로, 느린 숙고적 추론과 빠른 반사적 실행의 이중 시스템 아키텍처를 활용하여 추론 시 검색에서 매개변수 내재 기술로 기억을 전환하며, 여기서 실패는 대비 학습을 위한 중요한 학습 신호로 작용하고 자기 유발 메커니즘이 파국적 망각 없이 지속적 학습을 가능하게 하기 위해 경험을 내재화할 시점을 자율적으로 결정합니다.

원저자: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마인크래프트를 플레이하는 로봇을 가르친다고 상상해 보세요. 현재 대부분의 로봇은 아무것도 암기하지 않는 학생처럼 학습합니다. 좀비를 마주치거나 용광로를 만들어야 할 때마다, 그들은 멈춰서 과거 경험의 거대한 노트를 열고, 비슷한 이야기를 찾아 읽은 후 무엇을 해야 할지 파악하려 합니다. 이는 느리고, 많은 '두뇌 공간'(컴퓨터 메모리) 을 소모하며, 노트가 너무 커지면 혼란에 빠집니다.

PEAM(Parametric Embodied Agent Memory)은 로봇이 학습하는 방식을 근본적으로 바꾸는 새로운 방법입니다. 단순히 노트를 보관하는 대신, PEAM 은 로봇이 경험을 내면화하도록 돕습니다. "이걸 어떻게 했는지 기억한다"는 것을 "이걸 어떻게 하는지 안다"는 것으로 바꿉니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 두 개의 뇌 시스템: 사고하는 자와 행동하는 자

PEAM 은 '느린' 뇌와 '빠른' 뇌가 협력하여 작동합니다:

  • **느린 사고자 **(의사결정형 LLM): 이는 전문가 수준의 계획자입니다. 깊이 사고하고, 코드를 작성하며, 복잡한 단계를 계획하고, 어려운 문제를 해결하려 합니다. 실패하면 그 이유를 파악하고 다시 시도합니다.
  • **빠른 행동자 **(매개화된 기술): 이는 반사적인 근육 기억입니다. 느린 사고자가 문제 (예: 검 제작) 를 해결하면, 단순히 이야기를 저장하는 것이 아니라 빠른 행동자에게 해당 기술을 직접 가르칩니다. 다음 번에는 빠른 행동자가 느린 사고자에게 묻지 않고도 즉시 수행할 수 있습니다.

2. "내면화" 과정: 노트에서 근육 기억으로

자전거 타기를 배우는 것을 생각해 보세요. 처음에는 균형 잡기, 페달 밟기, 핸들 조종에 대해 생각해야 합니다 (느린 사고자). 결국에는 생각 없이 그냥 합니다 (빠른 행동자). PEAM 은 이를 로봇에게 자동화합니다.

  • 실패로부터의 학습: 대부분의 로봇은 실수를 무시하거나 텍스트 노트로 기록합니다. PEAM 은 실패를 학습 신호로 처리합니다. "실패한 시도"와 이를 수정한 "수정 사항"을 분석합니다. 로봇에게 이렇게 가르칩니다: "X(실패) 를 하지 마라; Y(수정) 를 하라." 이는 코치가 "너는 왼쪽으로 너무 많이 기울어서 넘어졌어; 다음엔 오른쪽으로 기울어"라고 말하는 것과 같습니다.
  • "가치" 점수: 로봇은 모든 것을 학습하지 않습니다. 이는 **매개화 가치 **(Parameterization-Worthiness)라는 필터를 통해 "이 기술이 암기할 만큼 유용한가? 안정적인가? 자주 사용하는 것인가?"를 질문합니다. 답이 '예'라면 내면화됩니다. 일회성 우연이라면 노트에 남습니다.

3. "전용 체육관" (격리된 어댑터)

이는 '망각'을 방지하기 위한 이 논문의 가장 큰 혁신입니다.
제작실, 전투실, 농장실 등 다양한 방이 있는 체육관을 상상해 보세요.

  • 기존 시스템에서는 전투를 배우는 것이 로봇이 제작하는 방법을 우연히 덮어쓰는 (운동복을 섞어 입는 것과 같은) 문제가 발생했습니다.
  • PEAM 에서는 로봇이 물리적으로 격리된 방들(어댑터)을 가지고 있습니다. 전투를 배울 때 '전투실'만 업데이트됩니다. '제작실'은 손대지 않은 채 유지됩니다. 이는 로봇이 새로운 기술을 영원히 배워도 기존 기술을 잊지 않음을 의미합니다.

4. 자기 유발형 알람 시계

로봇은 언제 연습을 멈추고 암기를 시작해야 하는지 어떻게 알까요?

  • 기존 방식: "100 번 연습한 후 암기하자." (이것은 경직되어 있어 너무 일찍 또는 너무 늦게 암기할 수 있습니다.)
  • PEAM 방식: 로봇은 자기 유발형 알람을 가지고 있습니다. 자신의 실패율을 관찰합니다. 특정 작업에서 평소보다 더 자주 실패하기 시작하면 알람이 울립니다: "이봐, 우리가 이 부분에서 고군분투하고 있어. 멈추고 즉시 해결책을 내면화하자." 이는 어떤 작업이든 상관없이 작동하며, 인간이 특정 숫자를 설정할 필요가 없습니다.

왜 이것이 더 나은가요?

이 논문은 마인크래프트에서 이를 테스트하여 세 가지 주요 이점을 발견했습니다:

  1. 속도: 로봇이 매번 노트를 검색할 필요가 없기 때문에 훨씬 빠르게 행동합니다 (테스트에서 약 40% 빠름).
  2. 효율성: 이전 이야기를 다시 읽을 필요가 없으므로 훨씬 적은 컴퓨터 성능 (처리할 '텍스트' 약 85% 감소) 을 사용합니다.
  3. 망각 없음: "전용 방" 덕분에 새로운 전투 기술을 배워도 집 짓는 방법을 잊지 않습니다.

요약

PEAM 은 모든 질문에 대해 교과서에 의존하는 학생을, 실제로 기술을 암기한 전문가로 바꾸는 것과 같습니다. 이는 수행하며 배우고, 실수로부터 배우며, 기술들이 섞이지 않도록 서로 분리해 유지하고, 언제 연습을 멈추고 기억을 시작해야 할지 정확히 압니다. 그 결과로 더 빠르고, 더 똑똑하며, 배운 것을 잊지 않는 로봇이 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →