← 최신 논문
🤖 machine learning

MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution

이 논문은 LLM 기반 생성과 진화된 평가자의 구조화된 피드백을 결합함으로써 장기적 임바디드 태스크를 위한 실행 가능한 코드 기반 정책(code-as-policies)을 진화시키고, 기존 베이스라인 대비 우수한 성능과 sim-to-real 전이 능력을 달성하는 메모리 가이드형 메메틱 프레임워크인 MEMENTO를 소개한다.

원저자: Alkis Sygkounas, Victor Aregbede, Amy Loutfi, Andreas Persson

게시일 2026-07-28
📖 6 분 읽기🧠 심층 분석

원저자: Alkis Sygkounas, Victor Aregbede, Amy Loutfi, Andreas Persson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 블록 쌓기나 샌드위치 만들기 같은 복잡한 집안일을 가르치려 한다고 상상해 보세요. 이것은 단순히 버튼 하나를 누르는 것이 아닙니다. 모든 움직임이 이전의 움직임에 의존하는 긴 일련의 단계들입니다. 만약 로봇이 잘못된 블록을 잡거나 잘못된 문을 연다면, 전체 계획은 무너지고 맙니다. 이것이 바로 소프트웨어가 복잡하고 물리적인 세계와 만나는 "임바디드 AI(Embodied AI, 체화된 인공지능)"의 세계입니다. 여기서 큰 과제는 "신용 할당 문제(credit assignment problem)"입니다. 로봇이 긴 작업을 마친 후 실패했을 때, 정확히 어떤 단계가 잘못되었는지 어떻게 알 수 있을까요? 첫 번째 움직임 때문이었을까요, 아니면 열 번째 움직임 때문이었을까요?

이를 해결하기 위해 연구자들은 "코드 기반 정책(code-as-policy)"이라는 영리한 기술을 시도하고 있습니다. 로봇을 막연한 지시나 시행착오 방식의 보상으로 훈련시키는 대신, 로봇의 두뇌를 실제 컴퓨터 코드로 작성하는 것입니다. 이는 로봇에게 단순히 '느낌'을 주는 대신 '레시피 북'을 주는 것과 같습니다. 만약 레시피가 실패한다면, 당신은 그것을 읽고 어떤 명령어가 혼란스러웠는지 정확히 파악하여 다시 쓸 수 있습니다. 하지만 이 레시피를 직접 손으로 쓰는 것은 어렵고, 적절한 코드를 추측하는 것은 훨씬 더 어렵습니다. 여기서 LLM(대규모 언어 모델)—우리와 대화하고 에세이를 쓰는 것과 같은 동일한 AI 두뇌—이 등장합니다. 이들은 코드를 생성할 수 있지만, 제대로 고칠 수 있도록 왜 특정 코드가 실패했는지 알아내는 데 도움이 필요합니다.

이것은 MEMENTO라고 불리는 새로운 방법의 이야기입니다. MEMENTO는 로봇 코드를 위한 매우 똑똑한 기억력을 가진 편집자 역할을 합니다. 연구자들은 AI가 코드를 쓰고, 테스트하고, 무엇이 작동하지 않았는지를 기억하는 특별한 "기억"을 사용하여 같은 실수를 반복하지 않도록 함으로써 더 나은 로봇 레시피를 진화시킬 수 있는지 확인하고자 했습니다. 그들은 이를 두 가지 까다로운 게임으로 테스트했습니다. 하나는 로봇 팔이 규칙을 어기지 않고 블록을 옮기는 하노이의 탑 퍼즐을 푸는 것이고, 다른 하나는 로봇이 가상의 집을 돌아다니며 간식을 만드는 것입니다.

MEMENTO가 어떻게 작동하는지, 그리고 연구팀이 발견한 내용은 다음과 같습니다.

"추측하고 확인하기"의 문제점

당신이 퍼즐을 풀기 위한 프로그램을 작성하려고 한다고 상상해 보세요. AI에게 코드를 써달라고 요청합니다. AI가 무언가를 작성하고, 실행했는데 실패했습니다. 만약 당신이 단순히 AI에게 새로운 무작위 아이디어로 "다시 시도해 봐"라고 요청한다면, 당신은 약간 다른 실패를 얻을 수는 있겠지만, 실제로 배우고 있는 것은 아닙니다. 그것은 눈을 가린 채 다트를 던져 거대한 들판에서 숨겨진 열쇠를 찾는 것과 같습니다.

이전의 방법들은 한 번에 여러 버전의 코드를 생성하여 그중 가장 좋은 것을 고르는 방식으로 이를 해결하려 했습니다. 하지만 연구자들은 이 접근 방식이 종종 목표를 놓친다는 것을 발견했습니다. 그것은 마치 백 명의 사람이 새는 파이프를 고치는 다양한 방법을 제안하지만, 정작 물이 새는 구체적인 지점은 아무도 보지 않는 것과 같았습니다. 그들에게는 하나의 좋은 아이디어를 가져와서 신중하게 수정하고, 어떤 수정이 실패했는지 기억하며, 서로 다른 아이디어의 장점을 결과적으로 결합하는 능력이 부족했습니다.

등장: MEMENTO - 기억을 유지하는 편집자

저자들은 MEMENTO를 소개했습니다. 이는 Memory-Guided Memetic Code-as-Policy Evolution(기억 유도형 밈적 코드 기반 정책 진화)의 약자입니다. 이름은 거창해 보이지만, 아이디어는 놀라울 정도로 인간적입니다. MEMENTO를 로봇 두뇌의 단 하나의 "스타" 초안과 함께 작업하는 숙련된 편집자로 생각하세요.

이 과정은 두 개의 주요 막으로 진행됩니다:

제1막: 심판 만들기
로봇이 학습을 시작하기도 전에, MEMENTO는 특별한 "심판(Judge, 평가자)"을 만듭니다. 이 심판은 로봇이 과업을 수행하는 것을 관찰하고 점수를 주는 코드 조각입니다. 하지만 심판은 단순히 "통과" 또는 "실패"라고만 말하지 않습니다. "점수는 얻었지만, 여기서 블록을 떨어뜨렸습니다" 또는 "문을 너무 빨리 열었습니다"와 같이 상세한 성적표를 제공합니다. 연구자들은 이 심판을 먼저 진화시켜, 로봇의 수행 능력에서 정확히 무엇이 잘못되었는지 포착할 수 있도록 만들었습니다.

제2막: 3개 분기 탐색
심판이 준비되면, 진짜 진화가 시작됩니다. MEMENTO는 단순히 다트를 던지는 것이 아니라, 과거의 실패를 "기억"하면서 로봇의 코드를 개선하기 위한 세 가지 구체적인 전략을 사용합니다:

  1. 힐 클라이머 (Hill-Climber, 신중한 조율사): 이 분기는 현재 가장 좋은 코드를 가져와 아주 작고 신중한 변화를 줍니다. 만약 변화가 로봇을 더 낫게 만든다면, 그것을 유지합니다. 만약 변화가 성능을 악화시킨다면, 왜 그 특정 변화가 실패했는지를 기억합니다. 이러한 "거부된 아이디어에 대한 기억"은 AI가 같은 실수를 두 번 하지 않도록 막아줍니다. 이는 길을 가다가 막다른 길을 발견하면 지도에 표시해 두고 다른 길을 찾는 등, 다시는 같은 덤불 속으로 들어가지 않는 등산객과 같습니다.
  2. 매크로 뮤테이터 (Macro-Mutator, 거대한 아이디어 생성기): 때로는 작은 수정만으로는 충분하지 않습니다. 이 분기는 가장 좋은 코드를 가져와 레시피의 한 단락 전체를 다시 쓰는 것처럼 크고 대담한 변화를 줍니다. 이것은 "완전히 다른 접근 방식을 시도해 보면 어떨까?" 하는 순간입니다.
  3. 크로스오버 (Crossover, 혼합기): 이것이 마법의 재료입니다. 신중한 조율사로부터 얻은 최선의 결과와 거대한 아이디어 생성기로부터 얻은 최선의 결과를 가져와 서로 섞습니다. 이것은 두 가지 서로 다른 레시피에서 가장 좋은 재료를 가져와 새로운 최고의 요리를 만드는 것과 같습니다.

이 세 가지 경로를 모두 시도한 후, MENDO는 다음 라운드를 위한 단 하나의 최선인 "엘리트(Elite)"를 선택합니다. 이 순환은 코드가 과업을 해결할 수 있을 때까지 천천히 정교해지며 반복됩니다.

결과: 실제로 효과가 있는가?

연구자들은 MEMENTO를 두 가지 매우 다른 환경에서 테스트했습니다:

  • Robosuite 하노이의 탑: 네 개의 블록을 쌓는 로봇 팔.
  • AI2-THOR: 사과를 전자레인지에 넣고 빵을 냉장고에 넣기 위해 가상의 주방을 탐색하는 로봇.

그들은 MEMENTO를 두 가지 인기 있는 다른 방법(Eureka 및 REvolve)과 비교했습니다. 결과는 명확했습니다: MEMENTO가 승리했습니다.

하노이의 탑 과업에서 MEMENTO는 0.97 ± 0.06의 성공률(즉, 거의 매번 퍼즐을 해결함)을 달ей한 반면, 다른 방법들은 고전했습니다. 하나는 0.53에 그쳤고, 다른 하나는 완전히 실패(0.00)했습니다. 주방 과업에서 MEMENTO는 완벽한 1.00 ± 0.00의 성공률을 기록한 반면, 다른 방법들은 각각 0.400.00을 기록했습니다.

하지만 진짜 마법은 훈련실 안에서만 일문한 것이 아니었습니다. 연구자들은 로봇이 한 번도 본 적 없는 새로운 상황을 처리할 수 있는지 테스트했습니다.

  • 새로운 모양: 블록을 정육면체에서 이상한 모양의 원기둥이나 비대칭 물체로 바꾸었을 때도, MEMENTO는 여전히 0.87의 확률로 문제를 해결했습니다. 다른 방법들은 0.23 또는 0.00으로 추락했습니다.
  • 새로운 방: 주방 로봇을 한 번도 본 적 없는 완전히 새로운 집 구조로 옮겼을 때도, MEMENTO는 여전히 0.78의 확률로 성공했습니다. 다른 방법들은 0.08로 떨어졌습니다.

이는 MMENTO가 단순히 특정 블록이나 특정 주방을 암기한 것이 아니라, 과업의 논리를 실제로 학습했음을 시사합니다.

"아하!" 모먼트 (Ablation Studies, 절제 실험)

그들의 설계가 비밀 소스임을 증명하기 위해, 연구자들은 MEMENTO의 구성 요소를 제거했을 때 어떤 일이 일어나는지 확인하기 위해 실험을 진행했습니다.

  • 기억 없음: "거부된 아이디어에 대한 기억"을 제거했을 때, 로봇은 같은 실수를 반복하며 계속 제자리걸음을 했습니다.
  • 큰 변화 없음: 오직 작은 수정만 허용했을 때("매크로 뮤테이션" 없음), 로봇은 국소적인 함정(local traps)에서 벗어나지 못했습니다.
  • 혼합 없음: 최선의 아이디어들을 섞는 것을 중단했을 때("크로스오버" 없음), 로봇은 올바른 전략들을 결합할 수 없었습니다.
  • 심판 진화 없음: 훈련되지 않은 단순한 심판을 사용했을 때, 로봇은 이기는 법을 알아낼 수 없었습니다.

매번 구성 요소를 제거할 때마다 성능이 크게 떨어졌으며, 이는 전체 시스템이 반드시 필요함을 입증했습니다.

시뮬레이션에서 현실로

가장 흥激한 부분은 무엇일까요? 그들은 컴퓨터 시뮬레이션에서 진화시킨 최상의 코드를 실제 물리적 로봇(Franka 로봇 팔)에 적용했습니다. 그들은 코드를 다시 훈련하거나 변경하지 않고, 그냥 실행했습니다.

로봇은 실제 세계에서 하노이의 탑 퍼즐을 90%(10번 중 9번)의 확률로 성공적으로 해결했습니다. 단 한 번의 실패는 코드가 틀려서가 아니라, 로봇의 카메라가 블록의 위치를 잘못 읽었기 때문이었습니다. 이는 "코드 기반 정책" 접근 방식이 단순한 시뮬레이션 기술이 아니라, 실제의 복잡한 물리적 세계에서도 작동한다는 것을 증명했습니다.

이것이 의미하는 바

이 논문은 로봇이 복잡하고 긴 과업을 배우기 위해서는 단순한 무작위 추측 이상의 것이 필요하다고 제안합니다. 우리는 무엇이 작동하지 않았는지를 기억하고, 작고 큰 변화를 모두 가하며, 최선의 아이디어를 결합하는 시스템이 필요합니다. MEMENTO는 로봇 코드를 실패의 기억을 가진 편집, 테스트, 정교화가 가능한 레시피처럼 취급함으로써, 우리가 이전에 너무 어려웠던 퍼즐을 로봇에게 가르칠 수 있음을 보여주었습니다.

저자들은 이 연구가 특정 작업에 대해 테스트되었으며, 사용된 특정 언어 모델에 의존한다는 점을 주의 깊게 언급했습니다. 그들은 이것이 모든 로봇 문제를 해결한다고 주장한 것이 아니라, 로봇에게 코드로 생각하는 법을 가르치는 매우 유망한 길을 보여주었다는 점을 강조했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →