← 최신 논문
🤖 machine learning

Forager: a lightweight testbed for continual learning with partial observability in RL

본 논문은 새로운 작업의 끝없는 흐름을 처리하는 데 있어 상태 구성의 결정적 역할과 에이전트의 가소성 상실에 대한 심층 연구를 촉진하도록 설계된 일정한 메모리 발자국을 가진 경량 부분 관측 가능 지속 강화 학습 환경인 Forager 를 소개합니다.

원저자: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 끝없는 숲의 채집자라고 상상해 보십시오. 당신의 목표는 간단합니다: 먹기 좋은 버섯을 찾아 먹고, 독이 있는 버섯은 피하는 것입니다. 하지만 함정이 하나 있습니다: 당신은 발 주변 작은 원만 볼 수 있는 안대를 쓰고 있습니다. 당신은 숲 전체를 볼 수 없으며, 숲은 끊임없이 변합니다. 때로는 맛있는 버섯이 이동하고, 때로는 썩으며, 때로는 '맛있는' 것의 규칙이 밤새 바뀝니다.

이것이 컴퓨터 과학자들이 **지속적 강화 학습 (Continual Reinforcement Learning, CRL)**이라고 부르는 현실 세계의 도전 과제입니다. 이는 AI 에이전트들이 거대하고 혼란스럽며 끊임없이 변화하는 세상에서 영원히 학습하도록 가르치는 것입니다.

문제는 대부분의 현재 AI 연구가 에이전트들이 모든 것을 볼 수 있는 (체스판과 같은) 작고 완벽한 세상에서 이러한 에이전트들을 테스트한다는 점입니다. 하지만 현실 세계는 그렇지 않습니다. AI 가 어떻게 '안대'와 끝없는 변화를 처리하는지 연구하기 위해 연구자들은 특별한 테스트 장치가 필요합니다.

이제 Forager가 등장합니다.

Forager 란 무엇인가?

Forager는 그 안대를 쓰고 있는 동안 AI 가 얼마나 잘 학습할 수 있는지 테스트하도록 특별히 설계된 경량이고 초고속의 비디오 게임이라고 생각하십시오.

  • 과거의 방식: 이전의 테스트 장치는 무거운 벽돌로 가득 찬 배낭을 메고 마라톤을 뛰는 것과 같았습니다. 그들은 느렸고, 거대한 컴퓨터를 필요로 했으며, AI 가 더 많은 것을 기억하려고 할 때 종종 메모리 오류에 빠졌습니다.
  • Forager 의 방식: Forager 는 세련되고 깃털처럼 가벼운 러닝화 같습니다. 그것은 놀라울 정도로 빠르게 실행됩니다 (초당 최대 10 만 회). 그리고 AI 가 얼마나 오랫동안 실행되든 상관없이 컴퓨터 메모리를 아주 작고 일정하게 사용합니다. 이를 통해 연구자들은 무엇이 작동하고 무엇이 실패하는지 보기 위해 수천 개의 실험을 신속하게 수행할 수 있습니다.

대규모 테스트: '안대'와 '전환'

이 논문은 AI 를 두 가지 주요 시나리오에서 테스트합니다:

  1. 제한된 시야: AI 는 작은 '시야'를 가집니다. 시야가 넓으면 AI 는 숲 전체를 볼 수 있어 음식을 쉽게 찾을 수 있습니다. 하지만 연구자들이 시야를 줄여 (안대를 더 꽉 조여) 작게 만들면, AI 는 좋은 버섯이 어디에 있었는지 기억하고 언제 다시 자랄지 예측해야 합니다.

    • 결과: 표준 AI 에이전트들 (DQN 및 PPO 등) 은 길을 잃었습니다. 그들은 음식이 어디에 있었는지 잊어버리고 효과적으로 학습하는 것을 멈췄습니다. 그들은 그저 목적 없이 헤매기만 했습니다.
  2. 끝없는 전환: 연구자들은 규칙이 끊임없이 변하는 트위스트를 추가했습니다. 오늘 보라색 버섯이 맛있을지 모르지만, 내일은 독이 되고 노란색 버섯이 새로운 최애가 될 수 있습니다. AI 는 오래된 습관을 잊고 새로운 것을 즉시, 그리고 반복적으로 학습해야 합니다.

    • 결과: AI 는 학습하는 법을 '잊기' 시작했습니다. 이를 **가소성 상실 (Loss of Plasticity)**이라고 합니다. 이는 한 시험을 위해 너무 열심히 공부한 학생이 뇌가 너무 가득 차서 다음 시험을 위해 아무것도 학습할 수 없게 되는 것과 같습니다.

'수정'들은 효과가 있었는가?

연구자들은 AI 의 메모리 및 학습 문제를 해결하기 위해 여러 가지 '반창고'를 시도했습니다. 그들은 다음과 같은 것들을 시도했습니다:

  • 정규화 (Regularization): AI 에게 원래의 '성격'에 더 가깝게 머물도록 지시하기.
  • 특수 활성화 (Special Activations): AI 의 뇌 세포가 소멸하는 것을 방지하기 위해 뇌 세포의 발화 방식을 변경하기.
  • 다중 네트워크 (Multiple Networks): AI 에게 뇌 하나 대신 팀을 구성하기.

판결: 이러한 수정들은 다리가 부러진 것에 반창고를 붙이는 것처럼 조금 도움이 되었습니다. 그들은 시간이 지남에 따라 AI 가 나빠지는 것을 막았지만, AI 를 그 작업에 수행하게 만들지는 못했습니다. AI 는 여전히 안대 낀 숲을 헤매는 데 어려움을 겪었습니다.

진정한 해결책: AI 에게 기억력 부여하기

이 논문은 비장의 무기가 정교한 알고리즘이 아니라 기억임을 발견했습니다.

  • 단순한 기억: 연구자들이 AI 에게 최근 먹은 것들을 적어둘 간단한 '노트북'을 주었을 때, 그 성능은 훨씬 더 좋아졌습니다. AI 는 "아, 내가 여기서 분홍색 버섯을 먹었는데 그게 좋았어"라고 기억할 수 있었습니다.
  • 순환 기억 (Recurrent Memory, 영웅): 가장 좋은 성과를 낸 것은 **순환적 (Recurrent)**인 뇌를 가진 AI (특히 RTU-PPO 라는 알고리즘) 였습니다. 이는 작동하는 단기기억을 가진 AI 라고 생각하십시오. 그것은 자기 앞의 버섯만 보는 것이 아니라, 자신이 밟아온 길, 지나간 냄새, 그리고 본 변화들을 기억합니다.
    • 이 AI 는 단순히 생존한 것이 아니라 번성했습니다. 그것은 변화를 예측하고, 전체 세상을 볼 수 있는 에이전트만큼이나 잘 안대 낀 숲을 항해하는 법을 학습했습니다.

궁극적인 도전: 무한한 흐름

마지막으로, 연구자들은 Forager 의 '하드 모드' 버전을 만들었습니다. 이 버전에서는 AI 가 충분히 먹으면 새로운 규칙을 가진 새로운 버섯 종들이 끝없이 생성됩니다. AI 는 정착하지 않고 영원히 학습하고, 적응하고, 기억해야 합니다.

기억력을 가진 가장 똑똑한 AI 조차도 여기서 어려움을 겪었습니다. 그것은 끝없는 새로운 작업의 흐름을 따라갈 수 없었습니다. 이는 우리가 진전을 이루었지만, 현재 AI 는 여전히 우리와 같이 복잡하고 부분적으로만 보이는 세상에서 '영원히' 학습할 수 있는 것과는 거리가 멀다는 것을 증명합니다.

요약

Forager는 현재 AI 가 어디서 실패하는지 정확히 보여 주는 새롭고 빠르며 효율적인 도구입니다. 이는 세상이 크고 우리가 모든 것을 볼 수 없을 때, 단순히 AI 를 '더 강력하게' 만드는 것만으로는 충분하지 않음을 드러냅니다. AI 는 변화를 추적하고 세상에 대한 정신적 지도를 구축하기 위해 기억이 필요합니다. 그것이 없으면 AI 는 길을 잃고 학습을 멈춥니다. 이 테스트베드는 과학자들에게 진정한 평생 학습이 가능한 차세대 AI 를 구축할 수 있는 명확한 놀이터를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →