← 최신 논문
💻 computer science

In-Context Reinforcement Learning under Non-Stationarity: A Survey

본 논문은 비정상성 인컨텍스트 강화학습(non-stationary in-context reinforcement learning, ICRL)에 관한 조사 연구를 제시하며, 현재의 태스크 규칙과 축적된 컨텍스트의 관련성을 모두 추론함으로써 변화하는 환경에 고정된 파라미터 정책을 적응시키는 과제를 다루고, 기존 문헌을 환경 변화의 성격, 역학 및 관측 가능성을 중심으로 정리한다.

원저자: A Run, Ziluo Ding

게시일 2026-07-15
📖 5 분 읽기🧠 심층 분석

원저자: A Run, Ziluo Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 친구는 뇌를 직접 바꾸어 새로운 것을 배우는 대신, 자신이 해온 모든 일을 기록한 거대하고 계속 커지는 일기장을 읽으며 배웁니다. 이것이 바로 **인-컨텍스트 강화학습(In-Context Reinforcement Learning, ICRL)**입니다. 로봇은 자신의 일기장을 읽고, 지금 자신이 플레이하고 있는 게임의 규칙을 파악한 뒤, 자신의 내부 코드를 업데이트하지 않고도 다음에 무엇을 할지 결정합니다.

하지만 여기 반전이 있습니다. 우리 로봇을 둘러싼 세상은 약간 장난꾸러기 같습니다. 때때로 게임 도중에 규칙이 바뀝니다. 점프 점수가 갑자기 두 배가 될 수도 있고, 바닥이 용암으로 변할 수도 있으며, 로봇 팔의 조작 키가 서로 바뀔 수도 있습니다. 이것이 **비정상성(Non-Stationarity)**입니다.

당신이 질문한 이 논문은 우리의 일기 읽는 로봇이 변화하는 규칙에 직면했을 때 어떤 일이 벌어지는지에 대한 방대한 조사 보고서입니다. 저자인 A Run과 Ziluo Ding은 우리가 로봇이 긴 일기장을 읽는 능력을 칭송하는 데 몰두하는 동안, 오래된 일기 기록이 규칙이 변했을 때 위험한 거짓말이 될 수 있다는 사실에는 충분한 주의를 기울이지 않았다고 주장합니다.

핵심 문제: "상태가 지난" 일기장

당신의 로봇 일기장을 요리책이라고 생각해 보세요. 당신이 수년간 초콜릿 케이크를 굽는 법을 기록해 왔다면, 당신의 일기장은 완벽한 초콜릿 케이크 레시피로 가득 차 있을 것입니다. 그런데 갑-자기 세상이 변했습니다. 당신은 이제 레몬 타르트만 파는 제과점에 와 있습니다.

만약 당신의 로봇이 눈을 감고 예전 일기장을 읽는다면, 그는 레몬 타르트 가게에서 초콜릿 케이크를 구우려고 할 것입니다. 그러면 그는 처참하게 실패할 것입니다. 논문에서는 이를 **"상태가 지난 컨텍스트(Stale Context)"**라고 부릅니다. 일기 속의 증거(초콜릿 레시피)가 현재 상황(레몬 가게)에 더 이상 유효하지 않은 것입니다.

이 서베이 논문의 주요 발견은, 변화하는 세상에서 살아남기 위해 로봇에게 필요한 것은 단순히 '긴 일기장'을 갖는 것이 아니라는 점입니다. 로봇에게는 똑똑한 사서가 필요합니다. 이 사서는 다음을 결정해야 합니다:

  1. 무엇을 기록할 것인가: 새로운 레몬 타르트 시도들을 기록해야 하는가?
  2. 무엇을 버릴 것인가: 초콜릿 케이크 레시피가 우리의 집중을 방해하지 않도록 삭제해야 하는가?
  3. 무엇을 믿을 것인가: 만약 로봇이 오래된 초콜릿 레시피와 새로운 레몬 시도가 섞인 것을 보게 된다면, 어느 쪽의 말에 귀를 기울여야 하는가?

저자들은 단순히 일기장을 길게 만드는 것(더 많은 컨텍스트를 추가하는 것)이 정답이 아니라고 제안합니다. 사실, 더 긴 일기장은 오히려 페이지를 어지럽히는 혼란스럽고 시대에 뒤떨어진 레시피들을 더 많이 가져올 뿐일 수도 있습니다. 진짜 마법은 일기장을 관리하는 것에 있습니다. 즉, 언제 잊어야 하고, 언제 기억해야 하며, 언제 무시해야 하는지를 아는 것입니다.

이 논문이 "아니오"라고 말하는 것들

저자들은 이 기술이 무엇이 아닌지에 대해 매우 엄격합니다. 그들은 사람들이 혼동할 수 있는 몇 가지 일반적인 아이디어를 명시적으로 제외합니다:

  • 이것은 "온라인 학습(Online Learning)"이 아닙니다: 만약 로봇이 작업하는 동안 자신의 뇌 코드(가중치)를 변경한다면, 그것은 이 논문의 주제가 아닙니다. 이 논문은 뇌 코드는 고정된 채로 오직 다른 일기 부분을 읽음으로써 행동만을 바꾸는 로봇에 관한 것입니다.
  • 이것은 단순한 "일반화(Generalization)"가 아닙니다: 만약 로봇이 한 번도 본 적 없는 새로운 레벨에서 테스트를 받더라도, 그 레벨의 규칙이 안정적이라면 그것은 단순한 일반화입니다. 이 논문은 규칙이 플레이 도중에 변하는 상황에 관한 것입니다.
  • 이것은 "챗봇의 기억"이 아닙니다: 만약 로봇이 대화 중에 당신의 이름을 기억하지만, 그 기억을 사용하여 미래의 게임 행동을 바꾸지는 않는다면, 그것은 단순한 챗봇입니다. 이것은 로봇이 행동과 보상의 루프 속에서 기억을 사용하여 행동하고 적응하는 것에 관한 것입니다.

얼마나 확신하는가?

저자들은 자신들이 식별한 문제점에 대해 매우 확신하고 있습니다. 그들은 기존 연구들을 조사했고 명확한 공백을 발견했습니다. 우리는 일기 읽는 로봇을 만드는 방법은 알지만, 규칙이 변할 때 이를 어떻게 다루는지에 대한 견고한 이론이나 표준 테스트는 갖추고 있지 않습니다.

  • 그들은 제안합니다: 현재의 테스트(예를 들어 평균 점수만 측정하는 것)는 로봇이 규칙 변경 직후에 실패하고 있을 가능성을 숨기기 때문에 오해의 소지가 있다고 말입니다.
  • 그들은 제안합니다: 규칙 변화 후 얼마나 빨리 회복하는지, 혹은 오래된 가짜 일기 기록으로 로봇을 속였을 때 얼마나 성능이 떨어지는지를 체크하는 것과 같은 새로운 테스트 방식을 제안합니다.
  • 그들은 인정합니다: 비록 우리가 몇 가지 아이디어(예: 오래된 데이터를 "잊기" 또는 새로운 데이터를 "검색하기")를 가지고 있기는 하지만, 세상이 변할 때 유한한 일기장에서 로봇이 정확히 얼마나 많은 것을 배울 수 있는지 설명하는 완벽한 수학적 이론은 아직 없다는 점을 인정합니다. 그들은 이를 "진정으로 열려 있는(open)" 문제라고 부릅니다.

세 가지 큰 질문

세상이 변하는 다양한 방식들을 이해하기 위해, 저자들은 이를 세 가지 간단한 질문으로 나눕니다:

  1. 무엇이 변했는가? 점수가 변했는가? 물리 법칙이 변했는가? 컨트롤러의 버튼이 바뀌었는가?
  2. 어떻게 변했는가? 즉각적으로 일어났는가(갑작스러운 정전처럼)? 천천히 일어났는가(일몰처럼)? 아니면 세상이 앞뒤로 순환하는가(낮과 밤처럼)?
  3. 로봇이 그것을 볼 수 있는가? 로봇에게 "규칙 변경!"이라는 커다란 표지판이 보이는가? 아니 아니면 자신의 실수를 관찰함으로써 그것을 추측해야 하는가?

"사서" 솔루션

논문은 일기 관리에 따라 로봇의 다양한 전략을 분류합니다:

  • "모두 추가하는(Append-All)" 로봇: 모든 것을 그냥 다 적습니다. 안정적인 세상에서는 좋지만, 변화하는 세상에서는 최악입니다. 일기장이 거짓말로 너무 가득 차기 때문입니다.
  • "검색하는(Retrieval)" 로봇: 가장 관련성 높은 페이지만을 뽑아내는 마법 같은 색인을 가지고 있습니다. 하지만 색인이 "무엇과 유사한가"를 기준으로 한다면, 레몬 타르트가 필요할 때 오래된 초콜릿 레시피를 뽑아올 수도 있습니다.
  • "가치 인식형(Value-Aware)" 로봇: 단순히 레시피를 읽는 것이 아니라, 그 레시피가 지금 당장 맛있는 케이크로 이어지는지 확인합니다. 만약 점수가 변했다면, 그는 예전 레시피가 가치 없다는 것을 깨닫습니다.

요약

저자들은 우리가 단순히 더 큰 기억력을 가진 로봇을 만드는 것을 멈춰야 한다고 결론짓습니다. 우리는 더 똑똑한 사서를 가진 로봇을 만들어야 합니다. 이 사서들은 어떤 기억이 현재의 규칙에 부합할 때만 유용하다는 것을 알아야 합니다. 규칙이 변하면, 로봇은 "저 오래된 일기 기록은 유효하지 않아. 나는 그것을 무시하고 새로운 증거를 보겠다"라고 말할 수 있어야 합니다.

그들은 이러한 로봇들을 테스트하기 위한 새로운 규칙들을 제안합니다. 단순히 "몇 점을 얻었니?"라고 묻는 대신, "규칙이 변한 후 얼마나 빨리 회복했니?" 그리고 "너의 오래된 기억에 속았니?"라고 물어야 합니다.

논문은 이 분야가 매우 새롭고 흥격적인 분야라는 말로 끝을 맺습니다. 우리는 일기 읽는 로봇을 만들 도구를 갖추고 있지만, 움직이지 않는 세상이 아닌, 끊임없이 변하는 세상을 다루는 법을 가르치는 단계에 이제 막 들어섰을 뿐입니다. 이것은 아직 해결된 문제가 아니며, 다음 세대의 적응형 에이전트를 위한 로드맵입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →