← 최신 논문
🤖 machine learning

Position: Deployed Reinforcement Learning should be Continual

본 포지션 페이퍼는 실세계의 비정상성(non-stationarity)으로 인해 에이전트가 최적의 성능을 유지하기 위해 결코 적응을 멈추어서는 안 된다는 점을 들어, 배포된 강화 학습 시스템이 전통적인 '학습 후 수정(train-then-fix)' 방식보다는 지속 학습(continual learning) 패러다임을 채택해야 한다고 주장한다.

원저자: Parnian Behdin, Kevin Roice, Golnaz Mesbahi

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Parnian Behdin, Kevin Roice, Golnaz Mesbahi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가족을 위해 저녁을 요리할 유능한 셰프를 고용했다고 상상해 보십시오. 당신은 테스트 키친에서 몇 달 동안 그들을 훈련시키며, 그들이 필요로 할 수 있는 모든 레시피를 가르칩니다. 최종 시험을 통과하면, 당신은 주방 문을 잠그고 고정된 메뉴를 건네며 이렇게 말합니다. "이제 배움은 끝났습니다. 이 메뉴를 영원히 요리하세요."

이것이 오늘날 대부분의 인공지능(AI) 시스템이 작동하는 방식입니다. 이 논문은 이를 "학습 후 고정(Train-Then-Fix)" 패러다임이라고 부릅니다.

이 논문의 저자들은 이러한 접근 방식이 현실 세계의 AI에게는 근본적으로 결함이 있다고 주장합니다. 그들은 AI가 일단 배포(실제 현장에 투입)되면, 결코 학습을 멈추어서는 안 된다고 믿습니다. 그들은 이를 **"연속적 강화 학습(Continual Reinforcement Learning)"**이라고 부릅니다.

다음은 쉬운 비유를 사용한 그들의 논거에 대한 분석입니다.

1. 문제점: 세상은 움직이는 타겟이다

현실 세계에서는 모든 것이 끊임없이 변합니다.

  • 셰프 비유: 당신의 가족의 입맛이 변한다고 상상해 보십시오. 아마도 파스타에 질려 갑자기 초밥을 원하게 될 수도 있습니다. 또는 새로운 식재료가 인기를 끌 수도 있습니다. 만약 당신의 셰프가 예전 메뉴에 갇혀 있다면, 음식은 결국 맛이 없어질 것이고 가족들은 식사를 중단할 것입니다.
  • AI의 현실: 논문은 현실 세계가 너무 복잡하여("거대한 세상"), AI가 일을 시작하기 전에 모든 것을 학습하는 것은 불가능하다고 주장합니다. 설령 AI가 똑똑하더라도, 미래의 모든 변화를 예측할 수는 없습니다. 만약 훈련 후에 그 "두뇌"를 얼려버린다면, AI는 서서히 구식이 되어 성능이 저하될 것입니다.

2. 왜 "학습 후 고정"이 실패하는가

저자들은 세상이 AI가 작동을 시작한 후에도 변하는 구체적인 네 가지 이유를 밝히며, 왜 단순히 "설정하고 잊어버리는 것"이 불가능한지 설명합니다.

  • AI가 세상을 바꾼다 (행동 유발 비정상성 - Action-Induced Non-Stationarity):
    • 비유: 음악 추천 앱을 상상해 보십시오. 만약 앱이 계속해서 같은 종류의 노래만 추천한다면, 사용자는 지루함을 느껴 해당 장르를 듣지 않게 될 수 있습니다. 앱의 선택이 사용자의 취향을 변화시킨 것입니다.
    • 현실: AI의 행동은 종종 그것이 작동하는 환경을 변화시킵니다.
  • 세상이 스스로 변한다 (환경 역학 - Environment Dynamics):
    • 비류: 계절이 바뀌고, 교통 패턴이 변하며, 하드웨어(예: 로봇의 관절)가 시간이 지남에 따라 마모됩니다.
    • 현실: AI의 통제 밖에 있는 것들이 변하면서, 과거의 규칙들을 쓸모없게 만듭니다.
  • 골대가 움직인다 (진화하는 목표 - Evolving Goals):
    • 비유: 어떤 회사가 오늘은 "속도"가 가장 중요한 지표라고 결정했다가, 내년에는 "안전"을 우선순위로 둘 수 있습니다.
    • 현실: 인간의 우선순위와 규제는 변하며, 이에 따라 무엇이 "좋은 성과"인지에 대한 기준도 변합니다.
  • 예기치 못한 사건 (새로운 현상의 출현 - Emergent Novelty):
    • 비유: 갑작스러운 글로벌 팬데к믹이나 아무도 본 적 없는 기이한 새로운 유형의 코드와 같은 "블랙 스완" 사건이 발생합니다.
    • 현실: AI는 필연적으로 훈련받지 못한 상황에 직면하게 됩니다.

3. 해결책: "측정 가능한 배포(Measurable Deployment)"

이 논문은 **"측정 가능한 배포"**라고 불리는 특정 상황에 초점을 맞춥니다.

  • 비유: 이것은 여전히 감시를 받고 있는 셰프와 같습니다. 실제 고객을 위해 요리하고 있지만, 고객들은 여 still 리뷰(평점, 팁 또는 불만 사항)를 남깁니다. 셰프는 음식이 좋은지 나쁜지를 실시간으로 알 수 있습니다.
  • 주장: 만약 AI가 자신이 얼마나 잘하고 있는지 알려주는 피드백(보상 신호)을 받는다면, 그 피드다백을 무시하는 것은 잠재력을 낭비하는 것입니다. 사람이 "이봐, 성능이 떨어졌으니 다시 훈련시켜야 해"라고 말할 때까지 기다리는 대신, AI는 그 피드백을 사용하여 그 즉시 배우고 적응해야 합니다.

4. 실제 사례

논문은 이미 이를 성공적으로 수행하고 있는 두 회사를 언급합니다.

  • Cursor Tab (코딩 어시스턴트): 이 도구는 프로그래머가 코드를 작성하는 것을 돕습니다. 이 도구는 단순히 가만히 있는 것이 아니라, 프로그래머가 실제로 어떤 코드 제안을 수락하는지로부터 학습합니다. 이 도구는 새로운 소프트웨어 업데이트를 몇 달씩 기다리는 대신, 실시간 피드백을 바탕으로 몇 시간마다 자신의 "두뇌"를 업데이트합니다.
  • Lyft (승차 공유 서비스): Lyft는 운전자와 승객을 매칭하는 데 AI를 사용합니다. 교통, 수요, 운전자의 위치가 매초 변하기 때문에, 그들의 AI는 실시간으로 전략을 학습하고 업데이트합니다. 만약 그들이 오프라인에서 모델을 재훈련하기를 기다렸다면, 수백만 달러의 잠재적 수익을 놓쳤을 것입니다.

5. 행동 촉구

저자들은 두 집단에 사고방식을 바꿀 것을 촉구하고 있습니다.

  • 실무자들에게 (만드는 사람들): 배포를 학습 과정의 "끝"으로 취급하는 것을 멈추십시오. AI가 작업하는 동안 실수와 성공으로부터 배울 수 있는 시스템을 구축하십시오. 라이브 데이터를 훈련 데이터로 취급하십시오.
  • 연구자들에게: AI가 "수렴(완벽한 답을 찾으면 학습을 멈추는 것)"하도록 만드는 데 집중하지 마십시오. 대신, 현실 세계에서는 "완벽한 답"이란 존재하지 않기에, 영원히 탐색하고 적응하도록 설계된 AI를 만드십시오.

요약

논문의 핵심 메시지는 간단합니다: 만약 당신이 AI를 피드백을 받는 현실 세계에 배치한다면, 계속 학습하게 해야 합니다. 지식을 얼려버리는 것은 운전 면허 시험을 통과한 운전자에게 눈을 감고 계속 운전하라고 말하는 것과 같습니다. 도로는 변하고, 자동차는 변하며, 목적지도 변합니다. 안전하고 효율적으로 유지되는 유일한 방법은 계속 운전하고, 계속 보고, 계속 배우는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →