← 최신 논문
🤖 machine learning

Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

본 논문은 CMA-ES를 사용하여 오직 스칼라 검증 피드백만을 기반으로 보상 형성 파라미터를 최적화함으로써, 검증 환경에 대한 궤적 접근 없이도 표준 베이스라인을 능가하고 도메인 무작위화 성능과 대등한 성능을 구현하여 제한된 시나리오에서의 강화 학습 일반화 성능을 향상시키는 이중 레벨 최적화 프레임워크인 진화적 보상 형성(GERS)을 제안한다.

원저자: Ekasit Usaratniwart, Xilin Gao, Marc Ong, Youhei Akimoto

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ekasit Usaratniwart, Xilin Gao, Marc Ong, Youhei Akimoto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 걷는 법을 가르치고 있다고 상상해 보세요. 보통은 로봇에게 완벽하게 통제된 체육관에서 걷는 법을 가르칩니다. 그곳의 바닥은 항상 매끄럽고, 공기는 정지해 있으며, 로봇의 다리 무게도 정확히 설정되어 있습니다. 로봇은 이 체육관 안에서 완벽하게 걷는 법을 배웁니다.

하지만 그 후, 당신이 로봇을 실제 세상으로 보냅니다. 갑자기 바닥은 미끄러워지고, 바람은 불어오며, 로봇의 다리는 더 무겁게 느껴집니다. 로봇은 오직 "완벽한 체육관" 버전의 걷기만을 배웠기 때문에, 즉시 넘어지고 맙니다. 로봇은 체육관에 **과적합(overfitted)**되었고, 실제 세상으로 **일반화(generalize)**하는 데 실패한 것입니다.

이 논문은 이 문제를 해결하기 위해, 특히 로봇이 실제 세상에서 어떻게 실패했는지 그 과정은 볼 수 없고 오직 '실패했다'는 사실만 알 수 있는 까다로운 상황을 위한 새로운 방법인 GERS(Generalization via Evolutionary Reward Shaping)를 소개합니다.

다음은 쉬운 비유를 사용한 상세 설명입니다.

1. 문제점: "블랙박스" 검증기 (The "Black Box" Validator)

많은 실제 시나리오(예: 보안 AI를 클라이언트의 프라이빗 네트워크에서 테스트하는 경우)에서는 두 가지 유형의 환경이 존재합니다.

  • 훈련용 체육관 (The Training Gym): 이곳에는 모든 권한이 있습니다. 로봇이 취하는 모든 단계, 저지르는 모든 실수, 생성하는 모든 로그를 볼 수 있습니다.
  • 검증용 블랙박스 (The Validation Black Box): 개인정보 보호나 보안상의 이유로, 다른 몇몇 환경(예: 실제 클라이언트의 네트워크)에서는 로봇의 단계를 볼 수 없습니다. 당신은 오직 마지막에 나오는 하나의 숫자, 즉 "성공했는가? 여기 점수가 있다"라는 결과만 볼 수 있습니다.

표준적인 AI 훈련 방식은 대개 검증 환경에서도 로봇의 단계(궤적, trajectory)를 볼 수 있어야 합니다. 하지만 블랙박스 안에서는 로봇의 단계를 볼 수 없으므로, 표준적인 방식들은 막히게 됩니다. 블랙박스로부터 학습할 수 없기 때문에, 그들은 계속해서 훈련용 체육관에 과적합된 상태로 머물게 됩니다.

2. 해결책: "조절 노브" (The "Tuning Knob" - Reward Shaping)

저자들은 영리한 우회 방법을 제안합니다. 블랙박스의 점수를 사용하여 로봇을 직접 가르치는 대신, 체육관의 규칙을 미세하게 조정하기로 결정한 것입니다.

로봇의 "보상 함수(Reward Function)"를 성적을 매기는 선생님이라고 생각해 보세요.

  • 표준적인 선생님: "다리를 앞으로 움직이면 1점을 준다."
  • 문제점: 로봇은 체육관에서 1점을 받기 위해 아주 이상하고 끊기는 방식으로 다리를 움직이는 법을 배웁니다. 하지만 이런 방식은 실제 세상에서는 실패합니다.
  • GERS 선생님: 시스템은 채점 방식에 "조절 노브"(수학적으로는 벡터 ν\nu)를 추가합니다. 이는 규칙을 약간 변경합니다: "다리를 부드럽게 앞으로 움직이면 1.5점을 준다. 만약 끊기듯 움직이면 0점을 준다."

목표는 이 조절 노브의 완벽한 설정값을 찾는 것입니다. 그래야 로봇이 체육관뿐만 아니라 블랙박스 환경에서도 작동할 수 있는 걷기 스타일을 배우게 됩니다.

3. 이중 레벨 게임 (Bilevel Optimization)

논문은 이 조절 노브를 찾기 위해 "이중 레벨 게임"을 사용합니다.

  • 레벨 1 (학생): 로봇(PPO라는 알고리즘 사용)은 현재 설정된 조절 노브를 바탕으로 훈련용 체육관에서 걷는 법을 배웁니다. 로봇은 하나의 정책(walking rules의 집합)을 학습합니다.
  • 레벨 2 (코치): 다른 알고리즘(진화 생물학자와 같은 역할을 하는 CMA-ES)이 조절 노브를 살펴봅니다. 코치는 이렇게 묻습니다: "만약 우리가 이 노브를 약간 수정한다면, 로봇이 블랙박스에서 더 높은 점수를 받을 수 있을까?"
    • 코치는 블랙박스에서의 로봇의 단계(steps)에는 관심이 없습니다. 오직 최종 점수에만 관심이 있습니다.
    • 로봇이 블랙박스에서 더 높은 점수를 받으면, 코치는 그 조절 노브 설정을 유지합니다. 만약 점수가 떨어지면, 코치는 노브를 다시 조정합니다.

코치는 이 과정을 수천 번 반복하며, 로봇이 블랙박스 안에서도 살아남을 수 있을 만큼 견고한 걷기 스타일을 배우도록 "조절 노브"를 진화시켜 나갑니다. 비록 로봇이 훈련 중에 블랙박스를 실제로 본 적은 없지만 말입니다.

4. 결과: 역경을 이겨내다 (Beating the Odds)

저자들은 네 가지 로봇 작업(막대 균형 잡기, 점프하기, 달리기, 네 발 걷기 등)에 대해 이 방법을 테스트했습니다.

  • 베이스라인 (표준 AI): 체육관에서만 훈련되었습니다. 체육관에서는 챔피언이 되었지만, 물리적 조건이 변하면(예: 다리가 더 무거워지거나 바닥이 미끄러워질 때) 즉시 무너졌습니다.
  • "도메인 랜덤화(Domain Randomization, DR)" 방식: 현재의 표준적인 방법입니다. 로봇을 수많은 서로 다른 체육관에서 동시에 훈련시킵니다(모든 가능한 실제 환경을 시뮬레이션함). 이 방식은 매우 잘 작동하지만, 그 많은 다양한 체육관에 접근할 수 있어야 하며 로봇의 모든 단계를 볼 수 있어야 합니다.
  • GERS (새로운 방법): 오직 하나의 훈련용 체육관과 블랙박스 점수에만 접근할 수 있었습니다.
    • 결과: GERS는 훨씬 적은 정보만 가지고도 "도메인 랜덤화" 방식과 거의 대등한 성능을 보여주었습니다. GERS는 단 하나의 체육관에서 보상을 "형성(shaping)"하는 것만으로도, 보지 못한 어려운 환경에 일반화할 수 있었습니다.

요약 비유

요리사에게 요리법을 가르친다고 상상해 보세요.

  • 표준 훈련: 당신은 요리사가 당신의 주방에 있는 특정 가스레인지에서만 요리하게 합니다. 그들은 당신의 가스레인지에서 완벽하게 요리하는 법을 배웁니다. 하지만 다른 레스토랑의 가스레인지를 사용하게 되면 음식을 태워버립니다.
  • 도메인 랜덤화: 당신은 요리사를 100개의 서로 다른 주방에 있는 100개의 서로 다른 가스레인지 위에서 요리하게 합니다. 그들은 무엇에도 적응하는 법을 배웁니다. (하지만 이를 위해서는 100개의 주방에 접근할 수 있어야 합니다.)
  • GERS: 당신은 요리사가 오직 당신의 주방에서만 요리하게 합니다. 하지만 당신에게는 다른 비밀스러운 레스토랑에 있는 "비밀 맛 테스터"가 있습니다. 당신은 비밀 레스토랑에서 그들이 어떻게 요리하는지는 볼 수 없지만, 점수는 받을 수 있습니다: "맛있다" 또는 "맛없다".
    • GERS는 비밀 맛 테스터의 점수만을 바탕으로 레시피 지침(보상 형성)을 조정하는 똑똑한 수셰프와 같습니다.
    • 결국, 레시피 지침은 아주 미세하게 조정되어, 요리사가 비록 당신의 주방에서만 연습했을지라도 어떤 주방에서도 맛있는 음식을 만들 수 있는 방식으로 요리하도록 만듭니다.

이 논문은 로봇의 실패 과정(단계)을 모두 볼 필요는 없으며, 단지 최종 결과를 바탕으로 훈련 규칙을 조정하는 똑똑한 방법이 필요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →