← 최신 논문
🤖 machine learning

Corruption Robust Offline Reinforcement Learning with Human Feedback

이 논문은 신뢰 집합(confidence sets)을 통해 보상 모델을 학습하고 오염에 강건한 RL 오라클(corruption-robust RL oracles)을 통한 비관적 최적화(pessimistic optimization)를 활용함으로써, ε\varepsilon 비율의 오염된 궤적-피드백 쌍이 포함된 데이터셋으로부터 최적에 가까운 정책을 식별할 수 있는 최초의 증명 가능한 강건한 오프라인 인간 피드백 기반 강화학습(RLHF) 알고리즘을 소개한다.

원저자: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 복잡한 비디오 게임을 하는 법을 가르치려 한다고 상상해 보세요. 보통은 로봇이 플레이하게 두고, 로봇이 무엇을 하는지 지켜본 뒤, 성과에 따라 "잘했어!" 또는 "못했어!"라고 말해주면 됩니다. 이것이 바로 **인간 피드백을 통한 강화 학습(RLHF)**입니다.

하지만 현실 세계에서 수집하는 데이터는 완벽하지 않습니다. 때로는 피드백을 주는 사람이 피곤해서 실수를 하기도 하고(노이즈), 때로는 악의적인 해커가 로봇을 속이기 위해 "좋음"과 "나쁨"의 라벨을 의도적으로 뒤바꿔 놓기도 합니다(부패/오염).

이 논문은 매우 까다로운 문제를 다룹니다: 데이터가 부분적으로 오염되거나 부패했을 때, 로봇이 다시는 게임을 직접 플레이하지 않고도(오프라인 방식) 게임을 잘하도록 어떻게 가르칠 것인가?

다음은 이들의 해결책을 창의적인 비유를 사용하여 쉽게 풀어낸 내용입니다.

핵심 문제: "독이 든 레시피 북"

당신이 완벽한 케이크를 굽는 법을 배우고 싶다고 가정해 봅시다. 당신에게는 1,000개의 레시피가 담긴 레시피 북(데이터셋)이 있습니다. 하지만 공격자가 몰래 들어와 레시피 중 10%를 바꿔 놓았습니다. 어떤 레시피는 설탕을 넣어야 할 자리에 소금을 넣으라고 적혀 있고, 어떤 재료들은 잘못 기재되어 있습니다.

만약 당신이 이 책을 맹목적으로 따른다면, 끔찍한 케이크를 굽게 될 것입니다. 만약 직접 케이크를 구워 맛을 보며 배우려고 한다면(온라인 RL), 배탈이 나거나 재료를 낭비하게 될 수도 있습니다. 저자들은 이 오염된 책을 보고, 어떤 레시피가 진짜인지 파악하여, 주방에 발을 들이지도 않고 로봇에게 최고의 케이크를 굽는 법을 가르치는 방법을 제안합니다.

3단계 전략

저자들은 이 문제를 해결하기 위해 3단계의 "탐정" 프로세스를 제안합니다.

1. "진실 탐지기" (강건한 보상 학습)

먼저, 로봇은 무엇이 "좋은 것"인지 이해해야 합니다. 논문에서는 이를 **보상 모델(Reward Model)**을 학습하는 것이라고 부릅니다.

  • 비유: 집의 실제 가격을 판매 목록을 통해 추측하려고 한다고 상상해 보세요. 어떤 항목은 가짜입니다 (예: 대저택이 50달러로 기재됨).
  • 방법: 모든 가격의 평균을 내는 대신(이는 가짜 데이터에 의해 왜곡될 것입니다), 저자들은 **트림드 최대 가능도(Trimmed Maximum Likelihood)**라는 기술을 사용합니다. 이것은 "나는 가장 황당하고 수상한 상위 10%의 숫자들을 무시하고, 중간 90%의 숫자만을 신뢰하겠다"라고 말하는 스마트한 필터와 같습니다. 이를 통해 데이터가 거짓을 말하더라도 인간이 실제로 선호하는 것에 대한 "깨끗한" 추정치를 얻을 수 있습니다.

2. "안전망" (신뢰 집합)

진정한 보상에 대한 "최선의 추측"을 얻었다고 해서, 그것을 맹목적으로 믿지는 않습니다. 그들은 **신뢰 집합(Confidence Set)**을 구축합니다.

  • 비유: 탐정이 "범인은 이 특정 동네에 있을 확률이 95%입니다"라고 말한다고 상상해 보세요. 탐정은 그 동네 주변에 원을 그립니다. 범인이 그 원 안의 어딘가에 있다는 것은 알지만, 정확히 어디인지는 모릅니다.
  • 방법: 그들은 보상 추정치 주변에 수학적인 "거품(bubble)"을 만듭니다. 비록 정확한 중심은 모르더라도, 진정한 보상이 이 거품 안에 있다는 것을 알고 있습니다.

3. "신중한 계획가" (비관적 정책)

이제 로봇은 어떤 움직임을 취할지 결정해야 합니다. 데이터가 오염되었으므로, 로봇은 **비관적(pessimistic)**이어야 합니다. 즉, 조심스러워야 합니다.

  • 비유: 안개가 자욱한 숲을 걷고 있는데, 어떤 길은 "안전함"이라고 표시되어 있지만 실제로는 함정일 수도 있다고 상상해 보세요. 신중한 등산가는 단순히 가장 좋아 보이는 길을 고르는 것이 아니라, 최악의 시나리오에서도 가장 안전한 길을 고를 것입니다.
  • 방법: 로봇은 "안전망"(신뢰 집합) 안에 있는 모든 가능한 경로를 살펴보고 다음과 같이 묻습니다. "내가 이 경로를 택했을 때 얻을 수 있는 최악의 보상은 무엇인가?" 그런 다음 로봇은 이 최악의 보상을 최대화하는 경로를 선택합니다. 이를 통해 데이터가 약간 오염되었더라도 로봇이 치명적인 실수를 저지르지 않도록 보장합니다.

세 가지 다른 "지형" 전략

논문은 모든 데이터셋이 동일하지 않다는 점을 인지하고 있습니다. 어떤 데이터는 매우 풍부한 반면(모든 가능한 움직임에 대한 데이터가 있음), 어떤 데이터는 희소합니다(몇 가지 움직임에 대한 데이터만 있음). 저자들은 데이터의 "지형"에 따라 세 가지 다른 알고리즘을 설계했습니다.

  1. 균일한 커버리지 (The "Rich Map"):

    • 시나리오: 게임 세계의 모든 구석구석을 아우르는 데이터를 가지고 있습니다.
    • 결과: 로봇은 오염이 있더라도 오류가 거의 없이 거의 완벽하게 학습할 수 있습니다. 이는 가짜 도로를 쉽게 찾아낼 수 있는 고해상도의 완전한 지도와 같습니다.
  2. 낮은 상대적 조건수 (The "Rough Map"):

    • 시나리오: 모든 구석에 대한 데이터는 없지만, 가지고 있는 데이터가 전체 세계를 어느 정도 대표하고 있습니다.
    • 결과: 로봇은 "0차 오라클(zero-order oracle)"을 사용합니다. 이것은 발밑의 경사를 느끼며 지형을 짐작하는 눈먼 등산가와 같습니다. 속도는 느리고 덜 정밀하지만, 여전히 안전하며 수학적으로 증명 가능한 수준에서 작동합니다. 오류율은 약간 더 높습니다 (오염의 제곱근에 따라 달라집/결정됩니다).
  3. 유계된 일반화 커버리지 (The "Smart Map"):

    • 시나리오: 데이터가 희소하지만 특정한 예측 가능한 패턴을 따릅니다.
    • 결 결과: 로봇은 "1차 오라클(first-order oracle)"을 사용합니다. 이것은 단순히 발밑의 경사를 느끼는 것을 넘어, 앞의 경사(기울기)를 볼 수 있는 등산가와 같습니다. 이를 통해 로봇은 훨씬 더 효율적으로 작동하며, 더 적은 데이터 포인트로도 훨씬 더 나은 오류율(오염의 제곱근에 비례)을 달eric 수 있습니다.

핵심 요점

이 논문의 주요 성과는 특정한 "조심스러운" 방식과 "필터링" 기술을 사용한다면, 오염된 데이터로부터 로봇이 좋은 전략을 학습할 수 있다는 것을 수학적으로 보장할 수 있다는 점을 증명한 것입니다.

저자들은 단순히 "아마 잘 될 것이다"라고 말한 것이 아닙니다. 그들은 "설령 데이터의 10%가 거짓말을 하더라도, 우리의 방식은 완벽한 데이터를 가졌을 때와 거의 다름없는 최선의 전략을 찾아낼 것이다"라는 것을 입증하는 수학적 방패를 구축했습니다.

이는 **적대적 공격(adversarial attacks)**이 존재하는 상황에서 오프라인 학습과 인간 피드백을 결합하여 이러한 엄격한 보장을 제시한 최초의 사례입니다. 이는 마치 로봇에게 훈련 매뉴얼 속의 거짓말을 꿰뚫어 볼 수 있는 "진실의 안경"을 씌워준 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →