← 최신 논문
🤖 AI

Robust Shielding for Safe Reinforcement Learning

이 논문은 최악의 경우의 전이 불확실성 하에서도 강화 학습 에이전트의 안전성을 보장하는 동시에, 샘플링 방법과 결합하여 학습된 모델에 대해 아마도 근사적으로 정확한(PAC) 안전 보장을 제공하는, 강건한 마르코프 결정 과정(MDP)을 위한 새롭고 건전하며 최적인 쉴딩 프레임워크를 소개한다.

원저자: Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 팩맨(Pac-Man) 같은 비디오 게임을 하거나 자동차를 운전하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 가장 높은 점수를 얻거나 목적지에 최대한 빨리 도착하는 법을 배우길 원합니다. 이것을 **강화 학습(Reinforcement Learning)**이라고 부릅니다. 로봇은 시행착오를 통해 배웁니다. 움직여 보고, 어떤 일이 일어나는지 관찰하며, 좋은 움직임에는 "보상(점수)"을 받고 나쁜 움직임에는 "벌칙"을 받습니다.

문제는 로봇이 배우기 위해서 **탐색(explore)**을 해야 한다는 점입니다. 로봇은 어떤 동작이 효과가 있는지 확인하기 위해 위험한 시도를 해봐야 합니다. 하지만 현실 세계에서 위험한 시도는 로봇이 벽에 충돌하거나 자율주행 자동차가 보행자를 치는 상황을 초래할 수 있습니다. 우리는 그 시도가 재앙이 될 수 있는 상황에서 로봇이 시행착오를 통해 배우도록 내버려 둘 수 없습니다.

문제점: 현실이라는 "블랙박스"

보통 로봇을 안전하게 유지하려면, 로봇이 위험한 동작을 하지 못하도록 막는 "방패(shield)"—즉, 안전 가드—가 필요합니다. 하지만 완벽한 방패를 만들기 위해서는 세상의 정확한 규칙(물리학, 교통 법규, 게임 메커니즘 등)을 알아야 합니다.

현실 세계에서 우리는 그 정확한 규칙을 알지 못합니다. 우리는 단지 과거의 실행 데이터나 시뮬레이터로부터 얻은 일부 데이터만을 가지고 있을 뿐입니다. 만약 우리가 제한된 데이터를 바탕으로 규칙을 추측한다면, 그 추측은 틀릴 수 있습니다. 만약 우리의 방패가 잘못된 추측을 바탕으로 만들어졌다면, 재앙을 막지 못하고 실패할 것입니다.

해결책: "최악의 경우"를 대비한 우산

이 논문은 우리가 세상의 규칙을 모를 때를 대비하여 설계된 새로운 종류의 방패를 소개합니다. 이들은 알 수 없는 세상을 두 플레이어 간의 게임으로 취급합니다:

  1. 로봇 (에이전트): 높은 점수를 얻으려고 노력합니다.
  2. "그렘린" (적대자): 로봇이 하는 모든 움직임에 대해 최악의 결과를 선택함으로써 로봇을 실패하게 만들려는 장난꾸러기 힘입니다.

저자들은 이를 **강건한 MDP (Robust MDP)**라고 부릅니다. 이렇게 생각해보세요:

  • 기존 방식: "내 데이터에 따르면 이 다리가 버틸 확률은 90%야. 로봇이 건너게 해주자." (만약 실제로 다리가 무너지면, 로봇은 추락합니다.)
  • 새로운 방식 (이 논문): "나는 이 다리의 정확한 강도를 모르지만, 적어도 '약함'과 '강함' 사이 어딘가에 있다는 것은 알아. 나는 다리가 **'약하다'**고 가정하는 방패를 만들 거야. 만약 로봇이 다리가 약한 상황에서도 안전하게 건널 수 있다면, 다리가 강할 때도 반드시 안전할 거야."

작동 원리: "안전 예산"

이 논문은 **안전 예산(Safety Budget)**이라는 기발한 트릭을 사용합니다.

로봇이 특정 금액의 "안전 자금"(예를 들어 100달러)이 든 지갑을 가지고 있다고 상상해 보세요. 로봇이 한 걸음을 내디딜 때마다, 돈을 잃을 아주 작은 위험이 따릅니다.

  • 방패는 로봇이 할 수 있는 모든 움직임에 대해 돈을 잃을 최악의 경우의 확률을 계산합니다.
  • 만약 어떤 움직임이 로봇이 가진 돈보다 더 많은 돈을 잃을 위험이 있다면, 방패는 그 움직임을 차단합니다.
  • 만약 그 움직임이 지갑을 파산시키지 않을 만큼 충분히 안전하다면, 방패는 로봇이 그 움직임을 수행하도록 허용합니다.

이 "지갑"은 실시간으로 업데이트됩니다. 로봇이 세상에 대해 더 많은 데이터를 모을수록(학습할수록), "그렘린"은 덜 무서워집니다. 불확실성이 줄어들면서 "최악의 경우"는 덜 가혹해지고, 로봇은 더 높은 보상을 얻기 위한 위험을 감수할 수 있는 자유를 얻게 됩니다.

작동 중인 "방패"

논문은 다음의 3단계 과정을 설명합니다:

  1. 불확실성 학습: 로봇은 환경으로부터 데이터를 수집합니다. "낙하 확률은 5%이다"라고 말하는 대신, "낙하 확률은 2%에서 8% 사이이다"라고 말합니다. 이 범위가 바로 "강건한(Robust)" 부분입니다.
  2. 방패 구축: 이 범위를 사용하여, 설령 확률이 무서운 쪽 끝(8%)에 있더라도 안전을 보장하는 방패를 만듭니다.
  3. 로봇의 플레이: 로봇이 게임을 수행합니다. 방패는 모든 움직임을 지켜봅니다(감시합니다). 만약 로봇이 (설령 최악의 경우에만 위험할지라도) 위험할 수도 있는 행동을 하려고 하면, 방패가 개입하여 더 안전한 선택을 강제합니다.

결과: 안전하면서도 똑똑하게

저자들은 이 방법을 팩맨이나 "컬러 밤(color bombs)"이 있는 그리드 월드와 같은 게임에 테스트했습니다.

  • "추측" 방식 (기존 방식): 데이터를 바탕으로 규칙을 단순히 추측하면, 로봇은 높은 점수를 얻기도 하지만 추측이 약간만 틀려도 유령이나 폭탄에 부딪혀 충돌합니다.
  • "강건한 방패" 방식 (새로운 방식):
    • 초기 단계: 로봇이 데이터가 거의 없을 때, 방패는 매우 엄격합니다. "안 돼, 거기로 가면 안 돼, 위험할 수도 있어!"라고 말합니다. 로봇은 매우 안전하게 플레이하지만 낮은 점수를 얻습니다.
    • 데이터가 늘어남에 따라: 로봇이 더 많이 배울수록 "불확실성 범위"가 좁아집니다. 방패는 "아, 저 움직임은 실제로 그렇게 위험하지 않구나!"라고 깨닫고 규칙을 완화합니다.
    • 결과: 로봇은 100% 안전을 유지하면서(절대 충돌하지 않음), 결국 처음부터 모든 규칙을 알고 있었던 로봇만큼이나 잘 플레이하는 법을 배웁니다.

요약 비유

당신이 아이에게 자전거 타는 법을 가르치고 있다고 상상해 보세요.

  • 기존 방식: 당신은 아이에게 "길이 평평한 것 같으니 빠르게 달려도 돼"라고 말합니다. 만약 길에 숨겨진 구멍이 있다면, 아이는 넘어집니다.
  • 새로운 방식 (이 논문): 당신은 길이 평평한지 울퉁불퉁한지 모릅니다. 그래서 자전거에 보조 바퀴를 답니다 (방패). 당신은 아이에게 이렇게 말합니다. "우리는 길이 구멍투성이라고 가정할 거야. 만약 네가 보조 바퀴를 달고 울퉁불퉁한 길에서도 안전하게 탈 수 있다면, 너는 안전할 거야."
    • 처음에는 보조 바퀴가 무거워서 아이는 느리게 움직입니다.
    • 하지만 자전거를 타고 길을 지나가며 실제로 길이 매끄럽다는 것을 깨닫게 되면, 당신은 천천히 보조 바퀴를 들어 올립니다.
    • 아이는 결코 넘어지지 않으며(안전 보장), 결국에는 길이 매끄러운 것을 이미 알고 있었던 것처럼 아주 빠르게 달릴 수 있게 됩니다.

이 논문은 이 방법이 수학적으로 작동함을 증명합니다: 즉, 우리가 세상에 대해 확신이 없을 때도 로봇이 위험한 행동을 하지 않도록 보장하며, 로봇이 정보를 수집함에 따라 효율적으로 학습할 수 있도록 해준다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →