← 최신 논문
🤖 machine learning

Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning

본 논문은 비용 조건부 분류기 없는 안내와 실행 가능 궤적 재표시를 결합하여 안전 제약 조건을 보상 최적화에서 효과적으로 분리함으로써 적응적 예산 시나리오에서 우수한 안전 준수와 높은 수익을 달성하는 새로운 오프라인 안전 강화 학습 프레임워크인 안전 분리 안내 확산 (SDGD) 을 소개합니다.

원저자: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차를 운전하는 로봇을 가르친다고 상상해 보세요. 하지만 과거에 다른 자동차들이 어떻게 운전했는지에 대한 비디오 기록만 가지고 있습니다. 로봇이 실수하며 부딪히면서 학습하도록 할 수는 없습니다. 로봇은 그 오래된 영상 자료로부터만 엄격하게 학습해야 합니다. 이것이 **오프라인 강화 학습 (Offline Reinforcement Learning)**입니다.

이제 한 가지 변형을 더해 보겠습니다. 때로는 로봇이 매우 신중하게 운전하기를 원합니다 (예: 학교 구역 운전). 반면에 다른 때는 조금 더 공격적으로 운전하기를 원합니다 (예: 열린 고속도로 운전). "안전 예산 (safety budget)"은 상황에 따라 달라집니다. 이것이 **적응형 안전 강화 학습 (Adaptive Safe Reinforcement Learning)**입니다.

문제는 대부분의 기존 방법들이 특정 속도 제한을 위한 특정 경로를 외우려는 학생과 같다는 점입니다. 속도 제한이 바뀌면 그들은 혼란을 겪거나 추락합니다.

이 논문에서 제안한 새로운 방법인 SDGD가 어떻게 이 문제를 해결하는지 간단한 비유를 통해 설명해 보겠습니다.

1. 구식 방식: "단계별" 대 "흐릿한 사진"

  • 구식 방식 (자기회귀 모델): 긴 구불구불한 도로를 그리려면, 먼저 아주 작은 구획을 그리고 다음 구획을 그리고 또 다음 구획을 그려야 한다고 상상해 보세요. 첫 번째 구획에서 아주 작은 실수를 저지르면, 다음 구획이 그 실수를 보상해야 하므로 결국 끝날 때쯤에는 도로가 지도에서 완전히 벗어납니다. 이것이 이전 AI 플래너들이 작동하던 방식이었습니다. 작은 실수들이 쌓여 로봇이 안전 규칙을 위반하게 만들었습니다.
  • 새로운 방식 (확산 모델): 전체 도로를 흐릿하고 잡음이 섞인 사진으로 한 번에 찍은 뒤, 전체 경로가 선명해질 때까지 천천히 선명하게 만드는 것을 상상해 보세요. 이것이 **확산 (Diffusion)**이 하는 일입니다. 전체 여정을 함께 생성하므로 작은 실수들이 쌓이지 않습니다.

2. 핵심 문제: "안전"과 "속도"의 혼합

과거에는 AI가 안전과 속도를 두 가지 상반된 힘으로 취급하여 로봇을 서로 다른 방향으로 끌어당기도록 균형을 맞추려 했습니다.

  • 비유: "벽에 부딪히지 않으면서 가능한 한 빠르게 운전하라"고 운전자에게 말한다고 상상해 보세요. AI는 빠르게 가면서도 안전하게 유지할 완벽한 각도를 계산하려 할 것입니다. 하지만 "벽"(안전 제한) 이 움직이면 AI 는 혼란을 겪습니다. 벽이 다른 곳에 있다고 생각하며 빠르게 가다가 실수로 벽에 부딪히는 경우가 많습니다.

3. SDGD 해결책: "두 명의 코치" 시스템

저자들은 안전과 속도가 서로 싸워서는 안 되며, 서로 다른 역할을 해야 한다고 깨달았습니다. 그들은 두 명의 distinct 한 "코치"를 가진 시스템을 만들었습니다.

  • 코치 1: 안전 집행자 (Classifier-Free Guidance)

    • 역할: 이 코치는 "안전 예산"(예: "오늘은 위험에 10 점만 사용할 수 있음") 을 봅니다.
    • 행동: 완벽한 각도를 계산하려 하지 않습니다. 대신, "그리는 경로가 '위험 구역'(예산 초과) 으로 들어간다면 지우고 다시 그리라"고 말합니다. 이는 안전한 경로만 존재하도록 허용하는 필터처럼 작용합니다. 얼마나 빠르게 가는지에는 관심이 없고, 선 안에 머무르기만 하면 됩니다.
  • 코치 2: 속도 코치 (Reward-Gradient Guidance)

    • 역할: 이 코치는 안전한 경로들을 보며 말합니다. "우리가 가진 안전한 경로들 중 어느 것이 가장 빨리 결승선에 도달하는가?"
    • 행동: 로봇을 가장 빠른 안전한 경로로 밀어붙입니다.

마법 같은 점: 이 두 가지 역할을 분리함으로써 로봇은 "학교 구역 모드"(엄격한 안전 예산) 에서 "고속도로 모드"(완화된 예산) 로 즉시 전환할 수 있습니다. 단순히 코치 1 에게 규칙을 변경하라고 말하면 됩니다. 다시 운전하는 법을 배울 필요가 없습니다.

4. 교활한 함정: "실행 가능 궤적 재레이블링 (Feasible Trajectory Relabeling, FTR)"

두 명의 코치가 있더라도 "속도 코치"가 탐욕스러워질 수 있다는 한 가지 함정이 있었습니다.

  • 문제: 때로는 높은 점수를 얻는 가장 빠른 방법은 여행 시작 단계에서 큰 위험을 감수하는 것입니다. 로봇이 그 위험을 감수하면 즉시 추락할 수 있지만, "속도 코치"는 높은 잠재 점수를 보고 "감행하라!"고 말합니다.
  • 해결책 (FTR): 저자들은 **실행 가능 궤적 재레이블링 (Feasible Trajectory Relabeling)**이라는 규칙을 도입했습니다.
    • 비유: 시험에서 첫 번째 문제를 부정행위로 풀었지만 'A'를 받은 학생을 상상해 보세요. 선생님 (FTR) 은 "비록 'A'를 받았더라도, 첫 부분에서 부정행위를 했기 때문에 전체 시험을 'F'로 처리할 것이다"라고 말합니다.
    • 작동 원리: 시스템은 로봇의 계획 중 처음 몇 단계를 살펴봅니다. 만약 그 첫 단계들이 위험하다면 (나머지 계획이 훌륭해 보이더라도), 시스템은 "속도 코치"에게 "이 경로에는 점수를 주지 마라"고 말합니다. 이렇게 하면 로봇이 높은 점수를 얻기 위해 위험한 단계를 취하는 것을 막을 수 있습니다.

5. 결과: 완벽한 균형

연구자들은 이 방법을 38 가지의 다양한 운전 및 로봇 작업 (예: 버튼을 누르려는 자동차나 코스를 비행하는 드론) 에서 테스트했습니다.

  • 점수: 그들의 방법 (SDGD) 은 38 개 중 36 개의 작업에서 규칙을 통과할 만큼 안전했습니다.
  • 성능: 안전한 모든 방법 중에서 SDGD 는 21 개의 작업에서 가장 빠른(최고 보상) 성능을 보였습니다.
  • 유연성: 로봇이 실행되는 동안에도 안전 규칙을 변경할 수 있었고, 로봇은 재학습 없이 즉시 적응했습니다.

요약

SDGD 를 단순히 가장 빠른 경로를 계산하는 것이 아닌 스마트 내비게이션 시스템으로 생각해 보세요.

  1. 먼저 현재 속도 제한에 대해 합법적인 도로만 포함하는 지도를 그립니다 (안전 코치).
  2. 그런 다음, 그 합법적인 지도에서 가장 빠른 경로를 선택합니다 (속도 코치).
  3. "첫 번째 커브가 불법이면 전체 경로도 불법이다"라는 특별한 규칙을 가지고 있어, 시스템이 더 빠른 시간을 위해 속임수를 쓰지 못하게 합니다.

이것으로 로봇은 도로 규칙이 실시간으로 변경되더라도 안전하고 효율적으로 작동할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →