← 최신 논문
🤖 machine learning

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

본 논문은 대규모 언어 모델을 활용하여 자연어 지식을 보수적인 비용 함수에 정합시킴으로써, 관찰된 위반 사례가 없는 훈련 데이터에서도 반사실적 위험 샘플을 생성하고 안전한 정책을 학습할 수 있게 하는 모델 기반 오프라인 안전 강화 학습 프레임워크인 PROCO 를 제시합니다.

원저자: Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 자동차 운전법을 가르친다고 상상해 보세요. 로봇을 가르치는 일반적인 방법은 로봇이 주변을 돌아다니게 하고, 실수를 저지르며, 물체에 부딪히게 한 뒤 그 충돌로부터 학습하게 하는 것입니다. 하지만 현실 세계에서는 로봇이 벽이나 보행자에게 부딪혀 어떤 일이 일어나는지 확인하기 위해 충돌을 허용할 수 없습니다. 그것은 너무 위험하기 때문입니다.

따라서 대신, 매우 신중하게 운전했으며 단 한 번도 충돌한 적이 없는 인간 운전자가 수집한 운전 로그 데이터 세트를 로봇에게 제공합니다. 로봇은 오직 "안전한" 운전만 목격하게 됩니다.

문제: "거의 충돌한" 함정
여기가 까다로운 부분입니다. 데이터에 충돌 사례가 전혀 없다고 해서 로봇이 충돌이 발생하기 에 충돌이 어떻게 생겼는지 안다는 뜻은 아닙니다.

벽을 향해 운전하는 자동차를 상상해 보세요. 데이터 세트에서 인간 운전자는 항상 벽에 부딪히기 막전에 브레이크를 밟았습니다. 로봇은 자동차가 안전하게 정차하는 모습만 봅니다. 하지만 로봇은 브레이크를 밟지 않았더라면 2 초 후에 충돌했을 것이라는 사실을 깨닫지 못합니다. 로봇은 "아, 이렇게 빠르게 운전해도 괜찮구나!"라고 생각합니다. 왜냐하면 로봇은 충돌을 본 적이 없기 때문입니다.

이것이 이 논문이 다루는 핵심 문제입니다: 위험의 예시는 전혀 없고, 사람들이 간신히 피하는 사례만 있을 때 어떻게 안전성을 가르칠 수 있을까요?

해결책: PROCO ("만약에" 시뮬레이터)
저자들은 PROCO라는 새로운 방법을 제안합니다. 이를 세계의 작동 방식을 모델링한 수정구와 초지능 AI 가 작성한 안전 매뉴얼이라는 두 가지 주요 도구를 사용하는 안전 코치라고 생각하세요.

작동 원리는 다음과 같습니다:

1. 수정구 (동역학 모델)

먼저, 로봇은 안전한 운전 로그로부터 "수정구"를 학습합니다. 이는 마법이 아닙니다. "내가 여기에 있고, 이렇게 핸들을 꺾으면 1 초 후 어디에 있게 될까?"를 예측하는 수학적 모델입니다.

  • 비유: 이는 비행 시뮬레이터와 같습니다. 로봇은 실제로 운전하지 않고도 미래 시나리오를 상상할 수 있도록 자동차의 물리 법칙을 학습합니다.

2. 안전 매뉴얼 (LLM 비용 함수)

다음으로, 로봇은 "위험하다"는 것이 무엇을 의미하는지 알아야 합니다. 충돌 데이터가 없으므로 연구자들은 인간의 언어를 읽고 이해하는 초지능 AI 인 **대규모 언어 모델 (LLM)**에게 "안전 매뉴얼"을 작성하도록 요청합니다.

  • 프롬프트: 그들은 LLM 에게 이렇게 말합니다. "규칙은 이것입니다: 벽에 부딪히지 마세요. 하지만 각별히 주의하세요. 만약 벽에 가깝게 다가간다면, 이미 부딪힌 것처럼 취급하세요."
  • 결과: LLM 은 "비용 함수 (Cost Function)"로 작용하는 컴퓨터 함수 (코드 조각) 를 작성합니다. 이 함수는 벽에 부딪히는 것뿐만 아니라 벽에 위험하게 가까이 다가가는 것에도 높은 "페널티 점수"를 부여합니다. 이렇게 하여 "안전 마진"이 생성됩니다.

3. "만약에" 게임 (선제적 롤아웃)

이제 영리한 부분이 나옵니다. 로봇은 자신이 가진 안전한 데이터에서 출발하여 수정구를 이용해 앞으로 운전하는 것을 시뮬레이션합니다. "이 안전한 지점에서 직진하면 무슨 일이 일어날까?"라고 묻는 것입니다.

  • 안전 매뉴얼 덕분에 시뮬레이터는 벽에 가까워지는 것이 나쁘다는 것을 알고 있습니다.
  • 시뮬레이터는 이러한 "만약에" 시나리오를 실행하여 가짜 충돌 데이터를 생성합니다. 이는 실제 세계에서는 결코 발생하지 않았지만 수학적으로 예측된 "간신히 피한 사고"와 "충돌" 사례 수천 가지를 만들어냅니다.

4. 가짜로부터 학습하기

마지막으로, 로봇은 이 새로운 혼합 데이터 세트로 훈련합니다:

  • 원래의 실제 안전한 데이터.
  • 수정구와 안전 매뉴얼에 의해 생성되고 표시된 시뮬레이션된 "충돌" 데이터.

이러한 시뮬레이션된 위험을 통해 훈련함으로써 로봇은 충돌로 이어질 상태인 "위험 구역"을 인식하고, 실제로 실생활에서 충돌한 적이 없더라도 그 구역에서 벗어나는 법을 학습합니다.

왜 이것이 더 나은가요?

  • 기존 방식: 로봇에게 안전한 데이터만 보여준다면, 로봇은 충돌을 본 적이 없기 때문에 "벽 근처에서 빠르게 운전하는 것이 안전하다"고 생각할 수 있습니다. 그렇게 되면 로봇은 위험 구역으로 drifting 되어 배포 시 충돌할 수 있습니다.
  • PROCO 방식: 학습에 필요한 위험 시나리오를 선제적으로 생성합니다. 효과적으로 "아직 충돌한 적은 없지만, 지금 속도를 줄이지 않으면 수정구가 말하듯 앞으로 충돌할 것이다"라고 말합니다.

결과
저자들은 자동차 운전, 로봇 팔 이동, 수영 등 17 가지 다른 로봇 작업에서 이를 테스트했습니다.

  • 그들은 동일한 "안전 데이터만"에서 안전성을 학습하려던 다른 고급 방법들과 PROCO 를 비교했습니다.
  • 결과: PROCO 는 압도적으로 더 좋았습니다. 많은 경우, 다른 방법들에 비해 안전 위반 (충돌) 을 400% 이상 줄였습니다. 다른 방법들이 볼 수 없었던 미래의 위험을 "볼" 수 있었기 때문에 훨씬 더 안전하게 운전하는 법을 학습했습니다.

한 줄 요약: PROCO 는 시뮬레이터와 지능형 언어 가이드를 사용하여 "만약에" 게임을 하게 함으로써 로봇이 실제로 경험해 보지 못한 재해를 피하는 법을 배우게 하는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →