← 최신 논문
📊 statistics

Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions

이 논문은 다음 상태 변수를 대리 변수로 활용하여 무한 시간 지평(infinite-horizon) 마르코프 결정 과정에서 다중 강건하고 통계적으로 유효한 정책 가치 추정을 가능하게 하는, 은닉된 행동(hidden actions)이 존재하는 오프라인 강화 학습을 위한 첫 번째 방법인 LURE를 소개한다.

원저자: Zeyu Bian, Ying Zhou, Yifan Cui

게시일 2026-07-29
📖 6 분 읽기🧠 심층 분석

원저자: Zeyu Bian, Ying Zhou, Yifan Cui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 도시를 탐색하거나 환자의 건강을 관리하는 것과 같이 복잡한 게임을 하는 법을 가르치려 한다고 상상해 보십시오. 당신은 로봇이 실시간으로 게임을 직접 수행하게 하는 대신, 인간 플레이어가 과거에 시도했던 기록이 담긴 거대한 로그북(logbook)을 제공합니다. 이것이 바로 인공지능의 한 분야인 **강화 학습(Reinforcement Learning, RL)**의 세계입니다. 컴퓨터는 시행착오를 통해 시간이 흐름에 따라 최선의 결정을 내리는 법을 배웁니다. 목표는 대개 다음과 같습니다: "만약 우리가 이 오래된 로그북을 바탕으로 특정 규칙(정책)을 미래에 따른다면, 우리는 얼마나 잘 해낼 수 있을까?"

하지만 함정이 있습니다. 현실 세계에서 로그북은 결코 완벽하지 않습니다. 때로는 기록을 작성한 사람이 실수를 했을 수도 있고, 데이터를 기록하는 시스템에 오류가 있었을 수도 있습니다. 이 논문의 언어로 표현하자면, 인간이 실제로 취한 "행동(action)"(예: 특정 약을 투여함)은 숨겨져 있을 수 있으며, 우리가 보는 것은 그 행동의 "대리물(proxy)"이나 노이즈가 섞인 추측(예: 실제로 약을 투여했음에도 불구하고 '약 투여'라고 적힌 의사의 기록, 혹은 그 반대의 경우)일 수 있습니다. 만약 당신이 오류로 가득 찬 로그북을 사용하여 로봇을 가르치려 한다면, 로봇은 잘못된 교훈을 얻게 되어 나중에 잘못된 결정을 내리게 될 것입니다. 이 논문은 가장 중요한 이야기의 핵심인 '진정한 행동'이 누락되었거나 변형되었을 때 어떻게 효과적으로 학습할 수 있는지에 대한 까다로운 문제를 다룹니다.


사라진 움직임의 미스터리

"보이지 않는 것으로부터의 학습(Learning from the Unseen)"이라는 제목의 이 논문에서 저자들인 Zeyu Bian, Ying Zhou, Yifan Cui는 결정적인 단서가 사라진 탐정 소설 같은 상황에 직면합니다. 당신이 보안 영상을 보고 범죄를 해결하려는 탐정이라고 상상해 보십시오. 하지만 여기 반전이 있습니다. 영상에는 용의자 본인이 아니라 용의자의 그림자만 보입니다. 그림자의 움직임은 볼 수 있지만, 용의자의 손이 정확히 무엇을 하고 있었는지는 알 수 없습니다. 데이터 과학의 세계에서는 이를 "숨겨진 행동(hidden actions)"이라고 부릅니다.

보통 과학자들이 과거의 데이터를 사용하여 전략을 평가하려고 할 때(이를 **오프-폴리시 평가(Off-Policy Evaluation)**라고 합니다), 그들은 로그북이 완벽하다고 가정합니다. 즉, 로그에 "행동 A가 취해졌다"라고 적혀 있다면, 실제로 행동 A가 확실히 취해졌다고 가정하는 것입니다. 하지만 병원 기록에서 의사가 몇 시간 뒤에 처치를 기록하거나, 시스템이 버튼 누름을 실수로 잘못 라벨링하는 것과 같은 무질서한 현실 세계의 시나리오에서 이러한 가정은 함정이 됩니다. 만약 당신이 이러한 오류를 무시한다면, 당신의 전략 평가는 마치 잘못된 재료가 적힌 메뉴판을 보고 요리사의 요리 실력을 판단하는 것처럼 편향될 것입니다.

다음 단계의 마법

저자들의 위대한 돌파구는 비록 "행동"을 직접 볼 수는 없더라도, 종종 그 행동의 그림자를 다음 순간에 볼 수 있다는 사실을 깨달은 데 있습니다.

이것을 이렇게 생각해 보십시오. 마술사가 지팡이를 휘두를 때(숨겨진 행동), 카메라에 얼룩이 묻어 있어 지팡이를 명확하게 볼 수 없을 수도 있습니다. 하지만 당신은 모자 속에서 토끼가 나타나는 것(다음 상태)은 볼 수 있습니다. 토끼는 그냥 갑자기 나타난 것이 아닙니다. 지팡이를 휘둘렀기 때문에 나타난 것입니다. 저자들은 이 "다음 상태"(토끼)와 "노이즈가 섞인 기록"(얼룩진 영상) 사이의 관계를 연구함으로써, 마술사가 실제로 무엇을 했는지 수학적으로 재구성하는 방법을 찾아냈습니다.

그들은 이 새로운 방법을 LURE(Learning from the Unseen: Robust Estimator)라고 부릅니다. 이는 단순히 용의자의 흐릿한 사진만 보는 것이 아니라, 발자국과 기상 보고서까지 살펴보고 정확히 무슨 일이 일당했는지 추론하는 매우 똑똑한 탐정과 같습니다.

LURE의 작동 방식: "더블 체크" 시스템과 탐정의 도구 상자

이 논문은 오류에 속지 않고 전략의 가치를 추정하는 영리한 방법을 소개합니다. 그들은 **다중 견고성(Multiple Robustness)**이라는 개념을 사용합니다.

당신이 외부 온도를 추측하려고 하는데 온도계가 고장 났다고 상상해 보십시오. 당신에게는 세 가지 다른 단서가 더 있습니다: 젖은 개, 흔들리는 나무, 그리고 구름의 형태입니다.

  • 만약 온도계가 고장 났더라도, 당신의 "젖은 개" 단서가 정확하다면 여전히 올바르게 추측할 수 있습니다.
  • 개는 말라 있더라도 나무가 흔들리고 있다면, 당신은 여전히 올바르게 추측할 수 있습니다.
  • 이 시스템이 "견고(robust)"한 이유는 모든 단서가 완벽할 필요는 없기 때문입니다. 단지 그중 일부의 조합만 맞으면 됩니다.

LURE도 이와 똑같이 작동합니다. LURE는 데이터의 여러 부분을 점검하는 수학적 모델을 구축합니다. 설령 "노이즈가 섞인 행동"에 대한 모델이 약간 틀렸거나, "다음 상태"에 대한 모델이 약간 어긋나더라도, 다른 부분 중 하나라도 정확하다면 추정치는 여전히 전략의 진정한 가치를 찾아낼 수 있습니다. 이 덕분에 LURE는 단 하나의 부분만 엉망이 되어도 무너져 버리는 기존의 방법들보다 훨씬 더 신뢰할 수 있는 답을 내놓습니다.

하지만 LURE가 이 퍼즐을 푸는 과정에는 숨겨진 복잡함이 있습니다. 진정한 행동은 결코 관찰되지 않기 때문에, 컴퓨터는 실제로 일어난 일의 확률을 추측해야 합니다. 이를 위해 저자들은 반복 알고리즘(Expectation-Maximization, 즉 EM 방식에 기반한)을 개발했습니다. 이것은 끊임없이 자신의 이론을 정교화하는 탐정과 같습니다:

  1. 추측 단계 (E-step): 컴퓨터는 숨겨진 행동이 무엇이었는지에 대한 추측에서 시작합니다.
  2. 업데이트 단계 (M-step): 그 추측을 사용하여, 행동이 보상과 다음 상태로 어떻게 이어지는지에 대한 모델을 업데이트합니다.
  3. 정교화 단계: 그런 다음 업데이트된 모델을 사용하여 숨겨진 행동에 대해 더 나은 추측을 하고, 이야기가 완벽하게 맞아떨어질 때까지 이 순환 과정을 반복합니다.

그러나 마지막 반전이 하나 더 있습니다. 컴퓨터는 추측을 하는 것이기 때문에, 실수로 라벨을 뒤바꿔 버릴 수도 있습니다. 예를 들어, 실제로는 "약 투여"인데 "약 투여 안 함"으로, 혹은 그 반대로 결정할 수도 있습니다. 수학적으로는 어느 쪽이든 작동하지만, 그 의미는 정반대가 됩니다. 이를 해결하기 위해 저자들은 결정적인 라벨 정렬(label alignment) 단계를 포함했습니다. 최종 답을 내놓기 전에, 시스템은 어떤 "추측"이 관찰된 노이즈 데이터(예를 들어, 관찰된 "약 투여" 기록)와 가장 잘 부합하는지 확인합니다. 그런 다음 필요한 경우 라벨을 뒤집어서 최종 보고서가 실제와 일치하도록 보장합니다.

이론 검증

저자들은 단순히 이론만 제시한 것이 아니라, 세 가지 방식으로 이를 검증했습니다:

  1. 단순 시뮬레이션: 세 개의 상태와 두 개의 행동만 존재하는 아주 작은 가상의 세계(Tabular MDP)를 만들었습니다. 그들은 의도적으로 행동을 5%에서 30%까지 잘못 라벨링하여 데이터를 망가뜨렸습니다. 다른 방법들이 혼란에 빠져 틀린 답을 내놓는 동안, LURE는 목표를 놓치지 않고 전략의 가치를 정확하게 맞혔습니다.
  2. 복잡한 시뮬레이션: 더 복잡하고 연속적인 세계(예: 매끄러운 공간에서 움직이는 로봇)로 옮겨갔으며, 동일한 결과를 얻었습니다. LURE는 오류를 유연하게 처리한 반면, 다른 방법들은 실패했습니다.
  3. 실제 데이터: 저자들은 실제 병원의 방대한 환자 기록 데이터베이스(MIMIC-III)를 사용하여 LURE를 테스트했으며, 특히 패혈증(감염에 대한 치명적인 반응) 치료에 초점을 맞췄습니다. 이 실제 시나리오에서 LURE를 표준 방법들과 비교했습니다. 결과는 놀라웠습니다. 표준 방법들은 한 가지 치료법이 다른 것보다 낫다고 제안했지만, 의료 기록의 숨겨진 오류를 고려한 LURE는 더 신뢰할 수 있는 다른 순위를 제안했습니다. 실제로 표준 방법들의 신뢰 구간(가능한 답의 범위)은 서로 너무 많이 겹쳐서 차이를 구분할 수 없었던 반면, LURE는 명확하고 뚜렷한 답을 제공했습니다.

시사점

이 논문은 숨겨진 행동을 무시하는 것이 위험한 도박이라는 결론을 내립니다. "다음 상태"를 진실을 밝히는 자연스러운 단서로 활용하고, 모델의 다양한 부분에서 발생하는 실수에 견고한 시스템을 구축함으로써, 우리는 데이터가 불완전할 때라도 전략을 정확하게 평가할 수 있습니다.

이것은 단순한 이론적 승리가 아닙니다. 이는 미래를 위한 실질적인 도구입니다. 의료 처치를 결정하든, 교통 신호를 관리하든, 혹은 AI 에이전트를 훈련시키든, LURE는 과거로부터 배우되 노이즈에 현혹되지 않는 방법을 제공합니다. 저자들은 적절한 수학적 탐정 기술이 있다면, 보이지 않는 것을 보고 내일의 더 나은 결정을 내릴 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →