← 최신 논문
🤖 machine learning

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

이 논문은 소량의 데이터, 결정론적 로깅 정책, 그리고 새로운 행동과 같은 핵심적인 과제들을 극복하기 위해 타겟 도메인과 소스 도메인 모두의 이력 데이터셋을 활용하는 새로운 교차 도메인 오프-폴리시 평가 및 학습 프레임워크를 제안하며, 이를 통해 기존 방법들이 높은 분산이나 제한된 탐색으로 인해 실패하는 시나리오에서도 효과적인 정책 평가와 최적화를 가능하게 한다.

원저자: Yuta Natsubori, Masataka Ushiku, Yuta Saito

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuta Natsubori, Masataka Ushiku, Yuta Saito

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 폭풍우 치는 바다를 항해하려는 선장이라고 상상해 보십시오. 하지만 당신은 이 특정 경로를 실제로 항해해 본 적이 없습니다. 당신에게는 현재 선박의 과거 항해 기록(이른바 "로그 데이터")이 담긴 지도가 있지만, 그 지도는 불완전합니다. 아마도 이전 선장이 너무 조심스러워서 잔잔한 물에서만 항해했기에 위험한 암초들을 미기록 상태로 남겨두었을 수도 있습니다. 혹은 배가 너무 작아서 바다 전체를 탐험하지 못했기 때문에 지도가 아예 누락되었을 수도 있습니다. 컴퓨터 과학, 특히 **기계 학습(Machine Learning)**이라는 분야에서 이것은 **컨텍스추얼 밴딧(Contextual Bandits)**이라 불리는 흔한 문제입니다. 이는 컴퓨터가 모든 옵션을 실제로 다 시도해보지 않고도(그것은 비용이 많이 들거나 위험할 수 있으므로), 상황(즉, "컨텍스트")에 따라 어떻게 결정을 내릴지 배우는 방법입니다. 예를 들어 영화를 추천하거나, 약물을 제안하거나, 광고를 보여주는 것과 같은 일들 말입니다.

이 문제를 해결하기 위해 과학자들은 **오프-폴리시 평가(Off-Policy Evaluation, OPE)**라는 기술을 사용합니다. OPE를 결정 과정을 위한 "비행 시뮬레이터"라고 생각하십시오. 실제 사람들에게 새로운 전략을 테스트하는 대신(이는 위험하므로), 과거의 데이터를 사용하여 새로운 전략이 실제로 어떻게 작동했을지를 컴퓨터를 통해 실행해 보는 것입니다. 문제는, 만약 기존의 데이터가 너무 지루하다면(선장이 한 가지 행동만 했다면) 또는 새로운 전략이 이전 선장이 한 번도 시도하지 않았던 것을 시도하고자 한다면 대부분의 시뮬레이터는 고장이 난다는 점입니다. 만약 기존 데이터에 특정 행동에 대한 기록이 없다면, 시뮬레이터는 그 결과를 추측할 수 없게 되어 터무니없는 추측을 하거나 완전히 실패하게 됩니다. 이 논문은 기존 데이터가 너무 제한적이거나, 너무 경직되어 있거나, 혹은 중요한 새로운 옵션이 완전히 누락된 까다로운 시나리오를 다룹니다.

여기서 하쿠호도 DY 홀딩스(Hakuhodo DY Holdings)와 코넬 대학교(Cornell University)의 연구진은 이 고장 난 시뮬레이터를 고칠 수 있는 영리한 새로운 방법을 제안합니다. 그들은 이 아이디어를 **교차 도메인 오프-폴리시 평가 및 학습(Cross-Domain Off-Policy Evaluation and Learning)**이라고 부릅니다. 당신이 새로운, 미지의 바다(타겟 도메인)에서 서핑을 배우려고 노력하고 있는데, 당신의 로컬 해변(소스 도메인)은 파도의 패턴이 다르다고 상상해 보십시오. 만약 당신이 오직 당신의 로컬 해변만 바라본다면, 그곳에서는 결코 일어나지 않았던 거대한 파도를 보았을 때 혼란에 빠질 수 있습니다. 하지만, 만약 당신이 비슷한 파도를 가진 인근 해양의 서핑 영상을 함께 볼 수 있다면 어떨까요? 비록 물의 상태는 약간 다를지라도, 파도의 물리 법칙은 동일할 수 있습니다.

저자들은 당신이 현재의 상황에서 얻은 지루하거나 불완전한 데이터에만 갇혀 있는 대신, 다른 유사한 상황(다른 "도메인")으로부터 통찰력을 빌려올 수 있다고 제안합니다. 그들은 모든 병원, 국가, 또는 사용자 그룹이 고유하지만, 종종 근저에 깔린 공통된 패턴을 공유한다는 점을 깨달았습니다. 예를 들어, 환자의 인구 통계적 특성은 약간 다를지라도, 특정 치료법은 두 개의 서로 다른 병원에서 비슷하게 작용할 수 있습니다. 이 논문은 COPE(Cross-domain Off-Policy Evaluation)라는 새로운 방법을 소개합니다. COPE는 "보상(reward)"을 두 부분으로 나눕니다. 하나는 유사한 그룹 간에 공통적으로 나타나는 **공유 부분(shared part)**이고(마치 파도의 일반적인 물리 법칙처럼), 다른 하나는 오직 당신의 그룹에만 특정한 **고유 부분(unique part)**입니다(마치 지역적인 바람처럼).

다른 도메인의 데이터를 사용하여 "공유 부분"을 파악함으로써, COPE는 당신의 특정 데이터에서 시도되지 않았던 행동들에 대한 빈칸을 채울 수 있습니다. 이것은 마치 이웃 도시의 지도를 사용하여 당신의 마을에서 지도가 잊어버린 거리의 구조를 파악하는 것과 같습니다. 연구진은 이를 동영상 공유 앱(KuaiRec)의 실제 데이터로 테스트했으며, 타겟 데이터가 부족하거나, 기존 데이터가 너무 경직되어 있거나(결정론적), 혹은 새로운 행동을 시도해야 하는 상황에서도 그들의 방법이 기존 방식보다 훨씬 더 정확하다는 것을 발견했습니다. 그들은 여러 소스의 데이터를 결합하되 그 차이점을 주의 깊게 고려함으로써, 이전의 방식들이 단순히 포기하거나 거대한 오류를 범했던 상황에서도 훨씬 더 효과적으로 정책을 평가하고 학습할 수 있음을 보여주었습니다.

실험에서 그들은 새로운 행동이 가능한 선택지의 최대 80%를 차지하거나, 기존 데이터가 너무 제한적이어서 행동당 데이터 포인트가 단 하나뿐인 시나리오를 시뮬레이션했습니다. 이러한 어려운 경우에도, 그들의 새로운 방법은 표준적인 접근 방식들에 비해 오류를 크게 줄였습니다. 또한 그들은 이 방법이 단순히 "평가(evaluating)"하는 것뿐만 아니라 "학습(learning, 최적의 전략 찾기)"하는 데에도 작동함을 보여주었습니다. 이 논문은 서로 다른 데이터 소스를 고립된 섬이 아니라 연결된 가족처럼 다룸으로써, 우리가 처음부터 학습할 데이터가 충분하지 않은 상황에서도 더 똑똑하고, 안전하며, 적응력이 뛰어난 의사결정 시스템을 구축할 수 있다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →