← 최신 논문
🤖 AI

Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches

이 논문은 핵심 성과 지표(KPI)를 최적화하기 위한 행동을 권고하기 위해 과거 이벤트 로그로부터 직접 최적의 행동 정책을 학습하는 처방적 프로세스 모니터링을 위한 강화 학습 프레임워크를 제안하며, 모델 기반 마르코프 결정 과정 접근 방식과 모델 프리 딥 강화 학습 방식을 비교하고, 두 방식 모두 효과적으로 KPI를 개선하는 동시에 모델 기반 접근 방식이 우수한 계산 효율성을 제공함을 입증한다.

원저자: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 은행의 지점장이라고 상상해 보세요. 매일 고객들이 대출을 신청합니다. 때로는 대출이 승인되기도 하고, 때로는 거절되기도 하며, 때로는 고객이 그냥 발길을 돌리기도 합니다. 당신의 목표는 단순합니다. 최대한 많은 고객이 당신의 대출 제안에 "예"라고 답하게 만드는 것입니다.

하지만 당신이 모든 것을 통제할 수는 없습니다. 당신은 은행의 행동(예: 제안을 보내거나 추가 정보를 요청하는 것)을 통제하지만, 고객의 행동(예: 수락, 거절 또는 중단하기로 결정하는 것)은 통제할 수 없습니다. 이것은 마치 체스 게임을 하는 것과 같습니다. 당신은 자신의 기물을 움직일 수만 있지만, 상대방(고객)은 기분에 따라 무작위로 움직입니다.

이 논문은 컴퓨터에게 과거의 기록을 통해 어떻게 하면 최고의 은행 지점이 될 수 있는지 가르치는 방법에 관한 것입니다. 목표는 더 자주 승리를 거둘 수 있는 완벽한 전략을 찾아내는 것입니다.

두 명의 "코치"

연구진은 강화 학습(시행착오를 통해 배우는 AI의 한 종류이지만, 이 경우에는 실시간 플레이 대신 과거의 기록을 통해 배우는 방식)을 사용하여 컴퓨터에게 이 전략을 가르치는 두 가지 방법(또는 코치)을 테스트했습니다.

1. "지도 제작자" (MDP 기반 접근 방식)

이 코치는 수천 건의 과거 대출 신청 내서를 살펴보고 게임의 상세한 지도를 만들려고 시냅니다.

  • 작동 방식: 유사한 상황들을 그룹화하고(예: "고객이 1만 달러를 요청했고 우리가 제안을 보냄"), 그 다음에 어떤 일이 일어날 확률이 높은지 계산합니다. 그리고 명확한 규칙 책을 만듭니다: "만약 상황 A라면, 행동 B를 하라."
  • 비유: 도시의 모든 도로를 지도에 담은 GPS를 상상해 보세요. 그것은 어떤 회전이 교통 체증으로 이어지고 어떤 회전이 지름길로 이어지는지 정확히 알고 있습니다. 그것은 당신에게 길을 알려주기 전에 도시의 완전한 모델을 먼저 구축합니다.
  • 함정: 지도를 만드는 데는 노력이 필요하며, 만약 지도가 너무 상세하면 드물고 이상한 사건들 때문에 혼란을 겪을 수 있습니다. 이를 해결하기 위해 연구진은 기록 속의 드물고 신뢰할 수 없는 경로를 무시하는 "필터"를 추가했습니다.

2. "딥 러너" (Offline Deep RL)

이 코치는 지도를 만들려고 하지 않습니다. 대신, 인간이나 단순한 지도가 놓칠 수 있는 숨겨진 패턴을 찾기 위해 매우 똑똑한 신경망(여러 층으로 구성된 뇌와 같은 것)을 사용하여 과거 기록을 보고 최선의 수를 추측합니다.

  • 작ộng 방식: 과거 기록을 읽고 데이터 속에서 반복적으로 패턴을 찾아냅니다.
  • 비유: 수백만 건의 게임을 지켜본 체스 그랜드마스터를 상상해 보세요. 그들은 보드에 대한 지도를 그릴 필요가 없습니다. 그저 경험을 통해 쌓인 직관을 바탕으로 최선의 수를 "느낍니다".
  • 함정: 이 "뇌"는 매우 무겁습니다. 훈련하는 데 오랜 시간이 걸리며, 슈퍼컴퓨터로 거대한 퍼즐을 푸는 것처럼 많은 컴퓨팅 자원을 필요로 합니다.

실험: 시뮬레이션 아레나

실제 고객에게 잘못된 조언을 하여 어떤 결과가 나오는지 직접 실험할 수는 없으므로(그것은 은행에 손실을 줄 수 있습니다), 연구진은 가상 시뮬레이션을 구축했습니다.

  • 그들은 대출 과정을 구현한 "비디오 게임" 버전을 만들었습니다.
  • 컴퓨터가 학습한 전략을 사용하여 게임을 수천 번 플레이하게 했습니다.
  • 점수를 측정했습니다: 은행이 얼마나 많은 이익을 냈는가? (이익 = 발생 이자 - 대출 업무에 소요된 시간).

연구 결과

결과는 흥랬습니다:

  1. 두 코치 모두 승리했습니다: "지도 제작자"와 "딥 러너" 모두 기존의 표준적인 방식보다 훨씬 더 나은 전략을 찾아냈습니다. 둘 다 은행이 고객으로부터 더 많은 "예"라는 답변을 얻도록 도왔습니다.
  2. 지도 제작자가 약간 더 뛰어났습니다: "지도 제작자"(MDP)는 특히 까다롭고 드문 상황에서 일관되게 약간 더 나은 전략을 찾아냈습니다. 그것은 무엇을 해야 할지 정확히 아는 데 더 신뢰할 수 있었습니다.
  3. 지도 제작자가 훨씬 빨랐습니다: 이것이 가장 큰 차이점이었습니다. "지도 제작자"는 단 몇 분 만에 전략을 학습했습니다. "딥 러너"는 훈련하는 데 몇 시간(데이터 크기에 따라 몇 일까지도)이 걸렸습니다.
    • 비유: 지도 제작자는 교과서를 공부하고 10분 만에 시험에 합격한 학생과 같았습니다. 딥 러너는 같은 성적을 받기 위해 백과사전 전체를 100번씩 다시 읽어야 했던 학생과 같았습니다.

결론

이 논문은 과거 데이터를 사용하여 비즈니스 프로세스(대출 승인 등)를 운영하는 방법을 컴퓨터에게 가르치고자 한다면 다음과 같이 결론짓습니다:

  • 항상 가장 복잡하고 강력한 AI(딥 러닝)가 필요한 것은 아닙니다.
  • 프로세스의 명확한 모델을 구축하는 더 단순한 접근 방식(MDP)이 똑같이 잘 작동하거나 오히려 더 잘 작동하며, 훨씬 더 빠르고 저렴하게 실행할 수 있습니다.

이는 때때로, 단순히 일을 효율적으로 처리하고 싶을 때는 매우 복잡한 뇌보다 명확하고 좋은 지도가 더 낫다는 것을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →