Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches
本論文は、過去のイベントログから最適な行動方策を直接学習し、重要業績評価指標(KPI)を最適化するためのアクションを推奨する、処方的プロセスモニタリングのための強化学習フレームワークを提案しており、モデルベースのマルコフ決定過程アプローチとモデルフリーの深層強化学習手法を比較した上で、両者が効果的にKPIを向上させる一方で、モデルベースのアプローチが優れた計算効率を提供することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、忙しい銀行のマネージャーになったと想像してください。毎日、顧客がローンを申請してきます。時にはローンが承認され、時には拒否され、時には顧客がそのまま立ち去ってしまうこともあります。あなたの目標はシンプルです。できるだけ多くの顧客に、ローンの申し出に対して「はい(イエス)」と言ってもらうこと。
しかし、あなたはすべてをコントロールできるわけではありません。あなたは銀行側の行動(オファーを送る、あるいは追加情報を求めるなど)をコントロールできますが、顧客側の行動(承諾する、拒否する、あるいはキャンセルするなど)はコントロールできません。これは、自分の駒だけを動かせるものの、相手(顧客)は気分次第でランダムに動くチェスのゲームのようなものです。
この論文は、過去の記録を見て、コンピュータに最高の銀行マネージャーになる方法を教えることについて書かれています。目標は、より多く勝つための完璧な戦略を見つけ出すことです。
2人の「コーチ」
研究者たちは、この戦略をコンピュータに教えるために、2つの異なる方法(あるいはコーチ)を、強化学習(試行錯誤を通じて学習するAIの一種ですが、この場合はライブでプレイするのではなく、歴史の教科書から学ぶもの)を用いてテストしました。
1. 「地図作成者」(MDPベースのアプローチ)
このコーチは、数千件もの過去のローン申請を見て、ゲームの詳細な地図を作ろうとします。
- 仕組み: 似たような状況(例:「顧客が1万ドルを求め、我々がオファーを送った」)をグループ化し、次に何が起こるかの確率を計算します。そして、「もし状況Aなら、行動Bをとれ」という明確なルールブックを作成します。
- 比喩: 都市のあらゆる道路をマッピングしたGPSを想像してください。どの角を曲がれば渋滞に巻き込まれ、どの角を曲がれば近道になるかを正確に把握しています。指示を出す前に、まず街の完全なモデルを構築するのです。
- 落とし穴: この地図を作るには手間がかかり、地図が詳細すぎると、珍しい特殊な事象によって混乱してしまうことがあります。これを解決するために、研究者たちは、歴史の教科書にある信頼性の低い珍しい経路を無視するための「フィルター」を追加しました。
2. 「ディープラーナー」(オフライン深層強化学習)
このコーチは、地図を作ろうとはしません。代わりに、非常にスマートなニューラルネットワーク(多くの層を持つ脳のようなもの)を使用して、歴史の教科書を読み、最適な動きを直接推測します。
- 仕組み: 過去の記録を読み込み、人間や単純な地図が見逃してしまうかもしれない隠れたパターンを見つけ出そうとします。データを何度も繰り返し見ることで学習します。
- 比喩: 何百万もの対局を観戦してきたグランドマスター(チェスの達人)を想像してください。彼らは盤面の地図を描く必要はありません。経験から築かれた直感に基づいて、正しい手を「感じる」のです。
- 落とし穴: この「脳」は非常に重いです。トレーニングには時間がかかり、スーパーコンピュータを使って巨大なパズルを解くときのように、膨大な計算能力を必要とします。
実験:シミュレーション・アリーナ
現実の顧客に対して、悪いアドバイスを与えてどうなるかを見てしまうことは(銀行にとって損失になるため)できません。そこで、研究者たちは仮想シミュレーションを構築しました。
- 彼らは、ローンプロセスの「ビデオゲーム版」を作成しました。
- 学習した戦略を用いて、コンピュータにゲームを数千回プレイさせました。
- スコアを測定しました:銀行はどれだけの利益を得たか?(利益 = 得られた利息 - ローン業務に費やした時間)。
研究結果
結果は興味深いものでした。
- 両方のコーチが勝利した: 「地図作成者」も「ディープラーナー」も、銀行の古い標準的なやり方よりもはるかに優れた戦略を見つけ出しました。どちらも、顧客からより多くの「はい」という回答を得ることに貢献しました。
- 地図作成者の方がわずかに優れていた: 「地図作成者」(MDP)は、特にトリッキーで珍しい状況において、一貫してわずかに優れた戦略を見つけ出しました。それは、何をすべきかを正確に知る上でより信頼できました。
- 地図作成者ははるかに高速だった: これが最大の差でした。「地図作成者」は、わずか数分で戦略を学習しました。一方、「ディープラーナー」は、データのサイズによっては数時間(あるいは数日)のトレーニングを要しました。
- 比喩: 地図作成者は、教科書を勉強して10分でテストに合格した学生のようでした。ディープラーナーは、同じ成績を取るために百科事典を100回読み直さなければならなかった学生のようでした。
結論
この論文は、過去のデータを使ってコンピュータにビジネスプロセス(ローン承認など)の運営方法を教えたい場合、以下のことを結論付けています。
- 必ずしも最も複雑で強力なAI(ディープラーニング)が必要なわけではありません。
- プロセスの明確なモデルを構築する、よりシンプルなアプローチ(MDP)の方が、同等かそれ以上にうまく機能し、はるかに高速で安価に実行できます。
これは、単に効率的に仕事を遂行したい場合、時として、超複雑な脳よりも、優れた明確な地図の方が優れているということを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。