✨ 要約🔬 技術概要
忙しい厨房を眺めているところを想像してみてください。注文が入り、シェフが刻み、揚げ、盛り付けを行い、時にはソースや足りない材料のせいで料理が待機状態になることもあります。もし、次に何が行われるか、料理にどれくらいの時間がかかるか、あるいは注文が遅れるかどうかを正確に予見できたら、問題が発生する前に解決できるはずです。これが**予測的プロセスモニタリング(Predictive Process Monitoring: PPM)**の核心です。これは、自動車を製造する工場やローンを承認する銀行のように、物事がどのように進行するかを示すデジタルの「レシート」を見て、次に何が起こるかを推測するコンピュータサイエンスの一分野です。長年、これを行う最善の方法は、その特定の厨房のルールを教え込むために、専用のコンピュータの脳を一から訓練することでした。しかし最近、**大規模言語モデル(LLM)と呼ばれる、詩を書いたり、コードを書いたり、あなたとチャットしたりできる、超スマートで汎用的な新しい波のコンピュータが登場しました。人々はこう疑問に思いました。「この汎用的な天才たちに、私たちの厨房の未来を予測させることができるだろうか?」と。同時に、第三の選択肢である タブラー・ファンデーション・モデル(Tabular Foundation Models)**も現れました。これらは、物語ではなく、整然とした行と列のデータを見る専門の統計学者のような存在です。大きな問いはこうです。私たちはまだ、専門の厨房エキスパートを必要としているのでしょうか? それとも、汎用的な天才や、行と列の統計学者が取って代わったのでしょうか?
この論文は、これら3つの「シェフ」のうち、どれが実際に最高の料理を作るのかを確かめる大規模な味見テストです。研究者たちは、5つの異なる現実世界の「厨房」(ビジネスプロセスのデータセット)を用いて制御された競技を設定し、モデルに対して3つのことを予測するよう求めました。それは、「次のアクティビティは何か」、「次のステップにどれくらいの時間がかかるか」、そして「全工程が終わるまでに残り時間はどのくらいか」です。彼らは、従来のシーケンス・モデル(Sequence Models) (この仕事のためだけに一から訓練されたもの)を、LLM (プロセスを学習するためにLoRAと呼ばれる手法で適応させたもの)およびタブラー・モデル (目の前にある例を見て学習する、インコンテキスト学習を用いるもの)と戦わせました。
結果は、少し驚きであり、少し安心させるものでした。次に何が起こるか(例えば、次は玉ねぎを切るだろうといった予測)を当てるという点では、特化したシーケンス・モデル が明確な勝者でした。彼らは一貫して最も高い精度を叩き出し、LLMやタブラー・モデルを打ち負かしました。論文は、これらのモデルが、特に多くの可能な経路(分岐)がある複雑なプロセスにおいて、イベントの特定の順序や流れを理解することに長けているためだと示唆しています。タブラー・モデル は、時間の関連するタスクにおいては非常に優秀で、物事にどれくらいの時間がかかるかを予測する際には、しばしば専門家と同等の性能を発揮しました。しかし、LLM は、最も有名で高価な運用コストがかかるにもかかわらず、通常は後れを取っていました。彼らは計算に非常に時間がかかり(単一のデータセットに対して、他のモデルが1分未満であるのに対し、時には200分以上かかることもありました)、必ずしも正解に辿り着けるわけではありませんでした。実際、あるデータセットでは、LLMはプロセスがまだ終わっていないにもかかわらず、終了したと頻繁に予測してしまうという、時期尚早な間違いを多く犯しました。
したがって、この論文は、華やかな汎用LLMは興味深いものの、プロセスで次に何が起こるかを予測する上で、まだ専門モデルの座を奪うには至っていないと結論付けています。専門化されたモデルは依然としてこの仕事における最も信頼できるシェフであり、タブラー・モデルはタイミングに関する質問に対する強力で高速な代替案です。著者らは、LLMが追いつくためにはさらに大規模にするか、あるいは異なる訓練方法が必要かもしれないと示唆しており、今のところ、複雑なプロセスで次に何が起こるかを知りたいのであれば、旧来の特化したアプローチが依然として最も正確な賭けであるとしています。
技術要約:基盤モデルの時代における予測的プロセスモニタリングの再考
問題提起
予測的プロセスモニタリング(PPM)は、過去のイベントログを活用して実行中のプロセスインスタンスの将来を予測するものであり、次のアクティビティの予測(NA)、完了までの残り時間の予測(RT)、および次のイベントまでの時間の予測(NT)といったタスクに対処する。近年のPPM研究は、ゼロから学習させるディープシーケンスモデル(例:LSTMやTransformer)によって支配されてきたが、基盤モデルの出現は新たな展望をもたらしている。具体的には、パラメータ効率の高いファインチューニング(PEFT)を通じて適応させた大規模言語モデル(LLM)や、インコンテキスト学習能力を持つ表形式基盤モデルが、代替となるパラダイムを提示している。しかし、古典的なシーケンスモデルが、特に表形式基盤モデルがまだ体系的にベンチマークされていない現状において、これらの基盤モデルベースのアプローチに対して依然として競争力を維持しているのかどうかは不明である。
手法
著者らは、5つの実世界のイベントログ(BPI12、BPI17、および3つのBPI20バリアント)と3つの予測タスク(NA、RT、NT)を用いて、3つの異なるモデリングパラダイムを比較する制御された経験的ベンチマークを実施した。
モデリングパラダイム
古典的シーケンスモデル: イベントログ上でゼロから学習されるモデル。これらは、カテゴリ属性と数値属性を組み合わせたイベント埋め込みの順序付きシーケンスとしてプレフィックスをエンコードする(回帰型またはアテンションベースのバックボーンを使用)。すべてのパラメータは教師あり最適化を通じて学習される。
LLMベースのアプローチ: 事前学習済みのデコーダーのみのLLM(Llama-3.2-1BおよびGemma-2-2b)をプロセスデータに適応させたもの。これらはシーケンシャルなプレフィックス表現を保持するが、アクティビティラベルをプロセス固有のトークンとして扱う構造化されたイベントログエンコーディングを採用している。適応は、事前学習されたバックボーンを凍結したまま、少数のパラメータのみを最適化する低ランク適応(LoRA)を通じて行われる。
表形式基盤モデル: PPMを表形式の予測問題として扱うモデル(TabPFN-3およびConTextTab)。これらは、明示的なイベントシーケンスを保持するのではなく、現在のアクティビティ、経過時間、および時間的指標などの特性を要約した固定長の特徴ベクトルにプレフィックスをマッピングする。これらはインコンテキスト学習を利用しており、推論時に勾配ベースの学習を必要とせず、観測された行へのコンテキスト条件付けに依存する。
実験設定
データ: サイズ、アクティビティ・アルファベット、およびトレース長が異なる5つの公開イベントログ。
分割: 最初のイベントのタイムスタンプに基づいてケースを順序付けた、リーケージを回避する時間的分割(80/20 ケースレベル)を適用。
特徴量: 入力にはアクティビティラベルと数値的特徴(累積時間、カレンダー属性)が含まれる。
評価指標: NAに対する精度(Accuracy)、RTおよびNTに対する平均二乗誤差(MSE)、および計算効率のためのウォールクロック・ランタイム。
ベースライン: 本研究では、3つのパラダイムを互いに、および多数派のベースラインと比較する。
主な貢献
概念的比較: 本論文は、プレフィックス表現、バックボーンのパラメータ化、および適応レジームの次元において、3つのパラダイムの構造化された比較を提供する。
体系的ベンチマーク: PPMにおける表形式基盤モデルの最初の制御された経験的評価を、ファインチューニングされたLLMおよび古典的シーケンスモデルとの比較とともに提示する。
失敗パターンの分析: パフォーマンスの違いを調査し、特に「分岐」(次のステップの曖昧さ)がモデルの性能にどのように影響するかを分析し、LLMにおける早期の終了トークン予測などの特定の失敗モードを特定する。
結果
ベンチマークは、タスクとデータセット間で明確なパフォーマンスパターンを示している:
次アクティビティ(NA)予測: 古典的なシーケンスモデル(LSTMおよびTransformer)は、5つのデータセットすべてにおいて一貫して最高の精度を達成している。表形式基盤モデルは一般に性能が低く、分岐の複雑さが増すにつれてその差が拡大する。LLMは表形式モデルよりもNAにおいて優れた性能を示すが、概して最高のシーケンスモデルには及ばない。
時間的タスク(RTおよびNT): 結果はより混在している。表形式基盤モデルは、残り時間(RT)予測において頻繁に最高の性能を達成する。次のイベント時間(NT)については、シーケンスモデルと表形式モデルの両方が、ログによって異なる最適な結果を確保している。LLMベースのモデルは、高い計算コストにもかかわらず、時間的タスクにおいては一般に遅れをとっている。
ランタイム: シーケンスモデルとConTextTabは、LoRAでファインチューニングされたLLMと比較して大幅に低い実行時間を示す。LLMの実行時間はログのサイズとともに著しく増加する。注目すべきは、表形式モデルにおいて勾配ベースの学習を欠いていることが、必ずしも実行時間の低減を保証するわけではない点であり、TabPFN-3はしばしばシーケンスベースラインよりも遅い。
分岐への感受性: スライスレベルの分析により、NA予測におけるシーケンスモデルと表形式モデルの性能差は、分岐の複雑さとともに増大することが明らかになった。シーケンスモデルはイベントの順序を保持するため、高分岐のシナリオをより良く扱うことができるが、プレフィックスを固定長の状態ベクトルとしてエンコードする表形式モデルは、高い曖昧さに直面すると苦戦する。
LLM特有の問題: LLMは、終了トークンを時期尚早に予測するといった特定の失敗パターンを示す。BPI12データセットにおいて、これはLLMのNAエラーの23〜25%を占めていたが、シーケンスベースラインでは0%であった。
意義と主張
本論文は、基盤モデルが有望な代替案を提供しているものの、PPMにおいて普遍的に古典的シーケンスモデルを凌駕するわけではないと主張している。研究の結論は以下の通りである:
シーケンスモデルは、特に複雑で高分岐なプロセスにおいて、次アクティビティ予測の最先端(SOTA)であり続ける。
表形式基盤モデルは、時間的予測タスク(RT/NT)において競争力があり 、学習を必要としない実行可能な代替手段を提供するが、複雑なログにおけるNAには苦戦する。
LLMは高いコスト(実行時間および計算リソース)を伴うが 、一貫して優れた精度をもたらすわけではなく、データセットに依存した適応の問題や、早期終了のような特定の失敗モードに悩まされることが多い。
著者らは、パラダイムの選択は、特定の予測タスクおよびプロセスログの構造的複雑さ(分岐)に大きく依存することを強調している。また、今回の評価では比較的小規模なLLMを使用しており、表形式モデルのための代替となる特徴表現を探索していないことを指摘し、これらを今後の調査領域として示唆している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×