← Ultimi articoli
🤖 AI

Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches

Questo articolo propone un framework di Reinforcement Learning per il Prescriptive Process Monitoring che apprende politiche comportamentali ottimali direttamente dai log degli eventi storici per raccomandare azioni volte all'ottimizzazione dei Key Performance Indicators, confrontando un approccio basato su processi decisionali di Markov modellati con un metodo di Deep RL model-free e dimostrando che entrambi migliorano efficacemente i KPI, mentre l'approccio model-based offre un'efficienza computazionale superiore.

Autori originali: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

Pubblicato 2026-06-15
📖 5 min di lettura🧠 Approfondimento

Autori originali: Stefano Branchi, Andrei Buliga, Chiara Di Francescomarino, Chiara Ghidini, Riccardo Graziosi, Francesca Meneghello, Massimiliano Ronzani

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere il direttore di una banca molto trafficata. Ogni giorno, i clienti richiedono prestiti. A volte il prestito viene approvato, a volte viene rifiutato e a volte il cliente decide semplicemente di ritirarsi. Il tuo obiettivo è semplice: far sì che il maggior numero possibile di clienti dica "Sì" alla tua offerta di prestito.

Tuttavia, non controlli tutto. Tu controlli le azioni della banca (come inviare un'offerta o chiedere ulteriori informazioni), ma non controlli le azioni del cliente (come decidere di accettare, rifiutare o ritirarsi). È come giocare a una partita a scacchi dove puoi muovere solo i tuoi pezzi, ma il tuo avversario (il cliente) muove i suoi in modo casuale in base al suo umore.

Questo articolo riguarda l'insegnare a un computer come essere il miglior direttore di banca possibile guardando i vecchi registri di come la banca ha giocato la partita in passato. L'obiettivo è capire la strategia perfetta per vincere più spesso.

I due "Allenatori"

I ricercatori hanno testato due modi diversi (o "allenatori") per insegnare al computer questa strategia utilizzando il Reinforcement Learning (un tipo di IA che impara per tentativi ed errori, ma in questo caso impara da un libro di storia invece di giocare dal vivo).

1. Il "Creatore di Mappe" (Approccio basato su MDP)

Questo allenatore osserva i migliaia di passate richieste di prestito e cerca di costruire una mappa dettagliata del gioco.

  • Come funziona: Raggruppa situazioni simili (come "Il cliente ha chiesto 10k e noi abbiamo inviato un'offerta") e calcola le probabilità di ciò che accadrà dopo. Crea un libro di regole chiaro: "Se sei nella Situazione A, fai l'Azione B".
  • L'analogia: Immagina un GPS che ha mappato ogni singola strada di una città. Sa esattamente quale svolta porta nel traffico e quale porta una scorciatoia. Costruisce un modello completo della città prima di dirti dove andare.
  • Il limite: Costruire questa mappa richiede del lavoro, e se la mappa è troppo dettagliata, potrebbe confondersi con eventi rari e strani. Per risolvere questo problema, i ricercatori hanno aggiunto un "filtro" per ignorare i percorsi rari e inaffidabili nel libro di storia.

2. L "Apprendista Profondo" (Offline Deep RL)

Questo allenatore non cerca di costruire una mappa. Inveve, utilizza una rete neurale super intelligente (come un cervello con molti strati) per guardare il libro di storia e indovinare la mossa migliore direttamente.

  • Come funziona: Legge i registri passati e cerca di trovare schemi nascosti che un essere umano o una semplice mappa potrebbero perdere. Impara guardando i dati ripetutamente.
  • L'analogia: Immagina un grande maestro di scacchi che ha osservato milioni di partite. Non ha bisogno di disegnare una mappa della scacchiera; semplicemente "sente" la mossa giusta grazie all'intuizione costruita con l'esperienza.
  • Il limite: Questo "cervello" è molto pesante. Richiede molto tempo per l'addestramento e molta potenza di calcolo, come cercare di risolvere un puzzle gigante con un supercomputer.

L'Esperimento: L'Arena di Simulazione

Poiché non puoi iniziare a dare consigli sbagliati a veri clienti per vedere cosa succede (questo costerebbe alla banca dei soldi), i ricercatori hanno costruito una simulazione virtuale.

  • Hanno creato una versione "videogioco" del processo di prestito.
  • Hanno lasciato che il computer giochi al gioco migliaia di volte usando le strategie apprese.
  • Hanno misurato il punteggio: Quanto profitto ha generato la banca? (Profitto = Interessi guadagnati meno il tempo impiegato per lavorare sul prestito).

Cosa hanno scoperto

I risultati sono stati interessanti:

  1. Entrambi gli Allenatori hanno vinto: Sia il "Creatore di Mappe" che l "Apprendista Profondo" hanno individuato strategie molto migliori del vecchio metodo standard della banca. Entrambi hanno aiutato la banca a ottenere più risposte "Sì" dai clienti.
  2. Il Creatore di Mappe era leggermente migliore: Il "Creatore di Mappe" (MDP) ha trovato costantemente strategie leggermente migliori, specialmente nelle situazioni difficili e rare. Era più affidabile nel sapere esattamente cosa fare.
  3. Il Creatore di Mappe era molto più veloce: Questa è stata la differenza più grande. Il "Creatore di Mappe" ha imparato la sua strategia in pochi minuti. L "Apprendista Profondo" ha impiegato ore (o addirittura giorni, a seconda della dimensione dei dati) per l'addestramento.
    • Analogia: Il Creatore di Mappe era come uno studente che ha studiato un libro di testo e ha superato l'esame in 10 minuti. L'Apprendista Profondo era come uno studente che doveva rileggere l'intera enciclopedia 100 volte per ottenere lo stesso voto.

La Conclusione

L'articolo conclude che, se vuoi insegnare a un computer come gestire un processo aziendale (come le approvazioni dei prestiti) utilizzando dati passati:

  • Non hai sempre bisogno dell'IA più complessa e pesante (Deep Learning).
  • Un approccio più semplice che costruisce un modello chiaro del processo (MDP) funziona altrettanto bene, se non meglio, ed è molto più veloce ed economico da gestire.

È un promemoria del fatto che, a volte, una buona e chiara mappa è meglio di un cervello super complesso, specialmente quando vuoi solo svolgere il lavoro in modo efficiente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →