A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting
Questo articolo propone un framework "predict-then-correct" che combina una previsione di machine learning statica con una politica di correzione basata su contextual bandit continuo few-shot per migliorare significativamente l'accuratezza delle previsioni della domanda al dettaglio e ridurre i costi di inventario, in particolare in scenari con etichette scarse e modelli di domanda rapidamente mutevoli.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di cercare di indovinare quante persone parteciperanno alla vendita di dolci annuale della tua scuola. Hai un programma per computer super intelligente che analizza i dati dell'anno scorso, le previsioni del tempo e il prezzo dei cupcake per fare una previsione. Questo è ciò che gli scienziati chiamano "previsione della domanda" (demand forecasting), ed è l'ossatura che permette di mantenere i negozi riforniti con la giusta quantità di merce. Ma ecco la parte complicata: cosa succede se quest'anno è totalmente diverso? Magari una nuova tendenza virale rende tutti affamati di un gusto specifico, o un improvviso temporale tiene tutti in casa. Il vecchio programma per computer, addestrato sui dati noiosi dell'anno scorso, non lo sa ancora. È come un GPS che non è stato aggiornato con le nuove chiusure stradali; continua a dirti di guidare dritto contro un muro.
Nel mondo del commercio al dettaglio, questo è un enorme problema. I negozi hanno milioni di articoli diversi (come gusti differenti di soda o taglie di scarpe) e a volte compaiono nuovi articoli senza alcuna storia pregressa. Se il negozio sbaglia il calcolo, o finisce i prodotti (clienti arrabbiati) o si ritrova con troppa merce sugli scaffali (soldi sprecati). Tradizionalmente, per correggere un errore di valutazione, dovresti fermare tutto, dare al computer una montagna di nuovi dati e riaddestrarlo da zero. Ma questo richiede troppo tempo. Nel momento in cui il computer impara, la tendenza potrebbe essere già finita. Questo articolo esplora un modo più intelligente per gestire queste sorprese senza dover premere il tasto "reset".
I ricercatori dietro questo studio, Zhiwei Lei, Benedict Jun Ma e Ilya Jackson, propongono un trucco astuto in due fasi che chiamano "Predict-then-Correct" (PtC). Immaginalo come avere uno chef esperto (il primo modello per computer) che prepara una zuppa base basata su una ricetta classica. Poi, invece di buttare via la zuppa e ricominciare da capo quando un cliente chiede "un po' più di spezie", hai un sous-chef rapido di pensiero (il sistema di correzione) che assaggia la zuppa e aggiunge il giusto quantitativo di sale o pepe in tempo reale.
Ecco come funziona il loro "sous-chef". Per prima cosa, il modello principale per computer fa la sua migliore ipotesi su quanto prodotto compreranno le persone. Poi, interviene un sistema speciale chiamato "contextual bandit". "Contextual" significa semplicemente che osserva la situazione attuale (è una festività? è il fine settimana?), e "bandit" è un nome altisonante per un sistema di apprendimento che prova diverse azioni e vede quali portano un risultato. In questo caso, l' "azione" è regolare la previsione dello chef verso l'alto o verso il basso. Il sistema prova un piccolo aggiustamento, vede se le vendite reali corrispondono meglio, e riceve un "premio" se ha ragione. Se sbaglia, impara a non farlo più.
La vera magia avviene quando non ci sono molti dati da cui imparare, come quando viene lanciato un prodotto del tutto nuovo. Di solito, i computer si confondono e dimenticano ciò che sapevano prima quando cercano di imparare da pochi nuovi numeri. Questo articolo suggerisce una strategia "few-shot", che è come insegnare a uno studente usando solo pochi problemi di pratica. Per far sì che questo funzioni, il sistema cerca altri prodotti simili al nuovo (come confrontare una nuova soda piccante con una vecchia soda piccante) per prendere in prestito alcuni indizi. Utilizza anche una regola di "Top-p masked update". Immagina che il cervello del computer abbia migliaia di manopole. Invece di girarle tutte insieme (il che potrebbe rompere la macchina), questa regola gira solo le manopoli minuscole e sensibili che necessitano di un piccolo tocco, lasciando intatte le manopole grandi e importanti che sostengono la conoscenza principale. Questo impedisce al computer di "dimenticare" tutto ciò che ha imparato in passato.
Il team ha testato questa idea utilizzando dati reali di Walmart e di una grande azienda di bevande. Hanno scoperto che il loro ciclo "Predict-then-Correct" è un chiaro vincitore. In vari tipi di prodotti — che si trattasse di articoli stabili che vendono molto, di pochi articoli stabili o di articoli strani e imprevedibili — il nuovo metodo ha ridotto significamente gli errori di previsione. In un test, ha migliorato l'accuratezza media del 9,52% rispetto all'uso del solo modello originale. Ancora più importante, quando hanno usato queste migliori previsioni per decidere quanto stock ordinare, i negozi hanno finito per spendere meno denaro per la gestione dell'inventario extra o per la perdita di vendite dovuta a scaffali vuoti.
L'articolo sostiene esplicitamente che non è necessario riaddestrare completamente i propri modelli ogni volta che il mercato cambia, né che servano enormi quantità di nuovi dati per effettuare una correzione. Dimostrano anche che semplicemente aggiungere uno strato di apprendimento per rinforzo (reinforcement learning) senza prestare attenzione a come si aggiorna il modello può in realtà peggiorare le cose, portando all'instabilità. Invece, i loro risultati suggeriscono che uno strato leggero e adattivo che corregge la previsione esistente in tempo reale è il punto di equilibrio ideale. Colma il divario tra l'apprendimento lento e pesante del passato e la realtà veloce e caotica del presente, dimostrando che a volte il modo migliore per correggere una previsione non è ricominciare da capo, ma semplicemente ascoltare il feedback e regolare la manopola.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.