← Ultimi articoli
🤖 AI

A Better Spur Should Start From Each Objective

Il documento propone la Multi-Marginal Preference Optimization (MMPO), un framework granulare che affronta la scarsità di ricompense e i conflitti di ottimizzazione nel Reinforcement Learning multi-obiettivo nel mondo reale, intervenendo ai livelli dei dati, del gradiente e dei vincoli per raggiungere un allineamento stabile e ad alte prestazioni attraverso compiti diversificati.

Autori originali: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Pubblicato 2026-09-09
📖 5 min di lettura🧠 Approfondimento

Autori originali: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mercato digitale, la pagina di un prodotto è spesso un denso muro di testo, pieno di specifiche tecniche e gergo di marketing che possono sopraffare un acquirente. Per colmare il divario tra informazioni complesse e comprensione umana, l'intelligenza artificiale è sempre più incaricata di un duplice compito: identificare le parole più importanti in una descrizione di un prodotto e poi scrivere una spiegazione breve e chiara per esse. Questo non è un semplice esercizio di editing testuale; è un gioco di equilibrio. Il sistema deve soddisfare rigide regole offline, come garantire che le parole estratte siano accurate e coprano l'intera gamma di caratteristiche del prodotto, pur cercando simultaneamente obiettivi online come massimizzare i clic degli utenti e minimizzare i "non mi piace". Questi obiettivi spesso tirano in direzioni opposte. Una caratteristica che genera molti clic potrebbe essere troppo generica per essere accurata, mentre un termine tecnico altamente accurato potrebbe essere troppo oscuro per interessare un utente occasionale. Quando i programmi informatici cercano di ottimizzare tutti questi obiettivi contrastanti contemporaneamente, spesso inciampano, oscillando selvaggiamente o rimanendo bloccati in un ciclo in cui il miglioramento di una metrica causa il crollo di un'altra.

Ricercatori dell'Istituto di Tecnologia di Harbin, JD.com e dell'Accademia Cinese delle Scienze hanno sviluppato un nuovo metodo per risolvere questo specifico problema di obiettivi contrastanti. Chiamano il loro approccio Multi-Marginal Preference Optimization, un sistema progettato per impedire al computer di trattare tutti gli obiettivi come un unico, disordinato mucchio di istruzioni. Invece di costringere il modello a trovare un'unica risposta "migliore" che scenda a compromessi su tutto, il nuovo framework tratta ogni obiettivo come una corsia separata su un'autostrada. Esso pulisce prima i dati che riceve, smussando i segnali rumorosi e sparsi che provengono dal comportamento reale degli utenti, come clic e "mi piace", che possono essere fuorvianti se presi letteralmente. Regolando il modo in cui il computer percepisce queste ricompense, il sistema assicura che le informazioni rare ma preziose non vengano ignorate solo perché appaiono meno frequentemente rispetto ai termini comuni.

L'innovazione principale risiede nel modo in cui il sistema gestisce il processo di apprendimento stesso. Quando il computer cerca di migliorare le sue prestazioni, genera aggiornamenti matematici basati sui suoi obiettivi. Nei metodi più vecchi, questi aggiornamenti venivano semplicemente sommati, il che spesso causava l'annullamento o la distorsione delle istruzioni per un obiettivo rispetto a un altro. Il nuovo metodo separa questi aggiornamenti prima che vengano applicati. Identifica quali parti del segnale di apprendimento sono essenziali per l'accuratezza di base e quali sono specifiche delle preferenze degli utenti, quindi proietta i segnali di preferenza in uno spazio in cui non interferiscano con le regole fondamentali. Ciò consente al modello di imparare a essere più interessante per gli utenti senza dimenticare accidentalmente come essere accurato.

Inoltre, i ricercatori hanno aggiunto un meccanismo di sicurezza per evitare che il sistema diventi troppo aggressivo nelle fasi avanzate del suo addestramento. Man mano che i modelli migliorano, a volte si fissano su un obiettivo in modo così intenso da trascurare gli altri, portando a un improvviso calo della qualità complessiva. Il nuovo sistema utilizza la capacità del modello di seguire le istruzioni per stabilire un confine. Chiede al modello di generare esempi di comportamento perfetto in condizioni ideali e utilizza tali esempi per definire una zona sicura per i futuri aggiornamenti. Se il modello tenta di spingersi troppo in una direzione, questa guida interna lo richiama gentilmente, garantendo che il progresso rimanga costante e bilanciato tra tutte le metriche.

I risultati di questo approccio sono stati testati su un dataset di prodotti reali di e-commerce, che coinvolgeva 65.232 prodotti di addestramento e 8.879 prodotti di valutazione, insieme ai dati sul comportamento degli utenti raccolti nell'ultimo trimestre. Il sistema è stato confrontato con diversi altri metodi avanzati e si è dimostrato significativamente più stabile ed efficace. Nei test offline, ha raggiunto un punteggio di completezza del 94,11 percento e un'accuratezza del 73,43 percento, superando ampiamente i metodi precedenti. Fondamentalmente, è riuscito a raggiungere un tasso di copertura target del 22,82 percento, che è quasi perfetto, mentre altri metodi o non raggiungevano l'obiettivo o lo superavano eccessivamente. Questi miglioramenti non erano solo teorici; quando implementato in un test online dal vivo con acquirenti reali, il sistema guidato da questo nuovo metodo ha aumentato il numero di ordini effettuati del 3,14 percento e il valore totale di tali ordini del 5,07 percento rispetto allo standard precedente.

Il successo di questo framework si estende oltre lo shopping online. I ricercatori lo hanno applicato anche a compiti che coinvolgono l'uso di strumenti e la generazione di codice informatico, aree in cui devono essere soddisfatti simultaneamente molteplici vincoli. In questi test, il metodo ha costantemente prodotto risultati migliori rispetto agli approcci standard, in particolare nell'evitare il "mode collapse", ovvero il fenomeno per cui un modello trova una singola soluzione facile e la ripete all'infinito. Invece, il nuovo sistema ha mantenuto una gamma diversificata di output di alta qualità pur rispettando regole rigorose. Decoppiando gli obiettivi contrastanti e fornendo un modo strutturato per bilanciarli, questo lavoro offre una soluzione pratica per rendere l'intelligenza artificiale più affidabile in ambienti complessi del mondo reale, dove la presenza di molteplici obiettivi competitivi è la norma.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →