← Ultimi articoli
🤖 AI

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

Questo articolo introduce un sistema di raccomandazione auto-evolutivo che utilizza gli agenti LLM di Google Gemini per generare, validare e distribuire autonomamente architetture di modelli e funzioni di ricompensa ottimizzate attraverso un flusso di lavoro a doppio ciclo, dimostrando con successo una velocità di sviluppo e prestazioni superiori negli ambienti di produzione di YouTube rispetto all'ingegneria manuale tradizionale.

Autori originali: Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

Pubblicato 2026-08-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui la vostra app video preferita non si limiti a indovinare cosa volete guardare dopo, ma impari effettivamente come migliorare nel farlo ogni singolo giorno, tutto da sola. Questo è il regno dell'Apprendimento per Rinforzo (Reinforcement Learning), un ramo dell'intelligenza artificiale in cui un programma per computer agisce come un esploratore curioso. Prova diverse azioni (come mostrarvi un video di un gatto o un tutorial di cucina), osserva cosa succede (l'avete guardato? vi è piaciuto?) e riceve una "ricompensa" per le buone scelte. L'obiettivo è massimizzare quella ricompensa nel tempo. Ma ecco la parte complicata: capire come dare quella ricompensa è incredibilmente difficile. È come cercare di insegnare a un cane a riportare la pallina, ma non potete parlare il linguaggio dei cani e il cane vi comunica di essere felice solo settimane dopo. Tradizionalmente, gli esseri umani devono passare anni a perfezionare le regole, cercando di indovinare cosa il cane (o l'utente) voglia davvero, e riscrivendo manualmente il codice. Questo articolo pone una domanda audace: e se potessimo costruire un sistema che faccia questo perfezionamento, sperimentazione e riscrittura tutto da solo, senza bisogno che un essere umano gli tenga la mano in ogni passaggio?

I ricercatori di Google propongono una soluzione che chiamano Sistema di Raccomandazione Auto-Evolutivo. Pensatelo come una fabbrica digitale dove le macchine non si limitano a costruire prodotti; ridisegnano il pavimento della fabbrica, inventano nuovi strumenti e riscrivono i manuali di istruzioni mentre la fabbrica è ancora in funzione. Al cuore di questo sistema ci sono gli Agenti LLM, programmi informatici specializzati alimentati da Modelli Linguistici di Grandi Dimensioni (gli stessi tipi di IA che possono scrivere storie o chattare con voi). Questi agenti agiscono come una squadra di ingegneri di Machine Learning super intelligenti e instancabili che non dormono mai. Non si limitano a regolare qualche numero; leggono il codice, elaborano nuove idee folli su come il sistema dovrebbe funzionare, scrivono il codice per testare quelle idee e poi controllano i risultati.

Il sistema funziona come una gara a staffetta tra due corridori con ritmi molto diversi. Il primo corridore è l'Agente Offline, il "Ciclo Veloce". Questo agente è una macchina da idee iperattiva. Si sveglia ogni cinque minuti, analizza montagne di dati e genera centinaia di nuove ipotesi. È come uno chef che assaggia una zuppa e pensa immediatamente: "E se aggiungessi un pizzico di cannella?" oppure "E se sostituissi il coltello con un frullatore?". Testa queste idee rapidamente utilizzando metriche "proxy" — segnali rapidi e facili da misurare che suggeriscono se un'idea sia buona. Se la zuppa ha un sapore strano nella ciotola di prova, l'agente passa oltre.

Il secondo corridore è l'Agente Online, il "Ciclo Lento". Questo è lo stratega attento. Prende le migliori idee dal Ciclo Veloce e le testa nel mondo reale, sugli utenti veri. Questo è il test della "Stella Polare". Quel nuovo ricettario ha effettivamente reso le persone più felici e le ha trattenute a guardare più a lungo? Questo richiede tempo — giorni o addirittura settimane — perché il comportamento umano reale è lento a cambiare. L'Agente Online decide quali idee meritano di essere mantenute e quali dovrebbero essere scartate, assicurando che solo i cambiamenti più promettenti arrivino al menù finale.

L'articolo trova che questa squadra autonoma è sorprendentemente efficace. Quando hanno lasciato liberi questi agenti IA sul sistema di raccomandazione di YouTube, gli agenti non si sono limitati a regolare le impostazioni; hanno scoperto modi completamente nuovi di strutturare il software. Ad esempio, hanno capito che passare il "motore" del modello da un tipo di matematica a un altro (da Adagrad a RMSprop) lo rendeva capace di imparare più velocemente. Hanno persino inventato una nuova architettura a "percorso a cancello" (gated path), un modo intelligente di far fluire le informazioni attraverso il sistema che gli umani non avevano ancora provato. Ancora più impressionante, hanno riprogettato il sistema di "ricompensa" stesso. Inveve di contare solo i clic, gli agenti hanno capito come combinare segnali complessi — come se un utente ha condiviso un video o lo ha guardato per molto tempo — per creare una definizione più intelligente di "felicità".

I risultati sono stati misurabili e significativi. Nei test, i cambiamenti guidati dall'IA hanno migliorato le metriche chiave per gli utenti di YouTube, superando molti dei cambiamenti apportati dagli ingegneri umani nello stesso periodo. Il sistema è riuscito a eseguire esperimenti a una velocità che gli umani non potevano eguagliare, testando centinaia di idee a settimana rispetto a solo una manciata. Sebbene l'articolo noti che l'IA ha ancora bisogno degli umani per stabilire le regole principali e controllare i risultati finali, suggerisce che il futuro della costruzione di questi sistemi potrebbe somigliare meno a un team di ingegneri che programmano fino a tarda notte e più a un giardiniere che si prende cura di un giardino che si pota e si pianta da solo, crescendo meglio ogni giorno. Gli autori confermano che questo approccio funziona nel mondo reale, dimostrando che gli agenti IA possono effettivamente agire come esperti ingegneri, scoprendo miglioramenti che sono sia strutturali che semantici, non solo semplici aggiustamenti numerici.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →