Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents
Dit artikel introduceert een zelfevoluerend aanbevelingssysteem dat gebruikmaakt van Google's Gemini LLM-agenten om autonoom geoptimaliseerde modelarchitecturen en beloningsfuncties te genereren, te valideren en te implementeren via een dual-loop workflow, waarmee succesvol een superieure ontwikkelingssnelheid en prestaties in productieomgevingen bij YouTube is aangetoond vergeleken met traditionele handmatige engineering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je favoriete video-app niet alleen raadt wat je de volgende keer wilt kijken, maar ook echt leert hoe hij elke dag beter kan raden, helemaal uit zichzelf. Dit is het domein van Reinforcement Learning (versterkend leren), een tak van kunstmatige intelligentie waarbij een computerprogramma handelt als een nieuwsgierige ontdekkingsreiziger. Het probeert verschillende acties uit (zoals het tonen van een kattenfilmpje of een kooktutorial), ziet wat er gebeurt (heb je ernaar gekeken? vond je het leuk?) en krijgt een "beloning" voor goede keuzes. Het doel is om die beloning over een langere periode te maximalen. Maar hier zit de crux: uitzoeken hoe je die beloning moet geven is ontzettend moeilijk. Het is alsof je een hond probeert te leren om een bal te halen, maar je spreekt geen hondentaal en de hond vertelt je pas weken later dat hij blij is. Traditioneel moeten mensen jarenlang regels aanpassen, gissen naar wat de hond (of de gebruiker) echt wil, en handmatig de code herschrijven. Dit artikel stelt een gedurfde vraag: wat als we een systeem zouden kunnen bouwen dat dit aanpassen, experimenteren en herschrijven zelf doet, zonder dat er een mens aan de hand hoeft te zitten?
De onderzoekers bij Google stellen een oplossing voor die ze een Self-Evolving Recommendation System (zelfevoluerend aanbevelingssysteem) noemen. Denk aan een digitale fabriek waar de machines niet alleen producten maken, maar ook de fabrieksvloer herontwerpen, nieuwe gereedschappen uitvinden en de instructiehandleidingen herschrijven terwijl de fabriek nog steeds draait. In het hart van dit systeem staan LLM Agents—gespecialiseerde computerprogramma's aangedreven door Large Language Models (hetzelfde soort AI dat verhalen kan schrijven of met je kan chatten). Deze agents fungeren als een team van superintelligente, onvermoeibare Machine Learning Engineers die nooit slapen. Ze passen niet alleen een paar getallen aan; ze lezen de code, bedenken wilde nieuwe ideeën voor hoe het systeem zou moeten werken, schrijven de code om die ideeën te testen, en controleren vervolgens de resultaten.
Het systeem werkt als een estafette tussen twee personen met een heel ander tempo. De eerste loper is de Offline Agent, de "Fast Loop" (snelle lus). Deze agent is een hyperactieve ideeënmachine. Hij wordt elke vijf minuten wakker, kijkt naar bergen data en genereert honderden nieuwe hypothesen. Het is alsof een chef een soep proeft en onmiddellijk denkt: "Wat als ik een snufje kaneel toevoeg?" of "Wat als ik het mes vervang door een blender?". Hij test deze ideeën snel met behulp van "proxy"-metrieken—snelle, gemakkelijk te meten signalen die een hint geven of een idee goed is. Als de soep in de testkom vreemd smaakt, gaat de agent door naar het volgende idee.
De tweede loper is de Online Agent, de "Slow Loop" (langzame lus). Dit is de zorgvuldige strateeg. Deze neemt de beste ideeën van de Fast Loop en test deze in de echte wereld, op echte gebruikers. Dit is de "North Star"-test. Heeft het nieuwe recept er echt voor gezorgd dat mensen gelukkiger zijn en langer bleven kijken? Dit kost tijd—dagen of zelfs weken—omdat echt menselijk gedrag traag verandert. De Online Agent beslist welke ideeën het waard zijn om te behouden en welke weggegooid moeten worden, om er zeker van te zijn dat alleen de meest veelbelovende veranderingen op de definitieve menukaart terechtkomen.
Het artikel concludeert dat dit autonome team verrassend effectief is. Toen ze deze AI-agents de vrije loop lieten op het aanbevelingssysteem van YouTube, pasten de agents niet alleen instellingen aan; ze ontdekten geheel nieuwe manieren om de software te structureren. Zo ontdekten de agents bijvoorbeeld dat het wisselen van de "motor" van het model van het ene type wiskunde naar een ander (van Adagrad naar RMSprop) ervoor zorgde dat het sneller leerde. Ze vonden zelfs een nieuwe "gated path"-architectuur uit, een slimme manier om informatie door het systeem te laten stromen die mensen nog niet hadden geprobeerd. Het meest indrukwekkend was dat ze het "beloningssysteem" zelf herontwierpen. In plaats van alleen klikken te tellen, ontdekten de agents hoe ze complexe signalen—zoals of een gebruiker een video deelde of hem lang heeft bekeken—zouden combineren om een slimmere definitie van "geluk" te creëren.
De resultaten waren meetbaar en significant. In tests verbeterden de door AI gestuurde wijzigingen belangrijke metrieken voor YouTube-gebruikers, waarbij ze veel van de wijzigingen gemaakt door menselijke engineers over dezelfde periode overtroffen. Het systeem slaagde erin om experimenten uit te voeren op een snelheid die mensen niet konden evenaren, waarbij het honderden ideeën per week testte tegenover slechts een handvol. Hoewel het artikel opmerkt dat de AI nog steeds mensen nodig heeft om de grote regels vast te stellen en de eindresultaten te controleren, suggereert het dat de toekomst van het bouwen van deze systemen er minder uit zal zien als een team van engineers die tot diep in de nacht coderen, en meer als een tuinman die een zelf snoeiende, zelf plantende tuin onderhoudt die elke dag beter groeit. De auteurs bevestigen dat deze aanpak in de echte wereld werkt, en bewijzen dat AI-agents inderdaad als deskundige engineers kunnen optreden, die verbeteringen ontdekken die zowel structureel als semantisch zijn, en niet slechts numerieke aanpassingen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.