Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation
Dit artikel introduceert Shape Your Feed (SYF), een op LLM gebaseerd agentisch systeem dat passieve rangschikking vervangt door real-time, conversationele co-curatie via een drielaagse architectuur, waarmee significante verbeteringen in feed-relevantie en gebruikerssentiment worden aangetoond via zowel offline alignment-nauwkeurigheid als grootschalige online A/B-testen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je telefoon een magisch, eindeloos buffet aan content is—video's, posts en stories—geserveerd door een zeer drukke, onzichtbare chef. Jarenlang heeft deze chef in het donker gewerkt, waarbij hij gokte wat jij leuk vindt op basis van alleen wat je eerder hebt gegeten. Als je langer bleef kijken naar een foto van een kat, neemt de chef aan dat je duizend andere katten wilt zien. Als je voorbij scrolde bij een recept, neemt hij aan dat je niet van koken houdt. Dit wordt "passieve ranking" genoemd, en hoewel het goed is in gokken, mist het vaak de plank omdat het je niet kan horen spreken. Het weet niet of je eigenlijk echt die kat wilde zien, of dat je alleen even stopte om hem te aaien.
Onlangs is er een nieuwe technologie genaamd Large Language Models (LLM's) gearriveerd. Zie dit als superintelligente, praatzieke assistenten die niet alleen begrijpen wat je klikt, maar ook wat je zegt. Ze kunnen naar je stem luisteren, je tekstberichten lezen en de nuance van je stemming begrijpen. De grote vraag voor wetenschappers die aan aanbevelingssystemen bouwen is: Kunnen we deze praatzieke assistent leren om de keuken over te nemen? Kunnen we de chef laten zeggen: "Eigenlijk ben ik vandaag klaar met katten; breng me wat feiten over de ruimte," en de chef dan onmiddellijk het menu laten aanpassen? Dit is de uitdaging van "conversationele aanbeveling"—het verschuiven van een systeem dat je smaak raadt naar een systeem dat naar je bestellingen luistert.
Het "Shape Your Feed"-systeem: Een Chef die Luistert
In hun paper introduceert een team onderzoekers van Meta een nieuw systeem genaamd Shape Your Feed (SYF). Ze bouwden een digitale keuken waar de chef niet alleen raadt; hij luistert, leert en past het menu in realtime aan op basis van jouw directe instructies. In plaats van een passief systeem dat wacht tot je op "niet leuk" klikt, is SYF een "agentic" systeem, wat een chique manier is om te zeggen dat het werkt als een intelligente assistent die actie kan ondernemen namens jou.
De onderzoekers ontdekten dat door een praatzieke AI te combineren met een traditionele aanbevelingsmotor, ze een feed konden creëren die veel meer aanvoelt als jouw feed. Ze lieten zien dat wanneer gebruikers met het systeem konden praten of slimme knoppen konden gebruiken om precies te zeggen wat ze wilden, het systeem veel beter werd in het tonen van de juiste zaken.
Hoe de Magie Werkt: De Drie-Stromen Keuken
Het SYF-systeem werkt als een drieledig team in een keuken, waarbij elk deel een specifieke taak heeft:
1. De Perceptie-stroom (De Oren en het Brein)
Dit is waar het systeem naar je luistert. Je kunt typen: "Ik wil meer kookvideo's maar geen pittig eten," je stem gebruiken om te zeggen: "Laat me minder politiek zien," of op een slimme knop tikken die zegt: "Ik ben dit onderwerp zat." De Perceptie-stroom neemt deze rommelige, menselijke instructies en zet ze om in een helder, georganiseerd "Semantisch Profiel". Denk aan de chef die een nette boodschappenlijst schrijft op basis van jouw warrige bestelling. Het onthoudt je geschiedenis, dus als je gisteren zei "geen politiek" en vandaag "meer tech", werkt het de lijst dienovereenkomstig bij. Het gaat zelfs stilletjes op pad om nieuwe "ingrediënten" (video's of posts) te verzamelen die bij je nieuwe lijst passen terwijl je nog aan het praten bent.
2. De Serveer-stroom (Het Opmaken en Serveren)
Zodra de lijst klaar is, neemt de Serveer-stroom het over. Het kijkt naar de enorme berg content die het systeem normaal gesproken aan je zou tonen (de "candidate pool") en begint deze te sorteren. Het gebruikt de nieuwe boodschappenlijst van de chef om te:
- Toevoegen: Nieuwe items ophalen die overeenkomen met je nieuwe interesses.
- Snoeien: Alles weggooien dat je regels overtreedt (zoals die politieke posts die je hebt verboden).
- Herordenen: Het bord zo opnieuw te rangschikken dat de dingen die je vroeg bovenaan staan.
Cruciaal is dat dit super snel gebeurt. Het systeem raadt niet alleen; het gebruikt een slimme scoreermethode om te beslissen hoe sterk je nieuwe verzoek de volgorde moet veranderen. Het mengt je expliciete orders met de gebruikelijke kennis van het systeem over wat je leuk vindt, zodat je niet al je favoriete content verliest, alleen omdat je om een kleine verandering vroeg.
3. De Zelfevolutie-stroom (De Proever)
Dit is het deel dat het systeem in de loop van de tijd slimmer maakt. Nadat het systeem een maaltijd heeft geserveerd, observeert het wat je doet. Heb je de nieuwe kookvideo gegeten? Heb je de tech-post weggegooid? Het gebruikt ook een team van "oordelende" AI's om te controlen of de beslissingen van het systeem goed waren. Als het systeem een fout heeft gemaakt, leert het ervan. De onderzoekers gebruikten een techniek genaamd Direct Preference Optimization (DPO), wat lijkt op een chef die oefent met een strenge voedselcriticus totdat de smaak perfect is. Deze lus zorgt ervoor dat het systeem niet alleen één keer opdrachten opvolgt, maar elke keer beter wordt in het opvolgen ervan.
Wat Ze Vonden: De Bewijslast zit in de Pudding
De onderzoekers hebben dit niet alleen gebouwd; ze hebben het getest om te zien of het daadwerkelijk werkt.
De Offline Tests (De Oefenronde)
Eerst testten ze het "alignment scoring"-module van het systeem—het deel dat beslist of een post overeenkomt met je verzoek. Ze vergeleken hun nieuwe systeem met oudere methoden die simpelweg gokten op basis van een paar voorbeelden.
- De oude "few-shot" methode had ongeveer 83,84% van de beslissingen goed.
- Hun nieuwe systeem, na training met de "oordelende" AI's en vervolgens verfijning met echte gebruikersdata (SFT + DPO), kreeg 98,85% van de beslissingen goed.
- Het deed dit ook ongelooflijk snel, waarbij het slechts 323 milliseconden nodig had om een lijst met items te scoren, wat snel genoeg is om te voorkomen dat je telefoon traag wordt.
De Online Tests (De Echte Maaltijd)
Daarna rolden ze SYF uit naar echte gebruikers in de VS en Canada gedurende enkele maanden. Ze verdeelden de gebruikers in twee groepen: één groep kreeg het oude systeem, en de andere groep kreeg het nieuwe "Shape Your Feed"-systeem.
- Gebruikers hielden van de nieuwe controles: Toen ze de keuze kregen tussen oude, statische knoppen en de nieuwe "Context-Aware Feedback Pills" (slimme knoppen die veranderen op basis van wat je bekijkt), koos 76,02% van de gebruikers voor de nieuwe, intelligentere knoppen.
- Minder spul waar mensen een hekel aan hebben: Het nieuwe systeem slaagde erin om het aantal posts dat gebruikers afwees of niet leuk vond, te verminderen. De "Post Dismiss" ratio daalde met 1,70%, en de "Post Dislike" ratio daalde met 2,74%. Dit betekent dat het systeem beter was in het filteren van de zaken die gebruikers niet wilden.
- Meer ontdekking: Gebruikers begonnen vaker nieuwe interesses te verkennen, met een stijging van 0,16% in "Interest Consumption". Dit suggereert dat het systeem niet alleen dingen verborg, maar gebruikers juist hielp nieuwe dingen te vinden die ze echt leuk vonden.
Wat het Betekent
Het paper laat zien dat we kunnen bewegen van systemen die simpelweg raden wat we willen op basis van onze eerdere klikken. Door een laag AI toe te voegen die onze woorden begrijpt en er naar handelt, kunnen we feeds creëren die persoonlijker en minder frustrerend aanvoelen. De onderzoekers vonden dat deze aanpak goed werkt in de echte wereld, waardoor gebruikers gelukkiger zijn en minder content hoeven over te slaan.
De auteurs merken echter voorzichtig op dat dit systeem ervan afhankelijk is dat je je stem laat horen. Als je nooit vertelt wat je wilt, valt het terug op de oude, passieve manier van gokken. Ze suggereren dat toekomstige versies misschien nog proactiever moeten zijn, bijvoorbeeld door vragen te stellen voordat je zelfs maar beseft dat je je verveelt, om te helpen bij mensen die niet van het geven van feedback houden. Maar voor nu bewijst Shape Your Feed dat een aanbevelingssysteem dat luistert, een systeem is dat beter werkt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.