← Nieuwste papers
🤖 machine learning

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

Dit artikel introduceert PageLLM, een multi-granulaire beloningsframework dat gebruikmaakt van impliciete gebruikersfeedback om gelijktijdig grove coherentie op paginaniveau en fijne plaatsing op itemniveau te optimaliseren voor zoekopdrachten en aanbevelingen op volledige pagina's, waarbij aanzienlijke verbeteringen worden bereikt in rangschikkingsmetrics en productiegerichte zakelijke KPI's zonder dat kostbare menselijke annotaties nodig zijn.

Oorspronkelijke auteurs: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

Gepubliceerd 2026-05-26
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een enorme, bruisende digitale warenhuis. Elke keer als een klant binnenkomt, heb je een gigantisch magazijn met producten om hen te tonen. Je taak is niet alleen om een paar goede items uit te zoeken; je moet een hele winkelpagina voor hen inrichten.

Dit is de uitdaging van Hele-Pagina-Optimalisatie (WPO). Het is niet genoeg om alleen de juiste schoenen te vinden; je moet beslissen:

  • Waar plaats je de schoenen op de pagina?
  • Moet je ze naast sokken tonen of naast een tent?
  • Laat je te veel rode schoenen zien en niet genoeg blauwe?
  • Is de pagina te rommelig, of saai en repetitief?

Lange tijd worstelden computers hiermee omdat ze te "dom" waren om het geheel te begrijpen, of omdat ze dure menselijke managers nodig hadden om elke enkele paginalay-out handmatig te beoordelen.

Dan komt PageLLM, een nieuw systeem dat een "Super-Intelligente Assistent" (een Large Language Model) gebruikt om deze pagina's automatisch in te richten. Maar hier zit de adder onder het gras: de auteurs ontdekten dat het AI simpelweg zeggen "maak een goede pagina" niet goed werkt. Het is alsof je een chef-kok zegt: "Maak een smakelijke maaltijd", zonder te specificeren of ze zich moeten richten op de smaak van het biefstuk (het individuele item) of de balans van het hele menu (de paginalay-out).

Hier is hoe PageLLM dit oplost, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Blinde" Chef

Eerdere pogingen om AI hiervoor te gebruiken, hadden twee grote problemen:

  • De "Menselijke Beoordeling"-Flesnek: Om een AI te leren, heb je meestal mensen nodig om twee verschillende pagina's te bekijken en te zeggen: "Ik vind Pagina A leuker dan Pagina B." Dit doen voor miljoenen gebruikers is te duur en te traag.
  • De "Enkel-Korrel"-Fout: De meeste AI-systemen keken naar het probleem op slechts één manier.
    • Sommigen keken alleen naar individuele items (bijv. "Heeft de gebruiker op deze specifieke schoen geklikt?"). Dit is als een chef die alleen geeft of het biefstuk gaar is, en negeert dat de soep koud is en de salade verwelkt.
    • Anderen keken alleen naar de hele pagina (bijv. "Ziet deze pagina divers uit?"). Dit is als een chef die om de balans van het menu geeft, maar niet merkt dat het biefstuk verbrand is.

2. De Oplossing: Het "Twee-Ogen"-Beloningssysteem

De auteurs realiseerden zich dat je om de AI te leren twee verschillende soorten feedback nodig hebt die samenwerken, zoals een chef met twee ogen: één oog voor de details, één voor het grote geheel.

Ze bouwden een systeem genaamd PageLLM dat "impliciete feedback" gebruikt (wat gebruikers echt doen, zoals klikken en kopen) in plaats van mensen te vragen pagina's te beoordelen. Ze veranderden deze rommelige data in vier soorten "trainingscenario's":

  1. Relevantie: Items tonen die de gebruiker absoluut niet wil.
  2. Rangschikking: De volgorde van items verwisselen om te zien of de gebruiker geeft wie er eerst staat.
  3. Diversiteit: Een pagina tonen vol met slechts één type item (bijv. alleen rode schoenen) om de AI te leren dat variatie goed is.
  4. Redundantie: Te veel vergelijkbare items gegroepeerd tonen om de AI te leren dingen verspreid te houden.

3. De Magische Truc: De "Grove" en "Fijne" Beloningen

Dit is de kerninnovatie. PageLLM traint twee aparte beloningskoppen (denk aan ze als twee verschillende rechters) op dezelfde data:

  • Rechter A (De Pagina-Niveau Coach): Deze rechter kijkt naar de hele winkelpagina in één keer. Hij vraagt: "Is dit een gebalanceerde, coherente lijst? Dekt het verschillende categorieën?" Hij is uitstekend in het opsporen of het hele menu saai of repetitief is.
  • Rechter B (De Item-Niveau Coach): Deze rechter kijkt naar individuele items en hun posities. Hij vraagt: "Heeft het verplaatsen van dit item van positie 5 naar positie 2 ervoor gezorgd dat de gebruiker meer klikt?" Hij is uitstekend in het opsporen van kleine, cruciale details die het grote geheel mist.

Waarom beide?
Het paper vond dat als je alleen Rechter A gebruikt, de AI een mooi ogende pagina maakt maar de specifieke items mist die gebruikers willen kopen. Als je alleen Rechter B gebruikt, kiest de AI geweldige items maar rangschikt ze op een rommelige, verwarrende manier.

  • Het Resultaat: Als je beide rechters combineert, wordt de AI 46,8% beter in het correct rangschikken van items dan wanneer je slechts één rechter gebruikt. Het is alsof je een dirigent hebt (Rechter A) die zorgt dat het orkest samen speelt, terwijl een solist-coach (Rechter B) zorgt dat elke violist de juiste noot raakt.

4. Bewijs uit de Wereld

Het team testte dit niet alleen in een lab; ze probeerden het op een echte e-commerce site met 10 miljoen gebruikers.

  • Het Resultaat: Het systeem verhoogde de totale omzet (GMV) van de winkel met 0,44% en het aantal klikken met 0,14%.
  • Waarom het belangrijk is: In een bedrijf met miljoenen klanten vertaalt een klein percentage als dat zich om tienduizenden extra verkopen.

5. De "Luie" Implementatie Bonus

Een slim neveneffect van dit systeem is dat het makkelijk uit te rollen is. Omdat de "Pagina-Niveau Coach" (Rechter A) zo goed is in het bekijken van de hele lijst, kan het bedrijf alleen dat deel gebruiken op hun bestaande, langzamere computerservers (CPU's) terwijl ze hun krachtige servers (GPU's) langzaam upgraden om de volledige AI te draaien. Het is alsof je een schets van het menu kunt gebruiken voordat je de volledige, hoog-resolutie foto klaar hebt.

Samenvatting

PageLLM is een nieuwe manier om online winkelpagina's te organiseren. In plaats van mensen te vragen elke pagina te beoordelen, leert het een AI door haar "slechte voorbeelden" van paginalay-outs te tonen (te repetitief, verkeerde volgorde, gebrek aan variatie). Het gebruikt twee verschillende feedbackloops – één voor het grote geheel en één voor de kleine details – om ervoor te zorgen dat de AI pagina's maakt die zowel logisch gebalanceerd zijn als perfect getimed voor wat de gebruiker wil aanklikken. Het resultaat is een slimmere, winstgevendere winkelervaring zonder een team van menselijke beoordelaars nodig te hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →