← Nieuwste papers
🤖 machine learning

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

Dit artikel introduceert AIGB-R1, een hiërarchisch zelfevoluerend auto-biedingsframework dat Large Language Models benut met een planner-executor-architectuur en een nieuw Decoupled Group Relative Policy Optimization (D-GRPO)-algoritme om de beperkingen van bestaande door AI gegenereerde biedingsmethoden te overwinnen door strategisch redeneren, numerieke precisie en autonome optimalisatie te verbeteren via een door ervaring gestuurde lus.

Oorspronkelijke auteurs: Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

Gepubliceerd 2026-07-21
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin elke keer dat je door je telefoon scrolt, er een stille, razendsnelle veiling plaatsvindt. Adverteerders strijden om jouw aandacht en werpen digitaal geld op het scherm om advertenties te tonen. Dit is de wilde grens van online advertising, een plek waar miljarden kansen voorbij flitsen in de oogwenk van een seconde. Om deze gevechten te winnen, vertrouwden bedrijven vroeger op mensen die handmatig biedingen aanpasten, maar dat is alsof je probeert een passerende kogel te vangen met een net gemaakt van spaghetti — het is simpelweg te traag en te rommelig. Daarom stapten ze over op computers. Eerst kwam "Auto-bidding", waarbij algoritmen automatisch prijzen aanpassen om de beste deal te krijgen. Daarna kwam "Generatieve AI", die probeert te leren van eerdere veilingen om de perfecte zet te voorspellen. Maar hier zit de crux: deze AI-modellen zijn als studenten die alleen uit één verouderd tekstboek hebben gestudeerd. Ze raken in de war wanneer de echte wereld verandert, en ze hebben vaak moeite met de wiskunde, waarbij ze soms getallen "hallucineren" (verzinnen) die geen zin maken.

Maak kennis met de nieuwe ster van de show: Large Language Models (LLM's). Je kent ze misschien als de chatbots die gedichten kunnen schrijven of raadsels kunnen oplossen. Ze zijn ongelooflijk slim in het begrijpen van context en het vooruit plannen, maar ze zijn slecht in het doen van snelle, precieze wiskunde en ze zijn te traag voor realtime veilingen. De grote vraag die wetenschappers stellen is: Kunnen we de hersenkracht van een slimme planner combineren met de snelheid van een snelle rekenmachine om deze digitale veilingen te winnen? Dit is precies wat een team van onderzoekers probeerde op te lossen, met als doel een AI te bouwen die niet alleen gokt, maar echt zijn weg naar de overwinning denkt.

Het Brein en de Spier: AIGB-R1

De onderzoekers stellen een nieuw systeem voor genaamd AIGB-R1. Zie dit als een high-stakes handels-team waarbij de rollen perfect verdeeld zijn. In het verleden probeerden mensen één gigantische AI te gebruiken voor alles — denken, rekenen én handelen. Maar de auteurs stellen dat dit een slecht idee is omdat AI slecht is in precieze getallen en traag is in reageren. In plaats daarvan gebruikt AIGB-R1 een hiërarchische aanpak, waarbij de taak wordt gesplitst in twee duidelijke delen: een Planner en een Executor.

De Planner is het "Grote Brein". Het is een krachtig Large Language Model dat fungeert als een ervaren generaal of een schaakgrootmeester. Voordat de veiling zelfs begint, kijkt deze generaal naar het budget van de adverteerder, hun doelen en eerdere prestaties. Hij maakt zich geen zorgen over de kleine details van de volgende seconde; in plaats daarvan formuleert hij een macro-strategie. Hij kan zeggen: "Vandaag gaan we agressief zijn en snel uitgeven," of "We moeten conservatief zijn en ons geld sparen." Hij schrijft deze strategie op als een duidelijke, gestructureerde prompt.

De Executor is de "Spier". Dit is een lichtgewicht, supersnelle AI-model (specifiek een Prompt Decision Transformer) dat de daadwerkelijke biedingen doet. Het ontvangt de strategische prompt van de generaal en zoomt vervolgens in op het huidige moment. Het kijkt naar de huidige staat van de veiling, het resterende budget en de concurrentie, en berekent direct het exacte bedrag om te bieden. Omdat de Executor een gespecialiseerd wiskundig model is, hallucineert het geen getallen en reageert het in milliseconden. De Planner geeft het "wat" en "waarom", en de Executor handelt het "hoe" en "wanneer" af.

Leren van Ervaring, Niet Alleen van Boeken

Het paper introduceert ook een slimme manier waarop dit systeem slimmer wordt in de loop van de tijd, wat zij een self-evolving loop noemen. De meeste AI-systemen worden getraind op oude, statische data — zoals studeren voor een toets met een tekstboek van tien jaar oud. Als de markt verandert, raakt de AI in de war. AIGB-R1 bouwt echter een simulatieomgeving genaamd AuctionNetEnv. Stel je een videogame voor waarin de AI tegen duizenden andere bots kan spelen, waarbij het steeds weer verschillende strategieën uitprobeert.

Hier wordt het echt interessant. Het systeem gokt niet zomaar willekeurig. Het houdt een geheugenbank bij van zijn beste eerdere zetten. Als een bepaalde strategie gisteren goed werkte, onthoudt de Planner dit en probeert hij het vandaag te verfijnen. Als een strategie faalde, leert hij van die fout. Dit is het "self-evolving" deel: het systeem leert van zijn eigen cumulatieve ervaring en past zijn aanpak voortdurend aan om dichter bij de perfecte bieding te komen.

Het Geheime Recept: D-GRPO

Een van de grootste uitdagingen in deze opstelling is bepalen wie de eer krijgt (of de schuld) wanneer het team wint of verliest. Was het de Generaal (Planner) die een slechte opdracht gaf, of faalde de Soldaat (Executor) in het uitvoeren ervan? Om dit op te lossen, hebben de auteurs een nieuwe wiskundige truc uitgevonden genaamd Decoupled Group Relative Policy Optimization (D-GRPO).

Stel je een coach voor die een estafette bekijkt. Als het team verliest, moet de coach weten of de eerste loper traag was of dat de tweede loper de stok liet vallen. D-GRPO werkt als een superintelligente coach die de prestaties van de Planner van die van de Executor kan scheiden. Het kijkt naar de resultaten en zegt: "De strategie was goed, maar de uitvoering was niet optimaal," of "De uitvoering was perfect, maar de strategie was fout." Door deze twee signalen te scheiden, kan het systeem beide delen tegelijkertijd trainen zonder dat ze in de war raken, wat leidt tot een veel stabieler en effectiever leerproces.

Wat Ze Vonden

De onderzoekers hebben AIGB-R1 getest op een enorme, real-world dataset van Alibaba die ongeveer 480.000 biedingstrajecten bevat. Ze vergeleken hun systeem met vele andere topniveau AI-methoden, inclusief die gebaseerd op Reinforcement Learning en andere generatieve modellen.

De resultaten waren duidelijk: AIGB-R1 won. Het presteerde consequent beter dan alle andere methoden, en behaalde de hoogste scores in zowel standaard als uitdagende "sparse" veilingscenario's. Het paper suggereert dat het simpelweg gebruiken van een Large Language Model als besluitvormer niet genoeg is vanwege de beperkingen in de wiskunde, maar dat het gebruiken ervan als een strategische planner terwijl een gespecialiseerd model de getallen afhandelt, een game-changer is.

De studie toonde ook aan dat elk onderdeel van hun systeem noodzakelijk was. Wanneer ze de "self-evolving" training verwijderden (het laten leren van de AI uit zijn eigen simulaties), daalde de prestatie. Wanneer ze de Planner verwijderden en de Executor gewoon lieten gokken, deed het minder goed. En wanneer ze de Planner bevroren zodat hij niet kon leren van nieuwe ervaringen, was het systeem niet zo goed als wanneer het kon aanpassen. Dit bewijst dat de combinatie van een slimme planner, een snelle executor en een loop die leert van ervaring de sleutel is tot het ontsluiten van het volgende niveau van auto-bidding.

Kortom, AIGB-R1 suggereert dat de toekomst van geautomatiseerde advertising niet gaat over het bouwen van één gigantische, alwetende robot. Het gaat over het bouwen van een team: een wijze strateeg die de route plant en een behendige bestuurder die de auto stuurt, die beiden samen leren van elke mijl die ze afleggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →