← Nieuwste papers
🤖 AI

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

Het artikel stelt HOBA voor, een hiërarchisch reinforcement learning-framework dat een groot taalmodel integreert voor adaptieve hyperparameteroptimalisatie, een bias-gecorrigeerde SARSA-agent voor dynamische selectie van expertmodellen, en een diverse pool van experts voor bieduitvoering, waardoor de beperkingen van offline getrainde biedingssystemen worden overwonnen door middel van significante online adaptiviteit en bewezen zakelijke waarde in grootschalige implementaties.

Oorspronkelijke auteurs: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Gepubliceerd 2026-07-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, razendsnelle veilingplaats voor waar miljoenen mensen elke seconde proberen kleine stukjes aandacht te kopen. Dit is de wereld van online advertenties. Adverteerders willen hun advertenties aan de juiste mensen tonen zonder hun hele budget in één minuut uit te geven. Hiervagen gebruiken ze "biedagents"—computerprogramma's die beslissen hoeveel ze betalen voor een advertentieplaats. Denk aan deze agents als racewagenschauffeurs. Sommige chauffeurs zijn erg voorzichtig en volgen een strikt regelboek (zoals een PID-controller), terwijl anderen als grootmeesters zijn die duizenden eerdere races hebben bestudeerd om de beste zetten te leren (zoals offline Reinforcement Learning).

Het probleem is dat het racecircuit voortdurend verandert. Het weer slaat om, andere chauffeurs worden sneller en de verkeersregels evolueren. Een chauffeur die alleen een statisch regelboek volgt, kan crashen wanneer het wegdek glad wordt. Een chauffeur die probeert nieuwe zetten te leren terwijl hij met 200 mijl per uur rijdt, kan uit de controle raken en in enkele seconden zonder brandstof komen te zitten (budget). Wetenschappers proberen een chauffeur te bouwen die zowel veilig als slim genoeg is om in realtime aan te passen, maar het is een lastige balans. Als je de computer te vrij laat leren, kan hij een rampzalige fout maken. Als je hem helemaal niet laat leren, wordt hij ingehaald wanneer de markt verandert.

Hier komt het artikel "HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising" kijken. De onderzoekers van Kuaishou Technology stellen een nieuwe manier voor om deze racewagenschauffeurs te beheren, genaamd HOBA. In plaats van te proberen één enkele chauffeur alles te leren, bouwen ze een drielaags team dat samenwerkt als een pitcrew, een strateeg en een chauffeur.

Aan de top van het team staat een "Strateeg" aangedreven door een Large Language Model (LLM). Stel je dit voor als een wijze coach die één keer per uur naar het grote plaatje kijkt. Deze coach bepaalt niet de exacte snelheid voor elke bocht; in plaats daarvan kijkt de coach naar het weer, het brandstofniveau en de concurrentie, en schrijft vervolgens een nieuwe set instructies voor het team. De coach kan bijvoorbeeld zeggen: "Vandaag moet je wat agressiever zijn," of "Houd de uitgaven langzaam en gestaag." Deze coach leert van een geheugenbank van eerdere races, waarbij een "Think-Act-Observe-Reflect"-lus wordt gebruikt om in de loop van de tijd slimmer te worden.

In het midden zit een "Tactische Manager", een slimme agent die elke twee minuten incheckt. Zijn taak is om de beste "chauffeur" te kiezen uit een garage vol vooraf getrainde experts. De garage bevat verschillende soorten chauffeurs: één is geweldig in snelle correcties (PID), een andere is goed in langetermijnplanning (MPC), en anderen zijn experts die hebben geleerd van enorme datasets (zoals IQL of Decision Transformers). De Tactische Manager gokt niet willekeurig; hij gebruikt een speciale "causale aanpassings"-tool om ervoor te zorgen dat hij niet wordt misleid door geluk. Als een chauffeur bijvoorbeeld een race won omdat het weer perfect was, weet de manager dat hij de chauffeur niet voor die overwinning moet prijzen. Hij kiest de chauffeur die echt de beste past bij het huidige moment.

Onderaan staan de "Chauffeurs" zelf. Dit zijn de experts die daadwerkelijk de biedingen plaatsen voor elke individuele advertentie-veiling, wat in milliseconden gebeurt. Zij volgen de regels die door de Strateeg zijn vastgesteld en de keuze gemaakt door de Tactische Manager. Cruciaal is dat deze chauffeurs hun eigen brein niet veranderen terwijl ze racen. Het zijn veilige, vooraf geteste instrumenten. Het "leren" vindt alleen plaats in de middelste laag, waar het team beslist welke chauffeur te gebruiken. Dit houdt het systeem veilig tegen het maken van wilde, budget-verkwistende fouten, terwijl het toch in staat is om snel aan te passen aan een veranderende markt.

De onderzoekers testten dit systeem op twee manieren. Eerst draaiden ze het in een gesimuleerde omgeving genaamd AuctionNet, wat een videogame-versie van de advertentiemarkt is. In deze tests versloeg HOBA consequent de beste bestaande methoden, met een verbetering van de prestaties tot wel 12% in moeilijke, onvoorspelbare scenario's. Ten tweede, en het belangrijkste, probeerden ze het in de echte wereld. Ze voerden een grootschalige test uit op een live advertentieplatform met duizenden campagnes en miljoenen dollars aan budget.

De resultaten waren indrukwekkend. In de echte wereldtest hielp HOBA adverteerders om hun kostendoelen 3,6% vaker te halen dan het oude systeem. Dit betekent dat ze meer waarde kregen voor hun geld zonder te veel uit te geven. Het systeem verhoogde ook de totale waarde van conversies met 8,1% en verbeterde het rendement op investering (ROI) met 3,3%. Misschien wel het belangrijkste: het deed dit allemaal zonder het budget te laten crashen of chaos te veroorzaken. Het systeem bewees dat door de taak te splitsen in een strategische coach, een tactische manager en een team van gespecialiseerde chauffeurs, je een advertentiesysteem kunt creëren dat zowel veilig als ongelooflijk aanpasbaar is. Het is een herinnering dat de slimste manier om een race te winnen soms niet is om één super-chauffeur te hebben, maar om een perfect team te hebben dat samenwerkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →