← Neueste Arbeiten
🤖 AI

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

Das Papier schlägt HOBA vor, ein hierarchisches Reinforcement-Learning-Framework, das ein Large Language Model für die adaptive Hyperparameter-Optimierung, einen Bias-korrigierten SARSA-Agenten für die dynamische Expertenmodell-Auswahl und einen diversifizierten Expertenpool für die Gebotsausführung integriert und dadurch die Einschränkungen offline trainierter Gebotssysteme durch signifikante Online-Adaptivität und nachgewiesenen Geschäftswert in groß angelegten Implementierungen überwindet.

Ursprüngliche Autoren: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Veröffentlicht 2026-07-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein riesiges, Hochgeschwindigkeits-Auktionshaus vor, in dem Millionen von Menschen jede Sekunde versuchen, winzige Anteile an Aufmerksamkeit zu kaufen. Dies ist die Welt der Online-Werbung. Werbetreibende wollen ihre Anzeigen den richtigen Menschen zeigen, ohne ihr gesamtes Budget in einer einzigen Minute auszugeben. Um dies zu erreichen, nutzen sie „Gebotsagenten“ – Computerprogramme, die entscheiden, wie viel sie für einen Anzeigenplatz bezahlen. Denken Sie bei diesen Agenten an Rennwagenfahrer. Einige Fahrer sind sehr vorsichtig und folgen einem strengen Regelwerk (wie ein PID-Regler), während andere wie Großmeister sind, die tausende vergangene Rennen studiert haben, um die besten Züge zu lernen (wie Offline-Reinforcement Learning).

Das Problem ist, dass sich die Rennstrecke ständig verändert. Das Wetter umschlägt, andere Fahrer werden schneller und die Verkehrsregeln entwickeln sich weiter. Ein Fahrer, der nur einem statischen Regelwerk folgt, könnte abstürzen, wenn die Strecke rutschig wird. Ein Fahrer, der versucht, neue Züge zu lernen, während er mit 200 Meilen pro Stunde fährt, könnte die Kontrolle verlieren und in Sekunden den Sprit (das Budget) aufbrauchen. Wissenschaftler versuchen seit langem, einen Fahrer zu bauen, der sowohl sicher als auch klug genug ist, um in Echtzeit zu adaptieren, aber das ist ein schwieriger Balanceakt. Wenn man den Computer zu frei lernen lässt, könnte er einen katastrophalen Fehler machen. Wenn man ihn gar nicht lernen lässt, wird er abgehängt, wenn sich der Markt verändert.

Hier kommt das Paper „HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising“ ins Spiel. Die Forscher von Kuaishou Technology schlagen eine neue Art vor, diese Rennfahrer zu managen, nämlich HOBA. Anstatt zu versuchen, einen einzelnen Fahrer alles lehren zu wollen, bauen sie ein dreistufiges Team auf, das wie ein Boxenstopp-Team, ein Stratege und ein Fahrer zusammenarbeitet.

An der Spitze des Teams steht ein „Stratege“, der von einem Large Language Model (LLM) angetrieben wird. Stellen Sie sich dies als einen weisen Coach vor, der einmal pro Stunde einen Blick auf das große Ganze wirft. Dieser Coach entscheidet nicht über die exakte Geschwindigkeit für jede Kurve; stattdin betrachtet er das Wetter, den Treibstoffstand und die Konkurrenz und schreibt dann einen neuen Satz von Anweisungen für das Team. Er könnte sagen: „Heute sei etwas aggressiver“ oder „Halte das Ausgeben langsam und stetig“. Dieser Coach lernt aus einem Gedächtnisbank vergangener Rennen und wird durch einen „Think-Act-Observe-Reflect“-Zyklus (Denken-Handeln-Beobachten-Reflektieren) mit der Zeit klüger.

In der Mitte befindet sich ein „Taktischer Manager“, ein intelligenter Agent, der alle zwei Minuten nachsieht. Seine Aufgabe ist es, den besten „Fahrer“ aus einer Garage voller vortrainierter Experten auszuwählen. Die Garage enthält verschiedene Typen von Fahrern: Einer ist großartig bei schnellen Korrekturen (PID), ein anderer ist gut in der langfristigen Planung (MPC), und andere sind Experten, die aus massiven Datensätzen gelernt haben (wie IQL oder Decision Transformer). Der Taktische Manager rät nicht einfach blind; er nutzt ein spezielles Werkzeug zur „kausalen Anpassung“, um sicherzustellen, dass er nicht von Glück getäuscht wird. Wenn ein Fahrer beispielsweise ein Rennen gewonnen hat, nur weil das Wetter perfekt war, weiß der Manager, dass er dem Fahrer nicht diesen Sieg zuschreiben darf. Er wählt den Fahrer aus, der für den aktuellen Moment wirklich der beste Fit ist.

Ganz unten sind die „Fahrer“ selbst. Dies sind die Experten, die tatsächlich die Gebote für jede einzelne Werbeauktion platzieren, was in Millisekunden geschieht. Sie folgen den Regeln, die der Stratege festgelegt hat, und der Entscheidung, die der Taktische Manager getroffen hat. Entscheidend ist, dass diese Fahrer ihr eigenes Gehirn während des Rennens nicht verändern. Sie sind sichere, vorgetestete Werkzeuge. Das „Lernen“ findet nur in der mittleren Ebene statt, wo das Team entscheidet, welchen Fahrer es verwendet. Dies hält das System sicher vor wilden, budgetsprengenden Fehlern, während es gleichzeitig in der Lage ist, schnell auf einen sich ändernden Markt zu reagieren.

Die Forscher testeten dieses System auf zwei Arten. Erstens ließen sie es in einer simulierten Umgebung namens AuctionNet laufen, was wie eine Videospiel-Version des Werbemarktes ist. In diesen Tests schlug HOBA die besten existierenden Methoden konsistent, mit einer Leistungssteigerung von bis zu 12 % in schwierigen, unvorhersehbaren Szenarien. Zweitens, und am wichtigsten, haben sie es in der realen Welt getestet. Sie führten einen massiven Test auf einer Live-Werbeplattform mit tausenden Kampagnen und Millionen von Dollar Budget durch.

Die Ergebnisse waren beeindruckend. Im Realwelt-Test half HOBA Werbetreibenden, ihre Kostenziele 3,6 % häufiger zu erreichen als das alte System. Das bedeutet, sie erhielten mehr Wert für ihr Geld, ohne zu viel auszugeben. Das System steigerte auch den Gesamtwert der Conversions um 8,1 % und verbesserte den Return on Investment um 3,3 %. Vielleicht am wichtigsten: Es tat all dies, ohne das Budget zu sprengen oder Chaos zu verursachen. Das System bewies, dass man durch die Aufteilung der Aufgabe in einen strategischen Coach, einen taktischen Manager und ein Team spezialisierter Fahrer ein Werbesystem schaffen kann, das sowohl sicher als auch unglaublich anpassungsfähig ist. Es ist eine Erinnerung daran, dass der klügste Weg, ein Rennen zu gewinnen, manchmal nicht darin besteht, einen Super-Fahrer zu haben, sondern ein perfektes Team, das zusammenarbeitet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →