← Nieuwste papers
🤖 AI

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

Dit artikel introduceert A/B Agent, een zelfevoluerend framework dat een hiërarchische ervaringsboom en multi-path Tree-RAG gebruikt om autonoom industriële aanbevelingsstrategieën te genereren, uit te voeren en iteratief te verfijnen via gesloten A/B-testen, waarbij significante GMV-verbeteringen worden bereikt in real-world e-commerce systemen.

Oorspronkelijke auteurs: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

Gepubliceerd 2026-08-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat jij de kapitein bent van een enorm, razendsnel ruimteschip (een aanbevelingssysteem) dat probeert de perfecte snack bij elke passagier te bezorgen. Soms raad je het goed en is iedereen blij. Op andere momenten serveer je een pittige chip aan iemand die iets zoets wilde, of raak je zonder brandstof omdat je de route niet goed hebt gepland. In de echte wereld gebruiken bedrijven zoals Kuaishou een methode genaamd "A/B-testen" om de beste route te bepalen. Het is alsof je tegelijkertijd twee verschillende versies van het schip laat varen: één met de oude kaart en één met een nieuw idee. Als de nieuwe kaart de passagiers sneller bij hun snacks krijgt, houd je die kaart aan. Maar hier zit de crux: dit handmatig doen is uitputtend. Het vereist een team van deskundige navigatoren die constant nieuwe kaarten moeten tekenen, tests moeten uitvoeren, de resultaten moeten controleren en de instellingen moeten bijstellen. Het is traag, en ze vergeten vaak de lessen die ze leerden van de mislukte omwegen van gisteren.

Onlangs hebben wetenschappers computers geleerd om deze oude kaarten te lezen en te begrijpen met behulp van "Large Language Models" (superintelligente AI die tekst leest) en "RAG" (Retrieval-Augmented Generation, wat lijkt op het geven van een bibliotheek aan de AI om antwoorden op te zoeken voordat hij spreekt). Maar zelfs deze slimme AI-helpers hebben een probleem: ze behandelen de bibliotheek vaak als een plat stapel papier. Ze kunnen een verhaal over een "woestijnroute" vinden wanneer je eigenlijk een "bergroute" nodig hebt, of ze kunnen de nuance missen dat een strategie die werkte voor "snacks" gevaarlijk kan zijn voor "dranken". Ze hebben moeite om het grote plaatje te zien van hoe verschillende onderdelen van het schip met elkaar verbonden zijn, en ze kunnen niet gemakkelijk leren van hun eigen fouten in de loop van de tijd zonder dat een menselijke baas hen vertelt wat ze de volgende stap moeten doen.

Dit is waar het artikel de A/B Agent introduceert, een nieuw soort "zelfevoluerende" AI-navigator die ontworpen is om deze problemen op te lossen. In plaats van alleen een platte stapel aantekeningen te lezen, bouwt de A/B Agent een gigantische, georganiseerde "Ervaringsboom". Stel je een boom voor waarbij de wortels de grote zakelijke doelen zijn, de takken verschillende onderdelen van het schip (zoals de snackbar of de machinekamer), en de bladeren specifieke strategieën die in het verleden wel of niet werkten. Wanneer de AI een nieuw idee nodig heeft, zoekt hij niet alleen op trefwoorden; hij klimt de boom op om de exacte tak te vinden die bij de huidige situatie past, zodat hij zeker weet dat hij de juiste kennis grijpt.

Zodra de AI een strategie heeft gekozen, stopt hij daar niet alleen mee. De A/B Agent handelt als een onvermoeibare wetenschapper die de test uitvoert, de resultaten observeert en vervolgens onmiddellijk zijn eigen boom bijwerkt. Als een nieuwe route meer passagiers trekt maar de motor doet oververhitten (een "guardrail"-metriek), merkt de AI dit op, past de instellingen aan en probeert het opnieuw. Hij blijft deze lus herhalen — denken, testen, leren en zijn eigen kennisbasis bijwerken — totdat hij de perfecte balans heeft gevonden. Het artikel laat zien dat dit systeem niet slechts een theorie is; wanneer het werd getest in een echte omgeving voor short-video shopping, verbeterde het de "Gross Merchandise Value" (de totale bestede waarde door gebruikers) met 4,829%, terwijl alle veiligheidsmetrieken positief bleven. Het presteerde zelfs beter dan sommige van de meest geavanceerde AI-modellen ter wereld in het creëren van strategieën die zowel correct als creatief waren. In essentie verandert de A/B Agent het chaotische proces van trial-and-error in een slimme, zelfverbeterende cyclus die vanzelf steeds beter wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →