← Neueste Arbeiten
🤖 AI

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

Dieses Paper stellt A/B Agent vor, ein selbstentwickelndes Framework, das einen hierarchischen Erfahrungstree und Multi-Path Tree-RAG nutzt, um durch geschlossene A/B-Testing-Schleifen autonom industrielle Empfehlungsstrategien zu generieren, auszuführen und iterativ zu verfeinern, wobei signifikante GMV-Verbesserungen in realen E-Commerce-Systemen erzielt werden.

Ursprüngliche Autoren: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

Veröffentlicht 2026-08-06
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind der Kapitän eines massiven, Hochgeschwindigkeits-Raumschiffs (ein Empfehlungssystem), das versucht, jedem Passagier den perfekten Snack zu liefern. Manchmal raten Sie richtig und alle sind glücklich. Ein anderes Mal überreichen Sie einen scharfen Chip an jemanden, der etwas Süßes wollte, oder Sie gehen wegen mangelnder Planung der Route zur Hälfte leer aus. In der realen Welt nutzen Unternehmen wie Kuaishou eine Methode namens „A/B-Testing“, um die beste Route zu finden. Es ist so, als würde man zwei verschiedene Versionen des Schiffes gleichzeitig betreiben: eines mit der alten Karte und eines mit einer neuen Idee. Wenn die neue Karte mehr Passagiere schneller zu ihren Snacks bringt, behalten Sie sie. Aber hier liegt der Haken: Dies manuell zu tun, ist erschöpfend. Es erfordert ein Team von Experten-Navigatoren, die ständig neue Karten zeichnen, Tests durchführen, die Ergebnisse prüfen und die Einstellungen anpassen müssen. Das ist langsam, und sie vergessen oft die Lektionen, die sie aus den gestrigen gescheiterten Umwegen gelernt haben.

Kürzlich haben Wissenschaftler Computern beigebracht, diese alten Karten mithilfe von „Large Language Models“ (superintelligente KI, die Text liest) und „RAG“ (Retrieval-Augmented Generation, was so etwas wie eine Bibliothek ist, in der die KI nach Antworten sucht, bevor sie spricht) zu lesen und zu verstehen. Aber selbst diese smarten KI-Helfer haben ein Problem: Sie behandeln die Bibliothek oft wie einen flachen Stapel Papier. Sie finden vielleicht eine Geschichte über eine „Wüstenroute“, wenn Sie eigentlich eine „Bergroute“ benötigen, oder sie übersehen die Tatsache, dass eine Strategie, die für „Snacks“ funktionierte, für „Getränke“ gefährlich sein könnte. Sie haben Schwierigkeiten, das große Ganze zu sehen – also wie die verschiedenen Teile des Schiffes miteinander verbunden sind – und sie können nicht ohne Weiteres aus ihren eigenen Fehlern lernen, ohne dass ein menschlicher Chef ihnen sagt, was als Nächstes zu tun ist.

Hier kommt das Paper ins Spiel, das den A/B Agent vorstellt, einen neuen Typ von „selbstentwickelndem“ KI-Navigator, der genau diese Probleme lösen soll. Anstatt nur einen flachen Stapel Notizen zu lesen, baut der A/B Agent einen riesigen, organisierten „Erfahrungsbaum“ auf. Stellen Sie sich einen Baum vor, bei dem die Wurzeln die großen Geschäftsziele sind, die Äste die verschiedenen Teile des Schiffes (wie die Snack-Bar oder den Maschinenraum) und die Blätter die spezifischen Strategien, die in der Vergangenheit funktioniert oder versagt haben. Wenn die KI eine neue Idee braucht, sucht sie nicht einfach nach Schlagworten; sie klettert den Baum hinauf, um den exakten Ast zu finden, der zur aktuellen Situation passt, um sicherzustellen, dass sie das richtige Wissen greift.

Sobald er eine Strategie ausgewählt hat, hört der A/B Agent nicht einfach auf. Er agiert wie ein unermüdlicher Wissenschaftler, der den Test durchführt, die Ergebnisse beobachtet und dann sofort seinen eigenen Baum aktualisiert. Wenn eine neue Route zwar mehr Passagiere anzieht, aber den Motor überhitzen lässt (eine „Guardrail“-Metrik), bemerkt die KI dies, passt die Einstellungen an und versucht es erneut. Er führt diese Schleife immer wieder aus – denken, testen, lernen und die eigene Wissensbasis aktualisieren – bis er das perfekte Gleichgewicht gefunden hat. Das Paper zeigt, dass dieses System nicht nur eine Theorie ist: Als es in einem realen Short-Video-Shopping-Umfeld getestet wurde, verbesserte es den „Gross Merchandise Value“ (den Gesamtumsatz der Nutzer) erfolgreich um 4,829 %, während alle Sicherheitsmetriken positiv blieben. Es übertraf sogar einige der fortschrittlichsten KI-Modelle der Welt bei der Erstellung von Strategien, die sowohl korrekt als auch kreativ waren. Im Wesentlichen verwandelt der A/B Agent den chaotischen Prozess von Versuch und Irrtum in einen intelligenten, selbstverbessernden Zyklus, der von selbst immer besser wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →