← Neueste Arbeiten
🤖 AI

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategies Refinement in E-Commerce Recommendation

Dieses Paper stellt SR-Agent vor, das erste eingesetzte agentische Framework, das die kontinuierliche Verfeinerung von Post-Ranking-Strategien in industriellen E-Commerce-Empfehlungssystemen durch die Vereinigung von Nutzersimulation, diagnostischer Analyse und eingeschränkter Aktionsausführung automatisiert und dadurch messbare Verbesserungen beim Bestellvolumen sowie dem Nutzerengagement erzielt, während es gleichzeitig die Betriebskosten signifikant reduziert.

Ursprüngliche Autoren: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

Veröffentlicht 2026-07-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie gehen durch einen riesigen, magischen Supermarkt, in dem sich die Regale sofort neu anordnen, basierend auf dem, was Sie mögen. Dies ist die Welt der E-Commerce-Empfehlungssysteme. Jahrelang waren diese digitalen Ladenbesitzer von einer Sache besessen: genau vorherzusagen, welchen einzelnen Artikel Sie anklicken oder kaufen werden. Sie sind wie erfahrene Glücksspieler, die auf Ihren nächsten Zug wetten. Aber hier ist der Haken: Nur weil ein Artikel eine „gute Wette“ ist, bedeutet das noch lange nicht, dass der gesamte Einkaufserlebnis gut ist. Wenn der Laden Ihnen nacheinander fünf identische rote Sneaker zeigt oder zehn verschiedene Marken desselben Typs von Hammer, könnten Sie gelangweilt, verwirrt oder genervt sein. Dies ist der Unterschied zwischen Genauigkeit (das richtige Produkt erraten) und Nutzererfahrung (die gesamte Reise unterhaltsam und nützlich zu gestalten).

Um dies zu beheben, nutzen Online-Shops Post-Ranking-Strategien. Denken Sie an diese als das Regelbuch des Filialleiters. Nachdem der Computer die besten Artikel ausgewählt hat, greift der Manager ein und sagt: „Okay, aber zeige nicht drei rote Schuhe hintereinander zusammen“ oder „Stelle sicher, dass wir eine Mischung aus Preisen zeigen“. Das Problem ist, dass diese Regelbücher meist von Menschen geschrieben und dann statisch und unveränderlich im Regal liegen gelassen werden. Aber die Welt der Produkte und Menschen ist ständig in Bewegung; neue Artikel erscheinen, Trends verschieben sich, und was gestern eine gute Regel war, kann heute eine schlechte sein. Wenn diese Regeln veraltet sind, wird das Einkaufserlebnis schwerfällig. Die große Frage für Wissenschaftler und Ingenieure lautet: Wie halten wir diese Regelbücher aktuell, ohne ein Heer von müden Menschen einzustellen, die jede einzelne Einkaufsliste lesen und die Regeln neu schreiben müssen?

Hier kommt das Paper mit SR-Agent ins Spiel, einer neuen Art von „digitalem Detektiv-Team“, das darauf ausgelegt ist, diese Einkaufslisten automatisch zu korrigieren. Die Forscher, die mit der Kuaishou E-Commerce-Plattform zusammenarbeiteten, bauten ein System, das wie eine selbstkorrigierende Schleife funktioniert. Anstatt darauf zu warten, dass ein Mensch ein Problem bemerkt, beobachtet SR-Agent ständig die Empfehlungen, erkennt, wenn die „Regeln des Managers“ versagen, findet heraus, warum sie versagt haben, und schlägt dann sicher eine kleine, spezifische Korrektur vor.

So arbeitet das Team:

  1. Der UserSim Agent (Der Empath): Dieser Teil des Systems gibt vor, ein echter Shopper zu sein. Er betrachtet eine Liste empfohlener Artikel und fragt: „Wenn ich ein Mensch wäre, würde ich es langweilig finden, diese drei ähnlichen Artikel zu sehen?“ Er zählt nicht nur Klicks; er sucht nach „schlechten Fällen“, wie zum Beispiel das Sehen von fünf Hosenpaaren, die exakt gleich aussehen, über eine Liste verteilt.
  2. Der Analysis Agent (Der Detektiv): Sobald der UserSim einen schlechten Fall findet, untersucht der Analysis Agent die Sache. Er fragt: „Warum hat das Regelbuch das geschehen lassen?“ Vielleicht ist die Regel für „ähnliche Artikel“ zu locker, oder vielleicht sind die Kategorien des Shops unordentlich. Er verwandelt das chaotische Problem in eine klare Diagnose, wie etwa: „Wir müssen die Regel für Hosen in dieser spezifischen Sitzung verschärfen.“
  3. Das Strategy Refinement Harness (Der vorsichtige Architekt): Dies ist der Sicherheitswächter. Er nimmt die Diagnose des Detektivs und versucht, das Problem zu beheben, aber nur innerhalb strenger Grenzen. Er kann nur kleine, vorab genehmigte Änderungen vornehmen, wie etwa eine Zahl um ein winziges Stück anzupassen oder ein Kategorie-Label zu korrigieren. Bevor eine Änderung live geht, durchläuft sie einen strengen vierstufigen Test: Er testet die schlechten Fälle erneut, simuliert die Änderung am alten Traffic, lässt einen Menschen zur Doppelkontrolle heranziehen und führt schließlich ein kleines, sicheres Experiment online durch.

Die Ergebnisse dieses „selbstentwickelnden“ Systems sind sehr vielversprechend. Als das Team SR-Agent einen Monat lang auf Kuaishous Plattform testete, stellte es fest, dass es nicht nur das Einkaufserlebnis verbesserte, sondern auch das Geschäft selbst besser machte. Das System steigerte die Anzahl der Bestellungen um 0,71 %, ließ die Nutzer tiefer in den Laden eintauchen (0,034 %) und half den Nutzern, auf eine größere Vielfalt an Kategorien zu klicken (0,48 %).

Vielleicht noch beeindruckender ist die Geschwindigkeit. Der alte Weg, diese Regeln zu korrigieren, bestand darin, dass Menschen Listen inspizierten, Probleme diagnostizierten und auf Updates warteten, was Wochen dauern konnte. SR-Agent komprimierte diesen gesamten Zyklus auf nur 3 bis 5 Tage. Obwohl das System immer noch Menschen nutzt, die zufällig etwa 1 % der Arbeit kontrollieren, um die Sicherheit zu gewährleisten, übernahm es die schwere Arbeit, tausende von Problemen zu finden und Lösungen vorzuschlagen, und das vollautomatisch.

Das Paper weist sorgfältig darauf hin, dass dies kein Zauberstab ist, der alles sofort löst. Das System arbeitet, indem es kleine, begrenzte Änderungen vornimmt und aus ihnen lernt. In ihren Tests verbesserte sich die Fähigkeit des Systems, spezifische schlechte Fälle zu beheben, von etwa 49 % beim ersten Versuch auf 83 % beim zehnten Update, was zeigt, dass es mit der Zeit klüger wird. Indem es einen langsamen, manuellen Prozess in eine schnelle, automatisierte Schleife verwandelt, zeigt SR-Agent, dass wir das Online-Shopping-Erlebnis frisch und spannend halten können, ohne die Menschen, die diese Prozesse verwalten, auszubrennen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →