A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
यह शोध पत्र A/B Agent को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) फ्रेमवर्क है जो एक पदानुक्रमित अनुभव वृक्ष (hierarchical experience tree) और मल्टी-पाथ ट्री-RAG का लाभ उठाकर क्लोज्ड-लूप A/B टेस्टिंग के माध्यम से औद्योगिक अनुशंसा रणनीतियों को स्वायत्त रूप से उत्पन्न करने, निष्पादित करने और पुनरावृत्त रूप से परिष्कृत करने के लिए उपयोग करता है, जिससे वास्तविक दुनिया के ई-कॉमर्स सिस्टम में महत्वपूर्ण GMV सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, तेज़ गति वाले अंतरिक्ष यान (एक रिकमेंडेशन सिस्टम) के कप्तान हैं, जो हर यात्री तक सही स्नैक पहुँचाने की कोशिश कर रहा है। कभी-कभी, आपका अनुमान सही होता है और सभी खुश होते हैं। अन्य समय में, आप किसी ऐसे व्यक्ति को तीखा चिप्स थमा देते हैं जिसे कुछ मीठा चाहिए था, या आपने रूट की ठीक से योजना नहीं बनाई इसलिए ईंधन खत्म हो जाता है। वास्तविक दुनिया में, कुआईशौ (Kuaishou) जैसी कंपनियाँ "A/B टेस्टिंग" नामक एक विधि का उपयोग करती हैं ताकि सबसे अच्छा रास्ता खोजा जा सके। यह एक ही समय में जहाज के दो अलग-अलग संस्करण चलाने जैसा है: एक पुराने मानचित्र के साथ, और दूसरा एक नए विचार के साथ। यदि नया मानचित्र यात्रियों को उनके स्नैक्स तक अधिक तेज़ी से पहुँचाता है, तो आप उसे रख लेते हैं। लेकिन यहाँ एक पेंच है: ऐसा मैन्युअल रूप से करना थका देने वाला है। इसके लिए विशेषज्ञ नेविगेटर्स की एक टीम की आवश्यकता होती है जो लगातार नए नक्शे बनाए, परीक्षण करे, परिणामों की जाँच करे और सेटिंग्स में बदलाव करे। यह धीमा है, और वे अक्सर उन सबक को भूल जाते हैं जो उन्होंने कल के असफल रास्तों से सीखे थे।
हाल ही में, वैज्ञानिकों ने कंप्यूटर को "लार्ज लैंग्वेज मॉडल्स" (सुपर-स्मार्ट AI जो टेक्स्ट पढ़ सकता है) और "RAG" (रिट्रीवल-ऑगमेंटेड जनरेशन, जो AI को बोलने से पहले उत्तर खोजने के लिए एक लाइब्रेरी देने जैसा है) का उपयोग करके इन पुराने मानचित्रों को पढ़ना और समझना सिखाया है। लेकिन इन स्मार्ट AI सहायकों के पास भी एक समस्या है: वे अक्सर लाइब्रेरी को कागजों के एक सपाट ढेर की तरह देखते हैं। वे "डेजर्ट रूट" (रेगिस्तानी रास्ते) के बारे में कहानी ढूंढ सकते हैं जब वास्तव में आपको "माउंटेन रूट" (पहाड़ी रास्ते) की आवश्यकता हो, या वे इस तथ्य को मिस कर सकते हैं कि जो रणनीति "स्नैक्स" के लिए काम करती थी वह "ड्रिंक्स" के लिए खतरनाक हो सकती है। वे यह देखने में संघर्ष करते हैं कि जहाज के विभिन्न हिस्से एक दूसरे से कैसे जुड़े हैं और बिना किसी मानव बॉस के निर्देश के वे समय के साथ अपनी गलतियों से आसानी से नहीं सीख सकते।
यहीं पर यह पेपर A/B Agent पेश करता है, जो एक नया प्रकार का "स्व-विकसित होने वाला" (self-evolving) AI नेविगेटर है जिसे इन समस्याओं को ठीक करने के लिए डिज़ाइन किया गया है। केवल नोट्स के एक सपाट ढेर को पढ़ने के बजाय, A/B Agent एक विशाल, व्यवस्थित "एक्सपीरियंस ट्री" (अनुभव वृक्ष) बनाता है। एक ऐसे पेड़ की कल्पना करें जहाँ जड़ें बड़े व्यावसायिक लक्ष्य हैं, शाखाएं जहाज के विभिन्न हिस्से हैं (जैसे स्नैक बार या इंजन रूम), और पत्तियाँ वे विशिष्ट रणनीतियाँ हैं जो अतीत में सफल या विफल रही हैं। जब AI को एक नए विचार की आवश्यकता होती है, तो वह केवल कीवर्ड्स नहीं खोजता; वह उस सटीक शाखा तक पहुँचने के लिए पेड़ पर चढ़ता है जो वर्तमान स्थिति से मेल खाती है, यह सुनिश्चित करते हुए कि वह सही प्रकार का ज्ञान प्राप्त करे।
एक बार जब यह एक रणनीति चुन लेता है, तो A/B Agent केवल वहीं नहीं रुक जाता। यह एक अथक वैज्ञानिक की तरह कार्य करता है जो परीक्षण चलाता है, परिणामों को देखता है, और फिर तुरंत अपने स्वयं के पेड़ को अपडेट करता है। यदि एक नया रास्ता अधिक यात्रियों को लाता है लेकिन इंजन को ओवरहीट कर देता है (एक "गार्डरेल" मेट्रिक), तो AI इसे नोटिस करता है, सेटिंग्स में बदलाव करता है, और फिर से प्रयास करता है। यह इस लूप को जारी रखता है—सोचना, परीक्षण करना, सीखना और अपने स्वयं के ज्ञान आधार को अपडेट करना—जब तक कि वह सही संतुलन न खोज ले। पेपर दिखाता है कि यह सिस्टम केवल एक सिद्धांत नहीं है; जब इसे वास्तविक दुनिया के शॉर्ट-वीडियो शॉपिंग वातावरण में टेस्ट किया गया, तो इसने सभी सुरक्षा मेट्रिक्स को सकारात्मक रखते हुए "ग्रॉस मर्चेंडाइज वैल्यू" (उपयोगकर्ताओं द्वारा खर्च किया गया कुल पैसा) में 4.829% का सुधार किया। इसने वास्तव में ऐसी रणनीतियाँ बनाने में दुनिया के सबसे उन्नत AI मॉडल्स में से कुछ को भी पीछे छोड़ दिया जो सही और रचनात्मक दोनों थीं। esenciaतः, A/B Agent प्रयास और त्रुटि (trial-and-error) की अराजक प्रक्रिया को एक स्मार्ट, स्व-सुधार चक्र में बदल देता है जो अपने आप बेहतर होता जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।