← नवीनतम पेपर
📊 statistics

Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning

यह शोध पत्र एक ट्रांसफॉर्मर रीइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तावित करके मौजूदा टाइम सीरीज़ ए/बी टेस्टिंग डिज़ाइनों की सीमाओं को संबोधित करता है जो पूर्ण ऐतिहासिक संदर्भ का लाभ उठाता है और बिना किसी प्रतिबंधात्मक धारणाओं के सीधे मीन स्क्वेर्ड एरर को अनुकूलित करता है, जो सिंथेटिक, सिम्युलेटेड और वास्तविक दुनिया के डेटासेट पर बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Xiangkun Wu, Qianglin Wen, Yingying Zhang, Hongtu Zhu, Ting Li, Chengchun Shi

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangkun Wu, Qianglin Wen, Yingying Zhang, Hongtu Zhu, Ting Li, Chengchun Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे राइड-शेयरिंग शहर के मैनेजर हैं। हर दिन, हजारों यात्रियों को सवारी चाहिए होती है, और हजारों ड्राइवर उन्हें लेने के लिए इंतजार कर रहे होते हैं। आप एक नई "स्मार्ट डिस्पैच" नीति का परीक्षण करना चाहते हैं ताकि यह देख सकें कि क्या यह मौजूदा प्रणाली की तुलना में ड्राइवरों को यात्रियों तक तेजी से पहुँचाती है।

पुराने दिनों में, कंपनियाँ बस एक सिक्का उछाल देती थीं: आधी बार पुराना तरीका इस्तेमाल करती थीं; आधी बार नया तरीका। लेकिन एक राइड-शेयरिंग शहर में, चीजें शून्य में नहीं घटतीं। यदि आप सुबह 8:00 बजे नीति बदलते हैं, तो यह केवल उस एक घंटे को प्रभावित नहीं करता; यह 8:15 बजे ड्राइवरों की स्थिति को बदल देता है, जो 8:30 बजे कौन उपलब्ध होगा, उसे प्रभावित करता है। इसे कैरियोवर इफेक्ट (carryover effect) कहा जाता है। अतीत लगातार वर्तमान को प्रभावित करता रहता है।

यह शोध पत्र इस समस्या पर केंद्रित है कि इन परीक्षणों को कैसे डिजाइन किया जाए ताकि आपको सबसे सटीक उत्तर मिल सके, भले ही अतीत भविष्य को प्रभावित कर रहा हो।

यहाँ उनके समाधान का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

समस्या: "अंधे" और "अनुमान लगाने वाले"

लेखकों का कहना है कि इन परीक्षणों को चलाने के मौजूदा तरीकों में दो बड़ी खामियां हैं:

  1. उनकी याददाश्त कम है: अधिकांश वर्तमान तरीके केवल यह देखते हैं कि अभी क्या हो रहा है या शायद पिछले कुछ मिनटों में क्या हुआ। वे दिन के बाकी इतिहास को नजरअंदाज कर देते हैं। लेखक गणितीय रूप से सिद्ध करते हैं कि यह एक गलती है। यह एक जहाज को नेविगेट करने की तरह है जहाँ आप केवल अपने सामने के पानी को देख रहे हैं, उन धाराओं को अनदेखा कर रहे हैं जो पिछले एक घंटे से जहाज को धकेल रही हैं। आप गलत जगह पहुँच जाएंगे।
  2. वे गणित को आसान बनाने के लिए नियम बनाते हैं: "सर्वश्रेष्ठ" तरीका चलाने के लिए गणना करने हेतु, पुराने तरीके अक्सर यह मान लेते हैं कि दुनिया एक सरल, अनुमानित मशीन (जैसे एक घड़ी) की तरह काम करती है। लेकिन वास्तविक दुनिया अव्यवस्थित, अराजक और नॉन-लीनियर (non-linear) है। इसे सरल मानकर, वे गलत उत्तर प्राप्त करते हैं।

समाधान: "वीडियो गेम ब्रेन" वाला "सुपर-ऑब्जर्वर"

लेखक एक नई प्रणाली प्रस्तावित करते हैं जिसे ट्रांसफॉर्मर रीइन्फोर्समेंट लर्निंग (TRL) कहा जाता है। इस नाम के दोनों हिस्सों को समझते हैं:

1. ट्रांसफॉर्मर (द "सुपर-ऑब्जर्वर")
एक "ट्रांसफॉर्मर" को एक ऐसे सुपर-स्मार्ट लाइब्रेरियन के रूप में सोचें जिसने लाइब्रेरी की हर किताब पढ़ी है और हर कहानी के कथानक को पूरी तरह से याद रखा है।

  • पुराना तरीका: लाइब्रेरियन केवल वही याद रखता है जो आपने अभी आखिरी वाक्य पढ़ा है।
  • नया तरीका: ट्रांसफॉर्मर पूरी किताब को याद रखता है।
    उनके प्रयोग में, यह "लाइब्रेरियन" राइड-शेयरिंग ऐप के पूरे इतिहास को देखता है: हर ऑर्डर, ड्राइवर की हर हरकत, हर ट्रैफिक जाम, और टेस्ट की शुरुआत से लेकर इस सटीक सेकंड तक की हर पॉलिसी चेंज। यह इस विशाल स्मृति का उपयोग यह तय करने के लिए करता है: "क्या हमें अभी नई नीति पर स्विच करना चाहिए, या इंतजार करना चाहिए?"

2. रीइन्फोर्समेंट लर्निंग (द "वीडियो गेम ब्रेन")
रीइन्फोर्समेंट लर्निंग (RL) को एक वीडियो गेम कैरेक्टर को प्रशिक्षित करने के रूप में सोचें।

  • लक्ष्य: एक वीडियो गेम में, आप उच्चतम स्कोर प्राप्त करना चाहते हैं। इस प्रयोग में, "स्कोर" यह है कि आपका अंतिम परिणाम कितना सटीक है।
  • ट्रिक: आमतौर पर, आपको खेल खत्म होने तक "असली स्कोर" का पता नहीं चलता। लेकिन लेखकों ने अपने AI को एक सिमुलेशन (वास्तविक शहर का वीडियो गेम संस्करण) खेलने के लिए सिखाया है।
  • रिवॉर्ड सिस्टम: जब भी AI कोई निर्णय लेता है (पॉलिसी बदलना), तो उसे परिणाम के अपने वर्तमान अनुमान और वास्तविक परिणाम के बीच की निकटता के आधार पर "रिवॉर्ड" (इनाम) या "पनिशमेंट" (दंड) मिलता है।
  • परिणाम: AI सिमुलेशन के माध्यम से, ट्रायल और एरर (परीक्षण और त्रुटि) के जरिए सीखता है कि त्रुटियों को कम करने के लिए समय के साथ पुराने और नए नीतियों को कैसे मिलाना है। उसे अनुमान लगाने की आवश्यकता नहीं है; वह बस लाखों बार गेम खेलकर इष्टतम पैटर्न सीख जाता है।

उपमा: शतरंज का खिलाड़ी

कल्पना कीजिए कि आप एक ग्रैंडमास्टर के खिलाफ शतरंज का खेल खेल रहे हैं।

  • पुराने तरीके: वे केवल अभी बोर्ड को देखते हैं। वे शायद एक प्यादा चल सकते हैं क्योंकि यह इस विशिष्ट क्षण में अच्छा दिखता है, यह समझे बिना कि यह तीन चालों बाद अपने प्रतिद्वंद्वी के लिए एक जाल सेट कर देता है।
  • पेपर का तरीका: यह एक ग्रैंडमास्टर है जो अब तक के खेल की हर एक चाल को याद रखता है। वे पूरे इतिहास का विश्लेषण करने के लिए एक सुपर-कंप्यूटर (ट्रांसफॉर्मर) का उपयोग करते हैं और भविष्य के लाखों परिदृश्यों को अपने दिमाग में खेलने के लिए एक सिमुलेशन इंजन (रीइन्फोर्समेंट लर्निंग) का उपयोग करते हैं। वे वह चाल चुनते हैं जो सर्वोत्तम परिणाम की गारंटी देती है, भले ही वह क्षण में अजीब लगे।

उन्होंने क्या पाया?

उन्होंने इस नए "सुपर-ऑब्जर्वर" का तीन तरीकों से परीक्षण किया:

  1. फेक डेटा: बनाए गए नंबर जो विशिष्ट नियमों का पालन करते हैं।
  2. एक पब्लिक सिम्युलेटर: एक वीडियो गेम जो एक वास्तविक शहर में ड्राइवरों और यात्रियों के व्यवहार की नकल करता है।
  3. रियल डेटा: उन्होंने अपने सिम्युलेटर को बनाने के लिए एक वास्तविक राइड-शेयरिंग कंपनी (अनाम) के वास्तविक डेटा का उपयोग किया।

परिणाम: हर एक परीक्षण में, उनकी नई विधि पुराने तरीकों की तुलना में अधिक सटीक थी। इसने कम "नॉइज़" (त्रुटि) के साथ नई नीति के वास्तविक प्रभाव को खोजा।

निचोड़ (The Bottom Line)

पेपर का दावा है कि जब समय-संवेदनशील वातावरण (जैसे राइड-शेयरिंग, स्टॉक मार्केट, या ट्रैफिक कंट्रोल) में नई नीतियों का परीक्षण करने की बात आती है, तो आप केवल वर्तमान क्षण को देखकर सर्वश्रेष्ठ परिणाम प्राप्त नहीं कर सकते। आपको एक ऐसी प्रणाली का उपयोग करना चाहिए जो सब कुछ याद रखती है जो पहले हुआ है और पुरानी और नई नीतियों को मिलाने की आदर्श रणनीति सीखने के लिए "वीडियो गेम" दृष्टिकोण का उपयोग करती है। उनका नया AI सिस्टम बिल्कुल यही करता है और मौजूदा उद्योग मानकों को पछाड़ देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →