← नवीनतम पेपर
🤖 machine learning

Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities

यह शोध पत्र एक कोटिएंट-DAG फ्रेमवर्क और फॉरवर्ड-DP एल्गोरिदम पेश करता है ताकि ऑटोरिग्रेसिव रिकमेंडेशन सिस्टम्स में कुशल ऑफ-पॉलिसी इवैल्यूएशन के लिए न्यूसेंस वेरिएंस को समाप्त किया जा सके और अनऑर्डर्ड स्लेट प्रोपेंसिटीज की सटीक गणना सक्षम की जा सके।

मूल लेखक: Ziwen Xie, Shaowen Xiang, Hongyu He, Dianbo Liu

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziwen Xie, Shaowen Xiang, Hongyu He, Dianbo Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो यह आंकना चाहते हैं कि एक नई रेसिपी (Target Policy) कितनी अच्छी होगी, लेकिन आप इसे अपने खुद के किचन में वास्तव में बना नहीं सकते क्योंकि यह बहुत महंगा या जोखिम भरा है। इसके बजाय, आपके पास एक नोटबुक है जिसमें एक दूसरे शेफ (Behavior Policy) द्वारा पहले बनाई गई रेसिपीज़ का विवरण है। आपका लक्ष्य केवल उस पुरानी नोटबुक का उपयोग करके यह अनुमान लगाना है कि वह नई रेसिपी कितनी स्वादिष्ट होगी। यही Off-Policy Evaluation (OPE) की मूल समस्या है।

समस्या: गलत चीजों को गिनना

आमतौर पर, नई रेसिपी का आकलन करने के लिए, आप पुराने शेफ द्वारा उठाए गए हर एक कदम को देखते हैं। आप कहते हैं, "ठीक है, उन्होंने नमक डाला, फिर काली मिर्च, फिर लहसुन।" आप उस सटीक क्रम के आधार पर एक स्कोर की गणना करते हैं।

लेकिन यहाँ एक पेंच है: कभी-कभी सामग्री डालने का क्रम वास्तव में अंतिम व्यंजन के स्वाद को नहीं बदलता है।

  • परिदृश्य: कल्पना करें कि वस्तुओं की एक "स्लेट" (जैसे 5 गानों की प्लेलिस्ट या 5 ऐपेटाइज़र की ट्रे) है। ग्राहक केवल इस बात की परवाह करता है कि ट्रे पर कौन से 5 आइटम हैं, न कि इस बात की कि शेफ ने उन्हें किस क्रम में रखा।
  • गलती: पुराना नोटबुक क्रम को रिकॉर्ड करता है (गाना A, फिर B, फिर C...)। यदि आप अपने स्कोर की गणना उस विशिष्ट क्रम के आधार पर करते हैं, तो आप "क्रम" को महत्वपूर्ण मान रहे हैं। लेकिन चूंकि ग्राहक इसकी परवाह नहीं करता, इसलिए आप अपनी गणना में "शोर" (noise) जोड़ रहे हैं।
  • परिणाम: यह शोर बहुत अधिक भ्रम (variance) पैदा करता है। यह ऐसा है जैसे आप हर एक मोज़े को अलग-अलग तौलकर सूटकेस का वजन बताने की कोशिश कर रहे हों, बजाय इसके कि आप पूरे सूटकेस को एक साथ तौलें। आप कितने मोज़ों को कैसे गिना, इस पर निर्भर करते हुए आपको बहुत अलग-अलग उत्तर मिलेंगे।

इसके अलावा, वस्तुओं के एक विशिष्ट समूह (क्रम को अनदेखा करते हुए) को प्राप्त करने की "वास्तविक" प्रायिकता (probability) की गणना करना एक गणितीय दुःस्वप्न है। यदि आपके पास 5 आइटम हैं, तो उन्हें चुनने के 120 अलग-अलग तरीके (5 factorial) हो सकते हैं। आपकी नोटबुक के हर एक एंट्री के लिए यह गणित करना कम्प्यूटेशनल रूप से असंभव है।

समाधान: "Quotient DAG" (ग्रुपिंग मैप)

लेखक डेटा को देखने का एक चतुर नया तरीका प्रस्तावित करते हैं। हर उस पथ (path) को देखने के बजाय जो एक ही परिणाम की ओर ले जाता है, वे सुझाव देते हैं कि उन सभी पथों को समूहित (grouping) किया जाए जो एक ही परिणाम तक पहुँचते हैं।

  • उपमा: एक विशाल पेड़ की कल्पना करें जहाँ प्रत्येक शाखा सामग्री डालने के एक अलग क्रम का प्रतिनिधित्व करती है।
    • पुराना तरीका: आप हर एक शाखा पर चलते हैं, वजन मापते हैं, और उनका औसत निकालने की कोशिश करते हैं।
    • नया तरीका (Quotient DAG): आप महसूस करते हैं कि वे सभी शाखाएं जो अंततः सामग्री के एक ही सेट पर समाप्त होती हैं, वास्तव में आपके मानचित्र में एक ही "नोड" हैं। आप उन सभी शाखाओं को एक एकल बिंदु में समेट देते हैं।
    • मैप: यह एक "Directed Acyclic Graph" (DAG) बनाता है—एक ऐसा मानचित्र जहाँ आप केवल चुने गए वस्तुओं के सेट पर ध्यान केंद्रित करते हैं, उनके क्रम पर नहीं।

जादुई ट्रिक: Forward-Flow Importance Sampling

एक बार जब आपके पास यह सरल मानचित्र हो जाता है, तो आपको यह जानने की आवश्यकता है कि नया शेफ एक विशिष्ट "सेट" तक पहुँचने की कितनी संभावना रखता है।

  • पुराना तरीका: आपको उत्तर प्राप्त करने के लिए सभी 120 अलग-अलग क्रमों की प्रायिकता को जोड़ना होगा।
  • नया तरीका (Forward-DP): लेखकों ने Forward-DP (डायनेमिक प्रोग्रामिंग) नामक एक विधि विकसित की है। इसे एक स्मार्ट कैलकुलेटर के रूप में सोचें जो उत्तर को चरण-दर-चरण बनाता है।
    • यह एक खाली ट्रे (प्रायिकता 1) से शुरू होता है।
    • यह पूछता है: "यदि मेरे पास 1 आइटम है, तो दूसरा जोड़ने की क्या संभावना है?"
    • यह पूछता है: "यदि मेरे पास 2 आइटम हैं, तो तीसरा जोड़ने की क्या संभावना है?"
    • यह बिना कभी भी सभी 120 क्रमों को सूचीबद्ध किए, पूरे सेट की प्रायिकता का निर्माण करता रहता है।

यह विधि सटीक (exact) है (यह अनुमान नहीं लगाती) और तेज़ है। वर्षों तक गणना करने के बजाय (factorial time), यह एक प्रबंधनीय समय में होता है (ट्रे के आकार के संदर्भ में exponential, लेकिन मेनू के आकार के संदर्भ में polynomial)।

यह क्यों महत्वपूर्ण है

  1. कम शोर: "क्रम" जैसे अप्रासंगिक विवरणों को अनदेखा करके, गणित बहुत स्पष्ट हो जाता है। हमारे अनुमान अधिक सटीक और स्थिर होते हैं।
  2. व्यवहार्यता (Feasibility): यह जटिल अनुशंसा प्रणालियों (जैसे "मुझे 10 फिल्में दिखाएं") का मूल्यांकन करना संभव बनाता है, जिन्हें पहले गणना करना बहुत कठिन था।
  3. वास्तविक परीक्षण: लेखकों ने इसे निम्नलिखित पर परखा:
    • मेडिकल डेटा: सेप्सिस (रक्त संक्रमण) के उपचार का अनुकरण करते हुए। उनकी विधि ने पुराने तरीकों की तुलना में रोगी के परिणामों की बहुत अधिक सटीक भविष्यवाणी की।
    • रेकमेंडेशन डेटा: KuaiRec नामक डेटासेट का उपयोग करके (वीडियो सिफारिशें)। उन्होंने दिखाया कि उनका तरीका कुछ ही सेकंड में वीडियो के एक समूह के दिखाए जाने की "वास्तविक" प्रायिकता की गणना कर सकता है, जबकि पुराने तरीके में इसमें कई दिन लग सकते थे या यह असंभव होता।

सारांश

यह पेपर "कैसे" (कार्यों का क्रम) का अत्यधिक विश्लेषण करने के बजाय "क्या" (वस्तुओं का अंतिम सेट) पर ध्यान केंद्रित करने का एक तरीका पेश करता है। समान पथों को एक साथ समूहित करके और एक स्मार्ट, चरण-दर-चरण गणना विधि (Forward-DP) का उपयोग करके, वे नए रणनीतियों का बहुत अधिक सटीकता और दक्षता के साथ मूल्यांकन कर सकते हैं, विशेष रूप से स्वास्थ्य सेवा और अनुशंसा इंजन जैसे क्षेत्रों में जहाँ वास्तविक जीवन में नए विचारों का परीक्षण करना बहुत खतरनाक या महंगा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →