← नवीनतम पेपर
🤖 machine learning

PIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems

यह शोध पत्र PIT-SUN को प्रस्तुत करता है, जो एक तैनात करने योग्य ढांचा (deployable framework) है जो प्रशिक्षण को स्थिर करने के लिए प्रोबेबिलिटी-इंटीग्रल-ट्रांसफॉर्म को लागू करके और मूल-स्थान के प्रत्याशित मानों (expectations) का सटीक अनुमान लगाने के लिए एक मल्टीप्लिकेटिव SUN रिकवरी पद्धति का उपयोग करके, सीधे व्युत्क्रमण (direct inversion) की सीमाओं के बिना, अनुशंसा प्रणालियों में रिग्रेशन के लिए प्रत्याशा-संगत रिकवरी (expectation-consistent recovery) प्राप्त करता है।

मूल लेखक: Mingyu Zhao, Zhaohan Li, Zhenxiong Miao, Xu Zhang, Dewei Leng, Yanan Niu, Kun Gai

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyu Zhao, Zhaohan Li, Zhenxiong Miao, Xu Zhang, Dewei Leng, Yanan Niu, Kun Gai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल वीडियो ऐप चला रहे हैं, और आपका काम यह अनुमान लगाना है कि एक उपयोगकर्ता एक वीडियो को कितनी देर तक देखेगा या वह कितना पैसा खर्च कर सकता है। यह रिकमेंडेशन सिस्टम में "रिग्रेशन" (regression) की समस्या है। PIT-SUN नामक पेपर एक पेचीदा पहेली को सुलझाता है: आप अपने अनुमानों को सटीक कैसे बना सकते हैं जब डेटा अव्यवस्थित हो, शून्य (zeros) से भरा हो, और उसमें अप्रत्याशित उछाल (spikes) हों?

समस्या: वह "रूलर" जो टूट जाता है

एक मानक रूलर (standard ruler) से पहाड़ों की एक श्रृंखला को मापने की कोशिश करने के बारे में सोचें। अधिकांश समय, आप छोटी पहाड़ियों (कम वॉच टाइम) को माप रहे होते हैं, लेकिन कभी-कभी, आप एक विशाल शिखर (जैसे कोई लगातार 10 घंटे तक देख रहा हो) या एक गहरी घाटी (शून्य वॉच टाइम) से टकरा जाते हैं।

यदि आप एक मानक रूलर (यानी "Original-Space MSE" विधि) के साथ सब कुछ मापने की कोशिश करते हैं, तो आपके माप डगमगाने लगते हैं। विशाल शिखर आपके रूलर को इतनी ज़ोर से खींचते हैं कि आपका औसत अनुमान ढह जाता है, और छोटी पहाड़ियाँ दब जाती हैं। अंततः, आप भविष्यवाणी करते हैं कि हर कोई एक उबाऊ औसत समय तक ही देखेगा, जिससे आप बड़े उछालों और ज़ीरो को पूरी तरह से मिस कर देते हैं।

विफल शॉर्टकट: "जादुई खिंचने वाला रूलर" (Magic Stretchy Ruler)

कई लोगों ने इसे ठीक करने के लिए एक "जादुई खिंचने वाले रूलर" (लॉग या स्क्वायर रूट जैसे गणितीय रूपांतरण) का उपयोग करने की कोशिश की। यह रूलर विशाल पहाड़ों को इतना सिकोड़ देता है कि वे आपकी मेज पर फिट हो सकें, जिससे गणित आसान हो जाता है।

यहाँ वह पेच है जिसे पेपर स्पष्ट रूप से खारिज करता है: आप पहाड़ों को केवल सिकोड़ नहीं सकते, उन्हें माप नहीं सकते, और फिर केवल परिणाम को "अन-स्ट्रेच" (un-stretch) करके वास्तविक उत्तर प्राप्त नहीं कर सकते। पेपर गणितीय रूप से सिद्ध करता है कि यदि आप अपने रूलर को गैर-रेखीय (non-linear) तरीके से खींचते हैं (उछालों को संभालने के लिए), तो केवल स्ट्रेच को रिवर्स करना आपको सही औसत नहीं देगा। यह एक रबर बैंड को खींचने, उस पर एक निशान लगाने और फिर यह मानने जैसा है कि छोड़ने पर वह निशान अपनी मूल जगह पर वापस आ जाएगा। ऐसा नहीं होता। पेपर दिखाता है कि जब तक आपका स्ट्रेच पूरी तरह से एक सीधी रेखा (जो उछालों को संभालने के उद्देश्य को ही खत्म कर देगी) नहीं है, तब तक यह सीधा "अन-स्ट्रेचिंग" गणितीय रूप से त्रुटिपूर्ण है।

समाधान: "दो-चरणीय जीपीएस" (Two-Step GPS - PIT-SUN)

लेखक PIT-SUN (Probability-Integral-TranSformed Unbiased recovery) नामक एक नया फ्रेमवर्क प्रस्तावित करते हैं। रूलर को ठीक करने के बजाय, वे एक दो-चरणीय जीपीएस सिस्टम बनाते हैं।

चरण 1: "रैंकिंग मैप" (निर्देशांक)
सबसे पहले, वे वास्तविक संख्याओं (जैसे "5 मिनट" या "$50") को अनदेखा करते हैं और केवल रैंक (rank) देखते हैं। वे पूछते हैं: "क्या यह उपयोगकर्ता शीर्ष 10% देखने वालों में है? या निचले 5% में?" वे प्रत्येक अव्यवस्थित डेटा पॉइंट को -3 और +3 के बीच एक साफ, सीमित स्कोर में बदल देते हैं (जैसे एक स्टैंडर्ड नॉर्मल स्कोर)। यह जंगली, ऊबड़-खाबड़ पहाड़ों को एक चिकनी, प्रबंधनीय पहाड़ी में बदल देता है। यह "PIT" वाला हिस्सा है। यह लर्निंग को स्थिर करता है ताकि AI भ्रमित न हो।

चरण 2: "रिकवरी बेस" (The SUN)
अब, AI के पास रैंक का एक बेहतरीन मैप है, लेकिन उसे अभी भी वास्तविक मूल्य जानने की आवश्यकता है। यहीं "SUN" वाला हिस्सा आता है। केवल रूलर को अन-स्ट्रेच करने के बजाय, AI एक विशेष "रिकवरी बेस" का उपयोग करता है।
इसे एक कैलिब्रेटेड एंकर (calibrated anchor) के रूप में सोचें। AI अपने द्वारा अनुमानित रैंक को देखता है और पूछता है, "इस विशिष्ट रैंक के इतिहास के आधार पर, इससे जुड़ा औसत वास्तविक मूल्य क्या है?" यह अंतिम भविष्यवाणी प्राप्त करने के लिए रैंक को इस एंकर से गुणा करता है।

महत्वपूर्ण बात यह है कि पेपर दिखाता है कि इस एंकर को फ्रीज (एक "stop-gradient" ट्रिक का उपयोग करके) किया जाना चाहिए जबकि AI अनुपात (ratio) सीख रहा होता है। यदि एंकर घूमता रहता है जबकि AI अनुपात सीखने की कोशिश कर रहा है, तो पूरा सिस्टम भ्रमित हो जाता है। इस एंकर को लॉक करके, AI सुरक्षित रूप से साफ रैंक को वास्तविक डॉलर राशि या समय में बदलना सीख सकता है।

क्या पेपर सिद्ध करता है और मापता है

लेखकों ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे हर जगह परखा:

  • सिमुलेशन: उन्होंने अजीब, अव्यवस्थित डेटा आकृतियों (कुछ में बड़े उछाल, कुछ में बहुत सारे ज़ीरो) के साथ 12 अलग-अलग नकली दुनिया बनाई। हर एक में, PIT-SUN स्थिर रहा जबकि अन्य विधियां क्रैश हो गईं या पक्षपाती (biased) उत्तर दिए।
  • पब्लिक बेंचमार्क्स: उन्होंने दो वास्तविक सार्वजनिक डेटासेट्स (CIKM16 और DTMart) पर इसका परीक्षण किया। PIT-SUN ने मौजूदा सर्वोत्तम मॉडलों को पछाड़ दिया, जिससे सटीकता में मापने योग्य सुधार हुआ (जैसे त्रुटि दरों को काफी कम करना)।
  • रियल-वर्ल्ड इंडस्ट्रियल डेटा: उन्होंने "ड्वेल टाइम" (देखने का समय) और "GMV" (सकल व्यापार मूल्य) की भविष्यवाणी करने के लिए कुआईशौ (Kuaishou - एक विशाल वीडियो प्लेटफॉर्म) में इसे तैनात किया।
    • ड्वेल टाइम के लिए, PIT-SUN ने त्रुटि (NMAE) को 0.477 तक कम कर दिया, जो अगले सर्वश्रेष्ठ (CCOR-Net 0.487) से बेहतर है।
    • GMV (जो ज़ीरो से भरा है) के लिए, PIT-SUN-ZI (ज़ीरो-हैवी डेटा के लिए एक संस्करण) ने 0-AUC का 0.902 हासिल किया, जो अगले सर्वश्रेष्ठ से काफी बेहतर है।
  • ऑनलाइन A/B टेस्ट: उन्होंने 7 दिनों तक एक लाइव प्रयोग चलाया। परिणामों ने "वॉचिंग टाइम" (0.318% की वृद्धि) और "वीडियो व्यू काउंट" (0.265% की वृद्धि) में सांख्यिकीय रूप से महत्वपूर्ण बढ़त दिखाई। पेपर नोट करता है कि हालांकि विज्ञापन राजस्व में एक सकारात्मक रुझान दिखा, लेकिन यह सांख्यिकीय रूप से महत्वपूर्ण नहीं था, इसलिए वे केवल जुड़ाव (engagement) की बढ़त का दावा करते हैं।

मुख्य निष्कर्ष (The Bottom Line)

पेपर सुझाव देता है कि आप केवल "ट्रांसफॉर्म और इनवर्ट" करके अव्यवस्थित डेटा से बाहर नहीं निकल सकते। आपको एक पूर्ण प्रणाली की आवश्यकता है जो स्थिर रैंकिंग को वैल्यू रिकवरी से अलग करती है।

PIT-SUN यही सिस्टम है। यह एक एकल "लुकअप टेबल" (डेटा के वितरण का एक अनुभवजन्य मानचित्र) का उपयोग करता है जो एक साथ तीन काम करता है: स्थिर रैंक को परिभाषित करना, रिकवरी के लिए एंकर प्रदान करना, और ड्रिफ्ट (drift) की निगरानी करना। यह हल्का और तेज़ है (इन्फरेंस में लगभग 14.61 ms लगता है), और यह तब भी काम करता है जब डेटा एक चिकनी पहाड़ी हो या एक ऊबड़-खाबड़ पर्वत श्रृंखला। यह एक टूटे हुए रूलर को एक विश्वसनीय जीपीएस में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →