← नवीनतम पेपर
💻 computer science

Time-Aware Diffusion based on Preference Disentanglement for Generative Recommendation

यह शोध पत्र TDPM का प्रस्ताव करता है, जो एक नवीन जनरेटिव रिकमेंडेशन फ्रेमवर्क है जो उपयोगकर्ता की प्राथमिकताओं को दीर्घकालिक अवधि (long-term period) और अल्पकालिक बिंदु (short-term point) घटकों में विसंयोजित (disentangle) करके डिफ्यूजन-आधारित मॉडलों को उन्नत करता है ताकि समय-जागरूक सिमेंटिक टोकन डिफ्यूजन को सक्षम बनाया जा सके, जिससे यह वास्तविक दुनिया के डेटासेट पर अत्याधुनिक बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Bangguo Zhu, Peng Huo, Yuanbo Zhao, Zhicheng Du, Jun Yin, Senzhang Wang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bangguo Zhu, Peng Huo, Yuanbo Zhao, Zhicheng Du, Jun Yin, Senzhang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अनुमान लगाने की कोशिश कर रहे हैं कि आपका एक दोस्त आगे क्या खरीदना चाहता है। आपके पास उन सभी चीजों की एक लंबी सूची है जो उसने अब तक खरीदी हैं।

पुराना तरीका (स्टैंडर्ड डिफ्यूजन - Standard Diffusion):
वर्तमान में अधिकांश अनुशंसा प्रणाली (recommendation systems) इस सूची को समान पहेली के टुकड़ों के ढेर की तरह मानती हैं। वे मान लेते हैं कि सूची में प्रत्येक आइटम समान रूप से महत्वपूर्ण है और पैटर्न सीखने के लिए हर एक पर एक ही प्रकार का "शोर" (noise) या भ्रम लागू करते हैं। यह एक गाना सीखने की तरह है जहाँ आप हर नोट को बिल्कुल एक ही वॉल्यूम पर बजाते हैं, चाहे वह एक धीमी फुसफुसाहट हो या एक ज़ोरदार ड्रम की थाप। शोध पत्र तर्क देता है कि यह एक घातक दोष है क्योंकि मानवीय पसंद एकसमान नहीं होती; यह समय के साथ बदलती रहती है।

नया तरीका (TDPM):
लेखक एक नई प्रणाली प्रस्तावित करते हैं जिसे TDPM (टाइम-अवेयर डिफ्यूजन बेस्ड ऑन प्रेफरेंस डिसेंटैंगलमेंट) कहा जाता है। TDPM को एक ऐसे जासूस के रूप में सोचें जो न केवल वस्तुओं की सूची को देखता है, बल्कि उस सूची के पीछे की कहानी को भी समझता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ तोड़कर समझाया गया है:

1. "पसंद" के दो प्रकार

शोध पत्र कहता है कि मानवीय पसंद वास्तव में दो अलग-अलग चीजों का मिश्रण है, और सिस्टम उन्हें बेहतर ढंग से समझने के लिए उन्हें अलग (disentangle) करता है:

  • पीरियड प्रेफरेंस (लंबे समय का मिजाज - The "Long-Term Vibe"): यह आपकी स्थिर, दीर्घकालिक पहचान है। यदि आप फुटबॉल के प्रशंसक हैं, तो आप वर्षों तक फुटबॉल, जर्सी और क्लीट्स खरीदेंगे। यह आपकी "पीरियड" पसंद है। यह सुसंगत है और समय के साथ धीरे-धीरे विकसित होती है।
  • पॉइंट प्रेफरेंस (अचानक आई चमक - The "Sudden Spark"): यह एक अचानक, अल्पकालिक परिवर्तन है। हो सकता है कि आप आमतौर पर फुटबॉल का सामान खरीदते हों, लेकिन एक दिन आप वीडियो गेम कंट्रोलर खरीदते हैं क्योंकि एक नया गेम आया है। यह एक "पॉइंट" पसंद है—एक विशिष्ट घटना या ट्रेंड के कारण हुआ अस्थायी विचलन।

2. "मास्किंग" का खेल

इन सूचियों से सीखने के लिए, सिस्टम "मैड लिब्स" (Mad Libs) या "रिक्त स्थान भरें" (fill-in-the-blank) के समान एक खेल का उपयोग करता है।

  • मानक विधि (Standard Method): यह सूची में मौजूद वस्तुओं को समान संभावना के साथ बेतरतीब ढंग से ढक देता है (mask)। यह एक फुटबॉल को उतनी ही बार छिपा सकता है जितनी बार वह एक वीडियो गेम कंट्रोलर को छिपाता है।
  • TDPM विधि: यह खेल को बुद्धिमानी से खेलती है।
    • यदि कोई आइटम "लंबे समय के मिजाज" (Period) में फिट बैठता है, तो यह उसे कम ढक सकती है, क्योंकि सिस्टम पहले से ही इस पैटर्न को अच्छी तरह समझ चुका है।
    • यदि कोई आइटम "अचानक आई चमक" (Point) का प्रतिनिधित्व करता है, तो यह उसे अधिक ढकती है। क्यों? क्योंकि सिस्टम को यह समझने के लिए अधिक मेहनत करने की आवश्यकता है कि आपने अचानक वह कंट्रोलर क्यों खरीदा। "कठिन" वस्तुओं को कठिन बनाकर, सिस्टम आपके व्यवहार में अचानक आए बदलावों को पहचानने में बहुत बेहतर तरीके से सीख जाता है।

3. "एडेप्टिव वेट" (वॉल्यूम नॉब - The "Volume Knob")

सिस्टम के पास एक विशेष नॉब (जिसे λ\lambda कहा जाता है) है जिसे वह सीखते समय घुमाता है।

  • प्रशिक्षण के दौरान शुरुआत में: यह आपकी लंबी अवधि की आदतों और आपकी अचानक आई चमक, दोनों को समान रूप से सुनता है।
  • प्रशिक्षण के अंत में: यह धीरे-धीरे आपकी लंबी अवधि की आदतों (Period Preference) पर वॉल्यूम बढ़ा देता है क्योंकि, जैसा कि शोध पत्र में उल्लेख किया गया है, आपकी स्थिर प्रोफाइल आपके अगले कदम का सबसे विश्वसनीय भविष्यवक्ता बन जाती है, जबकि यह अचानक होने वाले परिवर्तनों पर भी कान बनाए रखती है।

4. परिणाम

इस शोध पत्र का परीक्षण वास्तविक दुनिया के डेटा (जैसे ब्यूटी उत्पादों, स्पोर्ट्स गियर और खिलौनों के लिए अमेज़न रिव्यूज) पर किया गया।

  • दावा: सूची को स्थिर अध्यायों और अचानक आने वाले मोड़ वाली एक कहानी के रूप में मानने के कारण, TDPM ने अगली वस्तु का अनुमान लगाने में बहुत बेहतर प्रदर्शन किया।
  • आंकड़े: इसने मौजूदा सर्वोत्तम तरीकों की तुलना में अनुशंसाओं की सटीकता में 29% तक सुधार किया।

सारांश में:
कल्पना कीजिए कि एक शिक्षक छात्र का मूल्यांकन कर रहा है। पुराना तरीका हर प्रश्न को समान समय देता है। TDPM एक स्मार्ट शिक्षक की तरह है जो जानता है कि छात्र गणित में बहुत अच्छा है (लंबी अवधि की आदत) लेकिन ज्यामिति (geometry) के एक विशिष्ट प्रकार के सवाल में संघर्ष कर रहा है (अचानक विचलन)। शिक्षक ज्यामिति के सवाल पर अतिरिक्त समय बिताता है ताकि यह सुनिश्चित हो सके कि छात्र वास्तव में उसे सीख ले, जबकि गणित के उत्तरों की पुष्टि जल्दी से कर लेता है। यह लक्षित दृष्टिकोण बेहतर ग्रेड (अनुशंसा) की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →