← नवीनतम पेपर
🤖 AI

GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks

यह शोध पत्र GFlowGR को प्रस्तुत करता है, जो जेनरेटिव रिकमेंडेशन सिस्टम के लिए एक नवीन फाइन-ट्यूनिंग फ्रेमवर्क है, जो एक एडेप्टिव ट्रैजेक्टरी सैंपलर और रिवॉर्ड मॉडल में कोलैबोरेटिव नॉलेज को एकीकृत करके एक्सपोज़र बायस को कम करने के लिए जेनरेटिव फ्लो नेटवर्क्स का लाभ उठाता है, जिससे मौजूदा सुपरवाइज्ड और प्रेफरेंस-बेस्ड तरीकों की तुलना में प्रदर्शन में सुधार होता है।

मूल लेखक: Yejing Wang, Shengyu Zhou, Jinyu Lu, Qidong Liu, Xinhang Li, Wenlin Zhang, Feng Li, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng, Xiangyu Zhao

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yejing Wang, Shengyu Zhou, Jinyu Lu, Qidong Liu, Xinhang Li, Wenlin Zhang, Feng Li, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng, Xiangyu Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक रेस्टोरेंट चला रहे हैं। आपका लक्ष्य ग्राहक को उनके पहले खाए गए व्यंजनों के आधार पर एक बेहतरीन डिश की सिफारिश करना है।

पुराना तरीका (समस्या):
परंपरागत रूप से, जब आप अपने किचन स्टाफ (AI मॉडल) को प्रशिक्षित करते थे, तो आप उन्हें केवल उस डिश की एक विशिष्ट फोटो दिखाते थे जो ग्राहक ने पिछली बार वास्तव में ऑर्डर की थी। आप उनसे कहते थे, "इस सटीक फोटो को याद कर लो।"

  • कमी 1: वास्तविक दुनिया में, आप केवल एक डिश नहीं परोसते; आप बेहतरीन विकल्पों का एक पूरा मेनू पेश करते हैं। लेकिन आपके स्टाफ ने केवल एक विशिष्ट फोटो को कॉपी करना सीखा, इसलिए वे एक विविध, उच्च-गुणवत्ता वाला मेनू बनाने में संघर्ष करते हैं।
  • कमी 2: आपने हर बातचीत को एक जैसा माना। यदि किसी ग्राहक ने केवल मेनू आइटम को देखा, तो आपने उन्हें उतनी ही क्रेडिट दी जितनी कि अगर उन्होंने उसे खरीदा होता। लेकिन स्पष्ट रूप से, एक खरीदारी इस बात का कहीं अधिक मजबूत संकेत है कि वे क्या चाहते हैं, बजाय इसके कि उन्होंने केवल एक नज़र डाली। पुराने प्रशिक्षण ने इस अंतर के मूल्य की अनदेखी की।

नया समाधान: GFlowGR
शोधकर्ता एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे GFlowGR कहा जाता है। इसे ऐसे समझें जैसे आप अपने शेफ को केवल एक डिश की फोटो कॉपी करना नहीं, बल्कि स्वादों के 'प्रवाह' (flow) को समझना और एक पूरा मेनू बनाना सिखा रहे हैं, जहाँ सबसे अच्छे व्यंजन सबसे अधिक बार दिखाई दें।

वे Generative Flow Networks (GFlowNets) की अवधारणा का उपयोग करते हैं। यह सरल उपमाओं का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. "प्रवाह" की उपमा (The "Flow" Analogy)

कल्पना कीजिए कि पानी एक नेटवर्क के पाइपों के माध्यम से बह रहा है।

  • लक्ष्य: आप चाहते हैं कि पानी उन पाइपों में सबसे अधिक प्रवाहित हो जो "उच्च मूल्य" वाले गंतव्यों (जैसे कि एक स्वादिष्ट, लोकप्रिय डिश) की ओर ले जाते हैं।
  • पुराना तरीका: आप बस एक गंतव्य की ओर इशारा करते थे और कहते थे, "वहाँ जाओ!"
  • GFlowGR का तरीका: आप पाइपों को इस तरह सेट करते हैं कि किसी भी गंतव्य तक बहने वाला पानी का स्तर (प्रायिकता/probability) सीधे तौर पर इस बात के समानुपाती हो कि वह गंतव्य कितना "मूल्यवान" है। यदि कोई डिश एक "सुपर हिट" (उच्च पुरस्कार) है, तो वहां पानी की एक बड़ी धारा बहती है। यदि वह केवल एक "शायद" है, तो वहां केवल एक छोटी सी धार बहती है। यह सुनिश्चित करता है कि शेफ स्वाभाविक रूप से सर्वश्रेष्ठ विकल्पों को प्राथमिकता दे।

2. तीन मुख्य सामग्रियां (Three Key Ingredients)

इसे काम करने के योग्य बनाने के लिए, पेपर तीन विशिष्ट उपकरण पेश करता है:

  • "मेनू बिल्डर" (Trajectory Sampler):
    केवल उस एक डिश को देखने के बजाय जो ग्राहक ने खरीदी है, यह टूल पूरे इतिहास को देखता है: उन्होंने क्या खरीदा, उन्होंने किस पर क्लिक किया, उन्होंने क्या देखा लेकिन क्लिक नहीं किया, और यहाँ तक कि उन्होंने क्या नहीं देखा। यह कई संभावनाओं का एक "प्रशिक्षण मेनू" बनाता है ताकि शेफ एक "शायद" और एक "निश्चित हाँ" के बीच अंतर करना सीख सके।

  • "वैल्यू जज" (Reward Model):
    यह एक स्मार्ट स्कोरकीपर है। यह केवल "अच्छा" या "बुरा" नहीं कहता। यह विभिन्न संकेतों के आधार पर एक सूक्ष्म स्कोर देता है:

    • क्या उन्होंने खरीदा? (उच्च अंक)
    • क्या उन्होंने क्लिक किया? (मध्यम अंक)
    • क्या उन्होंने केवल देखा? (कम अंक)
    • क्या यह उनकी पिछली शैली से मेल खाता है? (बोनस अंक)
      यह स्कोर "फ्लो नेटवर्क" को ठीक-ठीक बताता है कि उस डिश की ओर कितना पानी बहना चाहिए।
  • "स्टेप-बाय-स्टेप कोच" (Token-Level Supervision):
    इन AI सिस्टमों में, एक डिश केवल एक शब्द नहीं है; यह टोकन का एक क्रम है (जैसे <Brand> <Flavor> <Size>)। पुराने तरीके केवल अंतिम परिणाम की जाँच करते थे। GFlowGR एक कोच की तरह कार्य करता है जो शेफ द्वारा उठाए गए हर एक कदम को देखता है। यदि शेफ शुरुआत में गलत "Brand" टोकन चुनता है, तो कोच तुरंत उसे सुधारता है, यह सुनिश्चित करता है कि पूरा रास्ता एक उच्च-मूल्य वाली डिश की ओर ले जाए।

3. वास्तविक दुनिया के परिणाम

शोधकर्ताओं ने केवल लैब में परीक्षण नहीं किया; उन्होंने इसे वास्तविक दुनिया में Taobao (एक विशाल चीनी ई-कॉमर्स प्लेटफॉर्म) पर आज़माया।

  • पैमाना: उन्होंने इसे सर्च एडवरटाइजिंग के लिए उपयोग किया, जो सैकड़ों मिलियन दैनिक उपयोगकर्ताओं को सेवा प्रदान करता है।
  • परिणाम: मध्य-2025 में लॉन्च होने के बाद से, इस सिस्टम ने वार्षिक राजस्व में 0.4% की वृद्धि की। हालांकि यह सुनने में छोटा लग सकता है, लेकिन इस आकार के प्लेटफॉर्म पर, यह अरबों डॉलर के अतिरिक्त मूल्य में बदल जाता है।
  • यह क्यों काम किया: सिस्टम उन उच्च-गुणवत्ता वाले आइटम्स की एक विविध श्रेणी दिखाने में बेहतर हो गया जो वास्तव में उपयोगकर्ताओं की खरीदने की इच्छा से मेल खाते थे, बजाय इसके कि केवल उन्हीं लोकप्रिय आइटम्स को दोहराया जाए।

सारांश में:
GFlowGR यह बदल देता है कि AI चीजों की सिफारिश करना कैसे सीखता है। एक एकल "सही उत्तर" को याद करने के बजाय, यह संभावनाओं के एक जटिल परिदृश्य को नेविगेट करना सीखता है, यह सुनिश्चित करता है कि सबसे मूल्यवान वस्तुओं पर सबसे अधिक ध्यान दिया जाए, जबकि उपयोगकर्ता को एक विविध और रोमांचक मेनू भी प्रदान किया जाए। यह एक कठोर "कॉपी-पेस्ट" प्रशिक्षण पद्धति को एक तरल, मूल्य-जागरूक सीखने की प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →