Bridging Textual Profiles and Latent User Embeddings for Personalization
यह शोध पत्र BLUE को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो व्याख्यात्मक पाठ्य उपयोगकर्ता प्रोफाइलों को विभेदात्मक विलुप्त एम्बेडिंग (discriminative latent embeddings) के साथ एकीकृत करता है, जिससे भाषा-आधारित प्रोफाइलों को एम्बेडिंग-स्पेस रिवॉर्ड संकेतों के साथ संरेखित करके ज़ीरो-शॉट अनुक्रमिक अनुशंसा (zero-shot sequential recommendation) और क्रॉस-डोमेन स्थानांतरण में बेहतर प्रदर्शन प्राप्त किया जाता है, साथ ही प्रश्न उत्तर के लिए व्यक्तिगत संदर्भ को भी बढ़ाया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Bridging Textual Profiles and Latent User Embeddings for Personalization" (BLUE) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।
बड़ी समस्या: दो अलग-अलग भाषाएँ
कल्प_ना कीजिए कि आप किसी ग्राहक को समझने की कोशिश कर रहे हैं ताकि उन्हें सही उत्पाद (product) सुझा सकें। आपके पास इस ग्राहक का वर्णन करने के दो तरीके हैं, लेकिन वे अलग-अलग भाषाएँ बोलते हैं:
- "ब्लैक बॉक्स" वेक्टर (Latent Embedding): यह एक गुप्त कोड या एक सघन गणितीय फिंगरप्रिंट की तरह है। कंप्यूटर इसे पसंद करता है क्योंकि यह मिलान खोजने के लिए अविश्वसनीय रूप से तेज़ और कुशल है। हालाँकि, यह मनुष्यों के लिए एक रहस्य है। यदि आप कंप्यूटर से पूछें, "आपने यह क्यों सुझाया?" तो वह खुद को स्पष्ट नहीं कर सकता; वह बस उस कोड की ओर इशारा करता है। यह एक GPS की तरह है जो जानता है कि कहाँ जाना है, लेकिन यह नहीं बता सकता कि उसने वह रास्ता क्यों चुना।
- "कहानी" वाला प्रोफाइल (Textual Profile): यह एक लिखित सारांश है, जैसे ग्राहक की पसंद की जीवनी। "यह व्यक्ति हाइकिंग पसंद करता है, तीखा खाना नापसंद करता है, और अपने बच्चों के लिए उपहार खरीदता है।" मनुष्य इसे इसलिए पसंद करते हैं क्योंकि इसे पढ़ना और समझना आसान है। लेकिन कंप्यूटर अक्सर इन कहानियों को प्रभावी ढंग से उपयोग करने में संघर्ष करते हैं क्योंकि इन्हें तेज़ खोज के लिए आवश्यक गणित में बदलना कठिन होता है।
अंतराल (The Gap): मौजूदा सिस्टम आमतौर पर या तो एक को चुनते हैं या दूसरे को। वे या तो तेज़-लेकिन-रहस्यमयी कोड का उपयोग करते हैं (जो रैंकिंग के लिए बेहतरीन है, लेकिन समझाने के लिए बुरा है) या फिर पढ़ने योग्य कहानी का (जो समझाने के लिए बेहतरीन है, लेकिन परिणामों के लिए अनुकूलित करना कठिन है)।
समाधान: BLUE (द ट्रांसलेटर)
लेखकों ने BLUE (Bridging textuaL profiles and latent User Embeddings) नामक एक सिस्टम बनाया है। BLUE को एक अनुवादक (translator) के रूप में सोचें जो "कहानी" को "ब्लैक बॉक्स" की भाषा बोलना सिखाता है, और इसके विपरीत भी।
BLUE एक रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) दृष्टिकोण का उपयोग करता है। कल्पना कीजिए कि एक छात्र (AI) ग्राहक का सारांश लिखने की कोशिश कर रहा है।
- शिक्षक: एक "प्रोफेसर" AI (एक लार्ज लैंग्वेज मॉडल) कहानी लिखता है।
- न्यायाधीश: एक "गणित" AI (एक एम्बेडिंग मॉडल) न्यायाधीश के रूप में कार्य करता है। उसे इस बात से फर्क नहीं पड़ता कि कहानी कितनी सुंदर है; उसे इस बात से फर्क पड़ता है कि क्या वह कहानी उसे सही उत्पाद खोजने में मदद करती है।
यह कैसे काम करता है: ट्रेनिंग जिम
BLUE छात्र AI को दो प्रकार के पुरस्कारों (rewards) का उपयोग करके प्रशिक्षित करता है, जैसे कि दो स्कोरबोर्ड वाला एक वीडियो गेम:
मैथ स्कोर (एम्बेडिंग स्पेस रिवॉर्ड):
- छात्र एक प्रोफाइल लिखता है।
- "गणित न्यायाधीश" उस प्रोफाइल को एक गुप्त कोड में बदल देता है।
- न्यायाधीश जाँचता है: "क्या यह कोड उस वस्तु के करीब है जिसे उपयोगकर्ता ने वास्तव में अगली बार खरीदा था?"
- यदि कोड सही वस्तु के करीब है, तो छात्र को उच्च स्कोर मिलता है। यदि यह दूर है, तो उसे कम स्कोर मिलता है।
- उपमा: यह एक डार्ट्स खिलाड़ी की तरह है। छात्र एक डार्ट फेंकता है (प्रोफाइल)। न्यायाधीश जाँचता है कि क्या वह बुल्सआई (सही उत्पाद) पर लगा या नहीं। छात्र बेहतर डार्ट फेंकना सीखता है।
स्टोरी स्कोर (टेक्स्ट स्पेस रिवॉर्ड):
- छात्र एक प्रोफाइल लिखता है।
- सिस्टम पूछता है: "केवल इस कहानी के आधार पर, क्या आप अनुमान लगा सकते हैं कि उपयोगकर्ता आगे क्या खरीदेगा?"
- यदि कहानी में पर्याप्त स्पष्ट संकेत हैं जो सही अनुमान लगाने में मदद करते हैं, तो छात्र को बोनस स्कोर मिलता है।
- उपमा: यह सुनिश्चित करता है कि कहानी केवल गणितीय रूप से काम करने वाला निरर्थक शब्द समूह नहीं है। इसे एक अच्छी कहानी होनी चाहिए जो वास्तव में उपयोगकर्ता की प्राथमिकताओं को समझा सके।
परिणाम: AI ऐसी कहानियाँ लिखना सीख जाता है जो न केवल मनुष्यों के लिए पढ़ने में आसान हैं, बल्कि गणित के लिए भी अनुकूलित (optimized) हैं।
उन्होंने क्या पाया (परिणाम)
शोधकर्ताओं ने Amazon (कपड़े, किताबें, इलेक्ट्रॉनिक्स) और Google Local Reviews के वास्तविक डेटा पर BLUE का परीक्षण किया।
- बेहतर सिफारिशें: भले ही उन्होंने एक "फ्रोजन" (अपरिवर्तनीय) गणित मॉडल का उपयोग किया हो, BLUE के टेक्स्ट प्रोफाइल ने सिस्टम को केवल क्लिक के कच्चे इतिहास को फीड करने की तुलना में बहुत बेहतर तरीके से आइटम सुझाने में मदद की। यह कंप्यूटर को उपयोगकर्ता की आदतों का सटीक सारांश देने वाले "चीट शीट" देने जैसा था।
- क्रॉस-डोमेन जादू: उन्होंने BLUE को कपड़ों के डेटा पर प्रशिक्षित किया और इसका परीक्षण किताबों और इलेक्ट्रॉनिक्स पर किया। BLUE इन नए क्षेत्रों में आश्चर्यजनक रूप से अच्छा काम करता है। ऐसा लगता है कि जो "कहानियाँ" इसने सीखीं, वे सामान्य मानवीय प्राथमिकताओं (जैसे "आराम पसंद करना" या "बच्चों के लिए खरीदना") को पकड़ती हैं जो विभिन्न प्रकार के उत्पादों पर लागू होती हैं।
- बेहतर बातचीत: जब उन्होंने इन प्रोफाइल्स का उपयोग प्रश्नों का उत्तर देने के लिए किया (जैसे, "यह उपयोगकर्ता आगे क्या खरीदेगा?"), तो उनके उत्तर कच्चे डेटा या अन्य तरीकों की तुलना में अधिक सटीक थे। प्रोफाइल्स ने AI के लिए एक आदर्श "संदर्भ" (context) के रूप में कार्य किया ताकि वह उपयोगकर्ता को समझ सके।
"सीक्रेट सॉस" (The Secret Sauce)
पेपर इस बात पर जोर देता है कि BLUE केवल AI को बेहतर तरीके से बात करना ही नहीं सिखाता, बल्कि यह भी सिखाता है कि क्या महत्वपूर्ण है उसके बारे में सोचना।
- एक केस स्टडी में, एक उपयोगकर्ता ने वर्क पैंट, सैंडल और कुछ बेबी क्लोथ्स खरीदे।
- अन्य तरीकों ने भ्रमित होकर यह सोचा कि उपयोगकर्ता मुख्य रूप से वर्कवियर या केवल रैंडम एक्सेसरीज में रुचि रखता है।
- BLUE के प्रोफाइल ने सही ढंग से पहचान की कि उपयोगकर्ता की बच्चों के कपड़ों (children's apparel) में एक मजबूत, निरंतर रुचि थी (भले ही यह इतिहास का एक छोटा हिस्सा था) और इसने अगले बेबी आइटम की सही भविष्यवाणी की। इसने "शोर" (noise) को फ़िल्टर करना और "सिग्नल" (signal) पर ध्यान केंद्रित करना सीख लिया।
सारांश
BLUE उपयोगकर्ता प्रोफाइल बनाने का एक नया तरीका है। यह AI को ऐसे सारांश लिखने के लिए मजबूर करता है जो मनुष्यों के लिए पठनीय हैं लेकिन गणित के लिए अनुकूलित हैं। यह कंप्यूटर विज्ञान के "ब्लैक बॉक्स" और मानव भाषा की "कहानी सुनाने" की कला के बीच के अंतर को पाटता है, जिसके परिणामस्वरूप बेहतर आइटम सुझाने वाले और अपने विकल्पों को अधिक स्पष्ट रूप से समझाने वाले सिस्टम बनते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।