Tokenizing Numerical and Embedding Features for LLM RecSys
यह शोध पत्र एक सॉफ्ट-टोकन फ्यूजन फ्रेमवर्क प्रस्तावित करता है जो एक इंटरेक्शन-आधारित मॉड्यूल के माध्यम से निरंतर संख्यात्मक और एम्बेडिंग फीचर्स को LLM एम्बेडिंग स्पेस में मैप करता है, जो मौजूदा LLM-आधारित बेसलाइन्स की तुलना में अनुशंसा बेंचमार्क पर रिट्रीवल प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो कहानियाँ पढ़ने, चुटकुले समझने और किताबों के बारे में बातचीत करने में माहिर है। आप इस रोबोट को किसी ग्राहक के लिए एकदम सही वीडियो गेम या खिलौना सुझाने के लिए काम पर रखना चाहते हैं।
यहाँ समस्या यह है: रोबोट केवल "टेक्स्ट" (Text) बोलता है। वह "कूल," "महंगा," या "एक्शन-एडवेंचर" जैसे शब्दों को समझता है। लेकिन सिफारिशों की असली दुनिया बहुत उलझी हुई है। यह नंबरों (जैसे $19.99 का प्राइस टैग) और गुप्त कोडों (डेंस एम्बेडिंग्स) से भरी हुई है जिनका उपयोग अन्य कंप्यूटर सिस्टम यह जानने के लिए करते हैं कि उपयोगकर्ता को क्या पसंद है।
यदि आप बस रोबोट को कह देते हैं, "इस आइटम की कीमत 19.99 है," तो वह भ्रमित हो सकता है। क्या 19.99 एक तारीख है? एक स्कोर है? या एक बहुत छोटा नंबर? यदि आप बिना सोचे-समझे इन नंबरों और गुप्त कोडों को रोबोट के टेक्स्ट स्ट्रीम में मिला देते हैं, तो वे शोर में खो सकते हैं, जैसे किसी रॉक कॉन्सर्ट में फुसफुसाहट सुनने की कोशिश करना।
बड़ा विचार: "सॉफ्ट टोकन" ट्रांसलेटर
लेखकों ने एक चतुर समाधान निकाला जिसे सॉफ्ट-टोकन फ्यूजन (Soft-Token Fusion) कहा जाता है। इस रोबोट को कच्चे नंबर पढ़ाने के बजाय, उन्होंने एक विशेष ट्रांसलेटर बनाया। यह ट्रांसलेटर उन पेचीदा नंबरों और गुप्त कोडों को "सॉफ्ट टोकन्स" में बदल देता है।
एक सॉफ्ट टोकन को एक कस्टम-मेड, अदृश्य LEGO ईंट की तरह समझें। यह ऐसा शब्द नहीं है जिसे आप पढ़ सकें, बल्कि यह एक ऐसी आकृति है जिसे रोबोट पूरी तरह से समझता है। ट्रांसलेटर एक कीमत जैसे $19.99 को लेता है, उसे एक विशेष गणितीय कंबल (जिसे फूरियर फीचर्स कहा जाता है, जो एक चिकनी वक्र को तरंगों के विशिष्ट पैटर्न में बदलने जैसा है) में लपेटता है, और उसे एक सॉफ्ट टोकन में बदल देता है। अब, रोबोट इस "प्राइस ब्रिक" (कीमत की ईंट) को "टॉय डिस्क्रिप्शन ब्रिक" (खिलौने के विवरण की ईंट) के ठीक बगल में रख सकता है और समझ सकता है कि वे आपस में कैसे फिट होते हैं।
सीक्रेट सॉस: उन्हें एक-दूसरे से बात करने देना
शोधकर्ताओं ने इन ईंटों को रोबटेज को खिलाने के कई तरीके आजमाए।
- "बस ढेर लगा दो" वाला तरीका: उन्होंने बस टेक्स्ट, प्राइस-ब्रिक्स और कोड-ब्रिक्स को एक लाइन में डाल दिया। उन्होंने पाया कि यह काम नहीं करता है। यह LEGO के ढेर, एक किताब और एक सैंडविच को एक मेज पर फेंकने जैसा है और यह उम्मीद करने जैसा है कि रोबोट तुरंत समझ जाएगा कि कौन सा हिस्सा किसके साथ जाता है। रोबोट भ्रमित हो गया, और सिफारिशें बहुत अच्छी नहीं रहीं।
- "बातचीत" वाला तरीका (विजेता): उन्हें बस ढेर लगाने के बजाय, उन्होंने एक छोटा सा मीटिंग रूम (एक इंटरैक्शन-बेस्ड फ्यूजन मॉड्यूल) बनाया जहाँ प्राइस-ब्रिक्स और कोड-ब्रिक्स को रोबोट से मिलने से पहले आपस में चैट करने का मौका मिला। उन्होंने पता लगाया कि कीमत आइटम के गुप्त कोड से कैसे संबंधित है, संदेश को परिष्कृत किया, और फिर पूरे पैकेज को रोबोट के सामने प्रस्तुत किया।
उन्होंने क्या पाया
टीम ने अमेज़न के तीन विशाल वास्तविक डेटा सेट्स पर इसका परीक्षण किया: ब्यूटी (Beauty) उत्पाद, स्पोर्ट्स एंड आउटडोर्स (Sports and Outdoors) गियर, और टॉयज एंड गेम्स (Toys and Games)।
- परिणाम: जब उन्होंने "कन्वर्सेशन" (बातचीत) विधि का उपयोग किया, तो रोबोट सही आइटम चुनने में बहुत बेहतर रहा।
- ब्यूटी डेटासेट पर, "कन्वर्सेशन" विधि ने 0.0459 का Recall@5 स्कोर प्राप्त किया, जो "बस ढेर लगा दो" विधि को पछाड़ दिया जो केवल 0.0423 ही था।
- स्पोर्ट्स एंड आउटडोर्स पर, "कन्वर्सेशन" विधि ने 0.0253 हासिल किया, जबकि सरल ढेर लगाने वाली विधि 0.0220 तक गिर गई।
- टॉयज एंड गेम्स पर, सुधार बहुत बड़ा था। "कन्वर्सेशन" विधि ने 0.0695 का स्कोर किया, जबकि सरल ढेर लगाने वाली विधि वास्तव में केवल टेक्स्ट का उपयोग करने से भी खराब प्रदर्शन कर गई, जिसका स्कोर केवल 0.0575 था।
उन्होंने किसे खारिज कर दिया
पेपर स्पष्ट रूप से कुछ चीजों के खिलाफ तर्क देता है:
- सब कुछ बस मिला मत दो: संख्यात्मक विशेषताओं और टेक्स्ट विशेषताओं को एक लंबी सूची में बस जोड़ देना (डायरेक्ट कॉन्कैटिनेशन) समाधान नहीं है। वास्तव में, टॉय डेटासेट पर, यह सरल विधि केवल टेक्स्ट का उपयोग करने से भी बदतर प्रदर्शन करती है।
- नंबरों को सिर्फ शब्दों में मत बदलो: आप सिर्फ "नाइन्टीन पॉइंट नाइन नाइन" लिख सकते हैं और उम्मीद कर सकते हैं कि रोबोट गणित को समझ जाएगा। नंबरों को उपयोगी होने के लिए निरंतर, चिकने संकेतों (सॉफ्ट टोकन्स) के रूप में रहना चाहिए।
- मीटिंग को मत छोड़ो: आप कच्चे डेटा को रोबोट को दिए बिना यह नहीं मान सकते कि अलग-अलग प्रकार के डेटा (कीमत बनाम कोड) आपस में क्रिया करेंगे।
वे कितने आश्वस्त हैं?
लेखक अपने परिणामों को लेकर काफी आश्वस्त हैं क्योंकि उन्होंने केवल सिमुलेशन नहीं, बल्कि वास्तविक डेटा पर वास्तविक प्रयोग चलाए हैं। उन्होंने अपने नए तरीके की तुलना कई अन्य प्रसिद्ध अनुशंसा प्रणालियों (जैसे GRU4Rec, SASRec, और TIGER) से की।
परिणाम एक सूक्ष्म तस्वीर दिखाते हैं: टॉयज एंड गेम्स डेटासेट पर, उनका तरीका पिछले शीर्ष दावेदार, TIGER को महत्वपूर्ण अंतर से पीछे छोड़ गया (Recall@5 को 0.0521 से बढ़ाकर 0.0695 करना)। हालाँकि, ब्यूटी और स्पोर्ट्स एंड आउटडोर्स डेटासेट पर, TIGER रैंकिंग-सेंसिटिव NDCG मेट्रिक्स पर प्रतिस्पर्धी बना रहा, भले ही नया मॉडल Recall@10 पर अधिक मजबूत था। यह दर्शाता है कि जबकि यह नया तरीका अत्यधिक प्रभावी है, सबसे अच्छा दृष्टिकोण इस बात पर निर्भर कर सकता है कि आप किस विशिष्ट मेट्रिक की परवाह करते हैं।
निष्कर्ष
पेपर सुझाव देता है कि यदि आप चाहते हैं कि एक सुपर-स्मार्ट लैंग्वेज मॉडल एक बेहतरीन रेकमेंडर बने, तो आप उसे केवल टेक्स्ट नहीं दे सकते। आपको नंबरों और गुप्त कोडों को उस भाषा में अनुवाद करना होगा जिसे वह समझता है (सॉफ्ट टोकन्स) और सबसे महत्वपूर्ण बात यह है कि उन अलग-अलग सूचनाओं को रोबोट से मिलने से पहले एक-दूसरे से बात करने देना होगा। यह केवल अधिक जानकारी होने के बारे में नहीं है; यह इस बारे में है कि आप उस जानकारी को मस्तिष्क में कैसे पेश करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।