← नवीनतम पेपर
💻 computer science

Tokenizing Numerical and Embedding Features for LLM RecSys

यह शोध पत्र एक सॉफ्ट-टोकन फ्यूजन फ्रेमवर्क प्रस्तावित करता है जो एक इंटरेक्शन-आधारित मॉड्यूल के माध्यम से निरंतर संख्यात्मक और एम्बेडिंग फीचर्स को LLM एम्बेडिंग स्पेस में मैप करता है, जो मौजूदा LLM-आधारित बेसलाइन्स की तुलना में अनुशंसा बेंचमार्क पर रिट्रीवल प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Zhe Xu, Ankit Peshin, Chiyu Zhang, Feng Qi, Johnson Lui, Anil Ramakrishna, Justin Johnson, Carl Hu, Kaushik Rangadurai, Luke Simon

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhe Xu, Ankit Peshin, Chiyu Zhang, Feng Qi, Johnson Lui, Anil Ramakrishna, Justin Johnson, Carl Hu, Kaushik Rangadurai, Luke Simon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो कहानियाँ पढ़ने, चुटकुले समझने और किताबों के बारे में बातचीत करने में माहिर है। आप इस रोबोट को किसी ग्राहक के लिए एकदम सही वीडियो गेम या खिलौना सुझाने के लिए काम पर रखना चाहते हैं।

यहाँ समस्या यह है: रोबोट केवल "टेक्स्ट" (Text) बोलता है। वह "कूल," "महंगा," या "एक्शन-एडवेंचर" जैसे शब्दों को समझता है। लेकिन सिफारिशों की असली दुनिया बहुत उलझी हुई है। यह नंबरों (जैसे $19.99 का प्राइस टैग) और गुप्त कोडों (डेंस एम्बेडिंग्स) से भरी हुई है जिनका उपयोग अन्य कंप्यूटर सिस्टम यह जानने के लिए करते हैं कि उपयोगकर्ता को क्या पसंद है।

यदि आप बस रोबोट को कह देते हैं, "इस आइटम की कीमत 19.99 है," तो वह भ्रमित हो सकता है। क्या 19.99 एक तारीख है? एक स्कोर है? या एक बहुत छोटा नंबर? यदि आप बिना सोचे-समझे इन नंबरों और गुप्त कोडों को रोबोट के टेक्स्ट स्ट्रीम में मिला देते हैं, तो वे शोर में खो सकते हैं, जैसे किसी रॉक कॉन्सर्ट में फुसफुसाहट सुनने की कोशिश करना।

बड़ा विचार: "सॉफ्ट टोकन" ट्रांसलेटर
लेखकों ने एक चतुर समाधान निकाला जिसे सॉफ्ट-टोकन फ्यूजन (Soft-Token Fusion) कहा जाता है। इस रोबोट को कच्चे नंबर पढ़ाने के बजाय, उन्होंने एक विशेष ट्रांसलेटर बनाया। यह ट्रांसलेटर उन पेचीदा नंबरों और गुप्त कोडों को "सॉफ्ट टोकन्स" में बदल देता है।

एक सॉफ्ट टोकन को एक कस्टम-मेड, अदृश्य LEGO ईंट की तरह समझें। यह ऐसा शब्द नहीं है जिसे आप पढ़ सकें, बल्कि यह एक ऐसी आकृति है जिसे रोबोट पूरी तरह से समझता है। ट्रांसलेटर एक कीमत जैसे $19.99 को लेता है, उसे एक विशेष गणितीय कंबल (जिसे फूरियर फीचर्स कहा जाता है, जो एक चिकनी वक्र को तरंगों के विशिष्ट पैटर्न में बदलने जैसा है) में लपेटता है, और उसे एक सॉफ्ट टोकन में बदल देता है। अब, रोबोट इस "प्राइस ब्रिक" (कीमत की ईंट) को "टॉय डिस्क्रिप्शन ब्रिक" (खिलौने के विवरण की ईंट) के ठीक बगल में रख सकता है और समझ सकता है कि वे आपस में कैसे फिट होते हैं।

सीक्रेट सॉस: उन्हें एक-दूसरे से बात करने देना
शोधकर्ताओं ने इन ईंटों को रोबटेज को खिलाने के कई तरीके आजमाए।

  1. "बस ढेर लगा दो" वाला तरीका: उन्होंने बस टेक्स्ट, प्राइस-ब्रिक्स और कोड-ब्रिक्स को एक लाइन में डाल दिया। उन्होंने पाया कि यह काम नहीं करता है। यह LEGO के ढेर, एक किताब और एक सैंडविच को एक मेज पर फेंकने जैसा है और यह उम्मीद करने जैसा है कि रोबोट तुरंत समझ जाएगा कि कौन सा हिस्सा किसके साथ जाता है। रोबोट भ्रमित हो गया, और सिफारिशें बहुत अच्छी नहीं रहीं।
  2. "बातचीत" वाला तरीका (विजेता): उन्हें बस ढेर लगाने के बजाय, उन्होंने एक छोटा सा मीटिंग रूम (एक इंटरैक्शन-बेस्ड फ्यूजन मॉड्यूल) बनाया जहाँ प्राइस-ब्रिक्स और कोड-ब्रिक्स को रोबोट से मिलने से पहले आपस में चैट करने का मौका मिला। उन्होंने पता लगाया कि कीमत आइटम के गुप्त कोड से कैसे संबंधित है, संदेश को परिष्कृत किया, और फिर पूरे पैकेज को रोबोट के सामने प्रस्तुत किया।

उन्होंने क्या पाया
टीम ने अमेज़न के तीन विशाल वास्तविक डेटा सेट्स पर इसका परीक्षण किया: ब्यूटी (Beauty) उत्पाद, स्पोर्ट्स एंड आउटडोर्स (Sports and Outdoors) गियर, और टॉयज एंड गेम्स (Toys and Games)

  • परिणाम: जब उन्होंने "कन्वर्सेशन" (बातचीत) विधि का उपयोग किया, तो रोबोट सही आइटम चुनने में बहुत बेहतर रहा।
    • ब्यूटी डेटासेट पर, "कन्वर्सेशन" विधि ने 0.0459 का Recall@5 स्कोर प्राप्त किया, जो "बस ढेर लगा दो" विधि को पछाड़ दिया जो केवल 0.0423 ही था।
    • स्पोर्ट्स एंड आउटडोर्स पर, "कन्वर्सेशन" विधि ने 0.0253 हासिल किया, जबकि सरल ढेर लगाने वाली विधि 0.0220 तक गिर गई।
    • टॉयज एंड गेम्स पर, सुधार बहुत बड़ा था। "कन्वर्सेशन" विधि ने 0.0695 का स्कोर किया, जबकि सरल ढेर लगाने वाली विधि वास्तव में केवल टेक्स्ट का उपयोग करने से भी खराब प्रदर्शन कर गई, जिसका स्कोर केवल 0.0575 था।

उन्होंने किसे खारिज कर दिया
पेपर स्पष्ट रूप से कुछ चीजों के खिलाफ तर्क देता है:

  • सब कुछ बस मिला मत दो: संख्यात्मक विशेषताओं और टेक्स्ट विशेषताओं को एक लंबी सूची में बस जोड़ देना (डायरेक्ट कॉन्कैटिनेशन) समाधान नहीं है। वास्तव में, टॉय डेटासेट पर, यह सरल विधि केवल टेक्स्ट का उपयोग करने से भी बदतर प्रदर्शन करती है।
  • नंबरों को सिर्फ शब्दों में मत बदलो: आप सिर्फ "नाइन्टीन पॉइंट नाइन नाइन" लिख सकते हैं और उम्मीद कर सकते हैं कि रोबोट गणित को समझ जाएगा। नंबरों को उपयोगी होने के लिए निरंतर, चिकने संकेतों (सॉफ्ट टोकन्स) के रूप में रहना चाहिए।
  • मीटिंग को मत छोड़ो: आप कच्चे डेटा को रोबोट को दिए बिना यह नहीं मान सकते कि अलग-अलग प्रकार के डेटा (कीमत बनाम कोड) आपस में क्रिया करेंगे।

वे कितने आश्वस्त हैं?
लेखक अपने परिणामों को लेकर काफी आश्वस्त हैं क्योंकि उन्होंने केवल सिमुलेशन नहीं, बल्कि वास्तविक डेटा पर वास्तविक प्रयोग चलाए हैं। उन्होंने अपने नए तरीके की तुलना कई अन्य प्रसिद्ध अनुशंसा प्रणालियों (जैसे GRU4Rec, SASRec, और TIGER) से की।

परिणाम एक सूक्ष्म तस्वीर दिखाते हैं: टॉयज एंड गेम्स डेटासेट पर, उनका तरीका पिछले शीर्ष दावेदार, TIGER को महत्वपूर्ण अंतर से पीछे छोड़ गया (Recall@5 को 0.0521 से बढ़ाकर 0.0695 करना)। हालाँकि, ब्यूटी और स्पोर्ट्स एंड आउटडोर्स डेटासेट पर, TIGER रैंकिंग-सेंसिटिव NDCG मेट्रिक्स पर प्रतिस्पर्धी बना रहा, भले ही नया मॉडल Recall@10 पर अधिक मजबूत था। यह दर्शाता है कि जबकि यह नया तरीका अत्यधिक प्रभावी है, सबसे अच्छा दृष्टिकोण इस बात पर निर्भर कर सकता है कि आप किस विशिष्ट मेट्रिक की परवाह करते हैं।

निष्कर्ष
पेपर सुझाव देता है कि यदि आप चाहते हैं कि एक सुपर-स्मार्ट लैंग्वेज मॉडल एक बेहतरीन रेकमेंडर बने, तो आप उसे केवल टेक्स्ट नहीं दे सकते। आपको नंबरों और गुप्त कोडों को उस भाषा में अनुवाद करना होगा जिसे वह समझता है (सॉफ्ट टोकन्स) और सबसे महत्वपूर्ण बात यह है कि उन अलग-अलग सूचनाओं को रोबोट से मिलने से पहले एक-दूसरे से बात करने देना होगा। यह केवल अधिक जानकारी होने के बारे में नहीं है; यह इस बारे में है कि आप उस जानकारी को मस्तिष्क में कैसे पेश करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →