TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems
TokenMinds एक औद्योगिक-स्तर का सिस्टम है जो PLUM फ्रेमवर्क का विस्तार करता है ताकि एक पूर्व-प्रशिक्षित LLM आर्किटेक्चर के माध्यम से डिस्क्रीट (discrete), सिमेंटिक रूप से ग्राउंडेड यूजर टोकन और डेंस एम्बेडिंग्स दोनों को जनरेट किया जा सके, जो लागत कम करने के लिए लॉन्ग-फॉर्म और शॉर्ट-फॉर्म वीडियो व्यवहारों को सफलतापूर्वक एकीकृत करता है और बड़े पैमाने पर YouTube रैंकिंग सिस्टम में पूरक मूल्य प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी व्यक्ति की फिल्मों की पसंद को समझने की कोशिश कर रहे हैं। पुराने दिनों में, रिकमेंडेशन सिस्टम (जैसे YouTube पर) यह करने के लिए एक व्यक्ति के वीडियो देखने के पूरे इतिहास को एक ही, छोटे, घने "समरी कार्ड" (summary card) में समेटने की कोशिश करते थे। इसे ऐसे समझें जैसे किसी पूरे उपन्यास का वर्णन एक स्टिकी नोट पर केवल एक वाक्य लिखकर करने की कोशिश करना। इसमें आप बहुत सारी बारीकियों, विशिष्ट विवरणों और अनूठी शैली को खो देते हैं।
अन्य सिस्टमों ने उपयोगकर्ता के बारे में एक लंबा, विस्तृत पैराग्राफ लिखने की कोशिश की। लेकिन वे पैराग्राफ अक्सर अस्पष्ट होते थे, जो सामान्य विषयों (जैसे "उन्हें बिल्लियाँ पसंद हैं") को तो पकड़ लेते थे, लेकिन उन विशिष्ट, गहरे पैटर्न को नहीं जो उन्होंने वास्तव में कब और क्या देखा था।
TokenMinds एक नया सिस्टम है जिसे Google DeepMind और YouTube द्वारा बनाया गया है जो इसे डिस्क्रीट टोकन (discrete tokens - जैसे विशिष्ट, अर्थपूर्ण कोडों का एक सेट) से बने "डिजिटल आईडी कार्ड" के माध्यम से हल करता है और साथ ही पुराने "समरी कार्ड" (dense embeddings) को बैकअप के रूप में रखता है।
यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ दिया गया है:
1. "सिमेंटिक आईडी" (The Semantic ID - जादुई पिन कोड)
हर वीडियो को एक रैंडम नंबर (जैसे "वीडियो #49201") देने के बजाय, TokenMinds हर वीडियो को एक सिमेंटिक आईडी (SID) देता है।
- उपमा: कल्पना कीजिए कि हर वीडियो का एक "पिन कोड" है जो इस आधार पर है कि वह वास्तव में किस बारे में है। "सोरडो ब्रेड (sourdough bread) पकाने" के वीडियो का पिन कोड
Food-Baking-Breadसे शुरू हो सकता है। "सिंक ठीक करने" के वीडियो का कोडHome-Plumbingसे शुरू हो सकता है। - यह कैसे मदद करता है: यदि कोई उपयोगकर्ता "सोरडो" के वीडियो को देखता है, तो सिस्टम केवल एक रैंडम नंबर नहीं देखता; वह कोड के "Food-Baking" वाले हिस्से को देखता है। यह सिस्टम को देखने के पीछे के अर्थ को समझने में मदद करता है, न कि केवल आईडी को।
2. "डुअल-आउटपुट" इंजन (The Dual-Output Engine - दो औजारों वाला किट)
TokenMinds एक विशेष AI आर्किटेक्चर (एनकोडर-डिकोडर) का उपयोग करता है जो एक स्विस आर्मी नाइफ की तरह काम करता है। यह एक साथ दो चीजें बनाता है:
- डेंस एम्बेडिंग (The Dense Embedding - समरी कार्ड): यह पुराना तरीका है, जो निरंतर नंबर वेक्टर (continuous number vector) है जिसे मौजूदा सिस्टम पहले से ही उपयोग करना जानते हैं। यह उपयोगकर्ता के 'वाइब' के एक त्वरित स्नैपशॉट की तरह है।
- SID टोकन (The SID Tokens - विस्तृत कोड): यह नया हिस्सा है। AI उपयोगकर्ता की भविष्य की रुचियों का प्रतिनिधित्व करने वाले विशिष्ट "पिन कोड्स" की एक सूची बनाता है। यह ऐसा है जैसे AI कह रहा हो, "आपने जो देखा उसके आधार पर, आपको ये चीजें पसंद आ सकती हैं:
Food-Baking-Bread,Tech-Coding-Python, औरSports-Basketball।"
लाभ: सिस्टम को दोनों का सबसे अच्छा मिश्रण मिलता है। यह पुराने सिस्टमों को खुश रखता है (समरी कार्ड का उपयोग करके) और साथ ही सटीक, सिमेंटिक समझ (टोकन) की एक नई परत जोड़ता है। पेपर में पाया गया कि इन दोनों को एक साथ उपयोग करना, अकेले किसी एक का उपयोग करने से बेहतर काम करता है।
3. "एसिंक्रोनस" डिलीवरी (The Asynchronous Delivery - प्री-ऑर्डर सिस्टम)
इन विस्तृत टोकन को बनाना भारी काम है, जैसे कोई जटिल भोजन पकाना। यदि आप ग्राहक के काउंटर पर इंतजार करने के दौरान ही खाना पकाने की कोशिश करेंगे, तो यह बहुत धीमा होगा।
- उपमा: TokenMinds एक "प्री-ऑर्डर" सिस्टम का उपयोग करता है। यह उपयोगकर्ता के ब्राउज़ करने के दौरान बैकग्राउंड (asynchronously) में उपयोगकर्ता का "आईडी कार्ड" और "टोकन" तैयार करता है। जब उपयोगकर्ता वास्तव में "रिकमेंड" पर क्लिक करता है, तो सिस्टम बस एक तेज़ स्टोरेज लॉकर से पहले से बना हुआ कार्ड उठा लेता है। इसका मतलब है कि सिस्टम बिना धीमे हुए अरबों उपयोगकर्ताओं को संभाल सकता है।
4. "यूनिवर्सल ट्रांसलेटर" (The Universal Translator - सभी वीडियो के लिए एक मॉडल)
YouTube में दो बहुत अलग प्रकार के वीडियो होते हैं: लॉन्ग-फॉर्म (जैसे 20 मिनट की डॉक्यूमेंट्री) और शॉर्ट-फॉर्म (जैसे 15 सेकंड के शॉर्ट्स)। आमतौर पर, आपको इन्हें समझने के लिए दो अलग-अलग मॉडल की आवश्यकता होती है क्योंकि लोग इन्हें अलग तरह से देखते हैं।
- उपमा: TokenMinds एक यूनिवर्सल ट्रांसलेटर की तरह है। यह दोनों (लॉन्ग और शॉर्ट वीडियो) के लिए एक ही "पिन कोड" सिस्टम का उपयोग करता है। यह एक उपयोगकर्ता के 20 मिनट के कुकिंग शो और 15 सेकंड के कुकिंग हैक देखने के इतिहास को देख सकता है और समझ सकता है, "आह, इस व्यक्ति को कुकिंग पसंद है!"
- परिणाम: दो अलग-अलग महंगे मॉडल चलाने के बजाय, वे एक ही काम करने के लिए एक मॉडल का उपयोग करते हैं। इससे उनकी कंप्यूटिंग लागत ट्रेनिंग के लिए 50% और सर्विंग (serving) के लिए 31% कम हो गई।
5. परिणाम (The Results - प्रमाण)
टीम ने वास्तविक YouTube ट्रैफिक (अरबों उपयोगकर्ताओं) पर इसका परीक्षण किया।
- बेहतर रिकमेंडेशन: जब उन्होंने इन नए टोकन को रैंकिंग सिस्टम में जोड़ा, तो उन्होंने देखा कि लोगों की वीडियो के साथ जुड़ाव (engagement) और संतुष्टि में मापने योग्य वृद्धि हुई।
- दक्षता (Efficiency): लॉन्ग और शॉर्ट वीडियो मॉडल को मिलाकर, उन्होंने कंप्यूटर की शक्ति की भारी बचत की।
- विविधता (Diversity): सिस्टम ने केवल एक ही चीज़ का अनुमान नहीं लगाया; इसने संभावित रुचियों की एक विविध सूची बनाई, बिल्कुल वैसे ही जैसे एक मानव मित्र उन चीजों का सुझाव देता है जो आपको पसंद आ सकती हैं।
संक्षेप में: TokenMinds, उपयोगकर्ताओं की पसंद को समझने का एक स्मार्ट और अधिक कुशल तरीका है। यह किसी व्यक्ति की जटिल पसंद को एक एकल संख्या में समेटने के बजाय, उन्हें उनके हितों का वर्णन करने वाले "अर्थपूर्ण कोडों" का एक सेट देता है, और यह सब एक ही, लागत प्रभावी इंजन के माध्यम से होता है जो सभी प्रकार की वीडियो सामग्री को संभाल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।