WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture
यह शोध पत्र WHALE को प्रस्तुत करता है, जो एक स्केलेबल यूनिफाइड रिकमेंडेशन आर्किटेक्चर है जो गैर-अनुक्रमिक (non-sequence) और अनुक्रमिक (sequence) विशेषताओं को संयुक्त रूप से मॉडल करने के लिए एक नवीन फ्यूजन मैकेनिज्म के माध्यम से Wukong और HSTU बैकबोन को एकीकृत करता है, जिससे औद्योगिक उत्पादन प्रणालियों में महत्वपूर्ण ऑफलाइन और ऑनलाइन प्रदर्शन लाभ प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे डिजिटल शहर में घूम रहे हैं जहाँ लाखों लोग लगातार स्क्रॉल, क्लिक और देख रहे हैं। यह ऑनलाइन अनुशंसा प्रणालियों (recommendation systems) की दुनिया है, जो आपके सोशल मीडिया फीड, वीडियो सुझावों और खरीदारी की सूचियों के पीछे के अदृश्य इंजन हैं। उनका काम यह अनुमान लगाना है कि आप आगे क्या देखना चाहते हैं। ऐसा करने के लिए, वे आमतौर पर दो बहुत अलग प्रकार के सुरागों को देखते हैं। पहला, आपकी "स्थिर" (static) जानकारी: आप कौन हैं, आपको क्या पसंद है, दिन का समय क्या है, और दिखाई जा रही विशिष्ट वस्तु क्या है। यह एक जासूस की तरह है जो संदिग्ध की फाइल और अपराध स्थल को देख रहा हो। दूसरा, आपकी "गतिशील" (dynamic) क्रियाएं: आपके द्वारा अतीत में क्लिक किए गए, देखे गए या खरीदे गए हर चीज़ का एक लंबा, उलझा हुआ निशान। यह एक जासूस की तरह है जो किसी संदिग्ध के पूरे जीवन की कहानी को वास्तविक समय में unfolding होते हुए देख रहा है।
लंबे समय तक, अनुशंसा प्रणालियों ने इन दो सुरागों को अलग-अलग माना। कुछ अति-बुद्धिमान मॉडल स्थिर विवरणों को मिलाने में माहिर थे (जैसे "यह उपयोगकर्ता विज्ञान कथा पसंद करता है" + "आज शुक्रवार की रात है"), जबकि अन्य मॉडल आपके पिछले व्यवहार की लंबी कहानी को पढ़ने में विशेषज्ञ थे (जैसे "आपने लगातार तीन अंतरिक्ष फिल्में देखी हैं, इसलिए आप शायद चौथी देखना चाहते हैं")। बड़ा सवाल यह था: क्या हम एक ऐसा सुपर-मॉडल बना सकते हैं जो बिना बहुत धीमा या बहुत महंगा हुए, दोनों में समान रूप से निपुण हो? यदि हम ऐसा कर सके, तो इसका मतलब होगा कि ऐसी सामग्री देखना जो बिल्कुल वैसी ही हो जैसी आप चाहते हैं—जो आपके व्यक्तित्व और आपकी हालिया गतिविधियों, दोनों के साथ पूरी तरह मेल खाती हो।
यहीं से WHALE आता है, एक नया आर्किटेक्चर जिसे मेटा के शोधकर्ताओं द्वारा विकसित किया गया है जो इस पहेली को सुलझाने की कोशिश करता है। WHALE को एक विशाल, बहु-स्तरीय टीम के रूप में सोचें जो मिलकर काम कर रही है। केवल एक टीम के पास फाइल होने और दूसरी के वीडियो देखने के बजाय, WHALE इन दोनों को एक ही कमरे में, परत-दर-परत (layer by layer) रखता है। मॉडल के प्रत्येक स्तर में, एक "वुकोंग" (Wukong) टीम (जो स्थिर विवरणों को मिलाने में विशेषज्ञ है) और एक "HSTU" टीम (जो आपके कार्यों के लंबे इतिहास को पढ़ने में विशेषज्ञ है) होती है। लेकिन यहाँ असली जादू है: वे केवल अगल-बगल नहीं काम करते; वे लगातार आपस में बातचीत करते हैं। वुकोंग टीम, HSTU टीम से पूछती है, "हे, इस विशिष्ट वस्तु के आधार पर जिसे मैं देख रहा हूँ, उपयोगकर्ता के लंबे इतिहास का कौन सा हिस्सा अभी सबसे महत्वपूर्ण है?" HSTU टीम फिर उस विशिष्ट स्मृति पर ज़ूम करती है और उसे वापस सौंप देती है। यह प्रक्रिया डेटा के मॉडल के माध्यम से आगे बढ़ने के दौरान बार-बार होती है, जिससे सिस्टम को अपनी समझ को लगातार परिष्कृत करने में मदद मिलती है।
शोध पत्र सुझाव देता है कि यह "प्रगतिशील आदान-प्रदान" (progressive exchange) एक गेम-चेंजर है। जब शोधकर्ताओं ने वास्तविक दुनिया के डेटा पर WHALE का परीक्षण किया, तो उन्होंने पाया कि जैसे-जैसे मॉडल बड़ा होता गया और उसे पढ़ने के लिए लंबा इतिहास दिया गया, यह उपयोगकर्ताओं के क्लिक करने की भविष्यवाणी करने में लगातार बेहतर होता गया। विशेष रूप से, जब उन्होंने उपयोगकर्ता के इतिहास की लंबाई बढ़ाई जिसे मॉडल देख सकता था, तो अनुशंसाओं की गुणवत्ता में सुधार हुआ। उन्होंने यह भी पाया कि मॉडल को गहरा (अधिक परतें) और चौड़ा (अधिक प्रोसेसिंग पावर) बनाने से बेहतर परिणाम मिलते रहे, जो दर्शाता है कि यह प्रणाली अच्छी तरह से स्केल करती है।
हालाँकि, शोधकर्ताओं ने इन दोनों प्रकार के मॉडलों को संयोजित करने के एक सरल तरीके का भी परीक्षण किया, जिसे वे "शैलो-हाइब्रिड" (shallow-hybrid) दृष्टिकोण कहते हैं। इस पुराने तरीके में, इतिहास को एक छोटे सारांश में संकुचित कर दिया जाता है और फिर इसे स्थिर विवरणों के साथ मिलाया जाता है। शोध पत्र का तर्क है कि यह एक गलती है क्योंकि यह सूक्ष्म विवरणों को फेंक देता है। उनके प्रयोगों ने दिखाया कि WHALE का गहरा, परत-दर-परत संवाद, इस शैलो दृष्टिकोण की तुलना में काफी बेहतर था, जो यह सिद्ध करता है कि दोनों टीमों के बीच निरंतर संचार बनाए रखना महत्वपूर्ण है।
बेशक, इतने जटिल सिस्टम को बनाना महंगा है। टीम को विशेष, कस्टम कंप्यूटर कोड (जिसे "ट्रिटन कर्नेल" कहा जाता है) का आविष्कार करना पड़ा ताकि यह सुनिश्चित हो सके कि WHALE इतनी तेज़ी से चल सके कि इसे एक साथ लाखों लोगों द्वारा उपयोग किया जा सके। वास्तविक दुनिया के परीक्षणों में, WHALE ने उपयोगकर्ता जुड़ाव के मुख्य मेट्रिक्स में सुधार किया, लेकिन इसके साथ एक छोटी सी लागत भी आई: पुराना सिस्टम की तुलना में WHALE प्रति सेकंड लगभग 5% कम अनुरोध (requests) संभाल सका। इस मामूली धीमी गति के बावजूद, अनुशंसा की गुणवत्ता में सुधार को एक जीत माना गया, और इसे पहले ही उत्पादन (production) में तैनात किया जा चुका है। शोध पत्र निष्कर्ष निकालता है कि हालांकि हम सब कुछ हल करने के लिए मॉडलों को अनंत रूप से बड़ा नहीं बना सकते, लेकिन डेटा के दो अलग-अलग तरीकों को—स्थिर विवरण और गतिशील इतिहास—एक ही, परस्पर क्रिया करने वाले आर्किटेक्चर में एकीकृत करना, अनुशंसाओं के भविष्य के लिए एक शक्तिशाली और व्यावहारिक मार्ग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।