RankGraph-2: Lifecycle Co-Design for Billion-Node Graph Learning in Recommendation
RankGraph-2 एक लाइफसाइकिल को-डिज़ाइन फ्रेमवर्क है जिसे मेटा (Meta) में तैनात किया गया है जो अरबों नोड्स वाले समानता-आधारित रिट्रीवल (similarity-based retrieval) के लिए ग्राफ कंस्ट्रक्शन, रिप्रेजेंटेशन लर्निंग और रियल-टाइम सर्विंग को संयुक्त रूप से अनुकूलित करता है ताकि बेहतर रिकॉल, कम कम्प्यूटेशनल लागत और मापने योग्य व्यावसायिक प्रभाव प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अरबों निवासियों (उपयोगकर्ताओं) और लाखों दुकानों (आइटमों) वाले एक विशाल, हलचल भरे शहर को चला रहे हैं। आपका लक्ष्य लोगों को वह आदर्श दुकान खोजने में मदद करना है जहाँ वे जाना चाहते हैं। इसके लिए, आपको एक ऐसे मानचित्र की आवश्यकता है जो समझ सके कि सभी लोग आपस में कैसे जुड़े हुए हैं।
यह शोध पत्र RankGraph-2 पेश करता है, जो इस तरह का मानचित्र बनाने और उपयोग करने का एक नया तरीका है। लेखक तर्क देते हैं कि पिछले अधिकांश प्रयासों ने एक गलती की थी: उन्होंने मानचित्र बनाया, उसे पढ़ने के लिए एक गाइड (मार्गदर्शक) को प्रशिक्षित किया, और फिर गाइड को काम पर भेजने की कोशिश की, जिससे प्रत्येक चरण को एक अलग कार्य माना गया। इससे एक ऐसी प्रणाली बनी जो या तो बहुत धीमी थी, बहुत महंगी थी, या ठीक से काम नहीं कर पा रही थी।
RankGraph-2 अलग है क्योंकि यह "लाइफसाइकिल को-डिज़ाइन" (Lifecycle Co-Design) का अभ्यास करता है। इसे ऐसे सोचें जैसे कि वास्तुकार (architects), निर्माण श्रमिक (construction workers) और यातायात योजनाकारों (traffic planners) की एक टीम एक ही कमरे में बैठी है, और वे शुरुआत से ही मिलकर शहर का डिज़ाइन बना रहे हैं। वे महसूस करते हैं कि यातायात योजनाकारों को जिस चीज़ की ज़रूरत है (गति), वह वास्तुकारों द्वारा सड़कों के निर्माण के तरीके को बदल देती है, और यह भी तय करती है कि निर्माण श्रमिकों को ईंटें कैसे लगानी चाहिए।
उनके सिस्टम के तीन मुख्य भाग कैसे काम करते हैं, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. मानचित्र बनाना (ग्राफ निर्माण - Graph Construction)
समस्या: अतीत में, अरबों लोगों और वस्तुओं के बीच हर एक संबंध का चित्र बनाने की कोशिश करना समुद्र तट पर रेत के हर एक कण को चित्रित करने जैसा था। यह संभालने के लिए बहुत विशाल था। साथ ही, लोकप्रिय दुकानें (जैसे कि एक विशाल सुपरमार्केट) मानचित्र पर हावी हो जाती थीं, जिससे छोटी और अनूठी दुकानों को खोजना कठिन हो जाता था।
RankGraph-2 का समाधान:
- स्मार्ट सबसैंपलिंग (Smart Subsampling): रेत के हर एक कण को चित्रित करने के बजाय, वे एक "स्मार्ट फ़िल्टर" का उपयोग करते हैं। वे सबसे महत्वपूर्ण कनेक्शन रखते हैं लेकिन शोर (noise) को हटा देते हैं। वे एक "लोकप्रियता सुधार" (popularity correction) भी लागू करते हैं ताकि विशाल सुपरमार्केट स्थानीय बेकरी को दबा न दे।
- पड़ोसियों का प्री-कंप्यूटिंग (Pre-Computing the Neighbors): आमतौर पर, एक गाइड को वास्तविक समय में पड़ोसियों को खोजने के लिए सड़कों पर चलना पड़ता है। RankGraph-2 गाइड के जागने से पहले ही यह "चलने" का काम कर देता है। वे एक विशेष एल्गोरिदम (Personalized PageRank) का उपयोग करके प्रत्येक व्यक्ति और वस्तु के लिए सबसे महत्वपूर्ण पड़ोसियों की गणना पहले ही कर लेते हैं। इसका मतलब है कि गाइड को मानचित्र डेटा का भारी बैग उठाने की आवश्यकता नहीं है; उन्हें बस एक पहले से छपी हुई सूची मिल जाती है कि किसे मिलना है।
2. गाइड को प्रशिक्षित करना (मॉडल ट्रेनिंग - Model Training)
समस्या: पारंपरिक प्रणालियों को एक विशाल, महंगे कंप्यूटर क्लस्टर की आवश्यकता होती है जो गाइड की मदद करने के लिए काम करते समय 24/7 ऑनलाइन रहे। यह धीमा है और बहुत अधिक लागत वाला है।
RankGraph-2 का समाधान:
- कोई ऑनलाइन बैकपैक नहीं (No Online Backpack): चूंकि पिछले चरण में "पड़ोसियों" की गणना पहले ही की जा चुकी थी, इसलिए प्रशिक्षण प्रणाली को एक भारी, लाइव मानचित्र ले जाने की आवश्यकता नहीं है। यह मानक, सस्ते कंप्यूटरों पर चल सकती है।
- एक साथ समूह बनाना सीखना (Learning to Clump Together): सिस्टम गाइड को न केवल पड़ोसियों को खोजना सिखाता है, बल्कि लोगों को "पड़ोसों" (clusters) में समूह बनाना भी सिखाता है। कल्पना कीजिए कि आप गाइड को सिखा रहे हैं: "यदि आप कॉफी शॉप की तलाश कर रहे हैं, तो पूरे शहर में न खोजें। बस 'डाउनटाउन' पड़ोस में जाएँ और वहाँ की दुकानों की सूची देखें।"
3. गाइड को सेवा देना (रियल-टाइम रिट्रीवल - Real-Time Retrieval)
समस्या: जब कोई उपयोगकर्ता पूछता है, "दूसरे लोग क्या पसंद करते हैं जो मैं पसंद करता हूँ?" (User-to-User-to-Item), तो सिस्टम को आमतौर पर तुरंत अरबों लोगों में से खोजना पड़ता है। मानक "सर्च" (KNN) के साथ ऐसा करने के लिए हजारों शक्तिशाली कंप्यूटरों की आवश्यकता होती है और इसमें बहुत समय लगता है।
RankGraph-2 का समाधान:
- पड़ोस की कतार (The Neighborhood Queue): पूरे शहर को खोजने के बजाय, सिस्टम प्रशिक्षण चरण में सीखे गए "पड़ोस" समूहों का उपयोग करता है।
- यदि कोई उपयोगकर्ता "डाउनटाउन" पड़ोस में है, तो सिस्टम उन वस्तुओं की एक पहले से बनी सूची देखता है जिन्हें उस पड़ोस के हाल ही में सक्रिय लोगों ने पसंद किया था।
- यह एक पुस्तकालय में एक विशिष्ट कमरे में जाने और उन किताबों को उठाने जैसा है जो अभी-अभी चेक आउट की गई हैं, बजाय इसके कि पूरे पुस्तकालय की सूची को तलाशा जाए।
- परिणाम: यह वास्तविक समय में महंगी खोज (searching) की आवश्यकता को समाप्त करता है। पेपर का दावा है कि यह सिस्टम चलाने की लागत को 83% तक कम कर देता है।
बड़ी जीत
इन तीनों चरणों को एक-दूसरे की मदद करने के लिए जोड़ने से, RankGraph-2 ने Meta (Facebook/Instagram) में प्रभावशाली परिणाम प्राप्त किए:
- बेहतर सिफारिशें (Better Recommendations): इसने एक जटिल, पुराने मॉडल (GAT + Deep Graph Infomax) की तुलना में 3.8 गुना बेहतर और एक अन्य विशाल प्रणाली (PyTorch-BigGraph) की तुलना में 2.1 गुना बेहतर प्रासंगिक आइटम खोजे।
- वास्तविक व्यावसायिक प्रभाव (Real Business Impact): लाइव परीक्षणों में, इसने विज्ञापनों पर क्लिक करने या चीजें खरीदने की दर (Click-Through Rate और Conversion Rate) को काफी बढ़ा दिया।
- सरलता (Simplicity): आश्चर्यजनक रूप से, मॉडल स्वयं उन जटिल मॉडलों की तुलना में वास्तव में सरल है जिन्हें इसने मात दी। जादू गणित को कठिन बनाने में नहीं था; जादू इस पूरी प्रक्रिया (निर्माण, प्रशिक्षण और सेवा) को सहजता से एक साथ काम करने के लिए डिज़ाइन करने में था।
संक्षेप में, RankGraph-2 साबित करता है कि विशाल अनुशंसा प्रणालियों (recommendation systems) के लिए, आपको एक बड़ा, अधिक जटिल इंजन बनाने की आवश्यकता नहीं है। आपको बस पूरी कार को इस तरह डिजाइन करने की आवश्यकता है कि उसका इंजन, पहिये और ड्राइवर सभी एक ही सड़क के लिए बने हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।