SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation
यह शोधपत्र SpecFormer को प्रस्तुत करता है, जो एक स्पेक्ट्रल-अवेयर (spectral-aware) ट्रांसफॉर्मर आर्किटेक्चर है जो लर्नबल स्पेक्ट्रल सॉफ्टनिंग (learnable spectral softening), स्पेक्ट्रम-सॉफ्टन्ड अटेंशन (spectrum-softened attention) और स्पेक्ट्रल रेसिडुअल पोजीशन एनकोडिंग (spectral residual position encoding) का उपयोग करके अनुशंसा प्रणालियों (recommendation systems) के विशिष्ट एम्बेडिंग और अटेंशन कोलैप्स को कम करता है, जिससे सार्वजनिक बेंचमार्क और वास्तविक वाणिज्यिक तैनाती दोनों में उत्कृष्ट प्रदर्शन और स्केलेबिलिटी प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को यह अनुमान लगाना सिखाने की कोशिश कर रहे हैं कि आप अगली बार क्या खरीदना चाहते हैं। यह रोबोट एक "रेकमेंडर सिस्टम" (recommender system) है, जो आपके पसंदीदा शॉपिंग ऐप्स पर दिखने वाली "आपको यह भी पसंद आ सकता है" वाली सूचियों के पीछे का डिजिटल दिमाग है। लंबे समय तक, इन रोबोटों को बनाने का सबसे अच्छा तरीका एक विशेष प्रकार का गणित था जिसे "ट्रांसफॉर्मर" (Transformer) कहा जाता है। आप एक ट्रांसफॉर्मर को एक बहुत ही व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह समझ सकते हैं जो आपके द्वारा क्लिक की गई हर चीज़ को देखता है और उनके बीच के संबंधों को समझने की कोशिश करता है। यह इस क्षेत्र में अविश्वसनीय रूप से कुशल है जहाँ जानकारी सुचारू और प्रवाहमयी होती है, जैसे कि लेखन या चित्रों को देखने में। लेकिन जब वैज्ञानिकों ने इसी लाइब्रेरियन का उपयोग एक विशाल ऑनलाइन स्टोर चलाने के लिए करने की कोशिश की, तो चीजें गलत हो गईं। रोबोट भ्रमित होने लगा, उन दुर्लभ या अद्वितीय वस्तुओं को अनदेखा करने लगा जिन्हें आप पसंद कर सकते थे, और केवल सबसे लोकप्रिय, उबाऊ चीजों पर ध्यान देने लगा। यह ऐसा था जैसे लाइब्रेरियन किताबों की भारी संख्या से इतना अभिभूत हो गया कि उन्होंने दिलचस्प किताबें पढ़ना बंद कर दिया और बस बार-बार बेस्टसेलर के शीर्षक चिल्लाने लगे। यह शोध पत्र पूछता है: खरीदारी में ऐसा क्यों होता है, और हम इसे कैसे ठीक करें ताकि रोबोट वास्तव में पूरे स्टोर से सीख सके, न कि केवल ऊपरी शेल्फ से?
इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व झेजियांग विश्वविद्यालय और अलीबाबा के यू कुई (Yu Cui) और उनके सहयोगियों ने किया था, पाया कि समस्या लाइब्रेरियन की बुद्धिमत्ता में नहीं, बल्कि डेटा के "शोर" (noise) में है। एक पुस्तकालय में, पुस्तकें कुछ हद तक समान होती हैं; एक शॉपिंग ऐप में, डेटा अनियंत्रित और अस्त-व्यस्त होता है। कुछ वस्तुएं दिन में लाखों बार खरीदी जाती हैं ("हेड" - head), जबकि अन्य वर्ष में केवल कुछ ही बार खरीदी जाती हैं ("टेल" - tail)। शोधकर्ताओं ने पाया कि इस अस्त-व्यस्त, लॉन्ग-टेल वितरण के कारण "स्पेक्ट्रल कोलैप्स" (spectral collapse) होता है। कल्पना कीजिए कि रोबोट का मस्तिष्क एक टॉर्च की बीम की तरह है। सामान्य रूप से, बीम को पूरे कमरे को रोशन करने के लिए फैल जाना चाहिए। लेकिन इन शॉपिंग ऐप्स में, बीम एक छोटे, अंधा कर देने वाले चमकीले बिंदु में दब जाती है। रोबोट केवल सबसे चमकीली, लोकप्रिय वस्तुओं को देखता है और बाकी सब के लिए "अंधा" हो जाता है। इससे भी बुरा यह है कि जैसे-जैसे उन्होंने रोबोट के मस्तिष्क में इसे स्मार्ट बनाने के लिए अधिक परतें जोड़ीं, यह अंधापन और भी खराब होता गया। यह एक दुष्चक्र था: रोबोट ने दुर्लभ वस्तुओं को अनदेखा किया, कुछ भी नया नहीं सीखा, और फिर अगले चरण में उन्हें देखने में और भी खराब हो गया।
इसे ठीक करने के लिए, टीम ने एक नए प्रकार का रोबोट मस्तिष्क बनाया जिसे SpecFormer कहा जाता है। टॉर्च की बीम को एक एकल बिंदु में दबने देने के बजाय, SpecFormer एक विशेष "स्पेक्ट्रल सॉफ्टनिंग" (spectral softening) लेंस का उपयोग करता है। इसे एक जादुई डिफ्यूज़र की तरह समझें जो उस अंधा कर देने वाली, केंद्रित बीम को धीरे से फैला देता है, जिससे यह सुनिश्चित होता है कि कमरे के धुंधले कोनों को भी रोशनी मिले। यह रोबोट को दुर्लभ, लॉन्ग-टेल वस्तुओं पर भी उतना ही ध्यान देने की अनुमति देता है जितना कि लोकप्रिय वस्तुओं पर। वे यहीं नहीं रुके; उन्होंने एक "रेसिड्यूअल पोजीशन एनकोडिंग" (residual position encoding) भी जोड़ी, जो एक मानचित्र की तरह रोबोट को याद दिलाती है, "हे, यह भी ध्यान रखें कि लोकप्रिय चीजों को पूरी तरह से न भूलें, बस उनके बीच संतुलन बनाएं।"
परिणाम प्रभावशाली थे। जब उन्होंने वास्तविक दुनिया के डेटा पर SpecFormer का परीक्षण किया, तो यह न केवल बेहतर काम कर रहा था, बल्कि जैसे-जैसे इसे गहरा बनाया गया, यह वास्तव में स्मार्ट होता गया। जबकि अन्य मॉडल बहुत जटिल होने पर टूट जाते थे, SpecFormer बेहतर होता गया। एक वास्तविक जीवन के परीक्षण में जिसमें लाखों उपयोगकर्ता शामिल थे, नए मॉडल ने विज्ञापनों पर क्लिक करने वाले लोगों की संख्या में 1.34% की वृद्धि की और वास्तविक ऑर्डरों की संख्या में 16.72% की वृद्धि की, और यह सब वेबसाइट को केवल 5 मिलीसेकंड धीमा करते हुए किया। शोध पत्र सुझाव देता है कि इस "कोलैप्स" की समस्या को ठीक करके, हम अंततः ऐसे अनुशंसा तंत्र (recommendation systems) बना सकते हैं जो गहरे, शक्तिशाली और लोगों की वास्तव में खरीदने की इच्छा की पूरी, अस्त-व्यस्त और अद्भुत विविधता को समझने में सक्षम हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।