← नवीनतम पेपर
🤖 machine learning

SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation

यह शोधपत्र SpecFormer को प्रस्तुत करता है, जो एक स्पेक्ट्रल-अवेयर (spectral-aware) ट्रांसफॉर्मर आर्किटेक्चर है जो लर्नबल स्पेक्ट्रल सॉफ्टनिंग (learnable spectral softening), स्पेक्ट्रम-सॉफ्टन्ड अटेंशन (spectrum-softened attention) और स्पेक्ट्रल रेसिडुअल पोजीशन एनकोडिंग (spectral residual position encoding) का उपयोग करके अनुशंसा प्रणालियों (recommendation systems) के विशिष्ट एम्बेडिंग और अटेंशन कोलैप्स को कम करता है, जिससे सार्वजनिक बेंचमार्क और वास्तविक वाणिज्यिक तैनाती दोनों में उत्कृष्ट प्रदर्शन और स्केलेबिलिटी प्राप्त होती है।

मूल लेखक: Yu Cui, Yi Xu, Jiahao Wang, Hao Zhang, Yu Zhang, Xiaoyi Zeng, Can Wang, Jinxin Hu, Jiawei Chen

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yu Cui, Yi Xu, Jiahao Wang, Hao Zhang, Yu Zhang, Xiaoyi Zeng, Can Wang, Jinxin Hu, Jiawei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को यह अनुमान लगाना सिखाने की कोशिश कर रहे हैं कि आप अगली बार क्या खरीदना चाहते हैं। यह रोबोट एक "रेकमेंडर सिस्टम" (recommender system) है, जो आपके पसंदीदा शॉपिंग ऐप्स पर दिखने वाली "आपको यह भी पसंद आ सकता है" वाली सूचियों के पीछे का डिजिटल दिमाग है। लंबे समय तक, इन रोबोटों को बनाने का सबसे अच्छा तरीका एक विशेष प्रकार का गणित था जिसे "ट्रांसफॉर्मर" (Transformer) कहा जाता है। आप एक ट्रांसफॉर्मर को एक बहुत ही व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह समझ सकते हैं जो आपके द्वारा क्लिक की गई हर चीज़ को देखता है और उनके बीच के संबंधों को समझने की कोशिश करता है। यह इस क्षेत्र में अविश्वसनीय रूप से कुशल है जहाँ जानकारी सुचारू और प्रवाहमयी होती है, जैसे कि लेखन या चित्रों को देखने में। लेकिन जब वैज्ञानिकों ने इसी लाइब्रेरियन का उपयोग एक विशाल ऑनलाइन स्टोर चलाने के लिए करने की कोशिश की, तो चीजें गलत हो गईं। रोबोट भ्रमित होने लगा, उन दुर्लभ या अद्वितीय वस्तुओं को अनदेखा करने लगा जिन्हें आप पसंद कर सकते थे, और केवल सबसे लोकप्रिय, उबाऊ चीजों पर ध्यान देने लगा। यह ऐसा था जैसे लाइब्रेरियन किताबों की भारी संख्या से इतना अभिभूत हो गया कि उन्होंने दिलचस्प किताबें पढ़ना बंद कर दिया और बस बार-बार बेस्टसेलर के शीर्षक चिल्लाने लगे। यह शोध पत्र पूछता है: खरीदारी में ऐसा क्यों होता है, और हम इसे कैसे ठीक करें ताकि रोबोट वास्तव में पूरे स्टोर से सीख सके, न कि केवल ऊपरी शेल्फ से?

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व झेजियांग विश्वविद्यालय और अलीबाबा के यू कुई (Yu Cui) और उनके सहयोगियों ने किया था, पाया कि समस्या लाइब्रेरियन की बुद्धिमत्ता में नहीं, बल्कि डेटा के "शोर" (noise) में है। एक पुस्तकालय में, पुस्तकें कुछ हद तक समान होती हैं; एक शॉपिंग ऐप में, डेटा अनियंत्रित और अस्त-व्यस्त होता है। कुछ वस्तुएं दिन में लाखों बार खरीदी जाती हैं ("हेड" - head), जबकि अन्य वर्ष में केवल कुछ ही बार खरीदी जाती हैं ("टेल" - tail)। शोधकर्ताओं ने पाया कि इस अस्त-व्यस्त, लॉन्ग-टेल वितरण के कारण "स्पेक्ट्रल कोलैप्स" (spectral collapse) होता है। कल्पना कीजिए कि रोबोट का मस्तिष्क एक टॉर्च की बीम की तरह है। सामान्य रूप से, बीम को पूरे कमरे को रोशन करने के लिए फैल जाना चाहिए। लेकिन इन शॉपिंग ऐप्स में, बीम एक छोटे, अंधा कर देने वाले चमकीले बिंदु में दब जाती है। रोबोट केवल सबसे चमकीली, लोकप्रिय वस्तुओं को देखता है और बाकी सब के लिए "अंधा" हो जाता है। इससे भी बुरा यह है कि जैसे-जैसे उन्होंने रोबोट के मस्तिष्क में इसे स्मार्ट बनाने के लिए अधिक परतें जोड़ीं, यह अंधापन और भी खराब होता गया। यह एक दुष्चक्र था: रोबोट ने दुर्लभ वस्तुओं को अनदेखा किया, कुछ भी नया नहीं सीखा, और फिर अगले चरण में उन्हें देखने में और भी खराब हो गया।

इसे ठीक करने के लिए, टीम ने एक नए प्रकार का रोबोट मस्तिष्क बनाया जिसे SpecFormer कहा जाता है। टॉर्च की बीम को एक एकल बिंदु में दबने देने के बजाय, SpecFormer एक विशेष "स्पेक्ट्रल सॉफ्टनिंग" (spectral softening) लेंस का उपयोग करता है। इसे एक जादुई डिफ्यूज़र की तरह समझें जो उस अंधा कर देने वाली, केंद्रित बीम को धीरे से फैला देता है, जिससे यह सुनिश्चित होता है कि कमरे के धुंधले कोनों को भी रोशनी मिले। यह रोबोट को दुर्लभ, लॉन्ग-टेल वस्तुओं पर भी उतना ही ध्यान देने की अनुमति देता है जितना कि लोकप्रिय वस्तुओं पर। वे यहीं नहीं रुके; उन्होंने एक "रेसिड्यूअल पोजीशन एनकोडिंग" (residual position encoding) भी जोड़ी, जो एक मानचित्र की तरह रोबोट को याद दिलाती है, "हे, यह भी ध्यान रखें कि लोकप्रिय चीजों को पूरी तरह से न भूलें, बस उनके बीच संतुलन बनाएं।"

परिणाम प्रभावशाली थे। जब उन्होंने वास्तविक दुनिया के डेटा पर SpecFormer का परीक्षण किया, तो यह न केवल बेहतर काम कर रहा था, बल्कि जैसे-जैसे इसे गहरा बनाया गया, यह वास्तव में स्मार्ट होता गया। जबकि अन्य मॉडल बहुत जटिल होने पर टूट जाते थे, SpecFormer बेहतर होता गया। एक वास्तविक जीवन के परीक्षण में जिसमें लाखों उपयोगकर्ता शामिल थे, नए मॉडल ने विज्ञापनों पर क्लिक करने वाले लोगों की संख्या में 1.34% की वृद्धि की और वास्तविक ऑर्डरों की संख्या में 16.72% की वृद्धि की, और यह सब वेबसाइट को केवल 5 मिलीसेकंड धीमा करते हुए किया। शोध पत्र सुझाव देता है कि इस "कोलैप्स" की समस्या को ठीक करके, हम अंततः ऐसे अनुशंसा तंत्र (recommendation systems) बना सकते हैं जो गहरे, शक्तिशाली और लोगों की वास्तव में खरीदने की इच्छा की पूरी, अस्त-व्यस्त और अद्भुत विविधता को समझने में सक्षम हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →