Dual Attention Residuals
यह शोध पत्र ड्यूल अटेंशन रेसिडुअल्स (DAR) का प्रस्ताव करता है, जो एक नवीन आर्किटेक्चर है जो विपरीत धाराओं से ऐतिहासिक जानकारी को गतिशील रूप से चुनने के लिए पारस्परिक क्रॉस-स्ट्रीम इंटरेक्शन को सक्षम करके ट्रांसफॉर्मर मॉडलों को उन्नत करता है, जिससे विभिन्न मॉडल स्केल्स में वैलिडेशन लॉस में सुधार होता है और डेप्थ-वाइज विविधता बनी रहती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखाने की कोशिश कर रहे हैं। आप उसे केवल एक बार में एक वाक्य नहीं देते; आप उसे उसके अपने पिछले विचारों का एक पूरा पुस्तकालय देते हैं ताकि वह याद रख सके कि उसने पाँच मिनट पहले या पाँच घंटे पहले क्या कहा था। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन "विचारों" को रेसिडुअल कनेक्शन (residual connections) कहा जाता है। इन्हें एक सुपर-हाईवे की तरह समझें जहाँ सूचना मस्तिष्क जैसी परतों के एक गहरे ढेर से होकर गुजरती है। आमतौर पर, रोबोट पुराने विचारों में नए विचार जोड़कर एक सीधी रेखा में चलता है। लेकिन हाल ही में, वैज्ञानिकों ने महसूस किया कि यह हाईवे थोड़ा बहुत कठोर है। उन्होंने हिस्टोरिकल रिट्रीवल (historical retrieval) सिस्टम बनाना शुरू किया, जो रोबोट को जानकारी का सही टुकड़ा खोजने के लिए अतीत के विशिष्ट क्षणों पर एक नज़र डालने की अनुमति देता है। उन्होंने मल्टी-स्ट्रीम (multi-stream) सिस्टम भी बनाना शुरू किया, जो हाईवे को दो समानांतर लेन में विभाजित करता है ताकि रोबोट एक ही समय में दो अलग-अलग चीजों के बारे में सोच सके। बड़ा सवाल यह था: क्या होगा यदि आप रोबोट को इन दोनों विचारों का एक साथ उपयोग करने दें? क्या दोनों लेन एक-दूसरे से बात कर सकती हैं ताकि यह तय किया जा सके कि अतीत के कौन से क्षण सबसे महत्वपूर्ण हैं?
यही वह चीज़ है जिसे TeleAI के शोधकर्ताओं ने अपने नए पेपर, डुअल अटेंशन रेसिडुअल्स (DAR) में खोजा। उन्होंने पाया कि केवल दो लेन होना ही काफी नहीं है; लेन को "सामाजिक" होने की आवश्यकता है। उनके नए सिस्टम, DAR में, रोबोट केवल यह तय करने के लिए अपने अतीत को नहीं देखता कि उसे क्या याद रखना है। इसके बजाय, वह सलाह के लिए अपनी "जुड़वां" लेन से पूछता है। यदि लेन A कुछ याद करने की कोशिश कर रही है, तो वह यह तय करने के लिए लेन B के वर्तमान 'मूड' को देखती है कि अतीत के किस हिस्से को खोदकर निकालना सार्थक है। यह दो दोस्तों के साथ परीक्षा की तैयारी करने जैसा है: केवल अपने नोट्स पलटने के बजाय, आप अपने दोस्त से पूछते हैं, "हे, तुम्हें क्या लगता है कि अभी पाठ्यपुस्तक का कौन सा हिस्सा सबसे महत्वपूर्ण है?" और फिर आप अपनी खुद की किताब में उसी विशिष्ट पृष्ठ को देखने जाते हैं।
पेपर दिखाता है कि यह "क्रॉस-टॉक" AI को काफी स्मार्ट बना देती है। जब उन्होंने 0.1 बिलियन पैरामीटर्स वाले छोटे मॉडल से लेकर 7 बिलियन पैरामीटर वाले विशाल मॉडल तक, DAR का परीक्षण किया, तो इसने मानक तरीकों की तुलना में लगातार कम गलतियाँ कीं। शोधकर्ताओं ने पाया कि दोनों लेन केवल एक ही जानकारी को दोहरा नहीं रही थीं; उन्होंने "श्रम का विभाजन" विकसित किया था। एक लेन वाक्य की शुरुआत को याद रखने पर ध्यान केंद्रित कर सकती है, जबकि दूसरी बीच के हिस्से पर ध्यान केंद्रित करती है, और वे सही विवरण खोजने में एक-दूसरे की मदद करती हैं।
महत्वपूर्ण रूप से, टीम ने यह सुनिश्चित किया कि यह केवल एक चाल नहीं थी। उन्होंने यह साबित करने के लिए प्रयोग किए कि सुधार केवल अधिक डेटा होने या नोट्स में कोई नया फ़िल्टर जोड़ने से नहीं आया। उन्होंने दिखाया कि यदि दोनों लेन एक-दूसरे से बात नहीं करतीं (एक सेटअप जिसे उन्होंने "सेल्फकेवी" (SelfKV) कहा), तो सिस्टम असंतुलित हो जाता, जिसमें एक लेन सारा काम करती और दूसरी खाली बैठी रहती। लेकिन DAR की पारस्परिक बातचीत के साथ, दोनों लेन सक्रिय और उपयोगी बनी रहीं। परिणाम एक अधिक कुशल, विविध और सटीक तरीका है जिससे AI अपने अतीत को याद रखता है, जो यह सिद्ध करता है कि कभी-कभी, आगे बढ़ने का सबसे अच्छा तरीका यह पूछना है कि आपका साथी पीछे कहाँ देखने के लिए कह रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।