Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions
यह शोध पत्र HyenaND को प्रस्तुत करता है, जो एक सबक्वाड्रेटिक (subquadratic), इनपुट-डिपेंडेंट ऑपरेटर है जो मानक अटेंशन और रिकरेंट मॉडल्स की सीमाओं को दूर करने के लिए सीधे नेटिव मल्टी-डायमेंशनल डेटा स्ट्रक्चर्स पर ग्लोबल कन्वोल्यूशन लागू करता है, और एक विशेषीकृत CUDA इम्प्लीमेंटेशन के माध्यम से प्रतिस्पर्धी सटीकता और महत्वपूर्ण गति प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अभी, सबसे अच्छे रोबोट "अटेंशन" (attention) नामक एक उपकरण का उपयोग करते हैं ताकि वे एक साथ सब कुछ देख सकें, जैसे कि एक छात्र सबसे महत्वपूर्ण शब्दों को खोजने के लिए पूरे पन्ने को स्कैन करता है। यह छोटी कहानियों के लिए बहुत अच्छा काम करता है, लेकिन यदि आप रोबोट को एक पूरी लाइब्रेरी, एक 3D मूवी, या एक जटिल मौसम मानचित्र दे दें, तो यह "अटेंशन" टूल अभिभूत हो जाता है। इसे डेटा के हर एक हिस्से की तुलना दूसरे हिस्से से करनी पड़ती है, जिसमें इतना समय और ऊर्जा लगती है कि रोबोट क्रैश हो जाता है या जीवित रहने के लिए उसे डेटा को एक बहुत ही छोटे छेद (जिसे "पैचिफिकेशन" कहा जाता है) के माध्यम से देखना पड़ता है।
इसे ठीक करने के लिए, वैज्ञानिक तेज़ उपकरण बनाने की कोशिश कर रहे हैं। एक लोकप्रिय विचार "रिकरेंट" (recurrent) मॉडल का उपयोग करना है, जो डेटा को एक टेक्स्ट की लाइन की तरह, एक के बाद एक शब्द के रूप में पढ़ते हैं। लेकिन यह एक 3D मूर्ति को केवल एक कोण से देखने और फिर बाकी का अनुमान लगाने जैसा है; यह वस्तु के प्राकृतिक आकार को नष्ट कर देता है। एक अन्य विचार "कन्वोल्यूशन" (convolutions) का उपयोग करना है, जो एक छवि पर आवर्धक लेंस (magnifying glass) को खिसकाने जैसा है ताकि पैटर्न पहचाने जा सकें। ये तेज़ होते हैं और 3D आकार को बरकरार रखते हैं, लेकिन ये आमतौर पर एक कठोर स्टैम्प की तरह कार्य करते हैं, जो बिना यह देखे कि वास्तव में वहां क्या है, छवि के हर हिस्से पर बिल्कुल एक ही पैटर्न लागू करते हैं। बड़ा सवाल कंप्यूटर विज्ञान के इस कोने में यह है: क्या हम एक ऐसा उपकरण बना सकते हैं जो विशाल 3D डेटा को संभालने के लिए पर्याप्त तेज़ हो, डेटा के प्राकृतिक आकार को बनाए रखे, और जो यह देखने में सक्षम हो कि वह वास्तव में क्या देख रहा है और उसके आधार पर अपने "आवर्धक लेंस" को बदल सके?
यह शोध पत्र HyenaND नामक एक नए उपकरण को पेश करता है जो कहता है "हाँ।" HyenaND को एक जादुई, आकार बदलने वाले आवर्धक लेंस के रूप में समझें जो किसी 3D वस्तु (जैसे मेडिकल स्कैन या मौसम सिमुलेशन) पर बिना उसे 1D लाइन में बदले फिसल सकता है। अतीत के कठोर स्टैम्प के विपरीत, यह टूल पहले पूरी वस्तु को देख सकता है, यह तय कर सकता है कि इसे किस प्रकार के पैटर्न को खोजने की आवश्यकता है, और फिर तुरंत अपने लेंस को उससे मेल खाने के लिए समायोजित कर सकता है। यह "फूरियर ट्रांसफॉर्म" (Fourier transforms - छवियों को ध्वनि तरंगों में बदलने का एक तरीका ताकि उन्हें तेज़ी से प्रोसेस किया जा सके) से जुड़ी एक चतुर गणितीय तकनीक का उपयोग करता है, जो गति को बहुत उच्च बनाए रखती है, और डेटा बड़ा होने पर इसकी लागत केवल थोड़ी सी बढ़ती है, न कि विस्फोट की तरह बढ़ती है।
लेखकों ने पाया कि जटिल, बहु-आयामी डेटा को संभालने के लिए HyenaND एक गेम-चेंजर है। अपने परीक्षणों में, उन्होंने दिखाया कि HyenaND उन कार्यों को संभाल सकता है जो मानक "अटेंशन" टूल्स को मेमोरी सीमाओं के कारण क्रैश कर सकते हैं, जैसे कि 3D मेडिकल इमेज का विश्लेषण करना या फ्लूइड डायनेमिक्स का अनुकरण करना। जब उन्होंने एक "कॉपी करने" वाले खेल पर परीक्षण किया जहाँ रोबोट को 3D ग्रिड से एक विशिष्ट रंग को याद रखना था, तो HyenaND पुराने तरीकों की तुलना में हजारों गुना अधिक सटीक था। उन्होंने nSubQ नामक एक विशेष सॉफ्टवेयर इंजन भी बनाया ताकि यह सुनिश्चित हो सके कि यह गणितीय ट्रिक वास्तविक कंप्यूटर चिप्स पर बिजली की तरह तेज़ चले, जिससे सैद्धांतिक गति वास्तविक समय की बचत में बदल सके।
शोध पत्र सुझाव देता है कि हालांकि HyenaND अपने आप में अविश्वसनीय रूप से शक्तिशाली है, यह पुराने "अटेंशन" टूल्स के साथ एक हाइब्रिड टीम के रूप में और भी बेहतर काम करता है। DNA अनुक्रमों, कंप्यूटर विज़न (ImageNet) और मेडिकल इमेजिंग के प्रयोगों में, इन हाइब्रिड टीमों ने शुद्ध अटेंशन मॉडल और अन्य तेज़ मॉडलों को पीछे छोड़ दिया जो डेटा को एक रेखा में पढ़ने की कोशिश करते हैं। लेखक तर्क देते हैं कि हमें अब गति और बुद्धिमत्ता के बीच चुनाव करने की आवश्यकता नहीं है; हम एक ऐसा उपकरण रख सकते हैं जो हमारे डेटा के 3D ज्यामिति का सम्मान करता है, विशाल आकार तक स्केल करता है, और फिर भी विवरणों पर पूरा ध्यान देता है। वे निष्कर्ष निकालते हैं कि यह दृष्टिकोण एक प्रमुख बाधा को दूर करता है, जिससे भविष्य के AI को अंततः अपने मूल, उच्च-रिज़ॉल्यूशन 3D वैभव में दुनिया को "देखने" की अनुमति मिलती है, बिना एक छोटे से छेद के माध्यम से आँख सिकोड़ने के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।