← नवीनतम पेपर
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

यह शोध पत्र HyenaND को प्रस्तुत करता है, जो एक सबक्वाड्रेटिक (subquadratic), इनपुट-डिपेंडेंट ऑपरेटर है जो मानक अटेंशन और रिकरेंट मॉडल्स की सीमाओं को दूर करने के लिए सीधे नेटिव मल्टी-डायमेंशनल डेटा स्ट्रक्चर्स पर ग्लोबल कन्वोल्यूशन लागू करता है, और एक विशेषीकृत CUDA इम्प्लीमेंटेशन के माध्यम से प्रतिस्पर्धी सटीकता और महत्वपूर्ण गति प्राप्त करता है।

मूल लेखक: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
प्रकाशित 2026-07-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अभी, सबसे अच्छे रोबोट "अटेंशन" (attention) नामक एक उपकरण का उपयोग करते हैं ताकि वे एक साथ सब कुछ देख सकें, जैसे कि एक छात्र सबसे महत्वपूर्ण शब्दों को खोजने के लिए पूरे पन्ने को स्कैन करता है। यह छोटी कहानियों के लिए बहुत अच्छा काम करता है, लेकिन यदि आप रोबोट को एक पूरी लाइब्रेरी, एक 3D मूवी, या एक जटिल मौसम मानचित्र दे दें, तो यह "अटेंशन" टूल अभिभूत हो जाता है। इसे डेटा के हर एक हिस्से की तुलना दूसरे हिस्से से करनी पड़ती है, जिसमें इतना समय और ऊर्जा लगती है कि रोबोट क्रैश हो जाता है या जीवित रहने के लिए उसे डेटा को एक बहुत ही छोटे छेद (जिसे "पैचिफिकेशन" कहा जाता है) के माध्यम से देखना पड़ता है।

इसे ठीक करने के लिए, वैज्ञानिक तेज़ उपकरण बनाने की कोशिश कर रहे हैं। एक लोकप्रिय विचार "रिकरेंट" (recurrent) मॉडल का उपयोग करना है, जो डेटा को एक टेक्स्ट की लाइन की तरह, एक के बाद एक शब्द के रूप में पढ़ते हैं। लेकिन यह एक 3D मूर्ति को केवल एक कोण से देखने और फिर बाकी का अनुमान लगाने जैसा है; यह वस्तु के प्राकृतिक आकार को नष्ट कर देता है। एक अन्य विचार "कन्वोल्यूशन" (convolutions) का उपयोग करना है, जो एक छवि पर आवर्धक लेंस (magnifying glass) को खिसकाने जैसा है ताकि पैटर्न पहचाने जा सकें। ये तेज़ होते हैं और 3D आकार को बरकरार रखते हैं, लेकिन ये आमतौर पर एक कठोर स्टैम्प की तरह कार्य करते हैं, जो बिना यह देखे कि वास्तव में वहां क्या है, छवि के हर हिस्से पर बिल्कुल एक ही पैटर्न लागू करते हैं। बड़ा सवाल कंप्यूटर विज्ञान के इस कोने में यह है: क्या हम एक ऐसा उपकरण बना सकते हैं जो विशाल 3D डेटा को संभालने के लिए पर्याप्त तेज़ हो, डेटा के प्राकृतिक आकार को बनाए रखे, और जो यह देखने में सक्षम हो कि वह वास्तव में क्या देख रहा है और उसके आधार पर अपने "आवर्धक लेंस" को बदल सके?

यह शोध पत्र HyenaND नामक एक नए उपकरण को पेश करता है जो कहता है "हाँ।" HyenaND को एक जादुई, आकार बदलने वाले आवर्धक लेंस के रूप में समझें जो किसी 3D वस्तु (जैसे मेडिकल स्कैन या मौसम सिमुलेशन) पर बिना उसे 1D लाइन में बदले फिसल सकता है। अतीत के कठोर स्टैम्प के विपरीत, यह टूल पहले पूरी वस्तु को देख सकता है, यह तय कर सकता है कि इसे किस प्रकार के पैटर्न को खोजने की आवश्यकता है, और फिर तुरंत अपने लेंस को उससे मेल खाने के लिए समायोजित कर सकता है। यह "फूरियर ट्रांसफॉर्म" (Fourier transforms - छवियों को ध्वनि तरंगों में बदलने का एक तरीका ताकि उन्हें तेज़ी से प्रोसेस किया जा सके) से जुड़ी एक चतुर गणितीय तकनीक का उपयोग करता है, जो गति को बहुत उच्च बनाए रखती है, और डेटा बड़ा होने पर इसकी लागत केवल थोड़ी सी बढ़ती है, न कि विस्फोट की तरह बढ़ती है।

लेखकों ने पाया कि जटिल, बहु-आयामी डेटा को संभालने के लिए HyenaND एक गेम-चेंजर है। अपने परीक्षणों में, उन्होंने दिखाया कि HyenaND उन कार्यों को संभाल सकता है जो मानक "अटेंशन" टूल्स को मेमोरी सीमाओं के कारण क्रैश कर सकते हैं, जैसे कि 3D मेडिकल इमेज का विश्लेषण करना या फ्लूइड डायनेमिक्स का अनुकरण करना। जब उन्होंने एक "कॉपी करने" वाले खेल पर परीक्षण किया जहाँ रोबोट को 3D ग्रिड से एक विशिष्ट रंग को याद रखना था, तो HyenaND पुराने तरीकों की तुलना में हजारों गुना अधिक सटीक था। उन्होंने nSubQ नामक एक विशेष सॉफ्टवेयर इंजन भी बनाया ताकि यह सुनिश्चित हो सके कि यह गणितीय ट्रिक वास्तविक कंप्यूटर चिप्स पर बिजली की तरह तेज़ चले, जिससे सैद्धांतिक गति वास्तविक समय की बचत में बदल सके।

शोध पत्र सुझाव देता है कि हालांकि HyenaND अपने आप में अविश्वसनीय रूप से शक्तिशाली है, यह पुराने "अटेंशन" टूल्स के साथ एक हाइब्रिड टीम के रूप में और भी बेहतर काम करता है। DNA अनुक्रमों, कंप्यूटर विज़न (ImageNet) और मेडिकल इमेजिंग के प्रयोगों में, इन हाइब्रिड टीमों ने शुद्ध अटेंशन मॉडल और अन्य तेज़ मॉडलों को पीछे छोड़ दिया जो डेटा को एक रेखा में पढ़ने की कोशिश करते हैं। लेखक तर्क देते हैं कि हमें अब गति और बुद्धिमत्ता के बीच चुनाव करने की आवश्यकता नहीं है; हम एक ऐसा उपकरण रख सकते हैं जो हमारे डेटा के 3D ज्यामिति का सम्मान करता है, विशाल आकार तक स्केल करता है, और फिर भी विवरणों पर पूरा ध्यान देता है। वे निष्कर्ष निकालते हैं कि यह दृष्टिकोण एक प्रमुख बाधा को दूर करता है, जिससे भविष्य के AI को अंततः अपने मूल, उच्च-रिज़ॉल्यूशन 3D वैभव में दुनिया को "देखने" की अनुमति मिलती है, बिना एक छोटे से छेद के माध्यम से आँख सिकोड़ने के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →