← नवीनतम पेपर
🤖 machine learning

Breaking chains with trees: Deep learning with O(logN)\mathcal{O}(\log N) parallel time complexity

यह शोध पत्र पदानुक्रमित ब्लॉक-स्थानीय शिक्षण (Hierarchical Block-Local Learning - HBLL) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो डीप न्यूरल नेटवर्क को पदानुक्रमित रूप से जुड़े ब्लॉकों में विभाजित करता है जिन्हें स्थानीय उद्देश्यों के माध्यम से प्रशिक्षित किया जाता है ताकि अनुक्रमिक बैकप्रॉपैगेशन को समाप्त किया जा सके, जिससे विजन और लैंग्वेज कार्यों पर प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए O(logN)\mathcal{O}(\log N) समानांतर समय जटिलता प्राप्त की जा सके।

मूल लेखक: Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam, Robin Schiewer, Amit Kumar Pal, Anand Subramoney, David Kappel

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam, Robin Schiewer, Amit Kumar Pal, Anand Subramoney, David Kappel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 1,000 लोगों की एक विशाल टीम को एक जटिल पहेली हल करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (Backpropagation): "टेलीफोन गेम" की बाधा
वर्तमान में, अधिकांश AI मॉडल को "बैकप्रोपैगेशन" नामक विधि का उपयोग करके प्रशिक्षित किया जाता है। इसे "टेलीफोन" के खेल की तरह समझें जो उल्टा खेला जा रहा है।

  1. टीम पहेली को शुरू से अंत तक हल करती है (फॉरवर्ड पास)।
  2. उन्हें पता चलता है कि उन्होंने बिल्कुल अंत में एक गलती की है।
  3. उन्हें फिर सुधार को पीछे की ओर, एक-एक करके, वापस शुरुआत तक फुसफुसाकर बताना होता है (बैकवर्ड पास)।
  4. समस्या: कोई भी अपनी रणनीति तब तक नहीं बदल सकता जब तक कि उससे पहले वाला व्यक्ति सुधार को फुसफुसाकर बताने का काम पूरा न कर ले। यदि आपके पास 1,000 लोग हैं, तो वह "फुसफुसाहट" बहुत लंबा समय लेती है। इसे "लॉकिंग" (Locking) कहा जाता है। इसका मतलब है कि आप अधिक कंप्यूटर जोड़कर गति नहीं बढ़ा सकते क्योंकि हर कोई अपने बगल वाले व्यक्ति का इंतज़ार कर रहा है। यह कार के इंजन को ठीक करने जैसा भी है जबकि कार अभी चल रही है; आपको एक हिस्सा ठीक करने के लिए पूरी कार के काम करने के तरीके को सटीक रूप से जानना होगा।

नया तरीका (HBLL): "मैनेजर्स का पेड़" (Tree of Managers)
यह पेपर एक नई विधि पेश करता है जिसे Hierarchical Block-Local Learning (HBLL) कहा जाता है। एक लंबी लाइन में खड़े होकर फुसफुसाने के बजाय, कल्पना करें कि आपने टीम को एक पिरामिड के रूप में प्रबंधकों (Managers) में व्यवस्थित किया है।

  • संरचना: 1,000 श्रमिकों की एक एकल रेखा के बजाय, आपके पास एक पेड़ (Tree) है। नीचे छोटे दल (Teams) हैं। उनके ऊपर, मैनेजर हैं जो दो टीमों की देखरेख करते हैं। उनके ऊपर, मैनेजर हैं जो उन मैनेजर्स की देखरेख करते हैं, और इसी तरह, जब तक आप शीर्ष पर पहुँचते हैं जहाँ CEO है।
  • प्रशिक्षण: जब कोई गलती होती है, तो CEO को पूरी गहराई तक फुसफुसाने की आवश्यकता नहीं होती।
    • CEO शीर्ष स्तर के दो प्रबंधकों को बताता है कि क्या गलत हुआ।
    • वे दो मैनेजर अपने चार उप-प्रबंधकों को बताते हैं।
    • वे आठ उप-प्रबंधकों को बताते हैं।
    • जादू: क्योंकि जानकारी पेड़ के माध्यम से नीचे की ओर विभाजित होती है, इसलिए संदेश बहुत तेज़ी से नीचे पहुँच जाता है। यदि आपके पास 1,000 परतें (Layers) हैं, तो संदेश को केवल लगभग 10 चरणों (Logarithmic time) में नीचे पहुँचना होगा, बजाय 1,000 चरणों के।
  • स्थानीय शिक्षण (Local Learning): प्रत्येक छोटा दल (या "ब्लॉक") केवल अपने तत्काल पड़ोसियों की चिंता करता है। उन्हें अपना काम करने के लिए पूरी कंपनी के रहस्यों को जानने की आवश्यकता नहीं है। उन्हें बस यह सुनिश्चित करने की आवश्यकता है कि पहेली का उनका स्थानीय हिस्सा ऊपर और नीचे के हिस्सों के साथ फिट बैठता है।

यह क्यों महत्वपूर्ण है ("जंजीरें तोड़ने" का उदाहरण)
पेपर का दावा है कि यह तरीका प्रतीक्षा करने की "जंजीरों" को तोड़ देता है।

  • गति: क्योंकि "फुसफुसाहट" एक लाइन के बजाय एक पेड़ के माध्यम से यात्रा करती है, इसलिए प्रशिक्षण का समय मॉडल के बड़े होने के साथ बहुत धीरे-धीरे बढ़ता है। पेपर का दावा है कि यह गहरे नेटवर्क को O(log N) समय में प्रशिक्षित कर सकता है, जिसका अर्थ है कि यदि आप नेटवर्क का आकार दोगुना करते हैं, तो प्रशिक्षण का समय दोगुना नहीं होता; बल्कि इसमें केवल थोड़ा सा ही समय जुड़ता है।
  • कोई "वेट ट्रांसपोर्ट" (Weight Transport) नहीं: पुराने तरीके में, "बैकवर्ड फुसफुसाहट" को ठीक उन्हीं तारों (Wires) का उपयोग करना पड़ता है जिनका उपयोग "फॉरवर्ड थिंकिंग" के लिए किया जाता है। HBLL को इस पूर्ण समरूपता (Symmetry) की आवश्यकता नहीं है। यह एक सड़क को ठीक करने के समान है बिना उसी रास्ते पर वापस चले जिससे आप वहां पहुंचे थे।

उन्होंने क्या परीक्षण किया
लेखकों ने इस "मैनेजर्स के पेड़" वाले दृष्टिकोण का कई कठिन कार्यों पर परीक्षण किया:

  1. अंकों को पहचानना (MNIST): उन्होंने दिखाया कि यह बहुत गहरे नेटवर्क पर भी काम करता है जहाँ पुराना तरीका (Backpropagation) कुछ भी उपयोगी सीखने में विफल रहा था।
  2. वस्तुओं को पहचानना (CIFAR-10 & 100): उन्होंने इसका उपयोग "विज़न ट्रांसफॉर्मर्स" (AI जो चित्रों को देखता है) पर किया। यह मानक पद्धति के समान ही प्रदर्शन करता है, भले ही चित्र के कुछ हिस्से गायब हों या लेबल शोर (Noisy) वाले हों।
  3. टेक्स्ट लिखना (WikiText-103): उन्होंने एक AI को वाक्य में अगले शब्द की भविष्यवाणी करना सिखाने के लिए इसका उपयोग किया। इसने अच्छा काम किया, जो साबित करता है कि यह विधि भाषा के लिए भी काम करती है।
  4. समय अनुक्रम (RNNs): उन्होंने इसे समय के साथ होने वाले कार्यों (जैसे वाक्य को शब्द-दर-शब्द पढ़ना) के लिए अनुकूलित किया। उन्होंने इन मॉडलों को समानांतर (Parallel) में प्रशिक्षित करने का तरीका पाया (पेड़ की तरह), लेकिन उपयोग करते समय उन्हें क्रमिक (Sequential) रूप से चलाया (सामान्य वाक्य की तरह)।

छिपी हुई महाशक्ति: लचीला अनुमान (Flexible Inference)
इस पेड़ जैसी संरचना का एक शानदार दुष्प्रभाव यह है कि AI अप्रत्यक्ष रूप से कई "सब-नेटवर्क्स" सीख लेता है।

  • कल्पना कीजिए कि AI के पास कठिन पहेलियों के लिए एक "फुल पाथ" (Full Path - सभी 1,000 परतों का उपयोग करना) है।
  • लेकिन आसान पहेलियों के लिए, इसके पास "शॉर्ट पाथ" (Short Paths - केवल शीर्ष कुछ परतों का उपयोग करना) भी है।
  • इसका मतलब है कि आप एक ही प्रशिक्षित मॉडल का उपयोग एक त्वरित, सरल काम या एक गहरे, जटिल काम के लिए बिना पुन: प्रशिक्षित (Retraining) किए कर सकते हैं। यह एक स्विस आर्मी नाइफ की तरह है जहाँ आप कार्य के आधार पर केवल पेचकश (Screwdriver) निकाल सकते हैं या पूरे उपकरण का उपयोग कर सकते हैं।

सारांश में
यह पेपर AI को प्रशिक्षित करने का एक तरीका प्रस्तावित करता है जो लोगों को लाइन में प्रतीक्षा करने से रोकता है। एक पदानुक्रमित पेड़ (Hierarchical Tree) में सीखने की प्रक्रिया को व्यवस्थित करके, जहाँ स्थानीय दल अपनी छोटी समस्याओं को स्वयं ठीक करते हैं, AI बहुत तेज़ी से समानांतर में सीख सकता है। यह मानक पद्धति के तुलनीय परिणाम प्राप्त करता है लेकिन "लॉकिंग" की बाधा को हटा देता है, जिससे विशाल मॉडलों को अधिक कुशलता से प्रशिक्षित करना संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →