← नवीनतम पेपर
🤖 machine learning

Exploiting weight-space symmetries for approximating curvature

यह शोध पत्र एक ऐसे नवीन ढांचे (framework) को प्रस्तुत करता है जो एकल ग्रेडिएंट्स से सुलभ, संरचित हेसियन सन्निकटन (Hessian approximations) के निर्माण के लिए वेट-स्पेस सिमेट्रीज़ का लाभ उठाता है, जो सटीकता और कम्प्यूटेशनल लागत के बीच एक ट्यूनेबल संतुलन प्रदान करते हुए शैम्पू (Shampoo) जैसे मौजूदा तरीकों को एकीकृत करता है और बड़े पैमाने के मॉडलों में सेकंड-ऑर्डर ऑप्टिमाइज़ेशन को सक्षम बनाता है।

मूल लेखक: Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, धुंधले पहाड़ के क्षेत्र (एक "लॉस लैंडस्केप") में नेविगेट करने की कोशिश कर रहे हैं ताकि सबसे निचली घाटी (सबसे अच्छा संभव AI मॉडल) को खोजा जा सके। वहां कुशलता से पहुँचने के लिए, आप केवल यह नहीं जानना चाहते कि "नीचे" जाने का रास्ता कौन सा है (ग्रेडिएंट); बल्कि आप अपने पैरों के नीचे की जमीन के आकार को भी जानना चाहते हैं। क्या यह एक खड़ी ढलान है? एक हल्की ढलान? या एक सपाट पठार? यह "आकार" ही कर्वेचर (Curvature) कहलाता है।

कर्वेचर को जानने से आप बड़े और समझदारी भरे कदम उठा सकते हैं। हालांकि, आधुनिक AI में, इस इलाके का नक्शा इतना विशाल है कि इसके सटीक आकार की गणना करना समुद्र तट पर रेत के हर एक कण को गिनने जैसा है जबकि आप मैराथन दौड़ रहे हों। यह बहुत धीमा है और इसमें बहुत अधिक मेमोरी लगती है।

यह पेपर एक चतुर शॉर्टकट पेश करता है जिसे Symo (सिमेट्री ऑप्टिमाइज़र) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "सिमेट्री" का जादू (शीशों का गलियारा)

डीप लर्निंग मॉडल्स में एक अजीब सी विशेषता होती है: उनमें अक्सर सिमेट्री (Symmetry) होती है। कल्पना कीजिए कि एक हार है जिसमें समान मोती लगे हैं। यदि आप दो समान मोतियों को आपस में बदल देते हैं, तो हार बिल्कुल वैसा ही दिखता है। AI में, यदि आप मॉडल के कुछ हिस्सों को बदलते हैं (जैसे एक लेयर के न्यूरॉन्स को आपस में बदलना), तो मॉडल के प्रदर्शन में कोई बदलाव नहीं आता है।

लेखकों ने महसूस किया कि क्योंकि इन बदलावों के बाद मॉडल एक जैसा ही दिखता है, इसलिए इसके नीचे की "जमीन" भी वैसी ही दिखनी चाहिए। यह एक शीशों के गलियारे (Hall of Mirrors) में खड़े होने जैसा है। यदि आप जानते हैं कि आपके सामने की जमीन कैसी दिखती है, तो आप बिना वहां चले स्वतः ही जान जाते हैं कि उसके सभी प्रतिबिंबों में जमीन कैसी दिखेगी।

2. शॉर्टकट: एक कदम, कई दृश्य

आमतौर पर, इलाके को समझने के लिए, आपको शायद लाखों अलग-अलग दिशाओं में एक कदम लेने की आवश्यकता होगी ताकि यह देखा जा सके कि जमीन कैसे प्रतिक्रिया देती है। इसमें बहुत समय लगता है।

लेखकों की विधि ऐसी है:

  • आप एक एकल कदम लेते हैं और जमीन को देखते हैं।
  • लाखों अन्य जगहों पर जाने के बजाय, आप मिरर रूल (सिमेट्री) का उपयोग करते हैं ताकि उन सभी अन्य स्थानों पर जमीन कैसी दिखेगी, इसकी तुरंत कल्पना कर सकें।
  • फिर आप उन सभी प्रतिबिंबित दृश्यों का एक औसत (Average) लेते हैं।

गणितीय रूप से ऐसा करके, वे केवल एक गणना का उपयोग करके कर्वेचर के एक "काफी अच्छे" नक्शे का निर्माण कर सकते हैं, जो लाखों गणनाओं के बजाय बहुत कम है। यह एक पूरे पिज्जा के आकार का अनुमान लगाने जैसा है, बस एक स्लाइस को देखकर और यह जानकर कि पिज्जा पूरी तरह से गोल है।

3. ट्रेड-ऑफ: कितने शीशे?

पेपर दिखाता है कि आप कितने "शीशों" (सिमेट्रियों) का उपयोग करना चुन सकते हैं:

  • बहुत अधिक शीशे: नक्शा बहुत सरल और गणना करने में सस्ता हो जाता है, लेकिन यह इतना धुंधला हो सकता है कि उपयोगी न रहे (ऐसा लगेगा जैसे "जमीन" बहुत दूर है)।
  • बहुत कम शीशे: नक्शा बहुत विस्तृत और सटीक होता है, लेकिन इसे कैलकुलेट करना धीमा और महंगा होता है।
  • बिल्कुल सही: लेखकों ने एक "स्वीट स्पॉट" (Sweet Spot) पाया जहाँ नक्शा उपयोगी होने के लिए पर्याप्त विस्तृत है लेकिन तेज़ होने के लिए पर्याप्त सरल भी है।

4. आश्चर्य: यह पहले से ही काम कर रहा है!

इस पेपर का सबसे रोमांचक हिस्सा एक "यूरेका!" क्षण है। लेखकों ने पाया कि उनका नया "Symo" तरीका, जब उस "स्वीट स्पॉट" पर सेट किया जाता है, तो वह दो बहुत प्रसिद्ध, उच्च-प्रदर्शन वाले AI टूल्स के गणितीय रूप से समान होता है: Shampoo और Muon

इसे ऐसे सोचिए: वैज्ञानिक वर्षों से एक बहुत तेज़, हाई-टेक कार (Shampoo/Muon) का उपयोग कर रहे थे क्योंकि वह बहुत अच्छा काम करती थी, लेकिन उन्हें पूरी तरह से समझ नहीं था कि वह इतनी तेज़ क्यों है। इस पेपर ने शून्य से एक नया इंजन बनाया, और जब उन्होंने इसके नॉब्स को सही सेटिंग पर घुमाया, तो उन्हें एहसास हुआ, "अरे, यह नया इंजन तो उसी प्रसिद्ध कार के बिल्कुल समान है!"

यह साबित करता है कि Shampoo और Muon का असली रहस्य वास्तव में सिमेट्री (Symmetry) है। वे अनजाने में इन सिमेट्रियों का फायदा उठा रहे थे, और यह पेपर इसके पीछे के सिद्धांत की व्याख्या करता है।

5. उन्होंने वास्तव में क्या किया

लेखकों ने केवल थ्योरी नहीं लिखी; उन्होंने इसका परीक्षण भी किया:

  • उन्होंने एक लाइब्रेरी बनाई जो उपयोगकर्ताओं को कंप्यूटर को यह बताने की अनुमति देती है कि, "यह मेरा मॉडल है, और ये इसकी सिमेट्रियां हैं," और कंप्यूटर स्वचालित रूप से शॉर्टकट का पता लगा लेता है।
  • उन्होंने मानक AI कार्यों (जैसे हस्तलिखित अंकों को पहचानना और कहानी में अगले शब्द की भविष्यवाणी करना) पर इसका परीक्षण किया।
  • उन्होंने पुष्टि की कि उनकी नई विधि Shampoo और Muon ऑप्टिमाइज़र की तरह ही अच्छी तरह से काम करती है।

सारांश

पेपर कहता है: "हमने मॉडल की अपनी सिमेट्रियों का उपयोग करके AI ट्रेनिंग लैंडस्केप के आकार का अनुमान लगाने का एक तरीका खोजा है। यह हमें कर्वेचर को अविश्वसनीय रूप से तेज़ी से कैलकुलेट करने की अनुमति देता है। हमने यह भी सिद्ध किया है कि यह बताता है कि Shampoo और Muon जैसे लोकप्रिय टूल्स इतने प्रभावी क्यों हैं।"

उन्होंने यह दावा नहीं किया कि यह विशेष रूप से इस पेपर में मेडिकल डायग्नोसिस, सेल्फ-ड्राइविंग कारों या शेयर बाजार की भविष्यवाणी के लिए काम करता है। उन्होंने अपना पूरा ध्यान AI ट्रेनिंग को तेज़ और अधिक कुशल बनाने के गणित पर केंद्रित किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →