← नवीनतम पेपर
🤖 machine learning

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo एक नवीन ऑप्टिमाइज़र है जो इसके प्रीकंडीशनर्स के देखे गए "स्पाइक-एंड-फ्लैट" आइजनवैल्यू स्ट्रक्चर का लाभ उठाकर KL-Shampoo को उन्नत करता है, जिससे एक निम्न-आयामी उप-स्थान (low-dimensional subspace) पर पूर्ण स्पेक्ट्रल ट्रैकिंग को शेष दिशाओं पर ऑर्थोगोनलाइजेशन के साथ संयोजित किया जाता है, जिससे कई LLM स्केल्स में वैलिडेशन लॉस, मेमोरी दक्षता और प्रशिक्षण गति में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Ruotong Sun, Ermin Wei

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruotong Sun, Ermin Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल रोबोट (एक लार्ज लैंग्वेज मॉडल) को मानव भाषा बोलना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आप उसे लाखों उदाहरण दिखाते हैं और उसे गलतियाँ करने देते हैं। हर बार जब वह कोई गलती करता है, तो आप उसे सही रास्ते पर लाने के लिए एक "धक्का" (ग्रेडिएंट) देते हैं।

समस्या यह है कि ये धक्के अव्यवस्थित होते हैं। कभी-कभी रोबोट को एक दिशा में बहुत छोटा, सटीक धक्का चाहिए होता है, और दूसरी दिशा में एक बहुत बड़ा धक्का। यदि आप उसे केवल बेतरतीब ढंग से धकेलते हैं, तो वह धीरे सीखता है। तेजी से सीखने के लिए, आपको एक स्मार्ट "प्रीकंडीशनर" (preconditioner) की आवश्यकता होती है—एक ऐसा उपकरण जो इन धक्कों को फिर से आकार दे सके ताकि वे पूरी तरह से संतुलित और कुशल बन सकें।

इस काम के लिए दो लोकप्रिय उपकरण हैं: KL-Shampoo और Muon

  • KL-Shampoo एक मास्टर मूर्तिकार की तरह है। यह हर एक धक्के के लिए एकदम सही आकार उकेरने की कोशिश करता है। यह बहुत सटीक है लेकिन पहेली के हर एक हिस्से का आकार निकालने के लिए बहुत अधिक भारी काम (कंप्यूटेशनल पावर और मेमोरी) की आवश्यकता होती है।
  • Muon एक जिम्नास्ट की तरह है। यह हर हिस्से को नया आकार देने की कोशिश नहीं करता; इसके बजाय, यह बस धक्कों के मोमेंटम (momentum) को सीधा करता है, जिससे वे एक साफ, ऑर्थोगोनल (लंबवत/right-angled) तरीके से आगे बढ़ते हैं। यह तेज़ और हल्का है, लेकिन यह उन सूक्ष्म विवरणों को मिस कर सकता है जिन्हें मूर्तिकार पकड़ लेता है।

बड़ी खोज: "स्पाइक-एंड-फ्लैट" (Spike-and-Flat) पैटर्न
लेखकों ने "मूर्तिकार" के काम (KL-Shampoo प्रीकंडीशनर) का बारीकी से अध्ययन किया और एक अजीब, सुंदर पैटर्न देखा। उन्होंने पाया कि "धक्के-के-आकार" (nudge-shapes) यादृच्छिक (random) नहीं हैं। वे एक स्पाइक-एंड-फ्लैट परिदृश्य की तरह दिखते हैं:

  • द स्पाइक (The Spike): कुछ दिशाओं में बहुत बड़े, प्रभावी मान (values) हैं (जैसे कुछ ऊंचे पहाड़)।
  • द फ्लैट (The Flat): बाकी की दिशाएं लगभग एक ही ऊंचाई की हैं (जैसे एक विशाल, सपाट मैदान)।

यह रोबोट के मस्तिष्क की पहली परत से लेकर अंतिम परत तक, सभी परतों में होता है। ऐसा लगता है जैसे रोबोट वास्तव में केवल कुछ विशिष्ट दिशाओं की परवाह करता है, और बाकी सब कुछ केवल "सपाट" शोर (noise) है।

समाधान: Pro-KLShampoo
लेखकों ने एक नया ऑप्टिमाइज़र बनाया जिसे Pro-KLShampoo (प्रोजेक्टेड KL-Shampoo) कहा जाता है। यह एक हाइब्रिड टूल की तरह है जो "स्पाइक-एंड-फ्लैट" खोज का उपयोग करके दोनों दुनियाओं का सर्वश्रेष्ठ लाभ उठाता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. "वीआईपी लाउंज" (The VIP Lounge - सबस्पेस):
    एल्गोरिदम उन "स्पाइक" दिशाओं की पहचान करता है—वे कुछ महत्वपूर्ण पहाड़। यह उन्हें एक विशेष "वीआईपी लाउंज" (एक ट्रैक किया गया सबस्पेस) में रखता है। इस लाउंज के अंदर, यह उन कुछ महत्वपूर्ण दिशाओं के लिए एकदम सही आकार प्राप्त करने के लिए भारी, सटीक मूर्तिकला उपकरण (KL-Shampoo) का उपयोग करता है। यह बाकी हिस्सों पर समय बर्बाद नहीं करता है।

  2. "खुला मैदान" (The Open Field - कॉम्प्लीमेंट):
    "फ्लैट" दिशाओं (बाकी परिदृश्य) के लिए, यह हर कंकड़ को तराशने की कोशिश करना बंद कर देता है। इसके बजाय, यह ऑर्थोगोनलाइजेशन (Orthogonalization) नामक एक चतुर ट्रिक का उपयोग करता है (जो Muon टूल से ली गई है)।

    • जादुई ट्रिक: लेखकों ने गणितीय रूप से सिद्ध किया है कि यदि आप इस सपाट क्षेत्र में धक्कों को केवल "सीधा" (orthogonalize) कर देते हैं, तो यह जादुği रूप से ठीक वही बीजगणितीय परिणाम (algebraic result) प्राप्त कर लेता है जैसा कि आपने वहां भारी मूर्तिकला करने से किया होता। यह ऐसा है जैसे यह महसूस करना कि एक सपाट मैदान के लिए, आपको मानचित्र की आवश्यकता नहीं है; आपको बस एक सीधी रेखा में चलना है, और आप उसी स्थान पर पहुँच जाएंगे जहाँ आप हर समन्वय (coordinate) की गणना करने के बाद पहुँचते।

यह बेहतर क्यों है?

  • गति (Speed): "फ्लैट" हिस्सों के लिए भारी मूर्तिकला को अनदेखा करके और उन्हें बस सीधा करके, यह एल्गोरिदम बहुत तेज़ी से चलता है। यह कंप्यूटर के "वॉलक्लॉक" (वास्तविक समय) पर बहुत समय बचाता है।
  • मेमोरी (Memory): इसे फ्लैट हिस्सों के लिए विशाल, जटिल आकार स्टोर करने की आवश्यकता नहीं होती है। यह केवल छोटे "वीआईपी" आकारों और बाकी के लिए एक संख्या को स्टोर करता है। इससे कंप्यूटर की मेमोरी बचती है।
  • प्रदर्शन (Performance): अलग-अलग आकार के रोबोट्स (GPT-2 और LLaMA) पर परीक्षणों में, Pro-KLShampoo ने मूल KL-Shampoo की तुलना में तेजी से सीखा और कम त्रुटि दर (error rate) तक पहुँचा, जबकि कम मेमोरी का उपयोग किया।

संक्षेप में
पेपर कहता है: "हमने पाया कि आधुनिक AI प्रशिक्षण के पीछे का जटिल गणित एक सरल पैटर्न रखता है: कुछ बड़े स्पाइक्स और एक फ्लैट टेल। हमने एक नया टूल बनाया है जो स्पाइक्स के साथ अत्यधिक सावधानी बरतता है और फ्लैट टेल के साथ एक सरल, तेज़ ट्रिक का उपयोग करता है। यह ट्रिक उतनी ही अच्छी तरह काम करती है जितनी कि कठिन गणित, लेकिन यह बहुत तेज़ और सस्ती है।"

परिणामस्वरूप, यह AI मॉडल्स को प्रशिक्षित करने का एक स्मार्ट, तेज़ तरीका है जो गुणवत्ता से समझौता किए बिना समय और कंप्यूटर संसाधनों की बचत करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →