← नवीनतम पेपर
🔢 mathematics

Precision autotuning for linear solvers via contextual bandit-based RL

यह शोध पत्र एक कॉन्टेक्स्टुअल बैंडिट-आधारित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो लीनियर सॉल्वर के लिए इष्टतम परिशुद्धता विन्यासों को गतिशील रूप से चुनता है, जो प्रशिक्षण और अनदेखे दोनों डेटासेटों में डबल-प्रिसिजन बेसलाइन के समान सटीकता बनाए रखते हुए, प्रभावी रूप से कम्प्यूटेशनल लागत को कम करता है।

मूल लेखक: Erin Carson, Xinye Chen

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Erin Carson, Xinye Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक उच्च-स्तरीय रेस्तरां चला रहे हैं। आपके पास हजारों मेहमानों के लिए जटिल व्यंजनों (गणितीय समस्याओं) का एक विशाल मेनू है।

पारंपरिक रूप से, यह सुनिश्चित करने के लिए कि हर व्यंजन उत्तम हो, आप हर एक रेसिपी के हर एक चरण के लिए सबसे महंगे, उच्च-गुणवत्ता वाले तत्वों का उपयोग करेंगे और सबसे सटीक, धीमी खाना पकाने की विधियों का उपयोग करेंगे। आप प्याज काटने के लिए सोने की परत वाले चाकू और सूप चलाने के लिए हीरे की नोक वाले व्हिस्क (फेंटने वाला उपकरण) का उपयोग करेंगे। यह गारंटी देता है कि भोजन का स्वाद अद्भुत होगा (उच्च सटीकता), लेकिन इसमें बहुत समय लगता है, यह बहुत अधिक ऊर्जा खर्च करता है, और आपका किचन (कंप्यूटर) थक जाता है।

समस्या:
सुपरकंप्यूटरों की दुनिया में, इस "सोने की परत वाले" दृष्टिकोण को डबल प्रिसिजन (FP64) कहा जाता है। यह अविश्वसनीय रूप से सटीक है लेकिन बहुत धीमा और ऊर्जा-खर्चीला है। आधुनिक कंप्यूटरों के पास तेज़, सस्ते उपकरण भी हैं (जैसे हाफ प्रिसिजन या BF16)। ये एक साधारण स्टील के चाकू या प्लास्टिक के व्हिस्क की तरह हैं। ये 32 से 64 गुना तेज़ हैं और बहुत कम ऊर्जा का उपयोग करते हैं। हालाँकि, यदि आप इन सस्ते उपकरणों का उपयोग सब कुछ करने के लिए करते हैं, तो आप व्यंजन खराब कर सकते हैं। एक सूप जिसे प्लास्टिक के व्हिस्क से चलाया गया हो, उसमें छींटे उड़ सकते हैं (संख्यात्मक त्रुटियां), या एक केक ढह सकता है (गणित विफल हो सकता है)।

चुनौती यह है: आप यह कैसे जानेंगे कि कब महंगे सोने के औजारों का उपयोग करना है और कब सस्ते प्लास्टिक के औजारों का उपयोग करना सुरक्षित है?

पुराना तरीका:
पहले, विशेषज्ञ अनुमान लगाने या एक ही रेसिपी को अलग-अलग उपकरणों के साथ सौ बार चलाने की कोशिश करते थे जब तक कि उन्हें काम करने वाला संयोजन न मिल जाए। यह ऐसा है जैसे शेफ सूप चखता है, नमक डालता है, फिर से चखता है, फिर से नमक डालता है, और घंटों तक इसे दोहराता है। यह धीमा, अक्षम है और नई, अनदेखी रेसिपी के लिए काम नहीं करता है।

नया समाधान: "स्मार्ट सू-शेफ" (रीइन्फोर्समेंट लर्निंग)
यह पेपर एक AI (विशेष रूप से, एक कॉन्टेक्स्टुअल बैंडिट) का उपयोग करके एक स्मार्ट, अनुकूलन योग्य सू-शेफ के रूप में एक नई विधि पेश करता है।

यह इस प्रकार काम करता है, हमारे किचन की उपमा का उपयोग करते हुए:

1. सामग्री को पढ़ना (कॉन्टेक्स्टुअल बैंडित)

शेफ द्वारा खाना बनाना शुरू करने से पहले, AI व्यंजन के लिए विशिष्ट सामग्रियों को देखता है। वह केवल अनुमान नहीं लगाता; वह "कंडीशन नंबर" (कितनी कठिन सामग्री है) और "मैट्रिक्स नॉर्म" (बर्तन का आकार) की जांच करता है।

  • उपमा: यदि सामग्रियां सरल हैं (जैसे उबलता हुआ पानी), तो AI जानता है कि सस्ते प्लास्टिक व्हिस्क का उपयोग करना सुरक्षित है। यदि सामग्रियां अस्थिर हैं (जैसे एक सूफ़ले जो ढह सकता है), तो AI जानता है कि उसे सोने के व्हिस्क का उपयोग करना ही होगा

2. प्रयास-और-त्रुटि प्रशिक्षण (रीइन्फोर्समेंट लर्निंग)

AI तुरंत सही उत्तर नहीं जानता। यह रेसिपी के विभिन्न चरणों के लिए विभिन्न उपकरणों के संयोजनों को आज़माना शुरू करता है।

  • पुरस्कार प्रणाली:
    • यदि व्यंजन स्वादिष्ट (सटीक) बनता है (और तेज़ भी था (कुशल)), तो AI को एक गोल्ड स्टार (सकारात्मक पुरस्कार) मिलता है।
    • यदि व्यंजन खराब हो जाता है या इसमें बहुत अधिक समय लगता है, तो AI को रेड कार्ड (नकारात्मक पुरस्कार) मिलता है।
  • सीखना: कई अभ्यास दौरों (ट्रेनिंग एपिसोड) के दौरान, AI एक पैटर्न सीख जाता है। वह समझ जाता है, "आह, साधारण सूप के लिए, मैं काटने और चलाने के लिए सस्ते उपकरणों का उपयोग कर सकता हूँ, लेकिन मुझे अंतिम उबाल के लिए सोने के औजारों पर स्विच करना ही होगा।"

3. "कॉन्टेक्स्टुअल" जादू

जो इसे विशेष बनाता है वह यह है कि AI केवल एक रेसिपी को याद नहीं करता है। यह एक सामान्य नियम सीखता है।

  • उपमा: एक बार जब AI सीख जाता है कि "सूफ़ले के लिए सोने के औजार चाहिए," तो वह इस तर्क को किसी भी नए सूफ़ले रेसिपी पर लागू कर सकता है जिसे उसने पहले कभी नहीं देखा है, भले ही वह अलग स्वाद का क्यों न हो। वह नई सामग्रियों को देखता है, जोखिम का आकलन करता है, और तुरंत निर्णय लेता है कि कौन से औजारों का उपयोग करना है।

4. परिणाम: बलिदान के बिना गति

शोधकर्ताओं ने हजारों गणितीय समस्याओं (लीनियर सिस्टम) पर इस "स्मार्ट सू-शेफ" का परीक्षण किया।

  • परिणाम: AI ने सस्ते और महंगे औजारों के बीच सफलतापूर्वक बदलाव किया।
    • "आसान" गणितीय समस्याओं के लिए, इसने लगभग विशेष रूप से तेज़, कम-परिशुद्धता वाले उपकरणों का उपयोग किया, जिससे कंप्यूटर बहुत तेज़ हो गया और ऊर्जा की भारी बचत हुई।
    • "कठिन" गणितीय समस्याओं के लिए, यह सटीकता सुनिश्चित करने के लिए स्वचालित रूप से धीमे, उच्च-परिशुद्धता वाले औजारों पर वापस आ गया।
  • जीत: अंतिम परिणाम उतने ही सटीक थे जितने कि यदि उन्होंने पूरे समय महंगे सोने के औजारों का उपयोग किया होता, लेकिन यह प्रक्रिया काफी तेज़ और सस्ती थी।

यह क्यों महत्वपूर्ण है

इसे अनुकूली ट्रैफिक कंट्रोल के रूप में सोचें। इसके बजाय कि हर कार गति सीमा पर चले (धीमी लेकिन सुरक्षित) या हर कार तेज़ चले (तेज़ लेकिन खतरनाक), यह AI एक स्मार्ट ट्रैफिक लाइट सिस्टम की तरह कार्य करता है। यह कारों (कंप्यूटेशनल चरणों) को बताता है कि जब सड़क साफ हो तो गति बढ़ाएं और जब मोड़ या खतरा हो तो धीमा हो जाएं।

सारांश में:
यह पेपर कंप्यूटर को उनके प्रयास के प्रति स्मार्ट होना सिखाता है। हर कार्य के लिए बिना सोचे-समझे सबसे शक्तिशाली (और महंगे) कंप्यूटिंग पावर का उपयोग करने के बजाय, यह एक सीखने वाले एल्गोरिदम का उपयोग करता है ताकि यह पता लगाया जा सके कि प्रत्येक विशिष्ट चरण के लिए कितनी शक्ति की आवश्यकता है। यह सुपरकंप्यूटरों को परिणामों की सटीकता से समझौता किए बिना, समस्याओं को तेज़ी से और कम ऊर्जा के साथ हल करने की अनुमति देता है। यह एक अखरोट तोड़ने के लिए हथौड़े के बजाय नटक्रैकर का उपयोग करने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →