← नवीनतम पेपर
🔢 mathematics

Performance evaluation of branch-free fused multiply-add algorithms for multi-component-type multiple-precision floating-point arithmetic

यह शोध पत्र डबल-वर्ड, ट्रिपल-वर्ड और क्वाड्रपल-वर्ड मल्टीपल-प्रिसिजन अंकगणित के लिए नए ब्रांच-फ्री फ्यूज्ड मल्टीप्लाई-ऐड एल्गोरिदम का प्रस्ताव और बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि वे कंडीशनल ब्रांचों को समाप्त करके मौजूदा तरीकों की तुलना में प्रदर्शन में और अधिक सुधार प्राप्त करते हैं।

मूल लेखक: Tomonori Kouya

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tomonori Kouya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केवल मानक, बाजार में उपलब्ध लेगो (Lego) ईंटों का उपयोग करके एक सुपर-सटीक कैलकुलेटर बनाने की कोशिश कर रहे हैं। ये ईंटें आपके कंप्यूटर के सामान्य फ्लोटिंग-पॉइंट नंबरों (floating-point numbers) की तरह हैं। आमतौर पर, जब आप एक "डबल-वर्ड" (दो ईंटें), "ट्रिपल-वर्ड" (तीन ईंटें), या "क्वाड्रपल-वर्ड" (चार ईंटें) नंबर बनाने के लिए इन्हें एक के ऊपर एक रखते हैं, तो आपको निर्माण के दौरान लगातार टुकड़ों के आकार की जांच करनी पड़ती है। यदि कोई टुकड़ा बहुत बड़ा या बहुत छोटा है, तो आपको रुकना पड़ता है, विराम लेना पड़ता है और ढेर को फिर से व्यवस्थित करना पड़ता है। कंप्यूटर चिप्स की दुनिया में, ये "विराम" (pauses) जिन्हें ब्रांच (branches) कहा जाता है, एक बड़ी समस्या बन जाते हैं।

जब आप एक साथ लाखों ऐसे ढेर बनाने की कोशिश करते हैं (जैसे कि एक आधुनिक ग्राफिक्स कार्ड या शक्तिशाली प्रोसेसर पर), तो ये विराम एक दुःस्वप्न बन जाते हैं। यह एक ट्रैफिक जाम की तरह है जहाँ हर कार को आगे बढ़ने से पहले एक अलग साइन बोर्ड चेक करने के लिए रुकना पड़ता है। कुछ कारें बाएं जाती हैं, कुछ दाएं, और पूरी कतार थम जाती है। इसे "लेन डाइवर्जेंस" (lane divergence) कहा जाता है, और यह प्रदर्शन (performance) को खत्म कर देता है।

बड़ी खोज: "बिना रुके" वाला हाईवे
टोमोनोरी कोया (Tomonori Kouya) का शोध पत्र इन स्टैक्स को बनाने का एक नया तरीका पेश करता है जो कभी भी साइन बोर्ड चेक करने के लिए नहीं रुकता। यह एक "ब्रांच-फ्री" (branch-free) एल्गोरिदम है। यह पूछने के बजाय कि "क्या यह टुकड़ा काफी बड़ा है?" और उत्तर का इंतजार करने के बजाय, यह नया तरीका एक चतुर, पूर्व-नियोजित मार्ग का उपयोग करता है जो टुकड़ों के स्वरूप चाहे जो भी हो, पूरी तरह से काम करता है।

यह पेपर सिद्ध करता है, एक सुपर-स्मार्ट रोबोट गणितज्ञ (एक SMT सॉल्वर जिसे FPANVerifier कहा जाता है) का उपयोग करके, कि यह नया मार्ग सभी मानक कंप्यूटर प्रारूपों के लिए सुरक्षित और सटीक है। मुख्य निष्कर्ष यह है कि इन "रुकने और जांचने" वाले विरामों को हटाकर, कंप्यूटर बहुत तेजी से गणना कर सकता है।

जादुई ट्रिक: मूव को फ्यूज करना (Fusing the Move)
पेपर एक विशिष्ट क्रिया पर ध्यान केंद्रित करता है जिसे फ्यूज्ड मल्टीप्लाई-ऐड (Fused Multiply-Add - FMA) कहा जाता है। कल्पना कीजिए कि आपको दो संख्याओं को गुणा करना है और फिर तीसरी संख्या को जोड़ना है। आमतौर पर, आप इसे दो चरणों में करते हैं:

  1. गुणा (और शायद परिणाम को ठीक करने के लिए रुकना)।
  2. जोड़ (और शायद फिर से रुकना)।

लेखक इसका एक "फ्यूज्ड" संस्करण प्रस्तावित करते हैं जो इन दोनों को एक ही सुचारू गति में करता है, जैसे कि एक निंजा जो एक ही सांस में चाकू फेंकता है और उसे पकड़ लेता है।

  • डबल-वर्ड (2 ईंटों) के लिए: पुराने तरीके में 29 चरण लगते थे। नए तरीके में केवल 17
  • ट्रिपल-वर्ड (3 ईंटों) के लिए: पुराने तरीके में 96 चरण लगते थे। नए तरीके में 66
  • क्वाड्रपल-वर्ड (4 ईंटों) के लिए: पुराने तरीके में 209 चरण लगते थे। नए तरीके में 146

पेपर एक "शॉर्टकट" विधि के बारे में भी चर्चा करता है जिसे अन्य शोधकर्ताओं द्वारा प्रस्तावित किया गया था (6-चरण वाली विधि)। महत्वपूर्ण रूप से, यह शॉर्टकट सामान्य रूप से मान्य नहीं है। यह एक उच्च-गति वाला उपकरण है जो केवल तभी काम करता है जब संख्याएं पहले से ही एक विशिष्ट तरीके से व्यवस्थित हों (विशेष रूप से, यदि जोड़ी गई संख्या गुणनफल (product) से कम से कम दोगुनी बड़ी है)। यदि आप इस शॉर्टकट को भाग (division) या वर्गमूल (square root) जैसे सामान्य गणितीय कार्यों पर आज़माते हैं, जहाँ आप यह गारंटी नहीं दे सकते कि वे संख्याएँ इस तरह से मिलेंगी, तो सटीकता बहुत खराब हो जाती है। लेखक का नया तरीका, जो किसी भी संख्या के लिए काम करता है, विशेष व्यवस्था की आवश्यकता के बिना एक सच्चा "ड्रॉप-इन" रिप्लेसमेंट है।

हम कितने आश्वस्त हैं?
लेखक अविश्वसनीय रूप से आश्वस्त हैं, लेकिन वे केवल अनुमान नहीं लगाते, बल्कि ठोस साक्ष्य देते हैं।

  • मशीन-वेरिफाइड: उन्होंने केवल कोड नहीं लिखा और उम्मीद नहीं की; उन्होंने गणितीय रूप से यह सिद्ध करने के लिए एक कंप्यूटर प्रोग्राम का उपयोग किया कि उनके नए तरीके में त्रुटि बहुत कम है (विशेष रूप से, 34u234u^2, 184u3184u^3, और 812u4812u^4 जैसे सूत्रों द्वारा सीमित, जहाँ uu एक एकल संख्या की सूक्ष्म राउंडिंग एरर है)।
  • हर जगह परीक्षण: उन्होंने इन एल्गोरिदम को दो बहुत अलग सुपर-कंप्यूटरों पर चलाया: एक Arm-आधारित चिप (GB10) और एक Intel-आधारित चिप (H100)
  • परिणाम:
    • Arm चिप पर, नया तरीका भाग और वर्गमूल की गणनाओं के लिए 1.5 से 2.1 गुना तेज़ था।
    • Intel चिप पर, यह भाग और वर्गमूल के लिए 1.2 से 1.6 गुना तेज़ था।
    • मैट्रिक्स गुणन (GEMM) जैसे बड़े गणितीय कार्यों के लिए, Arm चिप पर स्पीडअप और भी नाटकीय था, जो ट्रिपल-वर्ड नंबरों के लिए 2.0 गुना तक तेज़ पहुँच गया।

"एक्ज़ैक्ट" (Exact) विकल्प
पेपर इस ट्रिक के एक "परफेक्ट" संस्करण के बारे में भी चर्चा करता है जिसे Exact FMA कहा जाता है। यह संस्करण और भी अधिक सटीक है, लेकिन इसकी एक भारी कीमत है: यह प्रस्तावित नए तरीके की तुलना में 6 से 11 गुना धीमा है। लेखक इस "परफेक्ट" संस्करण का उपयोग केवल तभी करने का सुझाव देते हैं जब आपको वास्तव में, 100% उच्चतम सटीकता की आवश्यकता हो और गति की चिंता न हो। लगभग बाकी सब कुछ के लिए, नया "ब्रांच-फ्री" तरीका विजेता है।

"पुराने" तरीके के बारे में क्या?
पेपर इस शोध के एक पिछले संस्करण की गलती को भी सुधारता है। पहले, लेखकों ने अपने नए तरीके की तुलना एक "पूरी तरह से डिस्टिल्ड" पुराने तरीके से की थी जो अविश्वसनीय रूप से धीमा और अक्षम था। उन्होंने महसूस किया कि वह एक निष्पक्ष मुकाबला नहीं था। जब उन्होंने अपने नए तरीके की तुलना वास्तविक मानक "ब्रांच-फ्री" तरीके से की (जो पहले से ही काफी तेज़ है), तो नया तरीका अभी भी जीत गया, लेकिन स्पीडअप अधिक मामूली था (लगभग 1.3 से 1.7 गुना तेज़)। यह अभी भी एक बड़ी जीत है, लेकिन यह एक वास्तविक परिणाम है।

निष्कर्ष (The Bottom Line)
यह पेपर दिखाता है कि उच्च-परिशुद्धता गणित में "रुकने और जांचने" वाले विरामों को हटाकर, हम सटीकता खोए बिना कंप्यूटरों को काफी तेज़ बना सकते हैं। यह एक ऐसी कार में अपग्रेड करने जैसा है जिसे हर चौराहे पर रुकना पड़ता है, और अब वह कार उड़ सकती है। लेखकों ने सिद्ध किया है कि यह काम करता है, इसे वास्तविक हार्डवेयर पर परखा है, और दिखाया है कि यह अगली पीढ़ी के सुपर-फास्ट कैलकुलेटरों के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →