How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus
यह शोध पत्र प्रदर्शित करता है कि जहाँ Orthrus FP32 में सटीक प्रक्षेपवक्र मिलान (exact trajectory matching) के साथ लॉसलेस स्पेक्युलेटिव डिकोडिंग प्राप्त करता है, वहीं इसका दावा किया गया लॉसलेसनेस BF16 परिशुद्धता (precision) के तहत काफी घट जाता है, जो यह रेखांकित करता है कि संख्यात्मक परिशुद्धता प्रक्षेपवक्र तुल्यता (trajectory equivalence) को महत्वपूर्ण रूप से प्रभावित करती है, भले ही डाउनस्ट्रीम टास्क प्रदर्शन अप्रभावित रहे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक कंप्यूटर जो टेक्स्ट लिखते हैं, जिन्हें भाषा मॉडल (लैंग्वेज मॉडल्स) कहा जाता है, सूचना उत्पन्न करने के हमारे तरीके में एक प्रमुख शक्ति बन गए हैं। ये प्रणालियाँ अपने से पहले आए शब्दों के आधार पर एक वाक्य में अगले शब्द की भविष्यवाणी करके काम करती हैं, जो एक बार में एक कदम करके होता है। यह विधि विश्वसनीय है लेकिन स्वाभाविक रूप से धीमी है, क्योंकि कंप्यूटर को दूसरे शब्द के बारे में सोचना शुरू करने से पहले पहले शब्द की गणना पूरी करनी होती है। जैसे-जैसे ये मॉडल बड़े होते जाते हैं और बातचीत लंबी होती जाती है, यह चरण-दर-चरण प्रक्रिया एक बाधा बन जाती है, जिससे इस तकनीक का उपयोग करना महंगा और सुस्त हो जाता है। इसे तेज करने के लिए, शोधकर्ताओं ने 'स्पेक्टिव डिकोडिंग' (speculative decoding) नामक एक तकनीक विकसित की है। यह दृष्टिकोण एक साथ कई भविष्य के शब्दों का अनुमान लगाने की कोशिश करता है, जैसे कि कोई पाठक किताब को सरसरी निगाह से पढ़ रहा हो, और फिर जाँच करता है कि वे अनुमान सही हैं या नहीं। यदि अनुमान सही होते हैं, तो कंप्यूटर बहुत सारा समय बचा लेता है।
एक हालिया प्रणाली, जिसे ऑर्थ्रस (Orthrus) कहा जाता है, ने वादा किया था कि वह बिना किसी सटीकता को खोए ऐसा कर सकती है। यह एक मानक, धीमे टेक्स्ट जनरेटर को एक तेज़, समानांतर अनुमान लगाने वाले इंजन के साथ जोड़ती है। इसके रचनाकारों ने दावा किया कि एक अंतर्निहित जाँच तंत्र यह सुनिश्चित करेगा कि तेज़ इंजन उसी शब्दों के क्रम को उत्पन्न करे जो मूल, धीमे इंजन ने बनाया था, जिससे यह त्वरण वास्तव में "लॉसलेस" (lossless) बन जाता है। इस संदर्भ में लॉसलेस का अर्थ है कि अंतिम आउटपुट बिल्कुल वैसा ही है जैसा कि मूल, धीमे मॉडल ने उत्पादित किया होता, अंतिम अक्षर तक। यह वादा महत्वपूर्ण था क्योंकि इसने सुझाव दिया कि हमारे पास दोनों दुनियाओं का सर्वश्रेष्ठ मिल सकता है: समानांतर अनुमान की गति और मूल मॉडल की पूर्ण विश्वसनीयता।
शोधकर्ताओं की एक टीम ने स्वतंत्र रूप से इस वादे का परीक्षण करने का निर्णय लिया। उन्होंने अपना खुद का ऑर्थ्रस सिस्टम बनाया और कोडिंग लिखने, गणित की समस्याओं को हल करने और कविता रचने सहित विभिन्न कार्यों पर मूल मॉडल के विरुद्ध इसके आउटपुट की तुलना की। उन्होंने इन परीक्षणों को एक मानक स्तर की संख्यात्मक सटीकता (numerical precision) का उपयोग करके चलाया जो दक्षता के लिए अधिकांश आधुनिक कंप्यूटरों द्वारा उपयोग की जाती है। जब उन्होंने तेज़ ऑर्थ्रस सिस्टम द्वारा उत्पन्न शब्द अनुक्रमों की तुलना धीमे मूल सिस्टम से की, तो उन्हें एक आश्चर्यजनक परिणाम मिला। दोनों सिस्टम हमेशा सहमत नहीं हुए। वास्तव में, मूल जारी किए गए मॉडल के लिए, अनुक्रम केवल लगभग 45 प्रतिशत बार पूरी तरह से मेल खाते थे। शोधकर्ताओं के अपने स्वतंत्र रूप से प्रशिक्षित संस्करण के लिए, मिलान दर और भी कम, 43 प्रतिशत थी। इसका मतलब है कि आधे से अधिक मामलों में, तेज़ सिस्टम ने थोड़ा अलग रास्ता अपनाया, और उन शब्दों को चुना जो मूल मॉडल चुनता।
शोधकर्ताओं ने यह समझने के लिए गहराई से जांच की कि ऐसा क्यों हुआ। उन्होंने पाया कि सिस्टम के सहमत होने की संभावना मूल मॉडल के लिए टेक्स्ट की भविष्यवाणी करना कितना कठिन था, इससे जुड़ी हुई थी। जब मूल मॉडल अपने अगले शब्द को लेकर बहुत आश्वस्त था, तो तेज़ सिस्टम आमतौर पर उससे मेल खाता था। हालाँकि, जब टेक्स्ट अधिक जटिल था या मॉडल कम निश्चित था, तो तेज़ सिस्टम अलग होने और दूसरा शब्द चुनने की अधिक संभावना रखता था। यह सुझाव देता है कि "लॉसलेस" का दावा मानक कंप्यूटर गणनाओं की विशिष्ट स्थितियों में कायम नहीं रह सका। शोधकर्ताओं ने यह भी नोट किया कि यह विचलन अनिवार्य रूप से टेक्स्ट को खराब नहीं करता है। जब उन्होंने तर्क और कोडिंग के लिए मानक बेंचमार्क पर मॉडलों का परीक्षण किया, तो तेज़ सिस्टम का स्कोर कभी-कभी धीमे वाले की तुलना में थोड़ा अधिक रहा, जो दर्शाता है कि एक अलग रास्ता हमेशा खराब परिणाम नहीं देता है।
सिस्टम के असहमत होने के रहस्य को सुलझाने के लिए, शोधकर्ताओं ने कंप्यूटर द्वारा संख्याओं को संभालने के तरीके को बदल दिया। उन्होंने पूरे प्रयोग को उच्च स्तर की संख्यात्मक सटीकता का उपयोग करके दोहराया, जो कंप्यूटर को बहुत अधिक सटीकता के साथ संख्याओं को संग्रहीत करने की अनुमति देता है। जब उन्होंने इस स्विच को किया, तो परिणाम पूरी तरह से बदल गया। इस अधिक सटीक गणना के तहत, तेज़ ऑर्थ्रस सिस्टम ने सभी 1,190 टेस्ट प्रॉम्प्ट्स में धीमे मूल मॉडल के साथ पूरी तरह से मेल खाया। इस खोज ने खुलासा किया कि शुरुआती असहमति ऑर्थ्रस सिस्टम के डिज़ाइन में किसी दोष के कारण नहीं थी, बल्कि उन सूक्ष्म राउंडिंग एरर्स (rounding errors) के कारण थी जो तब होते हैं जब कंप्यूटर मानक, कम सटीक गणित का उपयोग करते हैं।
अध्ययन यह निष्कर्ष निकालता है कि "लॉसलेस" त्वरण का वादा पूरी तरह से कंप्यूटर द्वारा उपयोग की जाने वाली संख्यात्मक सटीकता पर निर्भर करता है। जबकि ऑर्थ्रस सिस्टम सिद्धांत रूप में अपने इरादे के अनुसार काम करता है, मानक हार्डवेयर पर चलाने की व्यावहारिक वास्तविकता छोटे एरर पैदा कर सकती है जो अंतिम आउटपुट को बदल सकते हैं। शोधकर्ता तर्क देते हैं कि जब वैज्ञानिक दावा करते हैं कि कोई सिस्टम लॉसलेस है, तो उन्हें उपयोग की जा रही संख्यात्मक सटीकता के स्तर को निर्दिष्ट करना चाहिए, क्योंकि एक प्रणाली जो एक सेटिंग में पूरी तरह से सटीक है, वह दूसरी सेटिंग में अलग परिणाम दे सकती है। यह कार्य स्पष्ट करता है कि हालांकि हम भाषा मॉडलों को बहुत तेज़ बना सकते हैं, यह सुनिश्चित करने के लिए कि वे मूल मॉडल के समान आउटपुट उत्पन्न करें, मॉडल के आर्किटेक्चर के बजाय अंतर्निहित गणित पर सावधानीपूर्वक ध्यान देने की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।