Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Serving-Time Weight Compression
यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में वेट क्वांटाइजेशन (weight quantization), आउटपुट विविधता को कम करके और सिमेंटिक पुनरावृत्ति को बढ़ाकर नियतता (determinism) को बढ़ा देता है, जो अनिवार्य रूप से पूर्वाग्रह को बढ़ाए बिना होता है, और ये व्यवहारिक प्रभाव मॉडल के स्केल के अनुसार महत्वपूर्ण रूप से भिन्न होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
जब हम किसी बड़े भाषा मॉडल (large language model) से ऐसा प्रश्न पूछते हैं जिसके कई संभावित सही उत्तर हो सकते हैं—जैसे कि "शहर में रहने वाले चालक के लिए एक कार ब्रांड का सुझाव दें" या "एक प्रसिद्ध तटरेखा वाला देश बताएं"—तो हम विविध प्रतिक्रियाओं की अपेक्षा करते हैं। ये कृत्रिम बुद्धिमत्ता प्रणाली विशाल मात्रा में मानव पाठ पर प्रशिक्षित होती हैं, जो पहले देखे गए पैटर्न के आधार पर वाक्य में अगले शब्द की भविष्यवाणी करना सीखती हैं। इन प्रणालियों को रोज़मर्रा के कंप्यूटरों पर चलाने के लिए पर्याप्त तेज़ और किफायती बनाने के लिए, डेवलपर्स अक्सर उनकी आंतरिक मेमोरी को संकुचित करते हैं, जिसे 'क्वांटाइजेशन' (quantization) कहा जाता है। यह तकनीक उन संख्याओं की सटीकता को कम करती है जिनका उपयोग मॉडल सोचने के लिए करता है, जिससे गणितीय विवरण के एक छोटे से हिस्से के बदले गति में महत्वपूर्ण वृद्धि और कम लागत प्राप्त होती है। वर्षों से, उद्योग ने यह मान लिया है कि यह संपीड़न मध्यम आकार के मॉडलों के लिए हानिरहित है, बशर्ते मॉडल अभी भी प्रश्नों का सही उत्तर दे सके। हालाँकि, यह धारणा मुख्य रूप से उन कार्यों पर परीक्षण की गई है जिनमें एक ही सही उत्तर होता है, जैसे गणित की समस्या हल करना या किसी विशिष्ट तथ्य की पहचान करना। यह एक महत्वपूर्ण प्रश्न अनुत्तरित छोड़ देता है: जब कई उत्तर मान्य होते हैं, तो क्या मॉडल को संकुचित करने से उसके द्वारा चुने जाने वाले उत्तरों की विविधता बदल जाती है?
एक शोधकर्ता ने इस विशिष्ट प्रश्न की जांच करने के लिए एक मॉडल को केवल एक टेस्ट-टेकर के रूप में नहीं, बल्कि एक अनुशंसाकर्ता (recommender) के रूप में देखते हुए अध्ययन किया। उन्होंने एक लोकप्रिय एआई मॉडल परिवार के तीन अलग-अलग आकारों पर ध्यान केंद्रित किया, जिनमें से प्रत्येक को तीन अलग-अलग स्तरों के मेमोरी संपीड़न पर चलाया: एक मानक, उच्च-सटीक सेटिंग, एक मध्यम रूप से संकुचित सेटिंग, और एक अत्यधिक संकुचित सेटिंग। एक निष्पक्ष तुलना सुनिश्चित करने के लिए, उन्होंने हर अन्य कारक को समान रखा, जिसमें एक ही कंप्यूटर हार्डवेयर, एक ही सॉफ़्टवेयर इंजन, और यहाँ तक कि प्रतिक्रियाएँ उत्पन्न करने के लिए समान रैंडम सीड्स (random seeds) का उपयोग किया गया। उन्होंने मॉडलों से कार ब्रांडों और देशों के बारे में हजारों प्रश्न पूछे, ऐसी स्थितियाँ जहाँ कोई एक सही उत्तर नहीं होता, और फिर प्रतिक्रियाओं की विविधता का सावधानीपूर्वक विश्लेषण किया। उनका लक्ष्य यह देखना था कि क्या संकुचित मॉडल केवल गलतियाँ कर रहे थे, या वे उन संभावनाओं की सीमा को मौलिक रूप से सीमित कर रहे थे जिन्हें वे पेश करने के लिए तैयार थे।
परिणामों ने व्यवहार में एक आश्चर्यजनक विभाजन का खुलासा किया जो पूरी तरह से मॉडल के आकार पर निर्भर करता है। परीक्षण किए गए सबसे छोटे मॉडल के लिए, उच्च संपीड़न ने विविधता में एक ध्यान देने योग्य गिरावट पैदा की। कार ब्रांडों की सिफारिश करने के लिए पूछे जाने पर, इस संकुचित मॉडल ने विभिन्न विकल्पों का मिश्रण देना बंद कर दिया और एक ही विकल्प पर टिक गया। एक विशिष्ट परिदृश्य में, मानक मॉडल ने बीस प्रयासों में चार अलग-अलग कार ब्रांड सुझाए, जबकि संकुचित संस्करण ने बीस में से सभी बीस प्रयासों में बिल्कुल एक ही ब्रांड का सुझाव दिया। इसका मतलब यह नहीं था कि मॉडल किसी विशिष्ट ब्रांड के प्रति हानिकारक रूप से पक्षपाती था; बल्कि, इसका अर्थ यह था कि किसी भी दिए गए प्रश्न के लिए, मॉडल उस एक ब्रांड को दोहराने के लिए बहुत अधिक संभावित हो गया जिसे उसने पहले ही चुन लिया था, जिससे अन्य वैध विकल्प प्रभावी रूप से बंद हो गए। शोधकर्ता ने पाया कि संकुचित मॉडल न तो रूढ़ियों को बढ़ा रहा था और न ही विशिष्ट राष्ट्रीयताओं का पक्ष ले रहा था; इसके बजाय, यह केवल अधिक नियतात्मक (deterministic) हो रहा था, जिससे सुझावों का पूल एक ही, दोहराव वाले पथ तक सीमित हो गया।
जैसे-जैसे शोधकर्ता ने बड़े मॉडलों को देखा, कहानी बदल गई। मध्यम और बड़े मॉडलों को उनके उत्तरों की विविधता में इस कमी का सामना नहीं करना पड़ा। वे अनकंप्रेस्ड (uncompressed) संस्करणों की तरह ही विविध श्रेणी के कार ब्रांडों और देशों की सिफारिश करना जारी रखते हैं। हालाँकि, इन बड़े मॉडलों ने बोलने के तरीके में एक सूक्ष्म बदलाव प्रदर्शित किया। वे अपने अनकंप्रेस्ड समकक्षों की तुलना में विराम चिह्नों, विशेष रूप से 'एम-डैश' (em-dash) का अधिक बार उपयोग करने लगे। यह सुझाव देता है कि जहाँ बड़े मॉडलों ने विभिन्न विचारों को सोचने की अपनी क्षमता बनाए रखी, वहीं संपीड़न ने उनके लेखन की बनावट को बदल दिया, जिससे वे थोड़े अलग सुनाई देने लगे, भले ही सामग्री समृद्ध और विविध बनी रही।
इन परिवर्तनों के पीछे का तंत्र इस बात की गहरी समझ प्रदान करता है कि ये मॉडल कैसे कार्य करते हैं। सबसे छोटे मॉडल में, संपीड़न ने सोचने की प्रक्रिया के व्यक्तिगत चरणों को अधिक अराजक और कम अनुमानित बना दिया, फिर भी अंतिम परिणाम अधिक कठोर हो गया। यह ऐसा है जैसे मॉडल प्रत्येक क्षण में अपने द्वारा चुने गए विशिष्ट शब्दों के बारे में अधिक अनिश्चित हो गया, लेकिन इस भ्रम ने विरोधाभासी रूप से हर बार एक ही अंतिम उत्तर पर पहुँचने में मदद की। शोधकर्ता ने देखा कि जबकि मॉडल की आंतरिक अनिश्चितता बढ़ गई थी, वास्तविक सुझावों की विविधता कम हो गई थी। यह विचार को चुनौती देता है कि संपीड़न केवल मॉडल को "मूर्ख" बनाता है। इसके बजाय, यह दिखाता है कि संपीड़न एक विशिष्ट प्रकार की विफलता पैदा कर सकता है जहाँ मॉडल विभिन्न वैध पथों का पता लगाने की अपनी क्षमता खो देता है, भले ही वह सामान्य रूप से कार्य करता हुआ प्रतीत हो।
अध्ययन निष्कर्ष निकालता है कि ग्राहक सेवा या उत्पाद अनुशंसा जैसे वास्तविक दुनिया के अनुप्रयोगों में उपयोग किए जाने वाले छोटे, संकुचित मॉडलों के लिए जोखिम आवश्यक रूप से यह नहीं है कि मॉडल पक्षपाती या अपमानजनक होगा, बल्कि यह है कि वह अपने सुझावों में बहुत संकीर्ण हो जाएगा। यह ग्राहकों को उपलब्ध उत्पादों की पूरी श्रृंखला दिखाना बंद कर सकता है, जिससे विभिन्न विकल्पों के प्रति उनका एक्सपोजर सीमित हो जाएगा। शोधकर्ता का सुझाव है कि इन प्रणालियों के ऑडिट करते समय, हमें केवल सटीकता से परे देखना चाहिए और इस तरह के संकेंद्रण की जाँच करनी चाहिए। यदि किसी मॉडल का उद्देश्य विकल्प प्रदान करना है, तो उसे विविध विकल्प देने में सक्षम होना चाहिए। संपीड़न जो इन प्रणालियों को किफायती बनाता है, वह सबसे छोटे मॉडलों में, चुपचाप उस विविधता को छीन सकता है जो उन्हें उपयोगी बनाती है, जिससे एक सहायक मॉडल एक दोहराव करने वाले सहायक में बदल जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।