Quantifying non deterministic drift in large language models
यह शोध पत्र यह प्रदर्शित करके कि विभिन्न मॉडलों और प्रॉम्प्ट प्रकारों में शून्य तापमान (zero temperature) पर भी आउटपुट परिवर्तनशीलता बनी रहती है, लार्ज लैंग्वेज मॉडल्स में आधारभूत व्यवहारिक विचलन (baseline behavioral drift) को अनुभवजन्य रूप से परिमाणित करता है, जो भविष्य की न्यूनीकरण रणनीतियों के मूल्यांकन के लिए एक व्यवस्थित संदर्भ बिंदु स्थापित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक रोबोट सहायक है। आप उससे बिल्कुल एक ही सवाल पूछते हैं, "मौसम कैसा है?" और आप उसे कहते हैं, "जितना संभव हो सके उतना सटीक और उबाऊ बनो।" आप उम्मीद करेंगे कि वह हर बार बिल्कुल एक ही जवाब देगा, है ना?
यह शोध पत्र, जिसे क्लेयर निकोलसन ने लिखा है, इस बात की जांच करता है कि जब आप वास्तव में आधुनिक AI रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) के साथ ऐसा करने की कोशिश करते हैं तो क्या होता है। चौंकाने वाला निष्कर्ष यह है: भले ही आप रोबोट को पूरी तरह से सुसंगत रहने के लिए कहें, फिर भी वह अक्सर वैसा नहीं रहता है।
यहाँ इस अध्ययन के निष्कर्षों का रोजमर्रा के उदाहरणों का उपयोग करके सरल विवरण दिया गया है:
1. "मशीन में भूत" (Non-Determinism)
शोधकर्ताओं ने दो अलग-अलग AI मॉडलों के साथ दो जुड़वा बच्चों की तरह व्यवहार किया:
- क्लाउड रोबोट: एक मॉडल जिसे
gpt-4o-miniकहा जाता है जो एक बड़े सर्वर फार्म पर रहता है (जैसे एक रेस्टोरेंट की रसोई जिसे आप देख नहीं सकते)। - लोकल रोबोट: एक मॉडल जिसे
llama3.1-8bकहा जाता है जो लैब में एक सिंगल कंप्यूटर पर चलता है (जैसे आपके अपने किचन में खाना बनाने वाला शेफ)।
उन्होंने इन रोबोटों से एक ही सवाल बार-बार पूछे, और सेटिंग्स को "अधिकतम निरंतरता" (टेम्परेचर 0.0) पर रखा।
- परिणाम: क्लाउड रोबोट ने 4 में से 1 बार अलग जवाब दिया। लोकल रोबोट अधिक सुसंगत था, लेकिन फिर भी उसने 10 में से 1 बार अपना जवाब बदला।
उपमा: कल्पना कीजिए कि आप एक बेकर से एक ही रेसिपी और सामग्री का उपयोग करके चॉकलेट केक बनाने के लिए कहते हैं। आप उम्मीद करेंगे कि केक हर बार बिल्कुल एक जैसा दिखेगा। लेकिन इस अध्ययन में, बेकर (AI) कभी-कभी थोड़ा सा नमक डाल देता है, या स्प्रिंकल्स को अलग तरह से सजा देता है, भले ही आपने उन्हें रेसिपी का पालन करने के लिए कहा हो।
2. यह क्यों होता है?
शोध पत्र इस "विचलन" (drift) के दो मुख्य कारण बताता है:
- मॉडल स्वयं: बड़े, अधिक जटिल मॉडल छोटे मॉडलों की तुलना में अधिक "अस्थिर" और कम सुसंगत दिखाई देते हैं।
- किचन (इंफ्रास्ट्रक्चर): क्लाउड रोबोट के लिए, इंटरनेट के माध्यम से आपकी रिक्वेस्ट कैसे यात्रा करती है, कंप्यूटर डेटा को कैसे प्रोसेस करता है, या सर्वर कैसे व्यवस्थित है, यह भी परिणाम बदल सकता है। यह ऐसा है जैसे यदि बेकर के ओवन का तापमान थोड़ा ऊपर-नीचे हो रहा हो या हर बार मिक्सिंग बाउल का आकार थोड़ा अलग हो, भले ही रेसिपी वही हो।
3. "टेम्परेचर" नॉब
शोधकर्ताओं ने यह परीक्षण भी किया कि क्या होता है जब वे "टेम्परेचर" (एक सेटिंग जो AI को अधिक रचनात्मक और रैंडम बनाती है) को बढ़ा देते हैं।
- कम टेम्परेचर (0.0): रोबोट उबाऊ और सुसंगत होने की कोशिश करता है, लेकिन फिर भी कभी-कभार चूक जाता है।
- उच्च टेम्परेचर (0.7): रोबोट बेकाबू हो जाता है। इस मोड में, हर एक जवाब अलग था। यह ऐसा था जैसे बेकर को केक बनाने के लिए कहना, लेकिन उसे "रचनात्मक होने" के लिए कहना। अचानक, हर केक पूरी तरह से अलग दिखने लगा।
4. "वर्ड काउंट" और "सिमिलैरिटी" चेक
उन्होंने इसे कैसे मापा? उन्होंने केवल जवाबों को पढ़ा नहीं; उन्होंने तुलना करने के लिए गणित का उपयोग किया।
- यूनिक फ्रैक्शन (Unique Fraction): उन्होंने गिना कि कितनी बार रोबोट ने पूरी तरह से नया जवाब दिया।
- जैकार्ड सिमिलैरिटी (Jaccard Similarity): यह पूछने का एक फैंसी तरीका है कि, "कितने शब्द समान हैं?"
- जब रोबोट "उबाऊ" (0.0) था, तो जवाब लगभग 90% समान थे।
- जब रोबोट "रचनात्मक" (0.7) था, तो जवाब 50% से भी कम समान थे।
5. इसका आपके लिए क्या अर्थ है ("वैरिएंस बजट")
यह पेपर आपको इस समस्या को ठीक करने का तरीका नहीं बताता है। इसके बजाय, यह कहता है: "आपको इसे ठीक करने की कोशिश करने से पहले यह जानने की जरूरत है कि यह हो रहा है।"
इसे एक "वैरिएंस बजट" (Variance Budget) की तरह समझें।
- यदि आप वित्तीय आंकड़े उत्पन्न करने वाली एक प्रणाली बना रहे हैं, तो आप कह सकते हैं, "मैं आउटपुट में केवल 5% अंतर बर्दाश्त कर सकता हूँ।"
- यदि AI इससे अधिक भटकता है, तो आप जानते हैं कि आपको हस्तक्षेप करने की आवश्यकता है।
- लेकिन पहले, आपको यह जानने की आवश्यकता है कि बिना किसी मदद के "सामान्य" विचलन कैसा दिखता है। यह पेपर उस बेसलाइन मैप को प्रदान करता है।
सारांश
यह अध्ययन एक "मापन रिपोर्ट" है। इसने रोबोटों को बदलने से रोकने का कोई नया तरीका नहीं बनाया। इसके बजाय, इसने ठीक से मापा कि वे बिना किसी मदद के कितना बदलते हैं।
मुख्य निष्कर्ष: भले ही आपको लगता है कि आपने एक रोबोट को 100% प्रेडिक्टेबल (अनुमानित) होने के लिए लॉक कर दिया है, फिर भी वह वास्तव में थोड़ा हिल-डुल रहा है। यदि आप AI से मिलने वाले एक एकल उत्तर पर भरोसा करते हैं, तो हो सकता है कि आप इस तथ्य को मिस कर रहे हों कि अगली बार पूछने पर उसने कुछ थोड़ा अलग कहा होता। पूरी तस्वीर पाने के लिए, आपको एक ही सवाल को कुछ बार पूछने और औसत देखने की आवश्यकता हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।