← नवीनतम पेपर
💬 NLP

Quantifying non deterministic drift in large language models

यह शोध पत्र यह प्रदर्शित करके कि विभिन्न मॉडलों और प्रॉम्प्ट प्रकारों में शून्य तापमान (zero temperature) पर भी आउटपुट परिवर्तनशीलता बनी रहती है, लार्ज लैंग्वेज मॉडल्स में आधारभूत व्यवहारिक विचलन (baseline behavioral drift) को अनुभवजन्य रूप से परिमाणित करता है, जो भविष्य की न्यूनीकरण रणनीतियों के मूल्यांकन के लिए एक व्यवस्थित संदर्भ बिंदु स्थापित करता है।

मूल लेखक: Claire Nicholson

प्रकाशित 2026-01-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Claire Nicholson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक रोबोट सहायक है। आप उससे बिल्कुल एक ही सवाल पूछते हैं, "मौसम कैसा है?" और आप उसे कहते हैं, "जितना संभव हो सके उतना सटीक और उबाऊ बनो।" आप उम्मीद करेंगे कि वह हर बार बिल्कुल एक ही जवाब देगा, है ना?

यह शोध पत्र, जिसे क्लेयर निकोलसन ने लिखा है, इस बात की जांच करता है कि जब आप वास्तव में आधुनिक AI रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) के साथ ऐसा करने की कोशिश करते हैं तो क्या होता है। चौंकाने वाला निष्कर्ष यह है: भले ही आप रोबोट को पूरी तरह से सुसंगत रहने के लिए कहें, फिर भी वह अक्सर वैसा नहीं रहता है।

यहाँ इस अध्ययन के निष्कर्षों का रोजमर्रा के उदाहरणों का उपयोग करके सरल विवरण दिया गया है:

1. "मशीन में भूत" (Non-Determinism)

शोधकर्ताओं ने दो अलग-अलग AI मॉडलों के साथ दो जुड़वा बच्चों की तरह व्यवहार किया:

  • क्लाउड रोबोट: एक मॉडल जिसे gpt-4o-mini कहा जाता है जो एक बड़े सर्वर फार्म पर रहता है (जैसे एक रेस्टोरेंट की रसोई जिसे आप देख नहीं सकते)।
  • लोकल रोबोट: एक मॉडल जिसे llama3.1-8b कहा जाता है जो लैब में एक सिंगल कंप्यूटर पर चलता है (जैसे आपके अपने किचन में खाना बनाने वाला शेफ)।

उन्होंने इन रोबोटों से एक ही सवाल बार-बार पूछे, और सेटिंग्स को "अधिकतम निरंतरता" (टेम्परेचर 0.0) पर रखा।

  • परिणाम: क्लाउड रोबोट ने 4 में से 1 बार अलग जवाब दिया। लोकल रोबोट अधिक सुसंगत था, लेकिन फिर भी उसने 10 में से 1 बार अपना जवाब बदला।

उपमा: कल्पना कीजिए कि आप एक बेकर से एक ही रेसिपी और सामग्री का उपयोग करके चॉकलेट केक बनाने के लिए कहते हैं। आप उम्मीद करेंगे कि केक हर बार बिल्कुल एक जैसा दिखेगा। लेकिन इस अध्ययन में, बेकर (AI) कभी-कभी थोड़ा सा नमक डाल देता है, या स्प्रिंकल्स को अलग तरह से सजा देता है, भले ही आपने उन्हें रेसिपी का पालन करने के लिए कहा हो।

2. यह क्यों होता है?

शोध पत्र इस "विचलन" (drift) के दो मुख्य कारण बताता है:

  • मॉडल स्वयं: बड़े, अधिक जटिल मॉडल छोटे मॉडलों की तुलना में अधिक "अस्थिर" और कम सुसंगत दिखाई देते हैं।
  • किचन (इंफ्रास्ट्रक्चर): क्लाउड रोबोट के लिए, इंटरनेट के माध्यम से आपकी रिक्वेस्ट कैसे यात्रा करती है, कंप्यूटर डेटा को कैसे प्रोसेस करता है, या सर्वर कैसे व्यवस्थित है, यह भी परिणाम बदल सकता है। यह ऐसा है जैसे यदि बेकर के ओवन का तापमान थोड़ा ऊपर-नीचे हो रहा हो या हर बार मिक्सिंग बाउल का आकार थोड़ा अलग हो, भले ही रेसिपी वही हो।

3. "टेम्परेचर" नॉब

शोधकर्ताओं ने यह परीक्षण भी किया कि क्या होता है जब वे "टेम्परेचर" (एक सेटिंग जो AI को अधिक रचनात्मक और रैंडम बनाती है) को बढ़ा देते हैं।

  • कम टेम्परेचर (0.0): रोबोट उबाऊ और सुसंगत होने की कोशिश करता है, लेकिन फिर भी कभी-कभार चूक जाता है।
  • उच्च टेम्परेचर (0.7): रोबोट बेकाबू हो जाता है। इस मोड में, हर एक जवाब अलग था। यह ऐसा था जैसे बेकर को केक बनाने के लिए कहना, लेकिन उसे "रचनात्मक होने" के लिए कहना। अचानक, हर केक पूरी तरह से अलग दिखने लगा।

4. "वर्ड काउंट" और "सिमिलैरिटी" चेक

उन्होंने इसे कैसे मापा? उन्होंने केवल जवाबों को पढ़ा नहीं; उन्होंने तुलना करने के लिए गणित का उपयोग किया।

  • यूनिक फ्रैक्शन (Unique Fraction): उन्होंने गिना कि कितनी बार रोबोट ने पूरी तरह से नया जवाब दिया।
  • जैकार्ड सिमिलैरिटी (Jaccard Similarity): यह पूछने का एक फैंसी तरीका है कि, "कितने शब्द समान हैं?"
    • जब रोबोट "उबाऊ" (0.0) था, तो जवाब लगभग 90% समान थे।
    • जब रोबोट "रचनात्मक" (0.7) था, तो जवाब 50% से भी कम समान थे।

5. इसका आपके लिए क्या अर्थ है ("वैरिएंस बजट")

यह पेपर आपको इस समस्या को ठीक करने का तरीका नहीं बताता है। इसके बजाय, यह कहता है: "आपको इसे ठीक करने की कोशिश करने से पहले यह जानने की जरूरत है कि यह हो रहा है।"

इसे एक "वैरिएंस बजट" (Variance Budget) की तरह समझें।

  • यदि आप वित्तीय आंकड़े उत्पन्न करने वाली एक प्रणाली बना रहे हैं, तो आप कह सकते हैं, "मैं आउटपुट में केवल 5% अंतर बर्दाश्त कर सकता हूँ।"
  • यदि AI इससे अधिक भटकता है, तो आप जानते हैं कि आपको हस्तक्षेप करने की आवश्यकता है।
  • लेकिन पहले, आपको यह जानने की आवश्यकता है कि बिना किसी मदद के "सामान्य" विचलन कैसा दिखता है। यह पेपर उस बेसलाइन मैप को प्रदान करता है।

सारांश

यह अध्ययन एक "मापन रिपोर्ट" है। इसने रोबोटों को बदलने से रोकने का कोई नया तरीका नहीं बनाया। इसके बजाय, इसने ठीक से मापा कि वे बिना किसी मदद के कितना बदलते हैं।

मुख्य निष्कर्ष: भले ही आपको लगता है कि आपने एक रोबोट को 100% प्रेडिक्टेबल (अनुमानित) होने के लिए लॉक कर दिया है, फिर भी वह वास्तव में थोड़ा हिल-डुल रहा है। यदि आप AI से मिलने वाले एक एकल उत्तर पर भरोसा करते हैं, तो हो सकता है कि आप इस तथ्य को मिस कर रहे हों कि अगली बार पूछने पर उसने कुछ थोड़ा अलग कहा होता। पूरी तस्वीर पाने के लिए, आपको एक ही सवाल को कुछ बार पूछने और औसत देखने की आवश्यकता हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →