← नवीनतम पेपर
💬 NLP

Before and After Temperature: A Distributional View of Creative LLM Generation

यह शोधपत्र यह प्रदर्शित करता है कि एक नवीन संदर्भ-मुक्त (reference-free) मीट्रिक, जो यह मात्रा निर्धारित करता है कि जनरेशन से पूर्व सैंपलिंग टेम्परेचर (sampling temperature) एक LLM के टोकन वितरण को कैसे नया रूप देता है, LLM जजों के विरुद्ध 0.918 और मानव रैंकिंग के विरुद्ध 0.870 का स्पीयरमैन सहसंबंध (Spearman correlation) प्राप्त करके रचनात्मक गुणवत्ता की भविष्यवाणी करने में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal, S. Shria Parupudi, Saiteja Dasari, Sahiti Bulusu

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal, S. Shria Parupudi, Saiteja Dasari, Sahiti Bulusu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जादूगर को टोपी से खरगोश निकालते हुए देख रहे हैं। आमतौर पर, यह तय करने के लिए कि जादू कैसा था, आप खरगोश को देखते हैं (AI द्वारा लिखा गया अंतिम टेक्स्ट)। आप पूछ सकते हैं, "क्या खरगोश रोएंदार है? क्या वह सफेद है? क्या वह एक असली खरगोश जैसा दिखता है?"

यह शोध पत्र तर्क देता है कि हम गलत चीज़ को देख रहे हैं। खरगोश को परखने के बजाय, हमें यह देखना चाहिए कि खरगोश निकालने से ठीक पहले जादूगर का हाथ कैसे हिला था।

यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध का विवरण दिया गया है:

1. समस्या: खरगोश को नहीं, जादू को परखना

जब AI रचनात्मक कहानियाँ लिखता है, तो तुलना करने के लिए कोई "सही" उत्तर नहीं होता। आमतौर पर, लोग अंतिम टेक्स्ट को देखकर गुणवत्ता को आंकने की कोशिश करते हैं।

  • पुराना तरीका: वे "परप्लेक्सिटी" (Perplexity) जैसे मेट्रिक्स का उपयोग करते हैं (कि AI अपने स्वयं के शब्दों से कितना हैरान है)। शोध पत्र कहता है कि यह एक पेंटिंग को केवल इस आधार पर आंकने जैसा है कि उसमें कितने ब्रशस्ट्रोक हैं। यह आपको बताता है कि पेंटिंग चिकनी है, लेकिन यह नहीं कि वह एक उत्कृष्ट कृति (masterpiece) है या कचरा।
  • नया विचार: शोधकर्ताओं ने AI के आंतरिक विचार प्रक्रिया को देखा जो एक शब्द चुनने से ठीक पहले होती है। उन्होंने AI के "मन" के दो संस्करणों की तुलना की:
    1. कच्चा विश्वास (The Raw Belief): जो AI स्वाभाविक रूप से अगला शब्द कहने के लिए सबसे अच्छा समझता था।
    2. संयमित विश्वास (The Tempered Belief): जो AI ने "तापमान" (temperature) का नॉब घुमाने के बाद सोचा।

2. "तापमान" (Temperature) का नॉब

"तापमान" सेटिंग को अराजकता के लिए वॉल्यूम नॉब के रूप में सोचें।

  • कम तापमान (0.3): AI बहुत शांत और केंद्रित होता है। यह सबसे स्पष्ट, सुरक्षित शब्द चुनता है। यह एक छात्र की तरह है जो परीक्षा दे रहा है और केवल वही उत्तर लिख रहा है जिनके बारे में वह 100% सुनिश्चित है।
  • मध्यम तापमान (0.8): AI सहज है लेकिन फिर भी समझदार है। यह एक दोस्ताना बातचीत की तरह है।
  • उच्च तापमान (1.5): AI "जंगली" मोड पर आ जाता है। यह रचनात्मक होने के लिए अजीब, अस्वाभाविक शब्द चुनने लगता है। यह एक जैज़ संगीतकार की तरह है जो इतना अधिक सुधार (improvisation) कर रहा है कि वह ऐसे सुर बजाने लगता है जो गाने में फिट नहीं बैठते।

3. खोज: बाल्टी में "रिसाव" (The "Leak" in the Bucket)

शोधकर्ताओं ने पाया कि "तापमान" का नॉब AI के मन को कैसे बदलता है, इसमें एक गुप्त संकेत छिपा हुआ है।

कल्पना कीजिए कि AI का मस्तिष्क पानी से भरी एक बाल्टी है (विभिन्न शब्दों की संभावना)।

  • कम/मध्यम तापमान पर: पानी ज्यादातर वहीं रहता है जहाँ से शुरू हुआ था। AI उन शब्दों को चुनता है जो पहले से ही उसके पसंदीदा विकल्पों के "टॉप 90%" में थे।
  • उच्च तापमान (1.5) पर: शोधकर्ताओं ने एक बड़ा "रिसाव" (leak) पाया। जब तापमान को बढ़ाकर 1.5 कर दिया जाता है, तो बाल्टी के मुख्य क्षेत्र से लगभग 13% पानी लीक होकर बाहर निकल जाता है और फर्श पर बिखर जाता है (अस्वाभाविक शब्दों की "पूंछ" या tail में)।

उपमा:
यदि आप किसी इंसान को कहानी सुनाने के लिए कहते हैं, और वह अचानक ऐसे शब्दों का उपयोग करने लगता है जिनका संदर्भ में कोई अर्थ नहीं है (जैसे पिकनिक के बारे में बात करते समय कहना "बिल्ली ने टोस्टर खा लिया"), तो आप जानते हैं कि वह भ्रमित (hallucinating) हो रहा है या अपनी सुसंगतता खो रहा है। शोध पत्र में पाया गया कि AI ठीक उसी समय एक गणितीय "रिसाव" दिखाता है जब वह ऐसा करने लगता है। उच्च तापमान के कारण AI का "अच्छे शब्दों" का आंतरिक मानचित्र इतना विकृत हो जाता है कि वह ऐसे शब्द चुनने लगता है जो वास्तव में उसकी नज़र में कभी थे ही नहीं।

4. परिणाम: एक बेहतर क्रिस्टल बॉल

शोधकर्ताओं ने इस "रिसाव" संकेत का परीक्षण दो समूहों के विरुद्ध किया:

  1. सुपर-स्मार्ट AI जज (GPT-4o और Gemini)।
  2. मानव जज (असली लोग)।

स्कोरबोर्ड:

  • पुराने तरीके: AI की रचनात्मकता को आंकने के मानक तरीके (जैसे यह जांचना कि AI कितना "हैरान" है) का स्कोर लगभग 0.76 था (1.0 के पैमाने पर जहाँ 1.0 पूर्ण है)। वे ठीक थे, लेकिन बहुत अच्छे नहीं।
  • नया तरीका: "Pre-vs-Post Temperature" सिग्नल ने AI जजों के खिलाफ 0.918 और मानव जजों के खिलाफ 0.870 का स्कोर प्राप्त किया।

इसका अर्थ है: नया तरीका यह अनुमान लगाने में काफी बेहतर है कि कौन सी कहानियाँ वास्तव में रचनात्मक और सुसंगत हैं, केवल यह मापकर कि "तापमान" के नॉब ने AI के आंतरिक मानचित्र को कितना विकृत किया।

5. पकड़: यह "अच्छा" और "बेहतरीन" के बीच अंतर नहीं कर सकता

इस जादू के खेल की एक सीमा है।

  • यह तरीका अराजकता (High Temperature = Bad/Incoherent) को पहचानने में अद्भुत है।
  • हालाँकि, इसे शांत (Low Temperature) और सहज (Medium Temperature) के बीच अंतर करने में संघर्ष करना पड़ता है।

उपमा:
यह तरीका एक स्मोक डिटेक्टर (धुआं पहचानने वाला यंत्र) की तरह है। यह घर में आग लगने पर (High Temperature/Incoherent) चिल्लाने में शानदार है। लेकिन यह वास्तव में यह नहीं बता सकता कि घर "सुखद और गर्म" (Medium Temperature) है या "ठंडा और ताज़ा" (Low Temperature)। डिटेक्टर के लिए दोनों ही "कोई आग नहीं" की तरह दिखते हैं। शोध पत्र सुझाव देता है कि "अच्छे" और "बेहतरीन" रचनात्मक लेखन के बीच अंतर करने के लिए, हमें पूरी कहानी (क्रम/sequence) को देखना होगा, न कि केवल चुने जा रहे एकल शब्द को।

सारांश

इस शोध पत्र ने खोजा है कि यह आंकने के लिए कि AI रचनात्मक रूप से लिख रहा है या सिर्फ बड़बड़ा रहा है, आपको पूरी कहानी पढ़ने की आवश्यकता नहीं है। आपको बस यह देखना है कि जब आप "रचनात्मकता" का नॉब बढ़ाते हैं, तो AI की आंतरिक "मतदान" प्रणाली कितनी गड़बड़ा जाती है। यदि गड़बड़ी के कारण AI ऐसे शब्द चुनने लगता है जो वास्तव में उसकी शॉर्टलिस्ट में भी नहीं थे, तो कहानी के बिखरने की संभावना अधिक है। यह सरल जांच AI रचनात्मकता को मापने के पिछले सभी तरीकों की तुलना में बहुत अधिक सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →