← नवीनतम पेपर
💬 NLP

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

यह शोध पत्र pp-less सैंपलिंग को प्रस्तुत करता है, जो एक सुदृढ़, हाइपरपैरामीटर-मुक्त डिकोडिंग रणनीति है जो सूचना सिद्धांत के आधार पर टोकन संभावनाओं को गतिशील रूप से ट्रंकेट करती है ताकि विभिन्न कार्यों में, विशेष रूप से उच्च तापमान पर, गुणवत्ता, दक्षता और स्थिरता में मौजूदा विधियों से लगातार बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Runyan Tan, Shuang Wu, Phillip Howard

प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runyan Tan, Shuang Wu, Phillip Howard

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बुद्धिमान, लेकिन थोड़े घबराए हुए दोस्त (AI) से कोई कहानी सुनाने या गणित की समस्या हल करने के लिए कह रहे हैं। हर बार जब आपका दोस्त एक शब्द बोलता है, तो उसे हजारों विकल्पों वाले एक विशाल शब्दकोश में से अगला शब्द चुनना पड़ता है।

अतीत में, AI के पास उस अगले शब्द को चुनने के दो मुख्य तरीके थे:

  1. रोबोट: हमेशा सबसे संभावित शब्द को चुनें। (सुरक्षित, लेकिन उबाऊ और दोहराव वाला)।
  2. जुआरी: शीर्ष 10 या शीर्ष 100 विकल्पों में से किसी एक शब्द को यादृच्छिक (randomly) रूप से चुनें। (मजेदार और रचनात्मक, लेकिन यदि 'टेम्परेचर' बहुत अधिक हो जाए तो यह अक्सर बेतुकी बातें करने लगता है)।

वर्तमान "जुआरी" (Gambler) विधियों की समस्या यह है कि वे नॉब्स और डायल (हाइपरपैरामीटर्स) पर निर्भर करते हैं जिन्हें आपको मैन्युअल रूप से एडजस्ट करना पड़ता है। यदि आप "रचनात्मकता" का नॉब बहुत अधिक बढ़ा देते हैं, तो AI मतिभ्रम (hallucinations) का शिकार होने लगता है या बकवास लिखने लगता है। यदि आप इसे बहुत कम कर देते हैं, तो यह एक उबाऊ रोबोट बन जाता है। हर कार्य के लिए सही सेटिंग ढूँढना एक सिरदर्द है।

पेश है: p-less सैंपलिंग (द "इंट्यूटिव गाइड")

यह पेपर एक नई विधि पेश करता है जिसे p-less सैंपलिंग कहा जाता है। इसे उन भ्रमित करने वाले नॉब्स को एक स्मार्ट, खुद-एडजस्ट होने वाले कंपास से बदलने के रूप में सोचें।

यह इस प्रकार काम करता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. "रैंडम गेस" टेस्ट (यादृच्छिक अनुमान परीक्षण)

कल्पना कीजिए कि आपका दोस्त एक बहुविकल्पीय परीक्षा (multiple-choice test) दे रहा है।

  • पुरानी विधियाँ (Top-p, Min-p): वे कहती हैं, "मैं केवल उन शीर्ष 5 उत्तरों पर विचार करूँगा जो अच्छे दिखते हैं।" लेकिन यदि परीक्षा बहुत कठिन है (high entropy), तो वे शीर्ष 5 उत्तर भी बहुत खराब हो सकते हैं।
  • p-less: यह एक अलग सवाल पूछता है: "यदि मैं अपनी आँखें बंद कर दूँ और पूरी तरह से रैंडम तरीके से एक शब्द चुनूँ, तो मेरे सही होने की संभावना क्या है?"

यह इस "भाग्यशाली अनुमान की संभावना" की गणना सभी संभावित विकल्पों की पूरी सूची के आधार पर करता है। फिर यह कहता है, "मैं केवल उन शब्दों पर विचार करूँगा जो एक भाग्यशाली रैंडम गेस की तुलना में कम से कम उतने ही संभावित हों।"

2. स्व-समायोजित जाल (The Self-Adjusting Net)

कल्पना कीजिए कि आप एक नदी में मछली पकड़ रहे हैं।

  • पुरानी विधियाँ: आप एक निश्चित छेद आकार वाला जाल उपयोग करते हैं। यदि मछलियाँ छोटी और बिखरी हुई हैं (high temperature), तो आपका जाल बहुत सारी छोटी, बेकार मछलियों को अंदर आने देता है (बेतुके शब्द)। यदि मछलियाँ बड़ी और दुर्लभ हैं, तो आपका जाल बड़ी मछलियों को फिसलने दे सकता है।
  • p-less: आपका जाल जादुई रबर का बना है।
    • जब पानी शांत होता है (low entropy, स्पष्ट उत्तर), तो जाल कस जाता है। यह केवल सबसे बड़ी, सबसे आत्मविश्वासी मछलियों को ही अंदर आने देता है।
    • जब पानी अशांत और अराजक होता है (high entropy, रचनात्मक लेखन), तो जाल अपने आप फैल जाता है। यह अधिक मछलियों को अंदर आने देता है, लेकिन यह अभी भी छोटी, बेकार गंदगी को बाहर रखता है जो आपकी पकड़ को बर्बाद कर सकती है।

आपको यह बताने की ज़रूरत नहीं है कि जाल कितना बड़ा होना चाहिए; जाल खुद पानी को देखकर यह तय कर लेता है।

3. यह गेम चेंजर क्यों है?

पेपर दिखाता है कि यह विधि सुपर रोबस्ट (अत्यधिक मजबूत) है:

  • कोई ट्यूनिंग नहीं: आपको सेटिंग्स के साथ छेड़छाड़ करने की आवश्यकता नहीं है। चाहे आप AI से एक सख्त गणितीय प्रमाण लिखवाना चाहते हों या एक काल्पनिक विज्ञान (sci-fi) की कहानी, यह बेहतरीन काम करता है।
  • हाई टेम्परेचर हीरो: आमतौर पर, जब आप "रचनात्मकता" की सेटिंग (temperature) को बढ़ाते हैं, तो अन्य विधियाँ टूट जाती हैं और बेतुकी बातें लिखने लगती हैं। p-less शांत रहता है। यह जानता है कि कब साहसी होना है और कब केंद्रित रहना है, जिससे AI नियंत्रण से बाहर होने से बच जाता है।
  • तेज़ और लीन (Lean): क्योंकि यह शब्दों को चुनने में इतना स्मार्ट है, इसलिए यह अक्सर वाक्यों को तेज़ी से और कम शब्दों में पूरा करता है, जिससे कंप्यूटिंग पावर की बचत होती है।

निष्कर्ष (The Bottom Line)

p-less सैंपलिंग को AI को एक इन-बिल्ट कॉमन सेंस फ़िल्टर देने के रूप में समझें। एक नियम पुस्तिका (जैसे "शीर्ष 50 शब्द चुनें") का आँख बंद करके पालन करने के बजाय, यह पूरी तस्वीर को देखता है और पूछता है, "क्या यह शब्द एक रैंडम गेस से बेहतर है?"

यदि उत्तर हाँ है, तो यह उसे रखता है। यदि उत्तर नहीं है, तो यह उसे फेंक देता है। यह सरल, गणित-आधारित अंतर्ज्ञान AI को अपना मानसिक संतुलन खोए बिना रचनात्मक होने की अनुमति देता है, जिससे जटिल सेटिंग्स को ट्यून करने के सिरदर्द के बिना उच्च-गुणवत्ता वाले परिणाम प्राप्त करने के लिए यह एक शक्तिशाली उपकरण बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →