← नवीनतम पेपर
💻 computer science

Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary

यह शोध पत्र लार्ज लैंग्वेज मॉडल (Large Language Model) के निर्णय सीमाओं (decision boundaries) को चित्रित करने के लिए एक सैद्धांतिक ढांचे के रूप में डिसीजन पोटेंशियल सरफेस (Decision Potential Surface - DPS) को प्रस्तुत करता है और K-DPS का प्रस्ताव करता है, जो एक व्यावहारिक एल्गोरिदम है जो केवल सीमित संख्या में नमूनों (samples) का उपयोग करके इन सीमाओं का अनुमान लगाता है और जिसका त्रुटि स्तर प्रमाणित रूप से नगण्य है।

मूल लेखक: Zi Liang, Zhiyao Wu, Haoyang Shang, Yulin Jin, Qingqing Ye, Huadi Zheng, Peizhao Hu, Haibo Hu

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zi Liang, Zhiyao Wu, Haoyang Shang, Yulin Jin, Qingqing Ye, Huadi Zheng, Peizhao Hu, Haibo Hu

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल रसोई में एक विशाल, अति-बुद्धिमान शेफ के रूप में करें। जब आप शेफ को कोई प्रॉम्प्ट देते हैं (जैसे "एक बिल्ली के बारे में कहानी लिखें"), तो शेफ केवल एक व्यंजन नहीं चुनता; उनके पास अरबों संभावित वाक्यों (टोकन) का एक मानसिक मेनू होता है जो वे आगे परोस सकते हैं।

आमतौर पर, शेफ सबसे स्वादिष्ट लगने वाला एक वाक्य चुनता है। लेकिन कभी-कभी, दो या अधिक वाक्य लगभग समान रूप से स्वादिष्ट होते हैं। वह सटीक क्षण जहाँ शेफ दो विकल्पों के बीच झिझक रहा होता है, जिसे शोधकर्ता डिसीजन बाउंड्री (Decision Boundary) कहते हैं।

समस्या: एक अरब आयामों का मानचित्र

पारंपरिक मशीन लर्निंग में, इन "झिझक वाले क्षणों" (डिसीजन बाउंड्री) का मानचित्र बनाना कठिन है लेकिन संभव है। हालाँकि, आधुनिक LLMs के लिए, यह एक ऐसे शहर का मानचित्र बनाने जैसा है जिसमें 1,00,000 सड़कें हैं और जहाँ हर एक कदम के लिए प्रत्येक सड़क 1,00,000 और सड़कों में विभाजित होती है।

पेपर बताता है कि शेफ द्वारा लिए जा सकने वाले हर एक संभावित पथ का मानचित्र बनाने की कोशिश करना गणितीय रूप से असंभव है। संयोजनों की संख्या इतनी विशाल है (जैसे 10169,79010^{169,790}) कि कोई भी कंप्यूटर कभी भी इसकी गणना नहीं कर पाएगा। पिछले अध्ययनों ने या तो इस जटिलता को अनदेखा किया या बहुत छोटे, नकली उदाहरणों का उपयोग किया जो वास्तविक AI व्यवहार को प्रतिबिंबित नहीं करते थे।

समाधान: "डिसीजन पोटेंशियल सरफेस" (DPS)

इस समस्या को हल करने के लिए, लेखक एक नया तरीका आविष्कार करते हैं जिसे डिसीजन पोटेंशियल सरफेस (DPS) कहा जाता है।

उपमा: एक पर्वत श्रृंखला
शेफ की निर्णय लेने की प्रक्रिया को पहाड़ों और घाटियों के परिदृश्य के रूप में कल्पना करें।

  • पहाड़ की ऊँचाई: यह उस आत्मविश्वास को दर्शाता है जो शेफ महसूस कर रहा है। यदि पहाड़ बहुत ऊँचा है, तो शेफ 100% आश्वस्त है कि कौन सा वाक्य चुनना है।
  • शून्य-ऊँचाई रेखा (समुद्र तल): यह डिसीजन बाउंड्री है। यह वह सटीक रेखा है जहाँ शेफ दो विकल्पों के बीच पूरी तरह से विभाजित होता है। यदि आप इस रेखा पर खड़े हैं, तो शेफ को पता नहीं चलता कि किस दिशा में जाना है।
  • घाटियाँ: ये वे क्षेत्र हैं जहाँ शेफ अनिश्चित है, और डिसीजन बाउंड्री के करीब मंडरा रहा है।

पेपर यह सिद्ध करता है कि यदि आप इस "समुद्र तल" की रेखा (जहाँ आत्मविश्वास शून्य है) को खोज लेते हैं, तो आपने सफलतापूर्वक डिसीजन बाउंड्री का मानचित्र बना लिया है।

जादुई ट्रिक: K-DPS (गिनने के बजाय सैंपलिंग करना)

बड़ा सवाल यह है: बिना हर शिखर पर चढ़े एक अनंत जटिल पर्वत श्रृंखला का मानचित्र कैसे बनाया जाए?

लेखक एक स्मार्ट शॉर्टकट प्रस्तावित करते हैं जिसे K-DPS कहा जाता है।

उपमा: स्वाद परीक्षण (The Taste Test)
शेफ द्वारा बनाए जा सकने वाले हर एक संभावित व्यंजन का स्वाद लेने की कोशिश करने के बजाय (जो असंभव है), शेफ को किसी दिए गए प्रॉम्प्ट के लिए केवल K रैंडम सैंपल (मान लीजिए 2,000 व्यंजन) चखने की आवश्यकता है।

  • यदि आप 2,000 रैंडम व्यंजन चखते हैं, तो आप लगभग निश्चित रूप से दो सबसे अच्छे व्यंजनों को पा लेंगे।
  • केवल उन शीर्ष दो की तुलना करके, आप उस स्थान पर पहाड़ की "ऊँचाई" का सटीक अनुमान लगा सकते हैं।

पेपर गणितीय रूप से सिद्ध करता है कि यह "स्वाद परीक्षण" (सैंपलिंग) पर्याप्त है। आपको पूरे मेनू की जाँच करने की आवश्यकता नहीं है। यदि आप पर्याप्त बार (K) सैंपल लेते हैं, तो आपके अनुमान और वास्तविक पहाड़ की ऊँचाई के बीच का अंतर बहुत कम हो जाता है।

उन्होंने क्या खोजा (प्रयोग)

लेखकों ने कई वास्तविक दुनिया के AI मॉडलों (जैसे Llama और Mistral) पर इस पद्धति का परीक्षण किया और कुछ दिलचस्प बातें पाईं:

  1. अलाइनमेंट परिदृश्य को सुचारू बनाता है:

    • अलाइनमेंट से पहले: एक अन-अलाइन्ड (unaligned) AI का "पर्वत परिदृश्य" ऊबड़-खाबड़ और तीखे, खतरनाक स्पाइक्स (spikes) से भरा होता है। ये स्पाइक्स "कमजोरियां" हैं जहाँ एक चालाक ट्रिक (जेलब्रैक) AI को कुछ हानिकारक कहने की ओर धकेल सकती है।
    • अलाइनमेंट के बाद: जब AI को मददगार और हानिरहित होने के लिए प्रशिक्षित किया जाता है, तो परिदृश्य चिकना और सपाट हो जाता है। खतरनाक स्पाइक्स गायब हो जाते हैं। AI अब एक चौड़ी, सुरक्षित घाटी में है जहाँ वह स्वाभाविक रूप से हानिकारक अनुरोधों को अस्वीकार करता है। यह समझाता है कि क्यों अलाइन्ड मॉडल को धोखा देना कठिन होता है।
  2. मशीन अनलर्निंग (Unlearning) अव्यवस्थित है:

    • जब शोधकर्ता किसी AI को विशिष्ट जानकारी (जैसे कि वह पुस्तक जिस पर उसे प्रशिक्षित किया गया था) "भूलने" के लिए प्रेरित करते हैं, तो यह प्रक्रिया विनाशकारी हो सकती है।
    • उनके मानचित्र का उपयोग करते हुए, उन्होंने देखा कि कुछ "अनलर्निंग" विधियों ने न केवल बुरी यादों को हटाया, बल्कि पूरे परिदृश्य को ही छिन्न-भिन्न कर दिया, जिससे चिकनी घाटियाँ ऊबड़-खाबड़ और अराजक परिदृश्य में बदल गईं। यह समझाता है कि क्यों AI अजीब व्यवहार करने लगता है या कुछ भूलने के लिए मजबूर होने के बाद अपना सामान्य ज्ञान खो देता है।

सारांश

यह पेपर हमें यह समझने के लिए एक नया "GPS" देता है कि AI मॉडल निर्णय कैसे लेते हैं।

  • पुराना तरीका: हर संभावित पथ की गणना करने की कोशिश करना (असंभव)।
  • नया तरीका (DPS): आत्मविश्वास स्तरों का एक 3D मानचित्र बनाना।
  • शॉर्टकट (K-DPS): सब कुछ कैलकुलेट करने के बजाय, एक सटीक मानचित्र बनाने के लिए बस कुछ हज़ार रैंडम सैंपल लेना।

यह शोधकर्ताओं को अंततः उन अदृश्य रेखाओं को "देखने" की अनुमति देता है जहाँ AI मॉडल एक उत्तर से दूसरे उत्तर में बदलते हैं, जिससे हमें यह समझने में मदद मिलती है कि वे कभी-कभी विफल क्यों होते हैं, वे सुरक्षित क्यों हैं, और उन्हें कैसे ठीक किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →