← नवीनतम पेपर
💻 computer science

Fixing Abstention with Token Probability: A Budget-Matched Causal Test Across Four Small Open-Weight Models

यह शोध पत्र प्रदर्शित करता है कि मौखिक रूप से व्यक्त आत्मविश्वास को बजट-मैच किए गए टोकन-संभाव्यता अपवर्जन नीति (token-probability abstention policy) से बदलने से llama3.2:1b मॉडल में देखे गए एक विशिष्ट सटीकता-घटाने वाले प्रभाव को कारणवश समाप्त कर दिया जाता है, लेकिन यह अन्य छोटे ओपन-वेट मॉडलों में इस लाभ को सामान्यीकृत करने में विफल रहता है, जो यह दर्शाता है कि ऐसे सुधार मॉडल-विशिष्ट हैं और निश्चित-बजट अपवर्जन बेहतर लक्ष्यीकरण के बावजूद शुद्ध-हानिकारक बना रह सकता है।

मूल लेखक: Kunal Dhanda

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kunal Dhanda

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, शोधकर्ता लगातार कंप्यूटर प्रोग्रामों को सवाल पूछने के लिए प्रशिक्षित कर रहे हैं। लेकिन एक महत्वपूर्ण चुनौती बनी हुई है: यह जानना कि कब एक प्रोग्राम को उत्तर नहीं पता है। जब कोई इंसान अनिश्चित होता है, तो वह कह सकता है, "मुझे नहीं पता।" पीछे हटने का यह कार्य, जिसे 'एब्स्टेंशन' (abstention) कहा जाता है, अक्सर एक सुरक्षा विशेषता के रूप में देखा जाता है, जो मशीन को बेतहाशा अनुमान लगाने और गलत सूचना फैलाने से रोकता है। हालांकि, हालिया जांचों ने इन प्रणालियों में एक अजीब सी खराबी का खुलासा किया है। जब इन विशिष्ट ओपन-सोर्स प्रोग्रामों के सबसे छोटे और हल्के मॉडलों से अनिश्चितता स्वीकार करने के लिए कहा गया, तो वे कभी-कभी तब से भी खराब प्रदर्शन करते थे जब उन्हें हर बार केवल अनुमान लगाने के लिए मजबूर किया गया होता। ऐसा प्रतीत होता है कि इन मॉडलों को अपनी आत्मविश्वास के बारें में बोलने के लिए कहना एक व्यवधान उत्पन्न करता है, जिससे वे उन्हीं प्रश्नों पर अपनी सटीकता खो देते हैं जिन्हें वे सावधानी से संभालने की कोशिश कर रहे थे।

यह नया अध्ययन उस व्यवधान का बारीकी से अध्ययन करता है ताकि देखा जा सके कि क्या इसे ठीक किया जा सकता है। शोधकर्ताओं ने चार छोटे, ओपन-वेट मॉडलों पर ध्यान केंद्रित किया—जो आर्टिफिशियल इंटेलिजेंस के ऐसे संस्करण हैं जो इतने संक्षिप्त हैं कि मानक कंप्यूटरों पर चल सकें लेकिन फिर भी जटिल तर्क करने में सक्षम हैं। उन्होंने पहले ही देखा था कि जब सबसे छोटे मॉडल को यह कहने के लिए प्रेरित किया गया कि यदि वह अनिश्चित महसूस करता है तो "मुझे नहीं पता" कहे, तो चिकित्सा और मनोरोग संबंधी प्रश्नों पर उसकी सटीकता काफी गिर गई। टीम को संदेह था कि समस्या स्वयं रुकने (abstain करने) की क्रिया नहीं थी, बल्कि रुकने का निर्णय लेने की विधि थी। मॉडल को अपने आत्मविश्वास को मौखिक रूप से व्यक्त करने के लिए कहा जा रहा था, एक ऐसा संकेत जो सांख्यिकीय रूप से बेकार साबित हुआ, जो एक सिक्के के उछाल (coin flip) से भी बेहतर नहीं था। इस बीच, मॉडल द्वारा प्रत्येक शब्द उत्पन्न करने के लिए उपयोग किए जाने वाले आंतरिक गणित, जिसे 'टोकन प्रोबेबिलिटी' (token probability) कहा जाता है, ने एक बहुत मजबूत संकेतक के रूप में काम किया कि उत्तर सही है या नहीं। प्रश्न यह था कि क्या निर्णय लेने की प्रक्रिया को मॉडल के बोले गए आत्मविश्वास से बदलकर उसके आंतरिक गणित में स्विच करने से सटीकता में गिरावट रुक जाएगी।

इसका उत्तर खोजने के लिए, शोधकर्ताओं ने कोई नए प्रयोग नहीं किए और न ही मॉडल को नया टेक्स्ट उत्पन्न करने के लिए कहा। इसके बजाय, उन्होंने तीन पिछले अध्ययनों में पहले से एकत्र किए गए डेटा का सावधानीपूर्वक पुन: विश्लेषण किया। उन्होंने मॉडलों द्वारा प्रश्नों के उत्तर देने के मौजूदा रिकॉर्ड लिए और उत्तर छोड़ने का निर्णय लेने के दो अलग-अलग तरीकों की तुलना की। पहला तरीका मूल वाला था: मॉडल उत्तर तभी छोड़ता था यदि वह मौखिक रूप से अनिश्चित होने की बात कहता था। दूसरा तरीका एक नई नीति थी: मॉडल उत्तर तब छोड़ देता था जब उसका आंतरिक गणित सही होने की कम संभावना दिखाता था। महत्वपूर्ण रूप से, शोधकर्ताओं ने दूसरे तरीके को इस तरह समायोजित किया कि वह पहले तरीके के समान ही उत्तर छोड़ता था। इसने यह सुनिश्चित किया कि परिणामों में कोई भी अंतर यह कारण से नहीं था कि कितने उत्तर छोड़े गए, बल्कि इस कारण से था कि कौन से प्रश्न छोड़े गए।

परिणाम चौंकाने वाले थे, विशेष रूप से सबसे छोटे मॉडल के लिए। जब शोधकर्ताओं ने मौखिक आत्मविश्वास की जाँच को आंतरिक संभाव्यता (probability) जाँच से बदल दिया, तो सटीकता में भारी गिरावट गायब हो गई। पुराने तरीके के तहत, मॉडल की सटीकता सात प्रतिशत अंक गिर गई थी, जो एक महत्वपूर्ण नुकसान था। नए तरीके के तहत, यह गिरावट लगभग शून्य हो गई, जो कि बिना किसी प्रभाव के समान थी। यह सुधार सामान्य चिकित्सा प्रश्नों और मनोरोग परिदृश्यों दोनों में लगातार काम आया। इसने पुष्टि की कि मूल विफलता वास्तव में मॉडल की अपने आत्मविश्वास को सटीक रूप से रिपोर्ट करने की अक्षमता के कारण थी, और आंतरिक गणित का उपयोग करके निर्णय लेने से इस त्रुटि को सफलतापूर्वक ठीक किया जा सका।

हालांकि, इस अध्ययन ने यह भी खुलासा किया कि यह समाधान एक सार्वभौमिक उपचार नहीं है। जब शोधकर्ताओं ने इसी समूह के एक अलग मॉडल पर वही सुधार लागू किया, जिसने मौखिक आत्मविश्वास की समस्या का सामना किया था, तो परिणाम अलग थे। इस दूसरे मॉडल के पास परीक्षण किए गए सभी मॉडलों में सबसे अच्छा आंतरिक गणित संकेत था, फिर भी नई नीति लागू करने पर सटीकता में उल्लेखनीय गिरावट आई। शोधकर्ताओं ने पाया कि इस मॉडल में "मुझे नहीं पता" कहने की दर बहुत अधिक थी। क्योंकि इसने बहुत सारे प्रश्न छोड़ दिए थे, इसने गलत उत्तरों के साथ कई सही उत्तरों को भी त्याग दिया। भले ही आंतरिक गणित उत्तरों को छाँटने में अच्छा था, लेकिन छोड़े गए आइटमों की भारी मात्रा अत्यधिक थी, जो फायदेमंद होने के बजाय नुकसानदेह रही। यह सुझाव देता है कि जो मॉडल पहले से ही बहुत सटीक हैं, उनके लिए केवल उस संकेत को बदलना पर्याप्त नहीं है जिसका उपयोग यह तय करने के लिए किया जाता है कि क्या छोड़ना है; इसके बजाय छोड़े जाने वाले आइटमों की संख्या को कम करने की आवश्यकता हो सकती है।

अध्ययन निष्कर्ष निकालता है कि जबकि रुकने के निर्णय को बोले गए आत्मविश्वास के बजाय आंतरिक गणित के माध्यम से रूट करना विशिष्ट विफलताओं के लिए एक शक्तिशाली समाधान है, यह 'एक आकार सबके लिए उपयुक्त' (one-size-fits-all) समाधान नहीं है। सबसे छोटे मॉडल के लिए, यह परिवर्तन एक पूर्ण बचाव था, जिसने एक हानिकारक निर्देश को एक तटस्थ निर्देश में बदल दिया। बड़े, अधिक सटीक मॉडल के लिए, समस्या संकेत नहीं बल्कि छोड़े गए आइटमों का बजट था। निष्कर्ष इस बात पर जोर देते हैं कि आर्टिफिशियल इंटेलिजेंस में, हर सिस्टम के लिए काम करने वाला कोई एकल सुरक्षा पैच नहीं है। प्रत्येक मॉडल को अपने स्वयं के सत्यापन की आवश्यकता होती है ताकि यह समझा जा सके कि वह अनिश्चितता को कैसे संभालता है, और जो एक के लिए सुधार के रूप में काम करता है वह दूसरे के लिए काम नहीं कर सकता है। शोधकर्ता चेतावनी देते हैं कि ये परिणाम एक विशिष्ट डेटा सेट पर आधारित हैं और इन्हें आगे के अध्ययन के लिए परिकल्पना के रूप में देखा जाना चाहिए न कि तैनाती के लिए अंतिम निर्देशों के रूप में, लेकिन वे एक स्पष्ट, कारण संबंधी प्रमाण प्रदान करते हैं कि संचार के चैनल को ठीक करने से कभी-कभी परिणाम को ठीक किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →