← नवीनतम पेपर
💬 NLP

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

यह शोधपत्र PiCSAR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो इसके तर्क (reasoning) और उत्तर के संयुक्त लॉग-लाइक्लीहुड (joint log-likelihood) के आधार पर सर्वश्रेष्ठ उम्मीदवार चयन करके लार्ज लैंग्वेज मॉडल की तर्क सटीकता में सुधार करती है, जिससे मौजूदा बेसलाइन की तुलना में कम नमूनों के साथ विविध बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो गणित के होमवर्क की ढेरी को ग्रेड कर रहे हैं। आपने अपने छात्रों (AI मॉडल्स) से एक कठिन समस्या हल करने के लिए कहा है। केवल एक उत्तर देने के बजाय, प्रत्येक छात्र अपनी पूरी विचार प्रक्रिया को चरण-दर-चरण लिखता है, और फिर एक अंतिम उत्तर देता है।

कभी-कभी, एक छात्र एक लंबी, भ्रामक कहानी लिखता है जो सही उत्तर पर समाप्त होती है। अन्य मामलों में, एक छात्र एक संक्षिप्त, स्पष्ट व्याख्या लिखता है जो गलत उत्तर पर समाप्त होती है। या, वे एक भ्रमित करने वाला ढेर लिख सकते हैं जो गलती से सही संख्या तक पहुँच जाता है।

समस्या: आप सबसे अच्छे को कैसे चुनते हैं?

पारंपरिक रूप से, शिक्षक (या AI सिस्टम) विजेता चुनने के दो मुख्य तरीकों का उपयोग करते हैं:

  1. "बहुमत मत" (सेल्फ-कंसिस्टेंसी - Self-Consistency): यदि तीन छात्र कहते हैं कि उत्तर "4" है और एक कहता है कि "3" है, तो आप "4" चुनते हैं। लेकिन क्या होगा यदि उन तीनों ने एक ही तरह की मूर्खतापूर्ण गलती की हो? तो आप गलत उत्तर चुन लेंगे।
  2. "विशेषज्ञ ग्रेडर" (रिवॉर्ड मॉडल - Reward Models): आप हर एक होमवर्क पेपर को पढ़ने और उसे एक स्कोर देने के लिए एक विशेष, महंगे AI को काम पर रखते हैं। लेकिन इस विशेषज्ञ को प्रशिक्षित करना कठिन, महंगा है, और यह कभी-कभी भ्रमित भी हो सकता है।

समाधान: PiCSAR (द "कॉन्फिडेंस डिटेक्टिव")

यह शोध पत्र PiCSAR (प्रोबेबिलिस्टिक कॉन्फिडेंस सिलेक्शन एंड रैंकिंग) पेश करता है। इसे एक नए शिक्षक के रूप में नहीं, बल्कि एक सुपर-स्मार्ट स्कोरिंग मशीन के रूप में सोचें जो छात्र की अपनी आवाज़ का उपयोग करके उन्हें ग्रेड करती है। इसे किसी अतिरिक्त प्रशिक्षण या महंगे विशेषज्ञों की आवश्यकता नहीं है।

PiCSAR कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करते हुए:

दो-भाग वाला स्कोरकार्ड

जब PiCSAR एक छात्र के होमवर्क को देखता है, तो वह दो चीजों के आधार पर एक स्कोर की गणना करता है:

  1. "फ्लो" स्कोर (तर्क संबंधी आत्मविश्वास - Reasoning Confidence):
    कल्पना कीजिए कि छात्र एक कहानी सुना रहा है। PiCSाR पूछता है: "क्या यह कहानी स्वाभाविक रूप से बहती है? क्या अगला वाक्य पिछले वाक्य के बाद एक तार्किक, आत्मविश्वासी कदम महसूस होता है?"
  • यदि छात्र हकलाता है, खुद को दोहराता है, या अतार्किक रूप से कूदता-फांदता है, तो "फ्लो" स्कोर गिर जाता है।
  • यदि तर्क सुचारू, सीधा और आत्मविश्वासी है, तो स्कोर बढ़ जाता है।
  • मुख्य अंतर्दृष्टि: PiCSAR उन कहानियों को पसंद करता है जो संक्षिप्त और अर्थपूर्ण हैं, न कि उन लंबी, भ्रामक कहानियों को जो केवल पन्ने भरने के लिए लिखी गई हैं।
  1. "निष्कर्ष" स्कोर (उत्तर संबंधी आत्मविश्वास - Answer Confidence):
    एक बार जब कहानी पूरी हो जाती है, तो PiCSAR पूछता है: "जो कुछ भी अभी कहा गया है, उसे देखते हुए, छात्र इस अंतिम उत्तर के बारे में कितना आश्वस्त है?"
  • यह उस विशिष्ट क्षण को देखता है जब छात्र अंतिम संख्या लिखता है। यदि मॉडल उस संख्या के बारे में बहुत निश्चित है जो तर्क के आधार पर है, तो स्कोर बढ़ जाता है।
  • यदि तर्क कमजोर था लेकिन छात्र ने सही नंबर का अनुमान लगा लिया, तो यह स्कोर कम रहता है।

जादुई ट्रिक:
PiCSAR इन दोनों स्कोर को जोड़ देता है। यह उस होमवर्क पेपर को चुनता है जिसका कुल स्कोर सबसे अधिक होता है।

यह बेहतर क्यों है?

इस शोध पत्र ने कई गणित और विज्ञान पहेलियों (जैसे AIME गणित प्रतियोगिता) पर इसका परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • यह "बहुमत मत" को मात देता है: कभी-कभी बहुमत गलत होता है क्योंकि उन सभी ने एक ही खराब तर्क का पालन किया होता है। PiCSAR उस छात्र को पहचान लेता है जिसके पास सबसे अच्छा तर्क और सबसे आत्मविश्वासी निष्कर्ष था, भले ही वह अकेला सही होने वाला व्यक्ति हो।
  • यह कुशल है: आमतौर पर, एक अच्छा परिणाम प्राप्त करने के लिए, आपको 32 अलग-अलग उत्तर उत्पन्न करने पड़ते हैं और सबसे अच्छा चुनना पड़ता है। PiCSAR अक्सर केवल 6 प्रयासों के साथ सबसे अच्छा उत्तर ढूंढ सकता है। यह पूरे ढेर को खोदने के बजाय, उस एक सुई को खोजने जैसा है जो सबसे अधिक चमक रही है।
  • यह "बड़े दिमाग" और "छोटे दिमाग" दोनों पर काम करता है: यह विशाल, शक्तिशाली AI मॉडलों पर बहुत अच्छा काम करता है, लेकिन यह छोटे, सस्ते मॉडलों को भी कठिन समस्याओं को हल करने में मदद करता है, उन्हें उनके सबसे अच्छे प्रयास को चुनने में सहायता करके।

"सूचना घनत्व" की खोज (The "Information Density" Discovery)

शोधकर्ताओं ने यह भी गौर किया कि स्मार्ट छात्र कैसे सोचते हैं।

  • "उच्च-आत्मविश्वास" वाले छात्र संक्षिप्त, सघन (dense) उत्तर लिखते थे। उनके हर वाक्य में नई, उपयोगी जानकारी जुड़ी थी।
  • "कम-आत्मविश्वास" वाले छात्र बहुत लंबे उत्तर लिखते थे, लेकिन वे लूप्स, दोहराव और "फालतू बातों" (fluff) से भरे होते थे। वे केवल जगह भरने के लिए बातें कर रहे थे।
    PiCSAR स्वाभाविक रूप से इस "फालतू बात" से नफरत करता है। यह उन छात्रों को पुरस्कृत करता है जो बिना किसी फालतू बात के सीधे मुद्दे पर आते हैं और उच्च आत्मविश्वास दिखाते हैं।

सारांश

PiCSAR एक मुफ्त, उपयोग में आसान टूल है जो AI मॉडल्स को उनका सबसे अच्छा उत्तर चुनने में मदद करता है, यह पूछते हुए कि:

  1. "क्या आपने इस पर स्पष्ट रूप से विचार किया?" (तर्क संबंधी आत्मविश्वास)
  2. "क्या आप उस सोच के आधार पर अपने उत्तर के बारे में आश्वस्त हैं?" (उत्तर संबंधी आत्मविश्वास)

इसे कुछ भी नया सीखने की आवश्यकता नहीं है; यह बस AI के अपने आत्मविश्वास स्तरों को सुनकर सही रास्ता खोज लेता है। परिणाम? स्मार्ट उत्तर, कम कंप्यूटर संसाधनों की बर्बादी, और कठिन समस्याओं पर बेहतर प्रदर्शन।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →