Consilience for Verifier-Free Test-Time Scaling
यह शोध पत्र "कन्सिलिएंस" (consilience) को प्रस्तुत करता है, जो एक नवीन वर्िफायर-मुक्त टेस्ट-टाइम स्केलिंग फ्रेमवर्क है जो एक विशिष्ट टेम्पोरल एसिमेट्री (temporal asymmetry)—जो अन्वेषण के लिए कम प्रारंभिक आत्मविश्वास और अभिसरण के लिए उच्च अंतिम आत्मविश्वास द्वारा अभिलक्षित है—के आधार पर रीजनिंग ट्रेजेक्टरीज का चयन करके मौजूदा कॉन्फिडेंस-आधारित विधियों की सीमाओं को दूर करता है, जिससे जटिल गणित और कोडिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक बहुत कठिन पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोट्स को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है। ये डिजिटल मस्तिष्क की तरह हैं जो कोड लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं और पेचीदा सवालों के जवाब दे सकते हैं। आमतौर पर, जब हम चाहते हैं कि वे किसी विशिष्ट समस्या को हल करने में बेहतर बनें, तो हम उन्हें कई अलग-अलग रास्ते आज़माने देते हैं और फिर एक "रेफरी" का उपयोग करते हैं जो यह जाँचता है कि कौन सा उत्तर सही है। इस रेफरी को कोड के लिए कंपाइलर या उत्तर कुंजी वाले शिक्षक की तरह समझें। लेकिन क्या होगा यदि आप ऐसी स्थिति में हों जहाँ कोई रेफरी न हो? क्या होगा यदि आप एक कहानी लिख रहे हों, एक नए प्रकार का सॉफ्टवेयर बना रहे हों, या ऐसी समस्या हल कर रहे हों जिसका उत्तर अभी तक कोई नहीं जानता? यहीं पर "वेरिफायर-फ्री" (Verifier-Free) स्केलिंग आती है। यह रोबोट को बिना किसी बाहरी जज के सबसे अच्छा रास्ता खोजने में मदद करने की चुनौती है। लंबे समय तक, वैज्ञानिकों ने सोचा कि सबसे अच्छा तरीका यह है कि उस उत्तर को चुना जाए जिसे लेकर रोबोट सबसे अधिक "आत्मविश्वासी" (confident) लगता है। विचार सरल था: यदि रोबोट पक्का है कि वह सही है, तो शायद वह सही ही है। लेकिन यह शोध पत्र सुझाव देता है कि वास्तव में कठिन समस्याओं पर, बहुत जल्दी बहुत अधिक आश्वस्त हो जाना वास्तव में एक जाल है।
इस अध्ययन के पीछे के शोधकर्ताओं ने, जो AWS AI लैब्स में काम कर रहे हैं, इस बात की जांच करने का निर्णय लिया कि यह "कॉन्फिडेंस ट्रिक" कठिन होने पर क्यों विफल हो जाती है। उन्होंने एक दिलचस्प दोष की खोज की: जब एक रोबोट के सामने एक कठिन समस्या आती है, तो जो सही उत्तर पाते हैं, वे अक्सर अनिश्चित दिखते हुए शुरुआत करते हैं, विभिन्न संभावनाओं की खोज करते हैं, और केवल अंत में ही आत्मविश्वासी होते हैं। इसके विपरीत, जो रोबोट गलत होते हैं, वे अक्सर शुरू में ही अविश्वसनीय रूप से निश्चित होकर शुरुआत करते हैं, और तुरंत एक (लेकिन गलत) विचार पर टिक जाते हैं। लेखक इस घटना को "कन्सिलिएंस" (Consilience) कहते हैं। यह एक फैंसी शब्द है जिसका अर्थ है "एक साथ कूदना"। विज्ञान में, यह उस स्थिति का वर्णन करता है जहाँ एक निष्कर्ष विश्वसनीय होता है क्योंकि साक्ष्य की कई अलग-अलग रेखाएं सभी एक ही उत्तर की ओर इशारा करती हैं। पेपर का तर्क है कि एक रोबोट के लिए वास्तव में उत्तर को "जानने" के लिए, उसे केवल एक पथ पर जल्दी से नहीं पहुँचना चाहिए; उसे पहले कई पथों की खोज करनी चाहिए (कम आत्मविश्वास दिखाते हुए) और फिर उन सभी को समाधान पर सहमत होना चाहिए (अंत में उच्च आत्मविश्वास दिखाते हुए)।
इसका परीक्षण करने के लिए, टीम ने "कन्सिलिएंस स्कोर" नामक एक नई स्कोरिंग प्रणाली बनाई। केवल पूरे उत्तर के औसत आत्मविश्वास को देखने के बजाय, यह नया तरीका आत्मविश्वास की "कहानी" को देखता है। यह उन उत्तरों को पुरस्कृत करता है जो थोड़े संकोच (खोज/exploration) के साथ शुरू होते हैं और एक मजबूत, निश्चित निष्कर्ष के साथ समाप्त होते हैं। उन्होंने इसका परीक्षण उपलब्ध कुछ सबसे कठिन चुनौतियों पर किया, जिसमें स्नातक स्तर की गणित की समस्याएं और फ्री-फॉर्म कोड जनरेशन शामिल थे। परिणाम चौंकाने वाले थे। आसान समस्याओं पर, पुराना "सबसे आत्मविश्वासी चुनें" वाला तरीका ठीक से काम करता था। लेकिन कठिन समस्याओं पर, पुराने तरीके ने अक्सर गलत उत्तर चुने क्योंकि वे "आत्मविश्वासी रूप से गलत" (confidently wrong) थे। हालाँकि, नए कन्सिलिएंस पद्धति ने उन अति-आत्मविश्वासी गलतियों को सफलतापूर्वक फ़िल्टर कर दिया। उदाहरण के लिए, लाइवकोडबेंच (LiveCodeBench) नामक एक कठिन कोडिंग बेंचमार्क पर, इस नई पद्धति का उपयोग करने से GPT-OSS-120B नामक मॉडल की सफलता दर 65.7% से बढ़कर 69.7% हो गई। यह सुझाव देता है कि रोबोट को केवल निष्कर्ष की गति के बजाय खोज की प्रक्रिया को महत्व देने के लिए सिखाकर, हम उन्हें उन समस्याओं को हल करने में बहुत अधिक स्मार्ट बना सकते हैं जो सबसे महत्वपूर्ण हैं, तब भी जब काम को ग्रेड करने के लिए कोई शिक्षक मौजूद न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।