Parallel Test-Time Scaling for Latent Reasoning Models
यह शोधपत्र अनिश्चितता-प्रेरित स्टोकेस्टिक सैंपलिंग रणनीतियों (मोंटे कार्लो ड्रॉपआउट और एडिटिव गॉसियन नॉइज़) और निरंतर वेक्टर स्पेस में प्रभावी ट्राजेक्टरी एग्रीगेशन को सुगम बनाने के लिए एक स्टेप-वाइज कॉन्ट्रास्टिव लेटेंट रिवॉर्ड मॉडल को पेश करके लेटेंट रीजनिंग मॉडल्स के लिए पैरेलल टेस्ट-टाइम स्केलिंग को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली लेकिन बहुत शांत जीनियस (AI मॉडल) है जो गणित की समस्याओं को हल करता है। आमतौर पर, यह जीनियस ज़ोर से सोचता है, यानी उत्तर देने से पहले वह अंग्रेजी में हर एक कदम बोलकर बताता है। इसे Chain-of-Thought कहा जाता है। यह अच्छा काम करता है, लेकिन यह धीमा है और बहुत अधिक "स्थान" (कंप्यूटिंग पावर) घेर लेता है क्योंकि जीनियस को हर शब्द लिखना पड़ता है।
हाल ही में, शोधकर्ताओं ने एक तरीका खोजा जिससे यह जीनियस मौन रहकर (silently) सोच सकता है। शब्दों के बजाय, जीनियस एक गुप्त, निरंतर "मानसिक भाषा" (अदृश्य संख्याओं की एक धारा) में सोचता है। यह Latent Reasoning है। यह बहुत तेज़ और संक्षिप्त है, जैसे किसी इंसान को अचानक कोई "अंतर्ज्ञान" या "गट फीलिंग" आती है।
हालाँकि, एक बड़ी समस्या थी: आप इस मौन जीनियस को अधिक सोचने का समय देकर कैसे स्मार्ट बना सकते हैं?
पुराने "बोलने वाले" तरीके में, यदि आप चाहते थे कि AI अधिक गहराई से सोचे, तो आप इसे 10 अलग-अलग बोले गए समाधान बनाने के लिए कह सकते थे और सबसे अच्छे को चुन सकते थे (जैसे 10 लोगों से एक पहेली सुलझाने के लिए कहना और बहुमत के आधार पर निर्णय लेना)। लेकिन मौन जीनियस बोलता नहीं है; वह केवल संख्याओं की एक धारा उत्पन्न करता है। आप आसानी से इसे "फिर से प्रयास करने" या "मुझे 10 संस्करण देने" के लिए नहीं कह सकते क्योंकि इसके पास अलग-अलग रास्ते बनाने का कोई स्वाभाविक तरीका नहीं है।
यह पेपर, जिसे ACL 2026 में स्वीकार किया गया है, इस समस्या को हल करता है। यह हमें सिखाता है कि कैसे इस मौन जीनियस को समानांतर (in parallel) सोचने के लिए प्रशिक्षित किया जाए (एक साथ कई रास्ते) और विजेता को चुना जाए। उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं का उपयोग करके बताया गया है:
1. समस्या: मौन जीनियस बहुत अधिक अनुमानित (Predictable) है
यदि आप मौन जीनियस को सोचने के लिए कहते हैं, तो वह हमेशा बिल्कुल एक ही रास्ता अपनाता है। यह एक ही पटरी पर चलने वाली ट्रेन की तरह है। यदि वह पटरी किसी डेड एंड (बंद रास्ते) की ओर ले जाती है, तो जीनियस विफल हो जाता है। बेहतर होने के लिए, हमें ट्रेन को कभी-कभी नई संभावनाओं को तलाशने के लिए अलग-अलग पटरियों पर कूदने की आवश्यकता है। लेकिन चूंकि जीनियस संख्याओं की एक "गुप्त भाषा" में काम करता है, हम इसे बस "एक यादृच्छिक शब्द चुनने" के लिए नहीं कह सकते।
2. समाधान: "नियंत्रित अराजकता" जोड़ने के दो तरीके
लेखकों ने जीनियस की सोचने की प्रक्रिया को हिलाने-डुलाने के दो तरीके आविष्कार किए, जो इस बात से प्रेरित हैं कि मनुष्य अनिश्चितता को कैसे संभालते हैं।
विधि A: "भुलक्कड़" जीनियस (Monte Carlo Dropout)
कल्पना कीजिए कि जीनियस एक पहेली सुलझाने की कोशिश कर रहा है, लेकिन हर बार जब वह सोचता है, तो हम उससे कहते हैं कि वह एक पल के लिए अपनी आँखें बंद कर ले और जो वह जानता है उसका एक छोटा सा हिस्सा भूल जाए।- उपमा: यह एक छात्र से गणित का सवाल हल करने के लिए कहने जैसा है, लेकिन हर बार जब वह एक चरण लिखता है, तो हम यादृच्छिक रूप से उसकी स्मृति का एक छोटा सा हिस्सा मिटा देते हैं। उसे अपने अंतर्ज्ञान का उपयोग करके उस खाली स्थान को भरना पड़ता है।
- परिणाम: क्योंकि वे हर बार अलग-अलग चीजें "भूल" गए, वे थोड़े अलग समाधान निकालते हैं। यह उन्हें अपरंपरागत रास्तों को खोजने में मदद करता है जो एक पूर्ण, स्मृति-पूर्ण जीनियस से छूट सकते हैं। यह कठिन समस्याओं के लिए बेहतरीन है।
विधि B: "लड़खड़ाता हुआ" जीनियस (Additive Gaussian Noise)
कल्पना कीजिए कि जीनियस एक रस्सी (tightrope) पर चल रहा है। हम धीरे से एक यादृच्छिक हवा के झोंके के साथ रस्सी को बाएँ और दाएँ धकेलते हैं।- उपमा: हम जीनियस के विचारों में थोड़ा सा यादृच्छिक "स्टैटिक" या "कंपन" जोड़ते हैं। यह ऐसा है जैसे जीनियस थोड़ा लड़खड़ा रहा है या ज़मीन हिल रही है।
- परिणाम: जीनियस अपनी मूल रणनीति नहीं बदलता, लेकिन वह केंद्र के चारों ओर थोड़ा डगमगाता है। यह सबसे संभावित उत्तर के आसपास समाधानों का एक विस्तृत, विविध (diverse) बादल बनाता है। यह अराजकता के बीच भी सटीकता बनाए रखने के लिए बेहतरीन है।
3. निर्णायक: "मौन स्कोरकीपर" (Latent Reward Model)
अब जबकि हमारे पास जीनियस के 10, 20 या 64 अलग-अलग मौन विचार हैं, तो हमें कैसे पता चलेगा कि कौन सा सही है?
- पुराने "बोलने वाले" तरीके में, हम उत्तरों को पढ़ सकते थे और वोट दे सकते थे।
- मौन तरीके में, विचार केवल अदृश्य संख्याएँ हैं। हम उन्हें पढ़ नहीं सकते।
लेखकों ने एक विशेष निर्णायक (Latent Reward Model) बनाया है।
- उपमा: कल्पना कीजिए कि एक रेफरी जो खिलाड़ियों को बोलते हुए नहीं सुन सकता लेकिन खेल की "ऊर्जा" को महसूस कर सकता है। यह रेफरी मौन विचारों को देखता है और प्रत्येक को इस आधार पर स्कोर देता है कि वह कितना आशाजनक दिखता है।
- इसने कैसे सीखा: रेफरी को हजारों उदाहरणों को देखकर प्रशिक्षित किया गया था। इसने सीखा कि यदि कोई विचार सही अंतिम उत्तर की ओर ले जाता है, तो उस विचार को उच्च स्कोर मिलता है। यदि वह डेड एंड की ओर ले जाता है, तो उसे कम स्कोर मिलता है।
- जादू: रेफरी एक "कॉन्ट्रास्टिव" (तुलनात्मक) विधि का उपयोग करता है। यह केवल "अच्छा" या "बुरा" नहीं कहता। यह सभी 64 विचारों को एक साथ देखता है और कहता है, "विचार #4, विचार #12 की तुलना में कहीं अधिक बेहतर लग रहा है।" यह पूर्णतः सर्वश्रेष्ठ पथ चुनने में मदद करता है।
4. परिणाम: बिना बोले स्केल करना
इस पेपर ने गणित की समस्याओं (जैसे GSM8K डेटासेट) पर इसका परीक्षण किया।
- पहले: मौन जीनियस लगभग 34% समस्याओं को हल करता था।
- बाद में: कई रास्तों को उत्पन्न करने के लिए "भुलक्कड़" और "लड़खड़ाता हुआ" तरीकों का उपयोग करके, और सर्वश्रेष्ठ को चुनने के लिए "निर्णायक" का उपयोग करके, सफलता दर काफी बढ़ गई (46%+ तक)।
- बड़ी जीत: उन्होंने साबित कर दिया कि आप बिना AI को बड़ा या धीमा किए, केवल इसे अलग-अलग रास्तों को तलाशने के लिए अधिक "सोचने का समय" (कंप्यूटिंग पावर) देकर एक मौन, कुशल AI को स्मार्ट बना सकते हैं।
सारांश
इस पेपर को एक मौन, सहज जीनियस को समानांतर में सोचने का तरीका सिखाने के रूप में देखें।
- चीजों को हिलाएं: कई अलग-अलग मौन विचार उत्पन्न करने के लिए "भुलक्कड़पन" या "लड़खड़ाहट" का उपयोग करें।
- विजेता चुनें: उन मौन विचारों को स्कोर करने और सबसे अच्छा चुनने के लिए एक विशेष AI जज का उपयोग करें।
यह हमें मौन विचार की गति के साथ "कई बार प्रयास करने" की शक्ति प्राप्त करने की अनुमति देता है, जिससे AI को एक भी शब्द बोले बिना स्मार्ट और अधिक कुशल बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।