← नवीनतम पेपर
🤖 AI

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

यह शोध पत्र ऐतिहासिक प्रीफिक्स के एक निरंतर पूल पर स्टोकेस्टिक बैकट्रैकिंग को प्रस्तुत करता है, जिसे फ्रंटियर-ओनली सर्च की सीमाओं को दूर करने और भाषा मॉडलों के लिए टेस्ट-टाइम स्केलिंग में सटीकता-से-टोकन दक्षता अनुपात को महत्वपूर्ण रूप से सुधारने के लिए सबपूल चयन और पावर बैकट्रैक सीक्वेंशियल मोंटे कार्लो द्वारा उन्नत किया गया है।

मूल लेखक: Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: "स्मार्ट एक्सप्लोरर" की समस्या

कल्पना कीजिए कि आप खोजकर्ताओं की एक टीम (AI) को एक विशाल, अंधेरी गुफा (एक जटिल गणितीय समस्या) में खजाना (सही उत्तर) खोजने के लिए भेज रहे हैं।

अतीत में, इन खोजकर्ताओं ने "फ्रंटियर-ओनली" (Frontier-Only) सर्च नामक रणनीति का उपयोग किया था। यह इस प्रकार काम करता था:

  1. टीम समूहों में विभाजित होती है, और प्रत्येक समूह एक अलग रास्ते पर चलता है।
  2. सड़क के हर मोड़ पर, एक गाइड (जिसे प्रोसेस रिवॉर्ड मॉडल या PRM कहा जाता है) रास्ते को देखता है और उसे एक स्कोर देता है। "यह रास्ता आशाजनक लग रहा है! वह रास्ता एक डेड एंड (बंद रास्ता) लग रहा है।"
  3. टीम तुरंत कम स्कोर वाले रास्तों को बंद कर देती है और केवल उन्हीं रास्तों पर अधिक लोगों को भेजती है जिनका स्कोर अधिक होता है।

समस्या: गाइड एकदम सटीक नहीं होता। कभी-कभी, गाइड घबरा जाता है और एक ऐसे रास्ते को बुरा स्कोर दे देता है जो वास्तव में खजाने तक ले जाता है। क्योंकि "फ्रंटियर-ओनली" नियम कहता है कि "जो वर्तमान में सबसे अच्छा नहीं है उसे हटा दो," टीम उस रास्ते को हमेशा के लिए छोड़ देती है। वे उस रास्ते को दोबारा देखने का दूसरा मौका नहीं पाते कि क्या वह "बुरा" रास्ता वास्तव में सोने की खान था। वे एक ऐसे रास्ते पर फंस जाते हैं जो अच्छा दिखता तो है लेकिन कहीं नहीं ले जाता, जिससे समय और ऊर्जा बर्बाद होती है।

नया समाधान: "परसिस्टेंट पूल" (Persistent Pool)

यह पेपर एक नई रणनीति पेश करता है जिसे स्टोकेस्टिक बैकट्रैकिंग ओवर अ परसिस्टेंट पूल (Stochastic Backtracking over a Persistent Pool) कहा जाता है।

केवल खोजकर्ताओं की वर्तमान अग्रिम पंक्ति को देखने के बजाय, टीम एक परसिस्टेंट पूल रखती है—उन सभी रास्तों का एक विशाल मानचित्र जो उन्होंने कभी भी आजमाए हैं, यहाँ तक कि वे भी जिन्हें उन्होंने छोड़ दिया था।

इसे एक ऐसे हाइकर (हाइकर) की तरह सोचें जिसके पास पुराने नक्शों से भरा एक बैग है। भले ही वे वर्तमान में पथ A पर चल रहे हों, उन्हें याद है कि पथ B पहले ठीक लग रहा था, और पथ C को इसलिए छोड़ दिया गया था क्योंकि गाइड का दिन खराब था।

यह पेपर इस "पुराने नक्शों के बैग" का उपयोग करके खजाना तेजी से और कम प्रयास के साथ खोजने के दो विशिष्ट तरीके प्रस्तावित करता है:

1. सबपूल सिलेक्शन (The "Lottery Ticket" Method)

कल्पnya कीजिए कि टीम के बैग में 1,000 रास्ते हैं। यदि वे केवल गाइड के स्कोर के आधार पर शीर्ष 10 को चुनते हैं, तो वे बार-बार उन्हीं "नकली" उच्च-स्कोर वाले रास्तों को चुनते रह सकते हैं।

सुधार: पूरे बैग को देखने के बजाय, टीम उन 50 रास्तों का एक रैंडम हाथ (एक "सबपूल") उठाती है। वे उसी हाथ में से सबसे अच्छे रास्ते को चुनते हैं।

  • यह क्यों काम करता है: यह "अंडरडॉग" रास्तों (जिन्हें गाइड ने अनुचित रूप से कम स्कोर दिया था) को चुने जाने का मौका देता है। यह एक लॉटरी की तरह है जहाँ आप केवल "पसंदीदा" लोगों के टिकट नहीं खरीदते; आप एक रैंडम मिश्रण खरीदते हैं, जिससे अंडरडॉग्स को जीतने का मौका मिलता है। यह टीम को एक ही अति-प्रचारित डेड एंड पर फंसने से रोकता है।

2. पावर बैकट्रैक SMC (The "Weighted Time Travel")

यह "समय में पीछे जाने" का एक अधिक गणितीय तरीका है।

टीम सभी पिछले रास्तों की एक सूची रखती है। जब वे तय करते हैं कि आगे किस रास्ते पर जाना है, तो वे केवल रैंडम तरीके से नहीं चुनते। वे एक विशेष फॉर्मूला का उपयोग करते हैं जो:

  • अच्छे स्कोर को बढ़ाता (Amplify) है (ताmaking कि वास्तव में अच्छे रास्ते उभर कर सामने आएं)।
  • पुराने रास्तों को पूल में जीवित (Keep) रखता है ताकि उन्हें फिर से देखा जा सके।
  • नए रास्तों को आजमाने और पुराने रास्तों पर वापस जाने के बीच संतुलन (Balance) बनाता है।

इसे एक "टाइम-ट्रैवलिंग डिटेक्टिव" (समय यात्रा करने वाला जासूस) के रूप में सोचें। यदि जासूस फंस जाता है, तो वह केवल आगे नहीं बढ़ता। वह अपने पुराने केस फाइलों (परसिस्टेंट पूल) को पलटता है, उस सुराग की फिर से जांच करता है जिसे उसने कल अनदेखा कर दिया था, और महसूस करता है, "रुको, यह वास्तव में आशाजनक लग रहा है!" फिर वह पीछे जाता है और उस पुराने सुराग का पीछा करता है।

यह क्यों मायने रखता है: "टोकन" की बचत

AI की दुनिया में, "टोकन" ईंधन की तरह होते हैं। AI जितना अधिक सोचता है, उतना ही अधिक ईंधन जलता है।

  • पुराना तरीका: सही उत्तर पाने के लिए, AI को बहुत अधिक ईंधन (कई टोकन) जलाना पड़ता था क्योंकि वह डेड एंड में जाता रहता था और वापस नहीं मुड़ पाता था।
  • नया तरीका: क्योंकि AI अपने "पुराने रास्तों के मानचित्र" को देख सकता है और फिर से प्रयास कर सकता है, इसलिए वह खजाना बहुत तेज़ी से खोज लेता है।

परिणाम: यह पेपर दिखाता है कि इन नई विधियों के साथ, AI काफी कम ईंधन (कम टोकन) का उपयोग करके कठिन गणितीय समस्याओं को हल कर सकता है, जबकि इसे पुरानी विधियों की तुलना में समान या बेहतर सटीकता प्राप्त होती है। यह एक ऐसी कार चलाने जैसा है जो 20 मील प्रति गैलन के बजाय 50 मील प्रति गैलन का माइलेज देती है, बिना इंजन को बड़ा किए।

सारांश

यह पेपर AI द्वारा समस्याओं को खोजने के तरीके में एक कमी को ठीक करता है। "वर्तमान सर्वश्रेष्ठ" पथ का अंधाधुंध पीछा करने और बाकी सब कुछ फेंक देने के बजाय, नई विधि सभी रास्तों का इतिहास रखती है। यह पुराने रास्तों को फिर से देखने के लिए चतुर ट्रिक्स (रैंडम सब-सैंपलिंग और स्मार्ट टाइम-ट्रैवलिंग) का उपयोग करती है जिन्हें अनुचित रूप से खारिज कर दिया गया था। यह AI को कठिन समस्याओं को तेजी से, सस्ते में और अधिक सटीकता के साथ हल करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →